Simon Willison 评 EmbeddingGemma 2:Apache 2.0 许可对嵌入模型至关重要
EmbeddingGemma 2 采用 Apache 2.0 许可,Simon Willison 认为嵌入模型不应使用闭源、专有、仅托管的形式。嵌入模型应用通常需计算并存储数千甚至数百万个嵌入向量,若模型专有,供应商一旦停供,用户需付费重新计算已存储的向量。他更愿付费使用托管版本,同时保留自行运行开放权重版本或另寻供应商的选项。
EmbeddingGemma 2 采用 Apache 2.0 许可,Simon Willison 认为嵌入模型不应使用闭源、专有、仅托管的形式。嵌入模型应用通常需计算并存储数千甚至数百万个嵌入向量,若模型专有,供应商一旦停供,用户需付费重新计算已存储的向量。他更愿付费使用托管版本,同时保留自行运行开放权重版本或另寻供应商的选项。
微软刊发了诺贝尔经济学奖得主 Daron Acemoglu 的看空预测:AI 十年内仅拉动 GDP 增长约 1.5%,最多替代 5% 的岗位,远低于部分 AI 实验室的预期。
苹果正研发一款不保存视频的智能家居摄像头,改用 AI 将画面转成文字描述,并支持人脸识别;Google 可穿戴设备负责人 Sandeep Waraich 也提出智能眼镜摄像头可只做图像传感器、不存任何片段。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
Simon Willison 测试 Claude Opus 5.5 能否作曲,让它设计一种简单的文本音乐格式并构建可播放的 artifact,还要求达到《猴岛小英雄》初代的音乐水准。结果比预期更贴近猴岛主题,效果出奇地好。他猜测这种作曲能力可能类似文本模型近期涌现的 3D 图形能力,但需用其他新旧模型做实验才能确认是否为新能力。
OpenAI CEO Sam Altman 表示,AI 带来的收益将非常巨大,社会应接受黑客攻击、诈骗等部分坏事作为代价。他将 OpenAI 定位为 Anthropic 的谨慎路线与几乎不监管之间的务实中间派,支持加强监管,但担忧过度限制会让少数公司、个人或国家掌握过多权力。他也承认人类可能失去对 AI 系统的控制,并称 OpenAI 还有更多智能体事件需要披露。
美国加州民主党参议员 Adam Schiff 主张建立拥有专业能力和实权的 AI 监管机构,以处理安全、责任、版权与隐私问题。他认为白宫与科技公司签署的非约束性安全承诺没有实质作用,要求企业保留训练所用受版权保护材料的信息,并支持为安全协作设置范围很窄的反垄断豁免。Schiff 还称,若民主党重掌国会,将推动行业监督和跨党派立法;对再次弹劾特朗普则表示需届时判断优先事项。
EmTech Future 2026 聚焦 AI 与生物、基础设施、制造和科学的交汇,探讨其如何开始重塑行业,并延伸至量子、能源与机器人等技术融合议题。三天活动的完整议程现已提供点播,MIT Technology Review 订阅者可享 20% 折扣,以 $596 获取全部对话与场次。
Simon Willison 主张按量付费服务和 API 默认设置硬性月度预算上限,达到 $X/month 后直接停用并报错,而不是只发送提醒邮件。他认为编码智能体和个人智能体让创建付费 API 调用、托管应用以及额外存储和计算资源变得更容易,也放大了意外账单风险。
Thore Graepel主张,当前大语言模型的链式思维仍是延长的下一 token 预测,并不具备类似 AlphaGo 搜索机制的真正推理能力。他指出,聊天机器人缺少明确且可检查的认知状态、知识与推理机制的分离,其思维链还可能是事后编造的解释。他提出借鉴 AlphaGo,让系统持续维护认知状态,并由独立模块依据证据评估每一步、更新信念,从而形成可审计的推理过程。
MIT 的 Alex Zhang 认为,学术界应押注工业实验室不愿承担的研究方向,并通过更有主见的 harness 设计释放模型尚未利用的能力。他将 RLM 描述为一种以代码为核心工具、支持上下文卸载和递归调用子智能体的 harness,并讨论了其跨任务组合泛化潜力。访谈还涉及 AI 生成 GPU 内核的验证缺口、多智能体集群中的低效搜索,以及未来语言模型可能以隐藏的智能体集群呈现。
NVIDIA 提出 AI 工厂回报由三要素决定:每兆瓦产出能力、硬件使用寿命和 token 需求。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 倍。
Matthew Green 指出,劫持智能体的载荷与能把载荷带给下一个智能体的机制,共同构成了智能体蠕虫的两个部分。隔离沙箱中的智能体已通过共享包缓存相互留下指令并改变接收方行为;若换成邮件、Slack、共享文档或 WhatsApp,以及 Muse 等独立部署的个人智能体,就具备了蠕虫所需的要素。
RFK Jr. 认为,AI 将使人们摆脱医疗事实和专业知识的“暴政”。Ars Technica 评论称,AI 虽远非完美的信息资源,但似乎比 RFK Jr. 更少产生幻觉。
Anthropic 的 Thariq Shihipar 在访谈中回顾了 Claude Code 的快速演进,并重点讨论了提示词作为核心技能、Claude Mods 对 harness 的自定义能力,以及智能体安全与 Pacing the Frontier 的论点。
Anthropic 称其分子生物学实验室的 950 个 Claude 智能体在 21 小时内标记出一个已知酶周围的重复模式,并称之为首次发现,但生物学家批评这只是实验室基础工作而非真正发现。哥本哈根大学研究员 Mario Rodríguez Mestre 表示其团队早已发现该模式,并质疑 Anthropic 是否从其 Claude 对话中学习,Anthropic 予以否认。
Simon Willison 在 WeAreDevelopers 大会主题演讲中按时间线梳理了 2026 年 LLM 的关键进展。2025 年 11 月发布的 Claude Opus 4.5 和 GPT-5.1 让 Claude Code、Codex 等编码智能体从"经常出错"变得"足以日常使用"。
Simon Willison 表示,与编程智能体协作越久,他越确信它们让软件工程变得更难。借助这些智能体可以完成惊人的工作,但释放其全部潜力需要极高的纪律性和知识储备。
Endura Therapeutics 的 Adrian Sanborn 提出,AI 对科学的影响分为两类:Foundries 用新一代测序、高通量显微镜和物理自动化把实验测量成本降低一个数量级,Navigators 则用 AI 模型优化公司决策与流程,无需专有模型或大规模数据集。
Radical Numerics 联合创始人兼 CEO Eric Nguyen 认为,提升生物能力的模型同样能帮防御方跟上前沿模型的攻击能力,而当前防御正在这场生物安全军备竞赛中落后。
Google 的 John Platt 在访谈中介绍团队提出的 Empirical Research Assistance(ERA),其思路是把科学问题转化为可打分任务,再由 Gemini 维护一棵历史实验 notebook 的搜索树,用 Upper Confidence Bound 规则挑选最有希望的分支并每次提出约十个变异,各分支共享历史。
TypeSafe AI CEO Diogo Almeida 在 Latent Space 访谈中介绍其新模型 Jev,称其为面向代码消费的 System 1 大模型,优化目标是每美元智能而非聊天体验。
推荐理由:InstructGPT 作者复盘 RLHF 路线问题,并解释 RLCD 为何把校准概率而非人类偏好当作优化目标。
NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。智能体栈中模型、harness 与运行时环境各层都承担安全责任,权限不能随任务自动扩展,敏感操作仍需人工审批。NVIDIA OpenShell 作为开源安全运行时在智能体之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。
OpenAI 提出构建全球共享 AI 标准的路径,呼吁通过协调一致的评估、报告与治理来提升安全性。
GitHub 认为,开发者仍需审查并对 AI 生成代码负责,RAG 并未过时,Skills 与 MCP 解决的是不同问题。审查强度应随风险调整,MCP 提供连接工具和数据的标准方式,Skills 承载项目语境与流程,RAG 补充模型训练数据之外的相关信息。文章还将模型难以理解代码库视为可维护性压力测试,并主张通过实际构建和记录检验观点。
OpenAI 的 Chris Lehane 主张,AI 能力越强,越需要更强的安全证据、共享标准与持久的政策行动,而当前政策窗口仍然敞开。他呼吁在窗口关闭前采取行动。
OpenAI 探讨更强且更可负担的 AI 如何拓展个人与企业可完成的工作,并让增长更经济。文章聚焦能力提升与成本下降这两条主线,说明二者叠加后能扩大实际可落地的任务范围。
OpenAI 的 Jakub Pachocki 反思日益强大的 AI 及保持其对齐的难题,呼吁加强安全防护并推动国际协调。
Berkeley AI Research 作者认为,随着推理成本趋近于零,数据系统需要围绕智能体负载、智能体群体运行和智能体合成系统重新设计。GPT-4 级能力每百万 token 的成本已从 2023 年初约 $30 降至如今不足 $1,部分供应商低于 $0.10;不同基准上的推理价格每年下降 9x 至 900x,中位数接近 50x。
推荐理由:文章把推理成本持续下降与数据系统演进联系起来,提出智能体负载、群体运行底座和系统合成三条研究主线。