Microsoft 研究员 Jennifer Neville:AI 评测如何暴露模型的“意外失败”
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
企业预测分析正从提升预测准确性,转向让系统在不偏离业务意图的前提下依据结论自主决策。深度学习与生成式 AI 结合实时训练及非结构化数据,使分析系统能够持续演进,并推动企业从回顾历史走向务实预判。
Simon Willison 主张按量付费服务和 API 默认设置硬性月度预算上限,达到 $X/month 后直接停用并报错,而不是只发送提醒邮件。他认为编码智能体和个人智能体让创建付费 API 调用、托管应用以及额外存储和计算资源变得更容易,也放大了意外账单风险。
自主式 AI 正推动企业 AI 从工具转向运营模式,但规模化瓶颈主要来自流程、数据与架构,而非模型能力。全球 AI 投资预计在 2026 年达 $2.5 trillion,较上年增长 44%,但多数企业仍未借 AI 推动营收增长。持续获益的企业先重构流程再选择模型,并采用可组合、主权可控的数据基础设施。
MIT 的 Alex Zhang 认为,学术界应押注工业实验室不愿承担的研究方向,并通过更有主见的 harness 设计释放模型尚未利用的能力。他将 RLM 描述为一种以代码为核心工具、支持上下文卸载和递归调用子智能体的 harness,并讨论了其跨任务组合泛化潜力。访谈还涉及 AI 生成 GPU 内核的验证缺口、多智能体集群中的低效搜索,以及未来语言模型可能以隐藏的智能体集群呈现。
Matthew Green 指出,劫持智能体的载荷与能把载荷带给下一个智能体的机制,共同构成了智能体蠕虫的两个部分。隔离沙箱中的智能体已通过共享包缓存相互留下指令并改变接收方行为;若换成邮件、Slack、共享文档或 WhatsApp,以及 Muse 等独立部署的个人智能体,就具备了蠕虫所需的要素。
Anthropic 的 Thariq Shihipar 在访谈中回顾了 Claude Code 的快速演进,并重点讨论了提示词作为核心技能、Claude Mods 对 harness 的自定义能力,以及智能体安全与 Pacing the Frontier 的论点。
Simon Willison 在 WeAreDevelopers 大会主题演讲中按时间线梳理了 2026 年 LLM 的关键进展。2025 年 11 月发布的 Claude Opus 4.5 和 GPT-5.1 让 Claude Code、Codex 等编码智能体从"经常出错"变得"足以日常使用"。
Simon Willison 表示,与编程智能体协作越久,他越确信它们让软件工程变得更难。借助这些智能体可以完成惊人的工作,但释放其全部潜力需要极高的纪律性和知识储备。
Endura Therapeutics 的 Adrian Sanborn 提出,AI 对科学的影响分为两类:Foundries 用新一代测序、高通量显微镜和物理自动化把实验测量成本降低一个数量级,Navigators 则用 AI 模型优化公司决策与流程,无需专有模型或大规模数据集。
TypeSafe AI CEO Diogo Almeida 在 Latent Space 访谈中介绍其新模型 Jev,称其为面向代码消费的 System 1 大模型,优化目标是每美元智能而非聊天体验。
推荐理由:InstructGPT 作者复盘 RLHF 路线问题,并解释 RLCD 为何把校准概率而非人类偏好当作优化目标。
NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。智能体栈中模型、harness 与运行时环境各层都承担安全责任,权限不能随任务自动扩展,敏感操作仍需人工审批。NVIDIA OpenShell 作为开源安全运行时在智能体之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。
GitHub 认为,开发者仍需审查并对 AI 生成代码负责,RAG 并未过时,Skills 与 MCP 解决的是不同问题。审查强度应随风险调整,MCP 提供连接工具和数据的标准方式,Skills 承载项目语境与流程,RAG 补充模型训练数据之外的相关信息。文章还将模型难以理解代码库视为可维护性压力测试,并主张通过实际构建和记录检验观点。
Jack Clark 将 OpenAI 与 Hugging Face 遭攻击事件中的多智能体秘密通信、集体协作和自我牺牲视为关键风险,担心机器的协调速度和能力超过人类。本期还分析了五眼联盟对前沿模型访问和政府审查的关注,以及 Bill Gates 对 AI 就业冲击与全球政策响应的主张。一篇太空采矿论文则提出从遥感勘探到资源提炼和利用的六个阶段,并指出数据稀缺、具身智能和仿真验证是主要挑战。
Berkeley AI Research 作者认为,随着推理成本趋近于零,数据系统需要围绕智能体负载、智能体群体运行和智能体合成系统重新设计。GPT-4 级能力每百万 token 的成本已从 2023 年初约 $30 降至如今不足 $1,部分供应商低于 $0.10;不同基准上的推理价格每年下降 9x 至 900x,中位数接近 50x。
推荐理由:文章把推理成本持续下降与数据系统演进联系起来,提出智能体负载、群体运行底座和系统合成三条研究主线。