Microsoft 研究员 Jennifer Neville:AI 评测如何暴露模型的“意外失败”
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
GitHub 发布 AI 代码审查开放基准 ReviewBench,其 219 个 pull request 来自 187 个公开开源许可仓库,覆盖 19 种语言,分布参考了对 103.9M 个 GitHub pull request 的分析。
推荐理由:公开数据集、评分规则和自助运行器形成可复现评测链路,线上实验案例也展示了离线指标筛选代码审查改进的用法。
Microsoft ThinkingBox 根据智能体执行后留下的数据库终态和副作用评分,并让507个有状态业务工作流各重复运行20次,以衡量结果一致性。在覆盖12个LLM、121,680次有效试验的消融中,79,853次未通过可执行检查,其中67.24%仍正常结束、调用了状态变更工具且未报告最终工具错误。
推荐理由:它把智能体评估从回答与工具调用转向数据库终态,并以连续20次运行揭示单次成功率难以代表工作流可靠性。
Microsoft Research 开发机器学习管线,利用太阳风信息为美国本土66,935座变电站生成位置特定的空间天气风险预估。系统结合AE、Dst预测与纬度、地质及地面电导率,可提前30-60分钟预警;对重大、严重和极端事件的检出率分别为76.5%、81.2%和64.1%。
Microsoft Research 推出 Quine,这套实验性 AI 研究系统由多模态生物世界模型和连接模型、科学工具、文献、湿实验及研究人员的交互框架组成。
推荐理由:案例展示了如何用跨模态生物世界模型筛选实验候选,再以湿实验反馈迭代,提供了可迁移的计算与实验闭环思路。
Microsoft Research Asia – Singapore 成立一年来扩充团队、深化合作,推动前沿 AI 研究在医疗等领域转化为实际应用。其工作涵盖下一代 AI 模型与智能体系统、领域 AI、AI 原生研究、生态与人才发展,并与 EDB 开展联合博士培养。
GitHub Copilot app 可通过 canvases 构建自定义工作流界面,用户在智能体会话中运行 /create-canvas 并用自然语言描述需求,无需手动编写代码或设计布局。提示词应说明界面支持的工作流、用户可执行的操作以及智能体可执行的操作。生成的 canvas 支持双方实时修改共享状态,并可保存为供团队共享或个人使用的扩展。
推荐理由:通过拆解 /create-canvas 的描述要素和双向协作机制,给出将日常流程转换成可复用界面的具体路径。
当任务需要反复操作、自定义界面或自动化开发流程时,聊天往往不是 GitHub Copilot 的合适交互方式。GitHub Copilot app 的 canvas 是运行在应用内的全栈程序,可与 Copilot 智能体双向通信、调用第三方 API,并在本机执行代码。
推荐理由:文章把重复操作从聊天迁移到可复用的自定义界面,并以数据库和开发流程示例说明如何减少 token 消耗与人工介入。
Microsoft Research 发布机器人物理 AI 推理卸载研究,发现将推理从机载 GPU 卸载到边缘或云端可显著提升任务成功率、支持更大模型并延长电池寿命。研究还推出基于 Kubernetes 的工具集,支持自动容器化和分布式推理,并作为 Physical AI Toolchain 的新能力发布。
推荐理由:研究量化了推理卸载对机器人任务成功率、延迟和续航的改善,并给出可复用的 Kubernetes 工具链。
Microsoft Research 在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型通过学习式集成融合 Transformer 模型 R-SMILES 2 与图神经网络模型 NeuralLoc,按排名为候选反应分配权重。
GitHub 使用 Copilot app 和 CLI,将 Copilot agent runtime 从 TypeScript 和 Node.js 完整改写为超过 800,000 行生产级 Rust,AI 智能体编写了大部分代码。
推荐理由:这份迁移复盘把增量替换、跨语言互操作、智能体协作和分层审查串成一套可迁移的大型代码库改写方法。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行和预览智能体生成的代码变更。diff 面板以绿色和红色高亮显示新增与删除行,终端面板支持运行命令和配置脚本,浏览器面板的 Pick & Polish 工具可选中页面元素并让智能体调整。完成审查、运行和预览后,可直接在应用内接受变更并创建 pull request。
Microsoft Research 开源 GigaPath-Flash 与 GigaTIME-Flash,以蒸馏骨干降低群体规模病理研究的计算成本。GigaPath-Flash 配备 22M 参数 ViT-S 和 21M 参数 LongNet 编码器,计算量约低 50 倍,成绩与原版相差 3% 以内;两者采用 Apache 2.0,仅供研究且未经临床验证。
Microsoft Research 发布 Skala 1.1:训练数据量为前版的 2.5×,GMTKN55 加权平均误差为 2.8 kcal/mol,并在 55 类中的 32 类排名第一。Skala 已可用于 CP2K,正集成至 Psi4、FHI-aims、ORCA 和 VASP;持续更新的 benchmark 将跟踪后续版本性能。
MindTopo 基准显示,当前多模态模型在静态拓扑识别上明显优于交互式规划,但两者均远低于人类水平,模型难以在连续行动中维持一致的结构理解。该基准围绕连续性、分离、顺序、封闭和绳结五类关系,同时测试推理与规划。图像生成有时能辅助单帧判断,视频推演则常改变拓扑或违反任务动态。