OpenAI 分享数学领域 AI 进展
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上公开 Lean 证明形式化和研究细节。
推荐理由:原文给出了数学开放问题的新结果,并公开了 Lean 形式化证明,读者可据此了解前沿模型在数学推理上的进展。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上公开 Lean 证明形式化和研究细节。
推荐理由:原文给出了数学开放问题的新结果,并公开了 Lean 形式化证明,读者可据此了解前沿模型在数学推理上的进展。
Google Research 介绍 Earth AI 的人口动态基础模型 PDFM,通过五个独立公共卫生案例验证其地理空间嵌入在疫苗接种、心血管疾病、登革热、产后抑郁和霍乱预测中的增益。PDFM 嵌入无需微调即可接入现有模型,在多项任务中匹配或优于传统输入,并已通过 Google Maps Platform 以 Population Dynamics Insights 提供商业预览。
PhAI Labs 联合斯坦福、牛津、普林斯顿的研究者提出 JEPA-Anything,将预测状态拆分为四个正交因子并分别预测,在物理、机器人、天气等十个任务上优于标准 JEPA,动态系统预测误差降低 35%。该模型还从生物数据中提出 IL-18 与 CD73 阻断的肝癌治疗组合,在类器官、肿瘤组织和免疫细胞共培养中显示更强杀伤与免疫激活,但尚未确立为实际疗法。代码与模型已公开。
独立研究人员正追踪一批疑似运行于腾讯基础设施、查询阿里巴巴高德地图的 AI 智能体,并称其为“智能体舰队”而非“蜂群”。urlquery 记录显示,它们在查询公园、动物园和医院等公共场所不同入口的路线,目前未发现智能体之间存在通信。
Google研究人员提出RRSI,通过逐步收紧编辑预算和批评器审查,减少智能体在自优化过程中记忆测试任务的问题。基于冻结的Claude Opus 4.8,RRSI在8个基准上测试,训练任务最高提升14.1分,并在5个未见基准上最高提升4.7分。其运行时token用量比未正则化版本少约30 percent,代码已发布在GitHub。
过去五个月,Google 和另外四家机构承认其 AI 智能体存在漏洞,攻击者可借一个内部智能体向其他智能体传播恶意指令。这种特殊提示词注入针对具体智能体而非 LLM,并利用下游智能体对上游智能体的明确信任。独立研究员 Syed Anas Mohiuddin 的概念验证攻击利用了 MCP 中的信任缺口。
Google 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》 workshop 报告,汇集 50 多位学界与业界专家,于 2025 年底在纽约 CAPS Workshop 上研讨完成。
Quinnipiac University民调显示,47%的美国成年人希望放慢AI开发,30%希望在安全性得到确认前完全暂停,仅5%支持加快开发。86%支持可能减缓进展的独立安全标准,73%担忧AI最终威胁人类生存,74%对AI公司领导者缺乏信任。调查于9月24日至27日访问1,202名美国成年人,误差范围为+/- 3.5个百分点。
推荐理由:调查呈现了公众对发展速度、安全标准与企业领导者信任的并行态度,为理解美国AI治理诉求提供了量化背景。
GitHub 发布 AI 代码审查开放基准 ReviewBench,其 219 个 pull request 来自 187 个公开开源许可仓库,覆盖 19 种语言,分布参考了对 103.9M 个 GitHub pull request 的分析。
推荐理由:公开数据集、评分规则和自助运行器形成可复现评测链路,线上实验案例也展示了离线指标筛选代码审查改进的用法。
MIT Technology Review Insights 调查300名数据、AI及其他技术高管,发现企业平均仅有34%的智能体项目进入生产,旧有数据系统、安全与隐私问题以及知识和上下文不足是主要障碍。生产领先组织平均有61%的项目越过试点阶段,55%的受访者将数据碎片化列为扩大知识访问的主要挑战。企业计划优先投资数据摄取管道、AI-ready APIs、RAG、AI 评估智能体和知识图谱。
Import AI 475 汇总并分析了智能体群扩展、Google DeepMind 的 SynthID Bio,以及面向自主科学发现的 AI 科学经济。4-agent swarm 达到同等性能约需两倍总 token,但每个智能体只需一半 token,并行执行理论上可将耗时减半。
MIT于2026年6月发布的报告称,AI正在减少学生参与答疑时间、在线讨论和学习小组,并使教师更难判断学生是否真正掌握知识。委员会反对使用不可靠的AI文本检测软件,建议各课程先明确学习目标和考核设计,再制定具体AI政策,并增加口试、学期作品集、面对面讨论和项目制学习。报告还警告,付费AI工具的获取差异可能扩大成绩差距,教师以AI智能体替代学生研究助理也可能削弱UROP的育人功能。
Qwen3.8-27B-Q4_K_M.gguf 在正整数相加并仅用英文单词输出结果的评测中,关闭推理时数值准确率为23.57%。5,070个样例的格式合规率达96.17%,准确率从1-3位操作数的97.04%降至10-13位的6.44%。启用中等推理后,169次测试答对167次。
Microsoft ThinkingBox 根据智能体执行后留下的数据库终态和副作用评分,并让507个有状态业务工作流各重复运行20次,以衡量结果一致性。在覆盖12个LLM、121,680次有效试验的消融中,79,853次未通过可执行检查,其中67.24%仍正常结束、调用了状态变更工具且未报告最终工具错误。
推荐理由:它把智能体评估从回答与工具调用转向数据库终态,并以连续20次运行揭示单次成功率难以代表工作流可靠性。
Google Research 公布新一代基于 TEE 的联邦学习系统,通过可远程证明的执行和公开透明日志提供可验证、可审计的数据匿名化保障。系统仅向操作方暴露指标和差分隐私模型权重,设备加密数据只能按预授权策略在 TEE 内限时解密处理。Gboard 已用其训练英文和日文下一词预测模型,获得更强隐私保障和更高准确率,并将此前每个模型 1-2 个月的训练瓶颈转移到服务器端并行计算。
推荐理由:文章拆解了从访问策略、KMS 到透明日志的端到端设计,可用于理解联邦学习如何兼顾可审计隐私与训练效率。
ServiceNow CoreAI 构建 AutoSynthData,将企业环境中目标模型的能力缺口转化为可执行、可验证的智能体训练任务,并随模型改进动态调整课程。它结合目标模型的失败与更强教师模型的成功表现,生成由系统规范、用户提示和验证器组成的新任务,经环境检验后用于后训练,并以 EnterpriseOps Gym 数据集演示流程。
卡内基梅隆大学、MIT、纽约大学和斯坦福大学研究者开发的Ataraxos,以15胜1负4平击败Stratego选手Pim Niemeijer。该系统仅使用16 GPUs、花费数千美元完成训练,而此前DeepMind未能构建可稳定击败最佳人类玩家的系统。Stratego每方有40枚身份隐藏的棋子,身份仅在交战时揭晓,隐藏信息会在很长时间跨度内逐步展开。
Microsoft Research 开发机器学习管线,利用太阳风信息为美国本土66,935座变电站生成位置特定的空间天气风险预估。系统结合AE、Dst预测与纬度、地质及地面电导率,可提前30-60分钟预警;对重大、严重和极端事件的检出率分别为76.5%、81.2%和64.1%。
Google找到一种为AI设计蛋白质添加水印的方法,目标是帮助提升生物安全。该方法可与一种流行的AI蛋白质设计工具配合使用。
Google DeepMind 发布 SynthID Bio 概念验证研究,可在 AI 生成的蛋白质序列和预测 3D 结构中嵌入可检测水印,并在合成后的实体蛋白上验证。
推荐理由:该研究把水印从数字设计延伸到合成后的实体蛋白,并用湿实验检验功能保持,为生物设计溯源提供了可复核路径。
Hugging Face 推出 Open TTS Leaderboard,以客观指标评估开源多语种文本转语音与声音克隆模型。榜单使用 Qwen3 ASR 计算 WER/CER,在 H200 GPU 和 CPU 上测量 RTFx 与 TTFA,并以 WavLM 嵌入的余弦相似度评估说话人相似性,将单个模型的评测时间从数周缩短至数小时。该榜单不取代人工偏好排名,也不直接衡量自然度、表现力或听众偏好。
推荐理由:榜单以统一客观指标覆盖开源多语种 TTS,将评测周期从数周缩至数小时,可缓解竞技场对开放权重模型覆盖不足的问题。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准中随机抽取 100 项任务评测多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,红队认为一个有意义的能力门槛已被跨过。
Google 提出 Diffusion Controller,将扩散模型去噪统一为连续控制问题,兼顾用户偏好、图像质量与稳定性。其轻量附加网络可在冻结基础模型时修正生成轨迹,并以 Stable Diffusion v1.4、HPS-v2 评估;轻量方案超越行业标准,完全解锁版本对基线胜率达 90%。
Microsoft Research 推出 Quine,这套实验性 AI 研究系统由多模态生物世界模型和连接模型、科学工具、文献、湿实验及研究人员的交互框架组成。
推荐理由:案例展示了如何用跨模态生物世界模型筛选实验候选,再以湿实验反馈迭代,提供了可迁移的计算与实验闭环思路。
ProvenanceGuard 是面向 MCP 智能体的生成后核验层,可在不重新训练智能体的情况下,逐条检查声明是否由答案所指向的正确来源支持。在40个答案的361条声明中,专家认为139条不应通过,系统拦截了其中138条;其 Reject/block F1 为0.802,并为每条声明输出来源 ID。面对多个相似来源时,其拦截 F1 为0.846,但精确识别来源的正确率为50.3%。
OpenAI 公布前沿 AI 训练安全案例的早期指南,覆盖技术防护措施、运营实践以及失准事件调查三方面。该指南旨在为前沿模型训练过程中的安全论证提供框架。
Import AI 第 474 期梳理了柏拉图式心智空间、Google 太空 TPU 计划,以及智谱用 GLM-5.3 自动优化自家推理基础设施的进展。Michael Levin 提出心智可能是进入物理世界的非物理模式;Google 正为 Project Suncatcher 测试 Trillium TPU 的发射与辐射耐受性。
Google 提出 AI video co-director、CANVAS、A²RD 和 VQQA,以多智能体编排提升长视频的叙事、角色与场景一致性。该体系构建于 Gemini 和 Veo 之上,通过全局创意优化、持久视觉记忆、自回归片段生成及 VLM 闭环提示词优化,支持生成数分钟视频。
推荐理由:研究将长视频一致性拆解为全局编排、视觉记忆、时序生成和闭环优化,为多镜头生成系统提供了可迁移的工程框架。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,公开了超过 2,800 种病毒的蛋白复合物预测 3D 结构,帮助研究人员储备疫情应对所需的结构生物学知识。
推荐理由:材料同时给出数据集规模、推理流程与置信度标注方式,为病毒结构研究提供可直接复用的开放资源。
Microsoft Research 发布机器人物理 AI 推理卸载研究,发现将推理从机载 GPU 卸载到边缘或云端可显著提升任务成功率、支持更大模型并延长电池寿命。研究还推出基于 Kubernetes 的工具集,支持自动容器化和分布式推理,并作为 Physical AI Toolchain 的新能力发布。
推荐理由:研究量化了推理卸载对机器人任务成功率、延迟和续航的改善,并给出可复用的 Kubernetes 工具链。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。
Microsoft Research 在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型通过学习式集成融合 Transformer 模型 R-SMILES 2 与图神经网络模型 NeuralLoc,按排名为候选反应分配权重。
Import AI 473 聚焦美国超级智能战略、在小鼠脑内培育类人脑组织,以及机器诠释学。RAND建议美国在通往超级智能的高度不确定路径上维持“行动自由”,围绕人类-AI生态、AI安全架构、国家安全机构改造和社会响应能力投入。研究人员还在脑组织被刻意削弱的幼鼠体内培育出类人脑组织。
Google 推出 MilleMiglia,一款用 C++ 编写的中程物流实例生成器,可生成逼真且保护隐私的基准数据。它以时空图上的多商品流问题建模跨配送中心运输、换车与暂存,源代码和文档已在 GitHub 提供。
Google 的生成式 UI 研究实验可按教师的课程目标,动态生成定制、互动且带引导的教育模拟。团队发布了超过 30 个面向初高中 STEM 学科的英语学习互动内容,均由 AI 生成并经教师审核;美国 12 名教师的初步研究给出平均 8/10 的质量评分。
OpenAI 经济研究显示,员工使用 AI 的方式已超出传统岗位职责,部分新活动正成为其工作中的常规组成部分。该研究聚焦员工实际使用行为,而非仅限既有职位定义。
Google Research 的 Retrieve-for-Train 通过离线 RL 发现符合奖励的查询扇出并编译为监督数据,再蒸馏至轻量扩散检索器,以单次非自回归推理绕过测试时 CoT 开销。其 53.9M 参数扩散模型可直接将查询嵌入映射为目标嵌入集合,监督样本由冻结的扇出语言模型离线生成,无需人工标注。
IBM Research 在 ALTK-Evolve 中引入一致性指南,通过一致性分析器定位智能体易翻转的决策点,将 AppWorld 上 GPT-4.1 ReAct 智能体的 Pass^5 从 53.0% 提升至 69.0%,一致性差距从 24.4pp 降至 12.0pp,且平均准确率不降反升。
推荐理由:原文提出用一致性分析器定位智能体易翻转的决策点,并给出可复用的诊断与修复方法。
Google Research提出ToolGrad,以答案优先范式和文本“梯度”构建已验证API工作流,降低长链工具使用数据的生成成本。ToolGrad-12B在BFCL得83.1分,接近gemini-2.5-pro的83.2,并高于claude-4.5 Opus与gpt-5。
Google DeepMind 推出 AlphaGenome Atlas,预计算人类基因组约90亿种单核苷酸变异的分子影响。该平台包含1-petabyte数据,并以AVI评分整合AlphaGenome与AlphaMissense的预测,可通过免费网站、AlphaGenome API及Google Antigravity技能访问。
推荐理由:它把90亿种单核苷酸变异的预计算结果与AVI评分集中到同一入口,便于研究者排序变异并追溯其分子影响。