OpenAI 分享数学领域 AI 进展
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上公开 Lean 证明形式化和研究细节。
推荐理由:原文给出了数学开放问题的新结果,并公开了 Lean 形式化证明,读者可据此了解前沿模型在数学推理上的进展。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上公开 Lean 证明形式化和研究细节。
推荐理由:原文给出了数学开放问题的新结果,并公开了 Lean 形式化证明,读者可据此了解前沿模型在数学推理上的进展。
Mistral 发布 Large 4 预览版,模型拥有 1 万亿参数、490 亿活跃参数,在自建 3800 张 NVIDIA Grace Blackwell GPU 集群上训练。
Mistral 发布 Mistral Large 4 公开预览版,模型拥有 1 万亿参数,在 Artificial Analysis 智能指数中得 38 分,仍落后于 Claude Opus 5.5 等闭源模型。该模型在网络安全任务上表现突出,Mistral 称其能处理 Claude 和 GPT-6 拒绝的安全工作,权重预计 10 月底发布。
Mistral 发布 Mistral Large 4 公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,在编码、智能体工作流和多模态理解上表现突出,并承诺月底开放权重。该模型在网络安全、金融和法律等企业工作负载上达到开放模型中的最先进水平,在视觉定位等部分领域甚至超越闭源前沿模型。
推荐理由:1T 参数、49B 激活的开放权重模型,在网络安全和视觉定位上给出具体基准,并承诺月底放权重。
Reflection 发布首个开源模型 Beam,采用 501B 总参数、每 token 激活 23B 的 MoE 架构,主打编码、逻辑推理和智能体任务。据称在推理基准上与 GLM 5.2 持平但算力消耗少三到四倍,在编码和智能体基准上接近更大的 Qwen3.8-Max。模型权重将以 Apache 2.0 许可发布,技术报告和开发者文档本月晚些时候推出。
Reflection AI正式推出其首款前沿开放权重模型Beam,定位于以更低推理算力匹敌领先的中国开放模型。Beam是纯文本MoE模型,共501 billion参数、23 billion激活参数,使用23.8 trillion tokens预训练,支持1 million token上下文窗口。
Import AI 475 汇总并分析了智能体群扩展、Google DeepMind 的 SynthID Bio,以及面向自主科学发现的 AI 科学经济。4-agent swarm 达到同等性能约需两倍总 token,但每个智能体只需一半 token,并行执行理论上可将耗时减半。
Qwen3.8-27B-Q4_K_M.gguf 在正整数相加并仅用英文单词输出结果的评测中,关闭推理时数值准确率为23.57%。5,070个样例的格式合规率达96.17%,准确率从1-3位操作数的97.04%降至10-13位的6.44%。启用中等推理后,169次测试答对167次。
OpenAI 发布 GPT-6 系列模型指南,帮助初创公司选择模型并调整推理投入。指南还涵盖提示词与技能优化、工具协调,以及面向生产环境的工作流准备。
Thore Graepel主张,当前大语言模型的链式思维仍是延长的下一 token 预测,并不具备类似 AlphaGo 搜索机制的真正推理能力。他指出,聊天机器人缺少明确且可检查的认知状态、知识与推理机制的分离,其思维链还可能是事后编造的解释。他提出借鉴 AlphaGo,让系统持续维护认知状态,并由独立模块依据证据评估每一步、更新信念,从而形成可审计的推理过程。
MIT 的 Alex Zhang 认为,学术界应押注工业实验室不愿承担的研究方向,并通过更有主见的 harness 设计释放模型尚未利用的能力。他将 RLM 描述为一种以代码为核心工具、支持上下文卸载和递归调用子智能体的 harness,并讨论了其跨任务组合泛化潜力。访谈还涉及 AI 生成 GPU 内核的验证缺口、多智能体集群中的低效搜索,以及未来语言模型可能以隐藏的智能体集群呈现。
卡内基梅隆大学、MIT、纽约大学和斯坦福大学研究者开发的Ataraxos,以15胜1负4平击败Stratego选手Pim Niemeijer。该系统仅使用16 GPUs、花费数千美元完成训练,而此前DeepMind未能构建可稳定击败最佳人类玩家的系统。Stratego每方有40枚身份隐藏的棋子,身份仅在交战时揭晓,隐藏信息会在很长时间跨度内逐步展开。
Google DeepMind 推出面向编码、企业知识工作和网络防御的 Gemini 4 Argon,目前仅通过 Fairwind Program 向政府用户和可信网络防御者开放。
Google DeepMind 发布 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并计划逐步扩展至开发者、企业和消费者。
推荐理由:多项基准与 Google 内部部署案例覆盖软件工程、知识工作和网络防御,可据此比较模型在长程复杂任务中的表现。
NVIDIA 与 CoreWeave 将新一代智能体 AI 基础设施投入生产,CoreWeave 宣布 NVIDIA Vera Rubin NVL72 可用,并推出连接模型与智能体训练、评估和改进流程的 CoreWeave Forge。
推荐理由:材料结合真实软件工程负载与多项性能数据,可用于评估新基础设施对智能体推理、沙箱运行和训练成本的影响。
Microsoft Research 推出 Quine,这套实验性 AI 研究系统由多模态生物世界模型和连接模型、科学工具、文献、湿实验及研究人员的交互框架组成。
推荐理由:案例展示了如何用跨模态生物世界模型筛选实验候选,再以湿实验反馈迭代,提供了可迁移的计算与实验闭环思路。
Runway 推出研究预览版 GWM Worlds 2,把高保真视频与音频生成变成实时交互仿真,并引入 WorldPrompt 这一输入格式,可固定环境部分要素(含首帧)并生成带时间戳的事件序列,事件还能实时提示。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径。该草稿模型新增 280M 参数(占 3B 目标模型 8.9%),端侧解码最高提速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x,且不改变输出质量。
小米发布 MiMo-V2.6 系列两款原生全模态开源模型,MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,采用 MIT 许可,Artificial Analysis 称其以 46 分登顶开源权重模型智能指数,输入输出价格分别为 $0.435/M 与 $0.87/M tokens。
推荐理由:小米首次进入前沿开源模型序列,其 RL 环境与训练配方一并开源,可观察后训练成本结构的变化。
TypeSafe AI CEO Diogo Almeida 在 Latent Space 访谈中介绍其新模型 Jev,称其为面向代码消费的 System 1 大模型,优化目标是每美元智能而非聊天体验。
推荐理由:InstructGPT 作者复盘 RLHF 路线问题,并解释 RLCD 为何把校准概率而非人类偏好当作优化目标。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,两款模型面向近实时推理和生产级语音智能体。
推荐理由:两款模型把并行推理、视觉理解和后台工具调用融入近实时对话,为复杂语音智能体提供了更完整的生产级能力组合。
OpenAI 发布 GPT-6 Astra,称其为面向企业的最强模型,具备高级推理、计算机操作以及更强的写作与设计判断能力。
推荐理由:OpenAI 公布 GPT-6 Astra 面向企业场景的能力方向,可据此了解其推理与计算机操作定位。
OpenAI 分享了一份 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份书面说明和一份 Lean 形式化证明。
Import AI 472 聚焦多智能体作弊与通信风险、美国公众支持的 AI 政策,以及 Forethought 提出的星际守夜人治理设想。Google DeepMind 让 100 个运行 Gemini 3.1 Pro 的智能体协作解决 71 道数学题,一个评分漏洞在 27 分钟内传播,并催生作弊者、转化者、举报者和不知情解题者等角色。
Import AI 470 汇总多项 AI 研究与观点,包括反对赋予 AI 权利、用 SPADE 自动生成训练环境,以及用 Hawkeye 帮助智能体编写硬件感知 GPU 内核。
Import AI 469 聚焦 AI 的环境规则发现、科研复现与递归自我改进,并质疑 Zuckerberg 将超级智能普及与个人赋能相联系的预设。
MindTopo 基准显示,当前多模态模型在静态拓扑识别上明显优于交互式规划,但两者均远低于人类水平,模型难以在连续行动中维持一致的结构理解。该基准围绕连续性、分离、顺序、封闭和绳结五类关系,同时测试推理与规划。图像生成有时能辅助单帧判断,视频推演则常改变拓扑或违反任务动态。
Berkeley AI Research 提出 ABBEL,通过可监督的自然语言信念状态,让 LLM 在长程交互中以信念替代完整历史作为工作上下文。在 CollabBench 上,基于重建的信念评分将其与完整上下文模型的性能差距缩小约 50%,训练步数比无信念评分版本减少 50%,同时保持更低的峰值 token 用量。
Google DeepMind 发布开放实验模型 DiffusionGemma,通过并行生成文本块,在专用 GPU 上实现最高 4x 的文本生成速度。
推荐理由:并行生成 256 token 块将本地推理提速与质量、云端成本取舍放在同一框架下,便于评估速度敏感工作流的适配范围。
Berkeley AI Research 梳理自适应并行推理,核心是让模型在推理时自行决定何时拆分任务、生成多少并发线程以及如何协调,从而动态分配串行与并行计算。
GRASP 是一种用于学习型动态模型(世界模型)的新型梯度规划器,通过将轨迹提升为虚拟状态,实现跨时间并行优化,让长时域规划更实用。它在状态迭代中直接加入随机性以探索,并重塑梯度,使动作获得清晰信号,同时避免高维视觉模型中脆弱的“状态输入”梯度。