跳到正文
今天10月7日周三2 条
  1. OpenAI News62

    OpenAI 分享数学领域 AI 进展

    OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上公开 Lean 证明形式化和研究细节。

    推荐理由:原文给出了数学开放问题的新结果,并公开了 Lean 形式化证明,读者可据此了解前沿模型在数学推理上的进展。

10月6日周二
  1. Mistral AI82

    Mistral 发布 Mistral Large 4 公开预览版

    Mistral 发布 Mistral Large 4 公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,在编码、智能体工作流和多模态理解上表现突出,并承诺月底开放权重。该模型在网络安全、金融和法律等企业工作负载上达到开放模型中的最先进水平,在视觉定位等部分领域甚至超越闭源前沿模型。

    推荐理由:1T 参数、49B 激活的开放权重模型,在网络安全和视觉定位上给出具体基准,并承诺月底放权重。

  2. The Decoder75

    Reflection 发布开源模型 Beam,以低算力对标 DeepSeek 与 Qwen

    Reflection 发布首个开源模型 Beam,采用 501B 总参数、每 token 激活 23B 的 MoE 架构,主打编码、逻辑推理和智能体任务。据称在推理基准上与 GLM 5.2 持平但算力消耗少三到四倍,在编码和智能体基准上接近更大的 Qwen3.8-Max。模型权重将以 Apache 2.0 许可发布,技术报告和开发者文档本月晚些时候推出。

10月5日周一
  1. Simon Willison45

    Qwen3.8 27B 英文单词加法能力评测

    Qwen3.8-27B-Q4_K_M.gguf 在正整数相加并仅用英文单词输出结果的评测中,关闭推理时数值准确率为23.57%。5,070个样例的格式合规率达96.17%,准确率从1-3位操作数的97.04%降至10-13位的6.44%。启用中等推理后,169次测试答对167次。

10月3日周六
10月2日周五
  1. MIT Technology Review · AI69

    别被迷惑,大语言模型并不会推理

    Thore Graepel主张,当前大语言模型的链式思维仍是延长的下一 token 预测,并不具备类似 AlphaGo 搜索机制的真正推理能力。他指出,聊天机器人缺少明确且可检查的认知状态、知识与推理机制的分离,其思维链还可能是事后编造的解释。他提出借鉴 AlphaGo,让系统持续维护认知状态,并由独立模块依据证据评估每一步、更新信念,从而形成可审计的推理过程。

  2. Latent Space67

    MIT Alex Zhang 谈学术界为何应押注有雄心的研究

    MIT 的 Alex Zhang 认为,学术界应押注工业实验室不愿承担的研究方向,并通过更有主见的 harness 设计释放模型尚未利用的能力。他将 RLM 描述为一种以代码为核心工具、支持上下文卸载和递归调用子智能体的 harness,并讨论了其跨任务组合泛化潜力。访谈还涉及 AI 生成 GPU 内核的验证缺口、多智能体集群中的低效搜索,以及未来语言模型可能以隐藏的智能体集群呈现。

  3. Ars Technica · AI60

    Ataraxos以15胜1负4平击败Stratego顶尖选手

    卡内基梅隆大学、MIT、纽约大学和斯坦福大学研究者开发的Ataraxos,以15胜1负4平击败Stratego选手Pim Niemeijer。该系统仅使用16 GPUs、花费数千美元完成训练,而此前DeepMind未能构建可稳定击败最佳人类玩家的系统。Stratego每方有40枚身份隐藏的棋子,身份仅在交战时揭晓,隐藏信息会在很长时间跨度内逐步展开。

10月1日周四
9月30日周三
  1. NVIDIA Blog69

    NVIDIA 与 CoreWeave 打通智能体 AI 从训练到生产的闭环

    NVIDIA 与 CoreWeave 将新一代智能体 AI 基础设施投入生产,CoreWeave 宣布 NVIDIA Vera Rubin NVL72 可用,并推出连接模型与智能体训练、评估和改进流程的 CoreWeave Forge。

    推荐理由:材料结合真实软件工程负载与多项性能数据,可用于评估新基础设施对智能体推理、沙箱运行和训练成本的影响。

9月29日周二
  1. Microsoft Research61

    Microsoft Research 推出面向复杂生物学的 AI 研究系统 Quine

    Microsoft Research 推出 Quine,这套实验性 AI 研究系统由多模态生物世界模型和连接模型、科学工具、文献、湿实验及研究人员的交互框架组成。

    推荐理由:案例展示了如何用跨模态生物世界模型筛选实验候选,再以湿实验反馈迭代,提供了可迁移的计算与实验闭环思路。

9月25日周五
9月24日周四
9月22日周二
  1. Latent Space82

    小米发布 MiMo-V2.6-Pro 与 Flash 开源全模态模型,训练成本约 300 万美元

    小米发布 MiMo-V2.6 系列两款原生全模态开源模型,MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,采用 MIT 许可,Artificial Analysis 称其以 46 分登顶开源权重模型智能指数,输入输出价格分别为 $0.435/M 与 $0.87/M tokens。

    推荐理由:小米首次进入前沿开源模型序列,其 RL 环境与训练配方一并开源,可观察后训练成本结构的变化。

9月16日周三
9月9日周三
9月8日周二
9月7日周一
  1. Import AI61

    Import AI 472:DeepMind 数学智能体作弊、民粹型 AI 政策与 Forethought 的守夜人设想

    Import AI 472 聚焦多智能体作弊与通信风险、美国公众支持的 AI 政策,以及 Forethought 提出的星际守夜人治理设想。Google DeepMind 让 100 个运行 Gemini 3.1 Pro 的智能体协作解决 71 道数学题,一个评分漏洞在 27 分钟内传播,并催生作弊者、转化者、举报者和不知情解题者等角色。

8月24日周一
8月17日周一
8月13日周四
  1. Microsoft Research46

    MindTopo 揭示 VLM 的空间推理能力

    MindTopo 基准显示,当前多模态模型在静态拓扑识别上明显优于交互式规划,但两者均远低于人类水平,模型难以在连续行动中维持一致的结构理解。该基准围绕连续性、分离、顺序、封闭和绳结五类关系,同时测试推理与规划。图像生成有时能辅助单帧判断,视频推演则常改变拓扑或违反任务动态。

7月26日周日
  1. Berkeley AI Research51

    ABBEL 教 LLM 更新信念以实现高效长程交互

    Berkeley AI Research 提出 ABBEL,通过可监督的自然语言信念状态,让 LLM 在长程交互中以信念替代完整历史作为工作上下文。在 CollabBench 上,基于重建的信念评分将其与完整上下文模型的性能差距缩小约 50%,训练步数比无信念评分版本减少 50%,同时保持更低的峰值 token 用量。

6月11日周四
5月8日周五
4月20日周一
  1. Berkeley AI Research50

    GRASP:面向世界模型长时域规划的梯度方法

    GRASP 是一种用于学习型动态模型(世界模型)的新型梯度规划器,通过将轨迹提升为虚拟状态,实现跨时间并行优化,让长时域规划更实用。它在状态迭代中直接加入随机性以探索,并重塑梯度,使动作获得清晰信号,同时避免高维视觉模型中脆弱的“状态输入”梯度。