跳到正文
  1. OpenAI News62

    OpenAI 分享数学领域 AI 进展

    OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上公开 Lean 证明形式化和研究细节。

    推荐理由:原文给出了数学开放问题的新结果,并公开了 Lean 形式化证明,读者可据此了解前沿模型在数学推理上的进展。

  1. Mistral AI82

    Mistral 发布 Mistral Large 4 公开预览版

    Mistral 发布 Mistral Large 4 公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,在编码、智能体工作流和多模态理解上表现突出,并承诺月底开放权重。该模型在网络安全、金融和法律等企业工作负载上达到开放模型中的最先进水平,在视觉定位等部分领域甚至超越闭源前沿模型。

    推荐理由:1T 参数、49B 激活的开放权重模型,在网络安全和视觉定位上给出具体基准,并承诺月底放权重。

  1. Google DeepMind79

    Google DeepMind 发布 Gemini 4 Argon,输出上限增至 1M tokens

    Google DeepMind 发布 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并计划逐步扩展至开发者、企业和消费者。

    推荐理由:多项基准与 Google 内部部署案例覆盖软件工程、知识工作和网络防御,可据此比较模型在长程复杂任务中的表现。

  1. NVIDIA Blog69

    NVIDIA 与 CoreWeave 打通智能体 AI 从训练到生产的闭环

    NVIDIA 与 CoreWeave 将新一代智能体 AI 基础设施投入生产,CoreWeave 宣布 NVIDIA Vera Rubin NVL72 可用,并推出连接模型与智能体训练、评估和改进流程的 CoreWeave Forge。

    推荐理由:材料结合真实软件工程负载与多项性能数据,可用于评估新基础设施对智能体推理、沙箱运行和训练成本的影响。

  1. Microsoft Research61

    Microsoft Research 推出面向复杂生物学的 AI 研究系统 Quine

    Microsoft Research 推出 Quine,这套实验性 AI 研究系统由多模态生物世界模型和连接模型、科学工具、文献、湿实验及研究人员的交互框架组成。

    推荐理由:案例展示了如何用跨模态生物世界模型筛选实验候选,再以湿实验反馈迭代,提供了可迁移的计算与实验闭环思路。

  1. Latent Space82

    小米发布 MiMo-V2.6-Pro 与 Flash 开源全模态模型,训练成本约 300 万美元

    小米发布 MiMo-V2.6 系列两款原生全模态开源模型,MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,采用 MIT 许可,Artificial Analysis 称其以 46 分登顶开源权重模型智能指数,输入输出价格分别为 $0.435/M 与 $0.87/M tokens。

    推荐理由:小米首次进入前沿开源模型序列,其 RL 环境与训练配方一并开源,可观察后训练成本结构的变化。

  1. Google DeepMind86

    Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking

    Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,两款模型面向近实时推理和生产级语音智能体。

    推荐理由:两款模型把并行推理、视觉理解和后台工具调用融入近实时对话,为复杂语音智能体提供了更完整的生产级能力组合。

  1. OpenAI News78

    OpenAI 发布 GPT-6 Astra,面向企业场景强化推理与计算机操作

    OpenAI 发布 GPT-6 Astra,称其为面向企业的最强模型,具备高级推理、计算机操作以及更强的写作与设计判断能力。

    推荐理由:OpenAI 公布 GPT-6 Astra 面向企业场景的能力方向,可据此了解其推理与计算机操作定位。

  1. Google DeepMind82

    Google DeepMind 发布 DiffusionGemma,文本生成最高提速 4x

    Google DeepMind 发布开放实验模型 DiffusionGemma,通过并行生成文本块,在专用 GPU 上实现最高 4x 的文本生成速度。

    推荐理由:并行生成 256 token 块将本地推理提速与质量、云端成本取舍放在同一框架下,便于评估速度敏感工作流的适配范围。

已经到底了