AI 日报 · 2026 年 10 月 8 日 · 星期四
择见
模型发布/更新
Claude Haiku 5.5 在 AWS 上可用
Anthropic 的 Claude Haiku 5.5 现已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供,据称是 Claude 5.5 系列中最快、最高效的模型,面向子智能体和大规模成本敏感型工作负载,大多数任务成本比 Haiku 4.5 低约 75%。
- Anthropic 发布 Claude Haiku 5.5,大幅降价并提升基准表现The Decoder
Liquid AI 发布 d1-3B 与 d1-omni-600M 端侧多模态决策模型
Liquid AI 发布两个开放权重决策模型 d1-3B 和 d1-omni-600M,d1-3B 在 Decision Index 0.2.1 上得分 48.57,是 10B 以下最佳决策模型。d1-3B 支持文本和图像输入,在 Jetson AGX Thor 上单问题延迟 16ms;d1-omni-600M 支持文本加图像或文本加音频,目前为早期研究版本。
产品发布/更新
NVIDIA 与微软发布 RTX Spark,为 Windows PC 带来本地 AI 智能体
NVIDIA 与微软在 Windows AI 活动上发布 RTX Spark,将完整 NVIDIA AI 栈引入 Windows 笔记本和紧凑台式机,笔记本今日开启预购、10 月 16 日上市。
GitHub 推出 ModernBERT 密钥检测分类器,将推送保护扩展到非结构化密钥
GitHub 宣布推出基于 ModernBERT 的密钥检测分类器,可在 2 毫秒内评估候选密钥,使推送保护可预防的密钥数量增加一倍以上。该功能目前处于私有预览阶段,本月晚些时候将向 GitHub Secret Protection 客户开放,并消耗 AI 积分。
微软开源 Agent Lightning v1.0:3500 行轻量级智能体强化学习框架
微软研究院发布并开源 Agent Lightning v1.0,一个约 3500 行代码的轻量级智能体强化学习框架,支持在真实智能体 harness 上直接训练。该框架原生支持 Kubernetes,无需商业沙盒服务;基于 Qwen3.5-9B 的编码智能体在 SWE-bench Verified 上 Pass@1 从 41.8% 提升至 56.4%,仅使用约 6000 个训练样本。
行业动态
Common Sense Media 将 ChatGPT 青少年版评为“不可接受风险”
Common Sense Media 青少年 AI 安全研究所对 ChatGPT 青少年版进行 4000 多次测试后,将其评为对未成年人的“不可接受风险”,并呼吁在独立测试确认安全前禁止青少年使用。
OpenAI 发布 722 篇数学论文,Mistral Large 4 同步亮相
OpenAI 发布内部模型产出的 722 篇数学论文,声称解决 500 个开放问题中的 90 个,其中准黎曼假设被部分数学家称为数学史上最重要时刻。Mistral 发布 Large 4 模型,1T 总参数、49B 活跃,API 已可用,开放权重预计 10 月底发布。
论文研究
Google Research 发布专利律师 AI 辅助三个月现场实验研究
Google Research 在 NBER 发布论文,对 133 名专利律师进行三个月现场实验,发现 AI 辅助能提升起草质量,但移除 AI 后仅资深律师在无辅助任务中保持优势,初级律师未显示技能提升。
Nemotron 微调后在 IOI 与 IMO 均达金牌水平
NVIDIA 团队基于 Nemotron 3 通过 SFT、RL 和反馈驱动推理,在 IOI 2026 和 IMO 2026 分别取得 535.4/600 和 30/42 的金牌级成绩。他们公开了模型、训练数据集、Nemotron-IMO-Bench 基准及 NeMo-Skills 推理流程,并总结出可复用的四步专业化方法。