OpenAI 发布 722 篇数学论文,Mistral Large 4 同步亮相
OpenAI 发布内部模型产出的 722 篇数学论文,声称解决 500 个开放问题中的 90 个,其中准黎曼假设被部分数学家称为数学史上最重要时刻。Mistral 发布 Large 4 模型,1T 总参数、49B 活跃,API 已可用,开放权重预计 10 月底发布。
推荐理由:同一期里 OpenAI 数学成果与 Mistral Large 4 发布并列,读者可对照两家在算力与开放策略上的不同路径。
OpenAI 发布内部模型产出的 722 篇数学论文,声称解决 500 个开放问题中的 90 个,其中准黎曼假设被部分数学家称为数学史上最重要时刻。Mistral 发布 Large 4 模型,1T 总参数、49B 活跃,API 已可用,开放权重预计 10 月底发布。
推荐理由:同一期里 OpenAI 数学成果与 Mistral Large 4 发布并列,读者可对照两家在算力与开放策略上的不同路径。
Lambda 正以 145 亿美元投前估值融资至多 40 亿美元,Coatue 和 Blackstone 领投,这可能是其 2027 年 IPO 前的最后一轮私募。其订单积压从 6 月的 150 亿美元增至 9 月的 500 亿美元,但增长主要来自 Anthropic 在 8 月底签署的 350 亿美元合同。Lambda 上周还额外举债 10 亿美元,以支持数据中心建设。
Simon Willison 测试 Claude Opus 5.5 能否作曲,让它设计一种简单的文本音乐格式并构建可播放的 artifact,还要求达到《猴岛小英雄》初代的音乐水准。结果比预期更贴近猴岛主题,效果出奇地好。他猜测这种作曲能力可能类似文本模型近期涌现的 3D 图形能力,但需用其他新旧模型做实验才能确认是否为新能力。
保险公司正为 AI 智能体失控引发的数百万美元索赔做准备,OpenAI 和 Anthropic 高管个人责任也被纳入考量。Verisk 承保负责人称责任最终落在 CEO 身上,Aon 已审查超 300 起 AI 相关法律案件,但尚无判例可依。
Anthropic 在 SF Tech Week 上宣布扩展 Claude for Startups 计划,为符合条件的初创公司提供免费一年的 Claude Team(最多五个高级席位)和 1000 美元 API 额度,并开放 Claude Marketplace 插件构建权限及 Applied AI 团队虚拟办公时间。申请条件为近五年内成立或近两年内获得融资的公司,可通过该计划页面申请。
特朗普本周召集多位 AI 行业高管,并通过行政命令要求美国政府官员使用“超级智能”而非“人工智能”的称呼。与会高管签署了“前沿责任联合承诺”,但该协议完全自愿、不具法律约束力,特朗普称其具有“道德约束力”。TechCrunch 的讨论认为,会议及协议未必会带来重大变化,其主要意义可能是重塑 AI 的公众形象。
Cowork 新版把模型推理和 VM 都放在云端,每个会话使用不与其他会话共享状态的独立沙箱。旧版的模型推理已在云端,但工具调用由部署在用户电脑上的 Anthropic VM 执行,该 VM 只映射用户明确加入会话的数据。需要设备文件时仍由桌面应用执行文件访问工具调用,此调整旨在支持手机使用、合盖后继续运行,并降低本地磁盘、电量和性能成本。
过去一年 OpenAI、Anthropic 等实验室在多个长期未解的数学问题上宣布突破,包括解决一个千禧年大奖难题,但进展引发学界反弹。文章汇总了 AI 接管数学领域的最新动态与争议。
Meta 和 Microsoft 正大幅削减 Claude 的内部使用,并转向各自工具及其他模型。Microsoft 原计划每年在 Claude 上投入超过 $1 billion,随后将支出削减超过三分之一,云部门每名员工的月度预算从 $100,000 降至约 $10,000,并要求员工优先使用 GitHub Copilot 和 OpenAI 模型。
推荐理由:两家公司削减 Claude 的预算和用户量数据,呈现大型科技公司在成本控制、内部工具扶持与供应商竞争之间的取舍。
Claude Code 可在 AWS GovCloud (US) 通过 Amazon Bedrock 调用 Claude Opus 5.5 和 Claude Sonnet 5.5,支持含 ITAR 要求的合规型 AI 辅助开发。两款模型均获 FedRAMP Class D 认证,可在终端和 IDE 中编辑代码、运行命令。
OpenAI CEO Sam Altman 表示,AI 带来的收益将非常巨大,社会应接受黑客攻击、诈骗等部分坏事作为代价。他将 OpenAI 定位为 Anthropic 的谨慎路线与几乎不监管之间的务实中间派,支持加强监管,但担忧过度限制会让少数公司、个人或国家掌握过多权力。他也承认人类可能失去对 AI 系统的控制,并称 OpenAI 还有更多智能体事件需要披露。
Anthropic 在计划 IPO 前通过员工捐赠股份和公司追加股份的机制扩大慈善捐赠,2025 年捐赠总额为 $540 million。2025 年 10 月至 2026 年 3 月,该机制给公司带来的成本超过 $660 million,并会稀释其他投资者的股份。CEO Dario Amodei 与六名联合创始人承诺捐出至少 80 percent 的个人财富。
Import AI 475 汇总并分析了智能体群扩展、Google DeepMind 的 SynthID Bio,以及面向自主科学发现的 AI 科学经济。4-agent swarm 达到同等性能约需两倍总 token,但每个智能体只需一半 token,并行执行理论上可将耗时减半。
AWS 介绍如何通过 Amazon Bedrock AgentCore Gateway 为 Claude Desktop 接入 Web Search,并以 JWT 入站鉴权保护通信。
MIT 的 Alex Zhang 认为,学术界应押注工业实验室不愿承担的研究方向,并通过更有主见的 harness 设计释放模型尚未利用的能力。他将 RLM 描述为一种以代码为核心工具、支持上下文卸载和递归调用子智能体的 harness,并讨论了其跨任务组合泛化潜力。访谈还涉及 AI 生成 GPU 内核的验证缺口、多智能体集群中的低效搜索,以及未来语言模型可能以隐藏的智能体集群呈现。
pwasm 0.2a0 经 Claude Opus 5.5 完成 42 次提交后,已支持几乎全部 WASM 规范。其 PyPI wheel 捆绑了可运行的 MicroPython、QuickJS 和 Micro QuickJS WASM 构建,但仍处于不可信赖的 alpha 阶段。
Amazon Bedrock AgentCore 支持构建"环境智能体"(ambient agent),它由 Amazon S3 事件通知、EventBridge 规则等事件流触发,无需用户发起对话即可并行处理多个事件。
AWS 博客给出 Claude Platform on AWS(CPonAWS)多环境访问的完整实现方案:在组织内建专用 AI Services 账户承载订阅与工作区,工作负载账户通过跨账户 SigV4 角色调用推理,无需存储 API key。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准中随机抽取 100 项任务评测多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,红队认为一个有意义的能力门槛已被跨过。
AMD以$8.2B收购World Labs,后者专注于创意、设计等领域的AI空间智能,并在收购SceniX后建设机器人模拟能力。World Labs称Atlas从零训练,可根据输入的2D图像预测新相机视角,并通过结合生成模型与多视图几何处理稀疏重建问题。
AINews 本期汇总了 Claude Opus 5.5 发布后的社区反响,指出其在解释视频生成上表现突出,并对比了同期 GPT-6 系列、Gemini 3.8 Flash 和 Xiaomi MiMo-V2.6-Pro 等模型的评测结果。
Anthropic 的 Thariq Shihipar 在访谈中回顾了 Claude Code 的快速演进,并重点讨论了提示词作为核心技能、Claude Mods 对 harness 的自定义能力,以及智能体安全与 Pacing the Frontier 的论点。
llm-anthropic 0.30 发布,除支持 Claude Sonnet 5.5 外,新增 llm anthropic refresh 命令,可直接从 Anthropic API 刷新模型列表,无需为新模型单独发版。该版本还加入 llm anthropic count 命令,调用 Anthropic 免费 token 计数 API,在发送提示词前返回其将消耗的 token 数。
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于 Sonnet 5。
推荐理由:作者实测了 Sonnet 5.5 的编码表现与免费层可用性,并给出与 Opus 5.5 的横向对比。
Anthropic 称其分子生物学实验室的 950 个 Claude 智能体在 21 小时内标记出一个已知酶周围的重复模式,并称之为首次发现,但生物学家批评这只是实验室基础工作而非真正发现。哥本哈根大学研究员 Mario Rodríguez Mestre 表示其团队早已发现该模式,并质疑 Anthropic 是否从其 Claude 对话中学习,Anthropic 予以否认。
Simon Willison 在 WeAreDevelopers 大会主题演讲中按时间线梳理了 2026 年 LLM 的关键进展。2025 年 11 月发布的 Claude Opus 4.5 和 GPT-5.1 让 Claude Code、Codex 等编码智能体从"经常出错"变得"足以日常使用"。
Simon Willison 用 Claude Opus 5.5 将三张 kākāpō 鹦鹉照片生成 HTML5 canvas 像素动画 Kākāpō Party,画面中至少 20 只鹦鹉随音乐跳跃、点击触发彩带和气球效果。
Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 家族首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,速度约快 30%,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:同一天两家实验室先后发布新模型并同步降价,读者可对照双方在能力与成本上的取舍。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,作者称 GPT-6 Sol 与 Luna 的价格是 GPT-5.6 同级模型的一半。
推荐理由:作者实测新模型并整理价格表,读者可据此比较各家定价与推理档位的实际表现。
英国 AI Security Institute(AISI)正采用 EvalEval 的 Every Eval Ever schema 和 Evaluation Cards 平台公开分享评测结果,以提升评测科学的可复现性。