Mistral 发布 Mistral Large 4 公开预览版
Mistral 发布 Mistral Large 4 公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,在编码、智能体工作流和多模态理解上表现突出,并承诺月底开放权重。该模型在网络安全、金融和法律等企业工作负载上达到开放模型中的最先进水平,在视觉定位等部分领域甚至超越闭源前沿模型。
推荐理由:1T 参数、49B 激活的开放权重模型,在网络安全和视觉定位上给出具体基准,并承诺月底放权重。
Mistral 发布 Mistral Large 4 公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,在编码、智能体工作流和多模态理解上表现突出,并承诺月底开放权重。该模型在网络安全、金融和法律等企业工作负载上达到开放模型中的最先进水平,在视觉定位等部分领域甚至超越闭源前沿模型。
推荐理由:1T 参数、49B 激活的开放权重模型,在网络安全和视觉定位上给出具体基准,并承诺月底放权重。
Reflection 发布首个开源模型 Beam,采用 501B 总参数、每 token 激活 23B 的 MoE 架构,主打编码、逻辑推理和智能体任务。据称在推理基准上与 GLM 5.2 持平但算力消耗少三到四倍,在编码和智能体基准上接近更大的 Qwen3.8-Max。模型权重将以 Apache 2.0 许可发布,技术报告和开发者文档本月晚些时候推出。
Reflection 发布 Beam,一个 501B 总参数、23B 活跃参数的纯文本 MoE 模型,面向编码、智能体和科学任务,从头训练,Apache 2.0 权重本月放出。团队称用 23.8T token 预训练,在 SWE-bench Verified 上得 80.9 分,推理效率是 GLM 5.2 的 3-4 倍。
Google研究人员提出RRSI,通过逐步收紧编辑预算和批评器审查,减少智能体在自优化过程中记忆测试任务的问题。基于冻结的Claude Opus 4.8,RRSI在8个基准上测试,训练任务最高提升14.1分,并在5个未见基准上最高提升4.7分。其运行时token用量比未正则化版本少约30 percent,代码已发布在GitHub。
GLM 5.3 已在 Amazon Bedrock 上向符合条件的企业客户开放,可通过全托管 API 使用跨区域推理、提示缓存和服务层级。该模型是发布于 Hugging Face Hub 的 753B 参数 MoE 模型,面向编码和长时程智能体任务。
Reflection AI正式推出其首款前沿开放权重模型Beam,定位于以更低推理算力匹敌领先的中国开放模型。Beam是纯文本MoE模型,共501 billion参数、23 billion激活参数,使用23.8 trillion tokens预训练,支持1 million token上下文窗口。
Claude Code 可在 AWS GovCloud (US) 通过 Amazon Bedrock 调用 Claude Opus 5.5 和 Claude Sonnet 5.5,支持含 ITAR 要求的合规型 AI 辅助开发。两款模型均获 FedRAMP Class D 认证,可在终端和 IDE 中编辑代码、运行命令。
Amazon SageMaker AI 推出 aws-ai-ml 智能体技能,可让 Kiro、Claude Code、Codex 等 MCP 兼容编码智能体执行推理基准测试、推荐部署配置、比较性能结果并生成可执行的 SageMaker Python SDK v3 代码。
推荐理由:文章给出从安装技能到基准测试、实例选型和结果对比的完整流程,可迁移到现有 MCP 编码智能体工作流中。
HackerRank 在约六个月测试后于周一向客户全面开放 AI 面试官 Chakra,测试期间已完成超过 500,000 场面试。Chakra 会观察候选人处理真实代码仓库任务的过程,通过追问评估答案、批判性思维、判断力和 AI 熟练度,并可将招聘筛选、居家测试和工程师复试合并为一次面试。
GitHub 发布 AI 代码审查开放基准 ReviewBench,其 219 个 pull request 来自 187 个公开开源许可仓库,覆盖 19 种语言,分布参考了对 103.9M 个 GitHub pull request 的分析。
推荐理由:公开数据集、评分规则和自助运行器形成可复现评测链路,线上实验案例也展示了离线指标筛选代码审查改进的用法。
Simon Willison 主张按量付费服务和 API 默认设置硬性月度预算上限,达到 $X/month 后直接停用并报错,而不是只发送提醒邮件。他认为编码智能体和个人智能体让创建付费 API 调用、托管应用以及额外存储和计算资源变得更容易,也放大了意外账单风险。
GitHub 建议开发者强化三项技能,包括学会指挥 AI 智能体、不轻信 AI 的首次回答,以及用节省的实现时间解决更广泛的问题。开发者仍需定义任务、审查输出并权衡技术方案,还可让第二个模型批评第一个模型的结果;GitHub Copilot 内置的 Rubber Duck 智能体也采用第二个模型审查计划、代码和测试。
Airbnb 正以“由内而外”路径推进 AI 原生改造,先用 AI 加速产品开发,再将相关能力用于客服和宾客体验。公司称 60% 的代码由 AI 编写,功能与改进同比增加近 80%,工程师平均 PR 吞吐量提升约 1.6x,约一半客服工单已完全由 AI 解决。
推荐理由:Airbnb 将原型协作、组织上下文图、按场景模型评测和异步智能体串成落地路径,为大型软件组织推进 AI 原生改造提供了可迁移框架。
Pi 1.0 与 Pi Durable 更新,前者新增原生 MCP 支持、虚拟模型扩展、延迟工具加载和会话中系统消息等能力。Pi Durable 将 Pi 移植到 TypeScript 并外置有状态组件,可通过任务检查点在进程故障后恢复智能体与子智能体,同时支持并发分支会话、后台上下文压缩、状态同步和代码热更新。
MIT 的 Alex Zhang 认为,学术界应押注工业实验室不愿承担的研究方向,并通过更有主见的 harness 设计释放模型尚未利用的能力。他将 RLM 描述为一种以代码为核心工具、支持上下文卸载和递归调用子智能体的 harness,并讨论了其跨任务组合泛化潜力。访谈还涉及 AI 生成 GPU 内核的验证缺口、多智能体集群中的低效搜索,以及未来语言模型可能以隐藏的智能体集群呈现。
Chatham Financial 使用 OpenAI 的 Codex 和 GPT-5.6 构建技术并重塑工作流程,将交易验证耗时从 30 分钟缩短至不足 4 分钟。此举帮助其扩展资本市场专业能力。
GPT-6 Astra Ultrafast 利用 NVIDIA Blackwell 架构进行推理优化,token 生成速度最高可达 Astra Standard 模式的 8x,现已面向 OpenAI API 及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:最高 8x 的 token 生成加速被具体落到编码智能体循环,可用于理解低延迟如何缩短工具调用间的等待。
pwasm 0.2a0 经 Claude Opus 5.5 完成 42 次提交后,已支持几乎全部 WASM 规范。其 PyPI wheel 捆绑了可运行的 MicroPython、QuickJS 和 Micro QuickJS WASM 构建,但仍处于不可信赖的 alpha 阶段。
Google DeepMind 推出面向编码、企业知识工作和网络防御的 Gemini 4 Argon,目前仅通过 Fairwind Program 向政府用户和可信网络防御者开放。
OpenAI 的 Ari Weinstein 认为,Computer Use 近几个月已因自我调试、失败恢复和多种界面机制的结合而显著改变,部分任务可快于普通人。
推荐理由:访谈把 Computer Use 的模型与 harness 进展拆到具体机制,也还原了 Decisions API 一周原型冲刺的技术取舍。
Google DeepMind 发布 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并计划逐步扩展至开发者、企业和消费者。
推荐理由:多项基准与 Google 内部部署案例覆盖软件工程、知识工作和网络防御,可据此比较模型在长程复杂任务中的表现。
NVIDIA 与 CoreWeave 将新一代智能体 AI 基础设施投入生产,CoreWeave 宣布 NVIDIA Vera Rubin NVL72 可用,并推出连接模型与智能体训练、评估和改进流程的 CoreWeave Forge。
推荐理由:材料结合真实软件工程负载与多项性能数据,可用于评估新基础设施对智能体推理、沙箱运行和训练成本的影响。
OpenAI 在 DevDay 2026 推出常驻智能体 Dots、GPT-6.1 Sol,以及 Ultrafast、Decisions API、Agents API、ChatGPT Spaces 和 Marketplace,并披露 ChatGPT 达到 1.2 Billion WAU。
推荐理由:文章把 OpenAI DevDay 的模型、智能体和平台更新与独立评测并置,便于比较价格、速度与编码表现。
OpenAI 发布 GPT-6.1 Sol,称其在编码、计算机使用和专业工作方面接近 Astra 智能,且 API 输入输出 token 价格仅为 Astra 标准价的五分之一。
OpenAI 在 DevDay 2026 上发布了超过 20 项公告,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。
AINews 本期汇总了 Claude Opus 5.5 发布后的社区反响,指出其在解释视频生成上表现突出,并对比了同期 GPT-6 系列、Gemini 3.8 Flash 和 Xiaomi MiMo-V2.6-Pro 等模型的评测结果。
Anthropic 的 Thariq Shihipar 在访谈中回顾了 Claude Code 的快速演进,并重点讨论了提示词作为核心技能、Claude Mods 对 harness 的自定义能力,以及智能体安全与 Pacing the Frontier 的论点。
H Company 发布 Holo4 通用计算机使用智能体模型系列,包含 27B dense 和 35B-A3B 混合专家架构两种规格。Holo4 可通过 GUI、代码、MCP 和 API 操作软件,并同步推出 Holotron4 Nano 更新。
推荐理由:文章给出跨 GUI、代码、MCP 与 API 的训练设计,并公开基准轨迹和成本口径,便于复核性能比较。
OpenAI 正在为 Codex Originals 项目征集使用 Codex 的开发者、研究者与创作者的真实故事,入选者将参与该项目的下一阶段。感兴趣的用户可通过官方表单提交自己的项目与经历。
Simon Willison 在 WeAreDevelopers 大会主题演讲中按时间线梳理了 2026 年 LLM 的关键进展。2025 年 11 月发布的 Claude Opus 4.5 和 GPT-5.1 让 Claude Code、Codex 等编码智能体从"经常出错"变得"足以日常使用"。
Simon Willison 用 Claude Opus 5.5 将三张 kākāpō 鹦鹉照片生成 HTML5 canvas 像素动画 Kākāpō Party,画面中至少 20 只鹦鹉随音乐跳跃、点击触发彩带和气球效果。
Proaction 借助 Codex、GPT-Live-1 和 GPT-6 Astra,更快地构建、运营并销售现代车队管理产品,销售提升 60%,节省 75+ 小时。
GitHub Copilot app 可通过 canvases 构建自定义工作流界面,用户在智能体会话中运行 /create-canvas 并用自然语言描述需求,无需手动编写代码或设计布局。提示词应说明界面支持的工作流、用户可执行的操作以及智能体可执行的操作。生成的 canvas 支持双方实时修改共享状态,并可保存为供团队共享或个人使用的扩展。
推荐理由:通过拆解 /create-canvas 的描述要素和双向协作机制,给出将日常流程转换成可复用界面的具体路径。
Simon Willison 表示,与编程智能体协作越久,他越确信它们让软件工程变得更难。借助这些智能体可以完成惊人的工作,但释放其全部潜力需要极高的纪律性和知识储备。
当任务需要反复操作、自定义界面或自动化开发流程时,聊天往往不是 GitHub Copilot 的合适交互方式。GitHub Copilot app 的 canvas 是运行在应用内的全栈程序,可与 Copilot 智能体双向通信、调用第三方 API,并在本机执行代码。
推荐理由:文章把重复操作从聊天迁移到可复用的自定义界面,并以数据库和开发流程示例说明如何减少 token 消耗与人工介入。
GitHub Security Lab 开源 Fuzzing Taskflow,可针对 GitHub 上的 C/C++ 项目自动识别入口、生成 harness、运行 AFL++、迭代提升覆盖率并分诊崩溃。
推荐理由:它把覆盖率反馈、语料演进与崩溃分诊串成自动化闭环,并给出智能体决策与 MCP 工具执行分离的工程方法。
GitHub Copilot app 重构 Pull Request 视图,使包含 2,200 个文件、超过 100 万行变更和 400 多条行内评审评论的超大 PR 也能流畅打开和滚动。其方案将确定性的代码几何与动态评论块分离,通过视口范围内的惰性测量、滚动锚定和结构优先的数据流减少卡顿。团队还用应用内结构化探针、端到端测试和自动化循环持续发现性能问题。
推荐理由:文章将代码行与评论拆成两套几何系统,并结合惰性测量与滚动锚定,提供了可迁移的超大虚拟化界面优化方法。
GitHub 认为,开发者仍需审查并对 AI 生成代码负责,RAG 并未过时,Skills 与 MCP 解决的是不同问题。审查强度应随风险调整,MCP 提供连接工具和数据的标准方式,Skills 承载项目语境与流程,RAG 补充模型训练数据之外的相关信息。文章还将模型难以理解代码库视为可维护性压力测试,并主张通过实际构建和记录检验观点。
GitHub 使用 Copilot app 和 CLI,将 Copilot agent runtime 从 TypeScript 和 Node.js 完整改写为超过 800,000 行生产级 Rust,AI 智能体编写了大部分代码。
推荐理由:这份迁移复盘把增量替换、跨语言互操作、智能体协作和分层审查串成一套可迁移的大型代码库改写方法。
Cognition 用 GPT‑6 Astra 提升 Devin 测试软件并证明其可用的能力,目标是让工程师少审代码、多交付。GPT‑6 Astra 强化了 Devin 对自身工作成果的验证环节。