V7 借助 GPT-5.6 Luna 将成本削减 78% 并提升准确率
V7 使用 GPT-5.6 将分散的公司文件转化为智能体可用的上下文,以完成复杂的、可溯源的工作,同时将成本削减 78% 并提升准确率。
V7 使用 GPT-5.6 将分散的公司文件转化为智能体可用的上下文,以完成复杂的、可溯源的工作,同时将成本削减 78% 并提升准确率。
Google 推出 MilleMiglia,一款用 C++ 编写的中程物流实例生成器,可生成逼真且保护隐私的基准数据。它以时空图上的多商品流问题建模跨配送中心运输、换车与暂存,源代码和文档已在 GitHub 提供。
GitHub 认为,开发者仍需审查并对 AI 生成代码负责,RAG 并未过时,Skills 与 MCP 解决的是不同问题。审查强度应随风险调整,MCP 提供连接工具和数据的标准方式,Skills 承载项目语境与流程,RAG 补充模型训练数据之外的相关信息。文章还将模型难以理解代码库视为可维护性压力测试,并主张通过实际构建和记录检验观点。
OpenAI 发布澳大利亚青少年安全蓝图,这是一份包含六大支柱的路线图,旨在打造更安全的 AI 体验,以保护和赋能青少年。
Google 的生成式 UI 研究实验可按教师的课程目标,动态生成定制、互动且带引导的教育模拟。团队发布了超过 30 个面向初高中 STEM 学科的英语学习互动内容,均由 AI 生成并经教师审核;美国 12 名教师的初步研究给出平均 8/10 的质量评分。
Pawprint Studio 的 Aniimo 本周首发上线 GeForce NOW,这是一款免费开放世界捉宠 RPG,玩家可在 Idyll 大陆捕捉 Aniimo 并 Twine 变身,无需下载 45GB 即可在 Steam Deck 和 Firefox 等设备串流。
Cooley 基于 ChatGPT Work 打造了 GO Public,把智能能力引入 IPO 流程,帮助律师更早发现问题并将判断力集中在最关键之处。
GitHub 使用 Copilot app 和 CLI,将 Copilot agent runtime 从 TypeScript 和 Node.js 完整改写为超过 800,000 行生产级 Rust,AI 智能体编写了大部分代码。
推荐理由:这份迁移复盘把增量替换、跨语言互操作、智能体协作和分层审查串成一套可迁移的大型代码库改写方法。
OpenAI 发布 Astra for Law,为法律行业提供前沿智能、律所自定义工作流、法律数据源接入,以及针对机密客户工作的法律级管控。该产品隶属 OpenAI for Law,具体模型版本、价格与可用性未在原文披露。
OpenAI 发布一套用于追踪、调查和披露模型失准的框架,同时给出六份关于模型意外或令人担忧行为的报告。
OpenAI 与 AARP 合作,在美国 10 座城市为 1000 名老年人提供免费的 ChatGPT 实操工作坊,帮助他们安全地掌握实用 AI 技能。
OpenAI 推出 AI 驱动的广告新体验,包括 Sponsored Agents 以及面向营销人员的工具,并集成 HubSpot 和 Shopify。
OpenAI 介绍如何用 ChatGPT Work 和 Codex 的分析功能,帮助团队了解 AI 使用量与支出、识别培训需求,并把 AI 采用情况与业务成果关联起来。
Mistral 与 Mozilla 达成合作,Firefox Smart Window(beta)现由 Mistral 模型提供支持,覆盖法国和北美,英国与德国预计于今年晚些时候跟进。该 AI 浏览助手可梳理复杂搜索、找回用户离开的重要页面,并根据浏览器标签页获取信息;对话默认不保存在 Mozilla 服务器,Mistral 等合作方同意零数据保留。
Hex 的数据智能体借助 GPT-6 Astra,把分析答案转化为可交互的可视化内容,让员工愿意主动分享。
OpenAI 经济研究显示,员工使用 AI 的方式已超出传统岗位职责,部分新活动正成为其工作中的常规组成部分。该研究聚焦员工实际使用行为,而非仅限既有职位定义。
Google Research 的 Retrieve-for-Train 通过离线 RL 发现符合奖励的查询扇出并编译为监督数据,再蒸馏至轻量扩散检索器,以单次非自回归推理绕过测试时 CoT 开销。其 53.9M 参数扩散模型可直接将查询嵌入映射为目标嵌入集合,监督样本由冻结的扇出语言模型离线生成,无需人工标注。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,两款模型面向近实时推理和生产级语音智能体。
推荐理由:两款模型把并行推理、视觉理解和后台工具调用融入近实时对话,为复杂语音智能体提供了更完整的生产级能力组合。
IBM Research 在 ALTK-Evolve 中引入一致性指南,通过一致性分析器定位智能体易翻转的决策点,将 AppWorld 上 GPT-4.1 ReAct 智能体的 Pass^5 从 53.0% 提升至 69.0%,一致性差距从 24.4pp 降至 12.0pp,且平均准确率不降反升。
推荐理由:原文提出用一致性分析器定位智能体易翻转的决策点,并给出可复用的诊断与修复方法。
Fyxer 基于 OpenAI 模型、微调与记忆能力,并结合真实用户反馈,打造出可整理收件箱、按用户本人语气起草邮件的 AI 行政助理。
Perplexity 采用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,且相比早期模型,人工检查频率大幅降低。
GitHub 日本和韩国区营销负责人用 GitHub Copilot 把活动运营流程自动化:以 GitHub Issue 为工作单元,用 Issue forms 收集活动信息、Labels 触发 GitHub Actions 工作流,活动从单个 Issue 自动搭建、每日筛选报名者并在结束后自动清理。
Cognition 用 GPT‑6 Astra 提升 Devin 测试软件并证明其可用的能力,目标是让工程师少审代码、多交付。GPT‑6 Astra 强化了 Devin 对自身工作成果的验证环节。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑超 10 亿 ChatGPT 用户、每秒 2200 万次请求。该平台用于应对 ChatGPT 的在线存储规模化需求。
Google Research提出ToolGrad,以答案优先范式和文本“梯度”构建已验证API工作流,降低长链工具使用数据的生成成本。ToolGrad-12B在BFCL得83.1分,接近gemini-2.5-pro的83.2,并高于claude-4.5 Opus与gpt-5。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行和预览智能体生成的代码变更。diff 面板以绿色和红色高亮显示新增与删除行,终端面板支持运行命令和配置脚本,浏览器面板的 Pick & Polish 工具可选中页面元素并让智能体调整。完成审查、运行和预览后,可直接在应用内接受变更并创建 pull request。
César de la Fuente 的实验室利用 Codex 和 ChatGPT,在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
OpenAI 宣布 ChatGPT Work 中的 Data agent 面向所有人开放,可连接公司数据、发现洞察,并用自然语言让 AI 构建交互式仪表盘。
推荐理由:OpenAI 官方披露 ChatGPT Work 数据智能体的连接数据与自然语言建看板能力,可据此判断企业数据工作流的入口变化。
Cloudera 与 Mistral 达成合作,将 Mistral 模型集成至 Cloudera 混合数据平台,为企业提供可控的专用主权 AI。企业可在私有云、公有云、本地及完全隔离环境中训练和运行推理,并利用专有数据定制开放权重模型,保留对数据、智能与计算的控制。
OpenAI 与美国总务管理局(GSA)合作,为符合条件的联邦、州、地方及部落政府提供 $0 许可费用、50% 用量折扣及扩展的网络防御支持。
OpenAI 发布 ChatGPT for Financial Services,将内置金融数据与 GPT-6 Astra 结合,用于研究、建模和面向客户的材料制作。
推荐理由:OpenAI 把内置金融数据与 GPT-6 Astra 打包成行业版本,读者可据此判断金融工作流的入口变化。
Gradio 发布 Workflow1111,用 73 个节点在单个工作流画布上重建了 AUTOMATIC1111 的大部分功能,包括文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成蒙版、ControlNet 风格标注器、背景移除、PNG 信息存储和图生视频。
推荐理由:用 73 个节点重建了 A1111 的多数功能,并说明每个输出节点可直接作为 REST 或 MCP 工具调用。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。
推荐理由:OpenAI 官方发布托管式 Agents API,读者可据此了解云端智能体的编排与长会话能力入口。
OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上更强,并支持自定义音色和电话通信(telephony)。
推荐理由:OpenAI 把全双工语音对话能力开放到 API,开发者可据此评估现有语音应用的改造空间。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过各 Job 挂载的 Storage Bucket 传递,无需 NCCL。
Paul Christiano 加入 OpenAI Foundation 董事会及其安全与安保委员会。他带来 AI 对齐、安全与标准方面的经验。
OpenAI 的 Chris Lehane 主张,AI 能力越强,越需要更强的安全证据、共享标准与持久的政策行动,而当前政策窗口仍然敞开。他呼吁在窗口关闭前采取行动。
Mistral 帮助一家欧洲能源运营商用 AI 智能体,将 40,000 行 Fortran 77 储层模拟器代码迁移到 C++,这部分是 300,000 行代码库的首个冲刺。团队先建立数值一致性测试框架,再用超过 100 个智能体整理分散的文档。实践最终采用由人类操作编码、测试和审查智能体的模块化工作流,而非完全自主迁移。
推荐理由:这项迁移复盘把数值一致性测试、文档整理和人机协作串成完整流程,可迁移到大型遗留系统改造。
OpenAI 发布 GPT-6 Astra,称其为面向企业的最强模型,具备高级推理、计算机操作以及更强的写作与设计判断能力。
推荐理由:OpenAI 公布 GPT-6 Astra 面向企业场景的能力方向,可据此了解其推理与计算机操作定位。
MIT 一位研究人员使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。该案例展示了 GPT-5.6 Sol 在量子计算实验流程中的自主执行与结果分析能力。