使用 Amazon Bedrock AgentCore 评估多智能体系统的可解释性与有用性
AWS 展示如何使用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的有用性、业务准确性与可解释性。教程以供应链决策系统为例,依次使用内置评估器、业务规则自定义评估器和六类可解释性评估器,区分决策错误与解释不足。
AWS 展示如何使用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的有用性、业务准确性与可解释性。教程以供应链决策系统为例,依次使用内置评估器、业务规则自定义评估器和六类可解释性评估器,区分决策错误与解释不足。
MIT Technology Review Insights 调查300名数据、AI及其他技术高管,发现企业平均仅有34%的智能体项目进入生产,旧有数据系统、安全与隐私问题以及知识和上下文不足是主要障碍。生产领先组织平均有61%的项目越过试点阶段,55%的受访者将数据碎片化列为扩大知识访问的主要挑战。企业计划优先投资数据摄取管道、AI-ready APIs、RAG、AI 评估智能体和知识图谱。
OpenAI 将在 ChatGPT 图像生成结果旁展示视觉广告,本月晚些时候先在美国面向一组测试广告主上线。广告会被明确标注,且不会影响 ChatGPT 的回答。公司还在扩展广告衡量工具与合作伙伴体系,并开发品牌适宜性评估方案。
OpenAI 阐明其在欧盟规则下处理文本水印的方案,涵盖水印适用范围与检测机制。相关访问权限将先向研究人员开放。
TechCrunch Disrupt 2026 将聚焦 AI 创业公司如何在开放模型、专有模型、前沿 API 和多模型方案间权衡成本、性能、控制权与灵活性。议题还涵盖自建、定制或租用 AI 技术栈,以及 AI 优化芯片和硬件;活动将于 10 月 13-15 日在旧金山举行,设有 200+ 场议程。
美国加州民主党参议员 Adam Schiff 主张建立拥有专业能力和实权的 AI 监管机构,以处理安全、责任、版权与隐私问题。他认为白宫与科技公司签署的非约束性安全承诺没有实质作用,要求企业保留训练所用受版权保护材料的信息,并支持为安全协作设置范围很窄的反垄断豁免。Schiff 还称,若民主党重掌国会,将推动行业监督和跨党派立法;对再次弹劾特朗普则表示需届时判断优先事项。
Aleph Alpha 发布德英双语模型 Kolibri,拥有 78 billion 参数,并通过 MoE 架构为每个 token 激活约 3 billion 参数。
AI 眼镜面临首次重大政府监管整治,挪威希望争取时间,为能够记录旁观者的眼镜制定永久规则。相关规范将聚焦这类设备记录他人的行为。
企业预测分析正从提升预测准确性,转向让系统在不偏离业务意图的前提下依据结论自主决策。深度学习与生成式 AI 结合实时训练及非结构化数据,使分析系统能够持续演进,并推动企业从回顾历史走向务实预判。
NVIDIA Inception 初创企业正用 AI 改善乳腺癌影像、风险评估和治疗规划。iSono Health 的 FDA 获批 ATUSA 每侧乳房约2分钟完成3D超声,公司称灵敏度较手持2D超声高28%;Ataraxis AI 以病理切片和临床变量预测治疗反应与复发风险。
OpenAI 将于本月晚些时候在美国测试 ChatGPT 新展示广告,用户等待图像生成时,界面下方会出现商品轮播或商品图片行。广告会明确标注并与生成图像分开,OpenAI 同时扩展转化归因、地域实验、品牌安全和否定关键词工具。ChatGPT 广告已覆盖超过 40 个国家,广告年化收入运行率达 $1 billion,公司目标是到 2030 年达到 $100 billion。
Import AI 475 汇总并分析了智能体群扩展、Google DeepMind 的 SynthID Bio,以及面向自主科学发现的 AI 科学经济。4-agent swarm 达到同等性能约需两倍总 token,但每个智能体只需一半 token,并行执行理论上可将耗时减半。
MIT于2026年6月发布的报告称,AI正在减少学生参与答疑时间、在线讨论和学习小组,并使教师更难判断学生是否真正掌握知识。委员会反对使用不可靠的AI文本检测软件,建议各课程先明确学习目标和考核设计,再制定具体AI政策,并增加口试、学期作品集、面对面讨论和项目制学习。报告还警告,付费AI工具的获取差异可能扩大成绩差距,教师以AI智能体替代学生研究助理也可能削弱UROP的育人功能。
OpenAI 在 ChatGPT 中推出新的视觉广告格式,并扩展面向广告主的衡量工具、归因合作伙伴关系和品牌适宜性支持。
推荐理由:新广告格式与衡量、归因及品牌适宜性能力同步扩展,可用于了解ChatGPT广告产品的整体构成。
公众对 AI 的反感与使用增长并存,核心矛盾可能不在技术本身,而在企业不断强推技术并渲染巨大的社会经济变革。ChatGPT 在 5 月达到 10 亿月活用户,Gemini 在 7 月录得 9.5 亿用户,但 71% 的美国成年人反对在当地新建 AI 数据中心。美国 50 个州均已通过或提出 AI 法案,全国相关法案超过 2,100 项,开源替代方案也为消费者保留了一定选择空间。
EmTech Future 2026 聚焦 AI 与生物、基础设施、制造和科学的交汇,探讨其如何开始重塑行业,并延伸至量子、能源与机器人等技术融合议题。三天活动的完整议程现已提供点播,MIT Technology Review 订阅者可享 20% 折扣,以 $596 获取全部对话与场次。
Qwen3.8-27B-Q4_K_M.gguf 在正整数相加并仅用英文单词输出结果的评测中,关闭推理时数值准确率为23.57%。5,070个样例的格式合规率达96.17%,准确率从1-3位操作数的97.04%降至10-13位的6.44%。启用中等推理后,169次测试答对167次。
Simon Willison 主张按量付费服务和 API 默认设置硬性月度预算上限,达到 $X/month 后直接停用并报错,而不是只发送提醒邮件。他认为编码智能体和个人智能体让创建付费 API 调用、托管应用以及额外存储和计算资源变得更容易,也放大了意外账单风险。
Microsoft ThinkingBox 根据智能体执行后留下的数据库终态和副作用评分,并让507个有状态业务工作流各重复运行20次,以衡量结果一致性。在覆盖12个LLM、121,680次有效试验的消融中,79,853次未通过可执行检查,其中67.24%仍正常结束、调用了状态变更工具且未报告最终工具错误。
推荐理由:它把智能体评估从回答与工具调用转向数据库终态,并以连续20次运行揭示单次成功率难以代表工作流可靠性。
Simon Willison 已发送 9 月赞助者专属月刊,涵盖 Fable class 模型、价格战、3D 图形、Blender、像素艺术、数学 LLM、意外网络攻击及 Datasette 漏洞危机。赞助费用为 $10/month,可比免费版本提前一个月阅读,并可查看 8 月刊作为预览。
AWS CEO Matt Garman称,公司在新数据中心项目审批中已停止在与政府机构的往来中使用保密协议,以回应社区对透明度的质疑。他称全美有超过100项数据中心暂停令正被考虑,并以0.5%的工业用水占比、备用发电机99.9%的闲置时间和过去三年超过$1 billion的社区投入回应相关批评。
负责撰写 OpenAI 重大产品发布安全报告的 David Robinson 宣布离职,称公司文化已经失灵。他认为试错式的迭代部署会带来周期性失误,前沿 AI 企业应像核电站或繁忙机场一样设置多层冗余,并需要来自公司外部的更强安全激励。OpenAI 回应称,公司会在必要时暂停训练或暂缓模型发布,并正加强研究测试环境安全、第三方评估和实时监控。
TechCrunch 盘点了多款可通过 iMessage、SMS、WhatsApp 或 Telegram 交互的 AI 智能体,它们能记忆上下文、连接现有服务并代用户完成任务。产品覆盖通用个人助理、家庭管理、旅行、内容创作和专业工作等场景,开放状态从公开测试到私测不等,部分提供免费方案或月费订阅。
GPT-6.1 Sol 以每百万输入/输出 token $2/$10 定价推出,在 Agent Arena 排名第 5,单任务中位成本 $0.56。Sonnet 5.5 [Max] 首秀排名第 3、Chat 类第 1,但每任务成本 $2.74,未进入 Pareto 前沿;Anthropic 模型包揽该榜前三。
Meta 推出开源项目 Muse Gadgets,让开发者构建可连接个人 AI 智能体 Muse 的硬件。项目提供开源固件、Linux SDK及彩色电子墨水屏和 HDMI 电视棒等创意,并支持 Raspberry Pi、ESP32及多类外设。Meta 还制作了 5,000 台 USB-C 供电的 Muse Home Link,将在库存有限的情况下免费提供给 Muse 订阅用户。
Apple 调整全磁盘访问权限,以遏制 AI 智能体滥用;Meta 称该权限不足以让 Muse 读取消息,但 Apple 持不同意见。
Sean Parker 与 CEO Prem Akkaraju 正将 Stability AI 调整为面向音乐专业人士的 AI 工具公司。公司在 8 月底宣布获得 Sony、Warner 和 Universal 等投资方提供的 $76 million 融资,这些公司还授权曲库用于训练。
OpenAI 发布 GPT-6 系列模型指南,帮助初创公司选择模型并调整推理投入。指南还涵盖提示词与技能优化、工具协调,以及面向生产环境的工作流准备。
自主式 AI 正推动企业 AI 从工具转向运营模式,但规模化瓶颈主要来自流程、数据与架构,而非模型能力。全球 AI 投资预计在 2026 年达 $2.5 trillion,较上年增长 44%,但多数企业仍未借 AI 推动营收增长。持续获益的企业先重构流程再选择模型,并采用可组合、主权可控的数据基础设施。
AWS 介绍了 Adjudicated Query 模式,并提供可端到端部署的参考实现,用 Amazon Quick 对数万份租约执行合规检查。模型只负责把自然语言问题映射到六个固定 MCP 工具并叙述结果,正式判定由确定性规则引擎完成,完备性回执确保每条记录归入合规、违规、模糊或不可读类别。
推荐理由:该模式将自然语言交互限制在固定工具表面,并以确定性规则和完备性回执隔离高风险判断,提供了可迁移的合规架构。
AWS 介绍如何通过 Amazon Bedrock AgentCore Gateway 为 Claude Desktop 接入 Web Search,并以 JWT 入站鉴权保护通信。
Ai2 开源 AstaBrief 8B 及其训练数据,该模型可将研究问题和检索到的文献片段生成带引用的报告。模型以 Qwen3-8B 为基础,使用 47K 个 SFT 样本和约 6K 个 DPO 样本,并以引用密度等信号过滤训练数据。
推荐理由:文章展示了如何用真实科研查询、引用密度过滤和双裁判偏好数据,让8B模型兼顾报告质量、溯源与生成效率。
GitHub 建议开发者强化三项技能,包括学会指挥 AI 智能体、不轻信 AI 的首次回答,以及用节省的实现时间解决更广泛的问题。开发者仍需定义任务、审查输出并权衡技术方案,还可让第二个模型批评第一个模型的结果;GitHub Copilot 内置的 Rubber Duck 智能体也采用第二个模型审查计划、代码和测试。
Google Research 公布新一代基于 TEE 的联邦学习系统,通过可远程证明的执行和公开透明日志提供可验证、可审计的数据匿名化保障。系统仅向操作方暴露指标和差分隐私模型权重,设备加密数据只能按预授权策略在 TEE 内限时解密处理。Gboard 已用其训练英文和日文下一词预测模型,获得更强隐私保障和更高准确率,并将此前每个模型 1-2 个月的训练瓶颈转移到服务器端并行计算。
推荐理由:文章拆解了从访问策略、KMS 到透明日志的端到端设计,可用于理解联邦学习如何兼顾可审计隐私与训练效率。
Nvidia Shield TV 因 AI 涨价 $100,这款设备已上市7年。其 Pro 版最初于2019年推出,目前零售价为 $299.99。
Airbnb 正以“由内而外”路径推进 AI 原生改造,先用 AI 加速产品开发,再将相关能力用于客服和宾客体验。公司称 60% 的代码由 AI 编写,功能与改进同比增加近 80%,工程师平均 PR 吞吐量提升约 1.6x,约一半客服工单已完全由 AI 解决。
推荐理由:Airbnb 将原型协作、组织上下文图、按场景模型评测和异步智能体串成落地路径,为大型软件组织推进 AI 原生改造提供了可迁移框架。
NVIDIA DGX Spark 将新增 64GB 统一内存配置,10月23日周五起由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 发售,起价 $4,999。
Thore Graepel主张,当前大语言模型的链式思维仍是延长的下一 token 预测,并不具备类似 AlphaGo 搜索机制的真正推理能力。他指出,聊天机器人缺少明确且可检查的认知状态、知识与推理机制的分离,其思维链还可能是事后编造的解释。他提出借鉴 AlphaGo,让系统持续维护认知状态,并由独立模块依据证据评估每一步、更新信念,从而形成可审计的推理过程。
Pi 1.0 与 Pi Durable 更新,前者新增原生 MCP 支持、虚拟模型扩展、延迟工具加载和会话中系统消息等能力。Pi Durable 将 Pi 移植到 TypeScript 并外置有状态组件,可通过任务检查点在进程故障后恢复智能体与子智能体,同时支持并发分支会话、后台上下文压缩、状态同步和代码热更新。
ServiceNow CoreAI 构建 AutoSynthData,将企业环境中目标模型的能力缺口转化为可执行、可验证的智能体训练任务,并随模型改进动态调整课程。它结合目标模型的失败与更强教师模型的成功表现,生成由系统规范、用户提示和验证器组成的新任务,经环境检验后用于后训练,并以 EnterpriseOps Gym 数据集演示流程。