跳到正文
10月5日周一
  1. MIT Technology Review · AI57

    AI 智能体如何连接企业知识

    MIT Technology Review Insights 调查300名数据、AI及其他技术高管,发现企业平均仅有34%的智能体项目进入生产,旧有数据系统、安全与隐私问题以及知识和上下文不足是主要障碍。生产领先组织平均有61%的项目越过试点阶段,55%的受访者将数据碎片化列为扩大知识访问的主要挑战。企业计划优先投资数据摄取管道、AI-ready APIs、RAG、AI 评估智能体和知识图谱。

  2. The Verge · AI56

    参议员 Adam Schiff 谈 AI 监管、言论自由与再次弹劾特朗普

    美国加州民主党参议员 Adam Schiff 主张建立拥有专业能力和实权的 AI 监管机构,以处理安全、责任、版权与隐私问题。他认为白宫与科技公司签署的非约束性安全承诺没有实质作用,要求企业保留训练所用受版权保护材料的信息,并支持为安全协作设置范围很窄的反垄断豁免。Schiff 还称,若民主党重掌国会,将推动行业监督和跨党派立法;对再次弹劾特朗普则表示需届时判断优先事项。

  3. MIT Technology Review · AI24

    将预测分析带入智能体 AI 时代

    企业预测分析正从提升预测准确性,转向让系统在不偏离业务意图的前提下依据结论自主决策。深度学习与生成式 AI 结合实时训练及非结构化数据,使分析系统能够持续演进,并推动企业从回顾历史走向务实预判。

  4. The Decoder68

    ChatGPT 将在图像生成加载界面测试商品轮播广告

    OpenAI 将于本月晚些时候在美国测试 ChatGPT 新展示广告,用户等待图像生成时,界面下方会出现商品轮播或商品图片行。广告会明确标注并与生成图像分开,OpenAI 同时扩展转化归因、地域实验、品牌安全和否定关键词工具。ChatGPT 广告已覆盖超过 40 个国家,广告年化收入运行率达 $1 billion,公司目标是到 2030 年达到 $100 billion。

  5. The Decoder73

    MIT报告称AI正在削弱答疑时间、学习小组和师生信任

    MIT于2026年6月发布的报告称,AI正在减少学生参与答疑时间、在线讨论和学习小组,并使教师更难判断学生是否真正掌握知识。委员会反对使用不可靠的AI文本检测软件,建议各课程先明确学习目标和考核设计,再制定具体AI政策,并增加口试、学期作品集、面对面讨论和项目制学习。报告还警告,付费AI工具的获取差异可能扩大成绩差距,教师以AI智能体替代学生研究助理也可能削弱UROP的育人功能。

  6. MIT Technology Review · AI69

    人们一边反感 AI,一边大量使用它,原因何在?

    公众对 AI 的反感与使用增长并存,核心矛盾可能不在技术本身,而在企业不断强推技术并渲染巨大的社会经济变革。ChatGPT 在 5 月达到 10 亿月活用户,Gemini 在 7 月录得 9.5 亿用户,但 71% 的美国成年人反对在当地新建 AI 数据中心。美国 50 个州均已通过或提出 AI 法案,全国相关法案超过 2,100 项,开源替代方案也为消费者保留了一定选择空间。

  7. MIT Technology Review · AI27

    EmTech Future 2026:当 AI 遇见万物

    EmTech Future 2026 聚焦 AI 与生物、基础设施、制造和科学的交汇,探讨其如何开始重塑行业,并延伸至量子、能源与机器人等技术融合议题。三天活动的完整议程现已提供点播,MIT Technology Review 订阅者可享 20% 折扣,以 $596 获取全部对话与场次。

  8. Simon Willison45

    Qwen3.8 27B 英文单词加法能力评测

    Qwen3.8-27B-Q4_K_M.gguf 在正整数相加并仅用英文单词输出结果的评测中,关闭推理时数值准确率为23.57%。5,070个样例的格式合规率达96.17%,准确率从1-3位操作数的97.04%降至10-13位的6.44%。启用中等推理后,169次测试答对167次。

10月4日周日
  1. Simon Willison73

    按量付费服务需要默认设置硬性预算上限

    Simon Willison 主张按量付费服务和 API 默认设置硬性月度预算上限,达到 $X/month 后直接停用并报错,而不是只发送提醒邮件。他认为编码智能体和个人智能体让创建付费 API 调用、托管应用以及额外存储和计算资源变得更容易,也放大了意外账单风险。

  2. Hugging Face Blog82

    Microsoft ThinkingBox 用数据库终态检验 AI 智能体是否真正完成任务

    Microsoft ThinkingBox 根据智能体执行后留下的数据库终态和副作用评分,并让507个有状态业务工作流各重复运行20次,以衡量结果一致性。在覆盖12个LLM、121,680次有效试验的消融中,79,853次未通过可执行检查,其中67.24%仍正常结束、调用了状态变更工具且未报告最终工具错误。

    推荐理由:它把智能体评估从回答与工具调用转向数据库终态,并以连续20次运行揭示单次成功率难以代表工作流可靠性。

  3. Simon Willison21

    Simon Willison 的 9 月赞助者专属通讯

    Simon Willison 已发送 9 月赞助者专属月刊,涵盖 Fable class 模型、价格战、3D 图形、Blender、像素艺术、数学 LLM、意外网络攻击及 Datasette 漏洞危机。赞助费用为 $10/month,可比免费版本提前一个月阅读,并可查看 8 月刊作为预览。

  4. TechCrunch · AI71

    AWS回应数据中心反对声浪,称项目审批中不再使用保密协议

    AWS CEO Matt Garman称,公司在新数据中心项目审批中已停止在与政府机构的往来中使用保密协议,以回应社区对透明度的质疑。他称全美有超过100项数据中心暂停令正被考虑,并以0.5%的工业用水占比、备用发电机99.9%的闲置时间和过去三年超过$1 billion的社区投入回应相关批评。

  5. TechCrunch · AI66

    OpenAI 安全员工 David Robinson 离职,称公司文化已经失灵

    负责撰写 OpenAI 重大产品发布安全报告的 David Robinson 宣布离职,称公司文化已经失灵。他认为试错式的迭代部署会带来周期性失误,前沿 AI 企业应像核电站或繁忙机场一样设置多层冗余,并需要来自公司外部的更强安全激励。OpenAI 回应称,公司会在必要时暂停训练或暂缓模型发布,并正加强研究测试环境安全、第三方评估和实时监控。

10月3日周六
  1. TechCrunch · AI60

    可在短信中使用的 AI 智能体盘点

    TechCrunch 盘点了多款可通过 iMessage、SMS、WhatsApp 或 Telegram 交互的 AI 智能体,它们能记忆上下文、连接现有服务并代用户完成任务。产品覆盖通用个人助理、家庭管理、旅行、内容创作和专业工作等场景,开放状态从公开测试到私测不等,部分提供免费方案或月费订阅。

  2. Latent Space45

    AINews 日报:GPT-6.1 Sol 与 Sonnet 5.5 的成本性能表现

    GPT-6.1 Sol 以每百万输入/输出 token $2/$10 定价推出,在 Agent Arena 排名第 5,单任务中位成本 $0.56。Sonnet 5.5 [Max] 首秀排名第 3、Chat 类第 1,但每任务成本 $2.74,未进入 Pareto 前沿;Anthropic 模型包揽该榜前三。

  3. TechCrunch · AI65

    Meta 推出 Muse Gadgets,让开发者自制连接 Muse 的硬件

    Meta 推出开源项目 Muse Gadgets,让开发者构建可连接个人 AI 智能体 Muse 的硬件。项目提供开源固件、Linux SDK及彩色电子墨水屏和 HDMI 电视棒等创意,并支持 Raspberry Pi、ESP32及多类外设。Meta 还制作了 5,000 台 USB-C 供电的 Muse Home Link,将在库存有限的情况下免费提供给 Muse 订阅用户。

  4. TechCrunch · AI66

    Sean Parker 正围绕音乐重建 Stability AI

    Sean Parker 与 CEO Prem Akkaraju 正将 Stability AI 调整为面向音乐专业人士的 AI 工具公司。公司在 8 月底宣布获得 Sony、Warner 和 Universal 等投资方提供的 $76 million 融资,这些公司还授权曲库用于训练。

10月2日周五
  1. MIT Technology Review · AI30

    自主式 AI 如何重塑企业智能

    自主式 AI 正推动企业 AI 从工具转向运营模式,但规模化瓶颈主要来自流程、数据与架构,而非模型能力。全球 AI 投资预计在 2026 年达 $2.5 trillion,较上年增长 44%,但多数企业仍未借 AI 推动营收增长。持续获益的企业先重构流程再选择模型,并采用可组合、主权可控的数据基础设施。

  2. AWS Machine Learning Blog69

    如何使用 Amazon Quick 和 Adjudicated Query 模式批量检查数千份租约的合规性

    AWS 介绍了 Adjudicated Query 模式,并提供可端到端部署的参考实现,用 Amazon Quick 对数万份租约执行合规检查。模型只负责把自然语言问题映射到六个固定 MCP 工具并叙述结果,正式判定由确定性规则引擎完成,完备性回执确保每条记录归入合规、违规、模糊或不可读类别。

    推荐理由:该模式将自然语言交互限制在固定工具表面,并以确定性规则和完备性回执隔离高风险判断,提供了可迁移的合规架构。

  3. Hugging Face Blog71

    Ai2 开源科研报告生成模型 AstaBrief 8B 及训练数据

    Ai2 开源 AstaBrief 8B 及其训练数据,该模型可将研究问题和检索到的文献片段生成带引用的报告。模型以 Qwen3-8B 为基础,使用 47K 个 SFT 样本和约 6K 个 DPO 样本,并以引用密度等信号过滤训练数据。

    推荐理由:文章展示了如何用真实科研查询、引用密度过滤和双裁判偏好数据,让8B模型兼顾报告质量、溯源与生成效率。

  4. GitHub Blog · AI & ML53

    GitHub 总结 AI 时代开发者应强化的三项技能

    GitHub 建议开发者强化三项技能,包括学会指挥 AI 智能体、不轻信 AI 的首次回答,以及用节省的实现时间解决更广泛的问题。开发者仍需定义任务、审查输出并权衡技术方案,还可让第二个模型批评第一个模型的结果;GitHub Copilot 内置的 Rubber Duck 智能体也采用第二个模型审查计划、代码和测试。

  5. Google Research62

    Google 探索基于 TEE 的可验证隐私联邦学习

    Google Research 公布新一代基于 TEE 的联邦学习系统,通过可远程证明的执行和公开透明日志提供可验证、可审计的数据匿名化保障。系统仅向操作方暴露指标和差分隐私模型权重,设备加密数据只能按预授权策略在 TEE 内限时解密处理。Gboard 已用其训练英文和日文下一词预测模型,获得更强隐私保障和更高准确率,并将此前每个模型 1-2 个月的训练瓶颈转移到服务器端并行计算。

    推荐理由:文章拆解了从访问策略、KMS 到透明日志的端到端设计,可用于理解联邦学习如何兼顾可审计隐私与训练效率。

  6. Latent Space77

    Airbnb 以“由内而外”路径改造内部开发与宾客体验

    Airbnb 正以“由内而外”路径推进 AI 原生改造,先用 AI 加速产品开发,再将相关能力用于客服和宾客体验。公司称 60% 的代码由 AI 编写,功能与改进同比增加近 80%,工程师平均 PR 吞吐量提升约 1.6x,约一半客服工单已完全由 AI 解决。

    推荐理由:Airbnb 将原型协作、组织上下文图、按场景模型评测和异步智能体串成落地路径,为大型软件组织推进 AI 原生改造提供了可迁移框架。

  7. MIT Technology Review · AI69

    别被迷惑,大语言模型并不会推理

    Thore Graepel主张,当前大语言模型的链式思维仍是延长的下一 token 预测,并不具备类似 AlphaGo 搜索机制的真正推理能力。他指出,聊天机器人缺少明确且可检查的认知状态、知识与推理机制的分离,其思维链还可能是事后编造的解释。他提出借鉴 AlphaGo,让系统持续维护认知状态,并由独立模块依据证据评估每一步、更新信念,从而形成可审计的推理过程。

  8. Latent Space75

    Pi 1.0 与 Pi Durable 更新,支持 MCP 和智能体断点恢复

    Pi 1.0 与 Pi Durable 更新,前者新增原生 MCP 支持、虚拟模型扩展、延迟工具加载和会话中系统消息等能力。Pi Durable 将 Pi 移植到 TypeScript 并外置有状态组件,可通过任务检查点在进程故障后恢复智能体与子智能体,同时支持并发分支会话、后台上下文压缩、状态同步和代码热更新。

  9. Hugging Face Blog49

    AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建 AutoSynthData,将企业环境中目标模型的能力缺口转化为可执行、可验证的智能体训练任务,并随模型改进动态调整课程。它结合目标模型的失败与更强教师模型的成功表现,生成由系统规范、用户提示和验证器组成的新任务,经环境检验后用于后训练,并以 EnterpriseOps Gym 数据集演示流程。