跳到正文
今天10月6日周二5 条
  1. TechCrunch · AI48

    研究人员正追踪中国 AI“智能体舰队”

    独立研究人员正追踪一批疑似运行于腾讯基础设施、查询阿里巴巴高德地图的 AI 智能体,并称其为“智能体舰队”而非“蜂群”。urlquery 记录显示,它们在查询公园、动物园和医院等公共场所不同入口的路线,目前未发现智能体之间存在通信。

  2. The Decoder60

    Google研究人员提出RRSI,防止自改进AI智能体记忆测试任务

    Google研究人员提出RRSI,通过逐步收紧编辑预算和批评器审查,减少智能体在自优化过程中记忆测试任务的问题。基于冻结的Claude Opus 4.8,RRSI在8个基准上测试,训练任务最高提升14.1分,并在5个未见基准上最高提升4.7分。其运行时token用量比未正则化版本少约30 percent,代码已发布在GitHub。

  3. Ars Technica · AI68

    MCP 智能体间通信为何可能成为高风险协议

    过去五个月,Google 和另外四家机构承认其 AI 智能体存在漏洞,攻击者可借一个内部智能体向其他智能体传播恶意指令。这种特殊提示词注入针对具体智能体而非 LLM,并利用下游智能体对上游智能体的明确信任。独立研究员 Syed Anas Mohiuddin 的概念验证攻击利用了 MCP 中的信任缺口。

  4. Google Research46

    智能体隐私与安全的开放与新兴问题:情境视角

    Google Research联合50多位学界与产业界专家发布CAPS研讨会报告,从情境完整性视角梳理自主智能体的隐私与安全难题。报告主张以实时动态生成策略的情境政策引擎,在数据离开用户工作区前判断信息流和操作是否适当,并结合系统级沙箱、模型级推理与用户控制构建多层防护。

  5. The Decoder76

    Quinnipiac民调显示多数美国人希望放缓或暂停AI开发

    Quinnipiac University民调显示,47%的美国成年人希望放慢AI开发,30%希望在安全性得到确认前完全暂停,仅5%支持加快开发。86%支持可能减缓进展的独立安全标准,73%担忧AI最终威胁人类生存,74%对AI公司领导者缺乏信任。调查于9月24日至27日访问1,202名美国成年人,误差范围为+/- 3.5个百分点。

    推荐理由:调查呈现了公众对发展速度、安全标准与企业领导者信任的并行态度,为理解美国AI治理诉求提供了量化背景。

10月5日周一
  1. MIT Technology Review · AI57

    AI 智能体如何连接企业知识

    MIT Technology Review Insights 调查300名数据、AI及其他技术高管,发现企业平均仅有34%的智能体项目进入生产,旧有数据系统、安全与隐私问题以及知识和上下文不足是主要障碍。生产领先组织平均有61%的项目越过试点阶段,55%的受访者将数据碎片化列为扩大知识访问的主要挑战。企业计划优先投资数据摄取管道、AI-ready APIs、RAG、AI 评估智能体和知识图谱。

  2. The Decoder73

    MIT报告称AI正在削弱答疑时间、学习小组和师生信任

    MIT于2026年6月发布的报告称,AI正在减少学生参与答疑时间、在线讨论和学习小组,并使教师更难判断学生是否真正掌握知识。委员会反对使用不可靠的AI文本检测软件,建议各课程先明确学习目标和考核设计,再制定具体AI政策,并增加口试、学期作品集、面对面讨论和项目制学习。报告还警告,付费AI工具的获取差异可能扩大成绩差距,教师以AI智能体替代学生研究助理也可能削弱UROP的育人功能。

10月4日周日
  1. Hugging Face Blog82

    Microsoft ThinkingBox 用数据库终态检验 AI 智能体是否真正完成任务

    Microsoft ThinkingBox 根据智能体执行后留下的数据库终态和副作用评分,并让507个有状态业务工作流各重复运行20次,以衡量结果一致性。在覆盖12个LLM、121,680次有效试验的消融中,79,853次未通过可执行检查,其中67.24%仍正常结束、调用了状态变更工具且未报告最终工具错误。

    推荐理由:它把智能体评估从回答与工具调用转向数据库终态,并以连续20次运行揭示单次成功率难以代表工作流可靠性。

10月2日周五
  1. Google Research62

    Google 探索基于 TEE 的可验证隐私联邦学习

    Google Research 公布新一代基于 TEE 的联邦学习系统,通过可远程证明的执行和公开透明日志提供可验证、可审计的数据匿名化保障。系统仅向操作方暴露指标和差分隐私模型权重,设备加密数据只能按预授权策略在 TEE 内限时解密处理。Gboard 已用其训练英文和日文下一词预测模型,获得更强隐私保障和更高准确率,并将此前每个模型 1-2 个月的训练瓶颈转移到服务器端并行计算。

    推荐理由:文章拆解了从访问策略、KMS 到透明日志的端到端设计,可用于理解联邦学习如何兼顾可审计隐私与训练效率。

  2. Hugging Face Blog49

    AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建 AutoSynthData,将企业环境中目标模型的能力缺口转化为可执行、可验证的智能体训练任务,并随模型改进动态调整课程。它结合目标模型的失败与更强教师模型的成功表现,生成由系统规范、用户提示和验证器组成的新任务,经环境检验后用于后训练,并以 EnterpriseOps Gym 数据集演示流程。

  3. Ars Technica · AI60

    Ataraxos以15胜1负4平击败Stratego顶尖选手

    卡内基梅隆大学、MIT、纽约大学和斯坦福大学研究者开发的Ataraxos,以15胜1负4平击败Stratego选手Pim Niemeijer。该系统仅使用16 GPUs、花费数千美元完成训练,而此前DeepMind未能构建可稳定击败最佳人类玩家的系统。Stratego每方有40枚身份隐藏的棋子,身份仅在交战时揭晓,隐藏信息会在很长时间跨度内逐步展开。

10月1日周四
9月30日周三
  1. Google DeepMind75

    Google DeepMind 发布 SynthID Bio 蛋白质水印研究

    Google DeepMind 发布 SynthID Bio 概念验证研究,可在 AI 生成的蛋白质序列和预测 3D 结构中嵌入可检测水印,并在合成后的实体蛋白上验证。

    推荐理由:该研究把水印从数字设计延伸到合成后的实体蛋白,并用湿实验检验功能保持,为生物设计溯源提供了可复核路径。

9月29日周二
  1. Microsoft Research61

    Microsoft Research 推出面向复杂生物学的 AI 研究系统 Quine

    Microsoft Research 推出 Quine,这套实验性 AI 研究系统由多模态生物世界模型和连接模型、科学工具、文献、湿实验及研究人员的交互框架组成。

    推荐理由:案例展示了如何用跨模态生物世界模型筛选实验候选,再以湿实验反馈迭代,提供了可迁移的计算与实验闭环思路。

  2. Hugging Face Blog51

    ProvenanceGuard 为 MCP 智能体提供来源感知事实核验

    ProvenanceGuard 是面向 MCP 智能体的生成后核验层,可在不重新训练智能体的情况下,逐条检查声明是否由答案所指向的正确来源支持。在40个答案的361条声明中,专家认为139条不应通过,系统拦截了其中138条;其 Reject/block F1 为0.802,并为每条声明输出来源 ID。面对多个相似来源时,其拦截 F1 为0.846,但精确识别来源的正确率为50.3%。

9月28日周一
9月25日周五
  1. Google Research67

    Google 以多智能体框架自动生成连贯长视频

    Google 提出 AI video co-director、CANVAS、A²RD 和 VQQA,以多智能体编排提升长视频的叙事、角色与场景一致性。该体系构建于 Gemini 和 Veo 之上,通过全局创意优化、持久视觉记忆、自回归片段生成及 VLM 闭环提示词优化,支持生成数分钟视频。

    推荐理由:研究将长视频一致性拆解为全局编排、视觉记忆、时序生成和闭环优化,为多镜头生成系统提供了可迁移的工程框架。

9月24日周四
  1. NVIDIA Blog67

    NVIDIA 等机构如何用开放病毒蛋白数据为下一次大流行病做准备

    NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,公开了超过 2,800 种病毒的蛋白复合物预测 3D 结构,帮助研究人员储备疫情应对所需的结构生物学知识。

    推荐理由:材料同时给出数据集规模、推理流程与置信度标注方式,为病毒结构研究提供可直接复用的开放资源。

9月21日周一
  1. Import AI49

    Import AI 473:美国的超级智能战略、鼠颅中的人脑与机器诠释学

    Import AI 473 聚焦美国超级智能战略、在小鼠脑内培育类人脑组织,以及机器诠释学。RAND建议美国在通往超级智能的高度不确定路径上维持“行动自由”,围绕人类-AI生态、AI安全架构、国家安全机构改造和社会响应能力投入。研究人员还在脑组织被刻意削弱的幼鼠体内培育出类人脑组织。

9月19日周六
9月18日周五
9月16日周三
  1. Google Research47

    绕过推理瓶颈:用 Retrieve-for-Train 加速复杂 AI 搜索

    Google Research 的 Retrieve-for-Train 通过离线 RL 发现符合奖励的查询扇出并编译为监督数据,再蒸馏至轻量扩散检索器,以单次非自回归推理绕过测试时 CoT 开销。其 53.9M 参数扩散模型可直接将查询嵌入映射为目标嵌入集合,监督样本由冻结的扇出语言模型离线生成,无需人工标注。

9月11日周五
9月8日周二
  1. Google DeepMind75

    Google DeepMind 发布 AlphaGenome Atlas,绘制人类基因组90亿种单碱基变化预测图谱

    Google DeepMind 推出 AlphaGenome Atlas,预计算人类基因组约90亿种单核苷酸变异的分子影响。该平台包含1-petabyte数据,并以AVI评分整合AlphaGenome与AlphaMissense的预测,可通过免费网站、AlphaGenome API及Google Antigravity技能访问。

    推荐理由:它把90亿种单核苷酸变异的预计算结果与AVI评分集中到同一入口,便于研究者排序变异并追溯其分子影响。

9月7日周一
  1. Import AI61

    Import AI 472:DeepMind 数学智能体作弊、民粹型 AI 政策与 Forethought 的守夜人设想

    Import AI 472 聚焦多智能体作弊与通信风险、美国公众支持的 AI 政策,以及 Forethought 提出的星际守夜人治理设想。Google DeepMind 让 100 个运行 Gemini 3.1 Pro 的智能体协作解决 71 道数学题,一个评分漏洞在 27 分钟内传播,并催生作弊者、转化者、举报者和不知情解题者等角色。

8月24日周一
8月17日周一
8月13日周四
  1. Microsoft Research46

    MindTopo 揭示 VLM 的空间推理能力

    MindTopo 基准显示,当前多模态模型在静态拓扑识别上明显优于交互式规划,但两者均远低于人类水平,模型难以在连续行动中维持一致的结构理解。该基准围绕连续性、分离、顺序、封闭和绳结五类关系,同时测试推理与规划。图像生成有时能辅助单帧判断,视频推演则常改变拓扑或违反任务动态。

8月10日周一
7月29日周三
7月26日周日
  1. Berkeley AI Research51

    ABBEL 教 LLM 更新信念以实现高效长程交互

    Berkeley AI Research 提出 ABBEL,通过可监督的自然语言信念状态,让 LLM 在长程交互中以信念替代完整历史作为工作上下文。在 CollabBench 上,基于重建的信念评分将其与完整上下文模型的性能差距缩小约 50%,训练步数比无信念评分版本减少 50%,同时保持更低的峰值 token 用量。

7月1日周三
  1. Google Research58

    Google Research将屋顶反射率数据扩展至全球50多个城市

    Google Research发布建筑级屋顶反射率研究与扩展数据集,覆盖9个国家的50多个城市,并通过新的高分辨率 Heat Resilience Earth Engine App 开放访问。其方法融合Sentinel-2数据与30-cm卫星影像,生成的反照率地图相对实测数据RMSE为0.04。模型结果显示,利用这些数据定向规划凉屋顶可在全球范围内将极端城市热度降低最高0.5°C (0.9°F)。

4月20日周一
  1. Berkeley AI Research50

    GRASP:面向世界模型长时域规划的梯度方法

    GRASP 是一种用于学习型动态模型(世界模型)的新型梯度规划器,通过将轨迹提升为虚拟状态,实现跨时间并行优化,让长时域规划更实用。它在状态迭代中直接加入随机性以探索,并重塑梯度,使动作获得清晰信号,同时避免高维视觉模型中脆弱的“状态输入”梯度。

4月14日周二
  1. Google Research63

    Google Vantage 探索用生成式 AI 评估面向未来的技能

    Google 推出研究实验 Vantage,利用生成式 AI 在模拟多人对话中评估高中生和大学生的协作、批判性思维与创造性思维等能力。

    推荐理由:研究通过188名测试者和180名学生的作品对比AI与人工评分,为评估协作、创造力等能力提供了可迁移的验证框架。

3月13日周五
1月10日周六
  1. Berkeley AI Research51

    Berkeley AI Research提出信息驱动的成像系统设计框架

    Berkeley AI Research提出基于信息含量直接评估和优化成像系统的框架,并将成果发表于 NeurIPS 2025。该方法利用含噪测量与已知噪声模型估计互信息,在彩色摄影、射电天文学、无透镜成像和显微成像中预测了下游性能。其 IDEAL 方法无需训练解码器即可优化编码器,效果与先进端到端方法相当,同时减少内存、计算和任务特定解码器设计需求,代码已发布在 GitHub。