MCP 智能体间通信为何可能成为高风险协议
过去五个月,Google 和另外四家机构承认其 AI 智能体存在漏洞,攻击者可借一个内部智能体向其他智能体传播恶意指令。这种特殊提示词注入针对具体智能体而非 LLM,并利用下游智能体对上游智能体的明确信任。独立研究员 Syed Anas Mohiuddin 的概念验证攻击利用了 MCP 中的信任缺口。
过去五个月,Google 和另外四家机构承认其 AI 智能体存在漏洞,攻击者可借一个内部智能体向其他智能体传播恶意指令。这种特殊提示词注入针对具体智能体而非 LLM,并利用下游智能体对上游智能体的明确信任。独立研究员 Syed Anas Mohiuddin 的概念验证攻击利用了 MCP 中的信任缺口。
Claude Code 可在 AWS GovCloud (US) 通过 Amazon Bedrock 调用 Claude Opus 5.5 和 Claude Sonnet 5.5,支持含 ITAR 要求的合规型 AI 辅助开发。两款模型均获 FedRAMP Class D 认证,可在终端和 IDE 中编辑代码、运行命令。
Amazon SageMaker AI 推出 aws-ai-ml 智能体技能,可让 Kiro、Claude Code、Codex 等 MCP 兼容编码智能体执行推理基准测试、推荐部署配置、比较性能结果并生成可执行的 SageMaker Python SDK v3 代码。
推荐理由:文章给出从安装技能到基准测试、实例选型和结果对比的完整流程,可迁移到现有 MCP 编码智能体工作流中。
AWS 展示了 Quick Resource Migrator,通过部署在 Amazon Bedrock AgentCore 上的 MCP server,自动将 Amazon Quick 资源从开发账户迁移到生产账户。
AWS 展示如何使用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的有用性、业务准确性与可解释性。教程以供应链决策系统为例,依次使用内置评估器、业务规则自定义评估器和六类可解释性评估器,区分决策错误与解释不足。
Microsoft ThinkingBox 根据智能体执行后留下的数据库终态和副作用评分,并让507个有状态业务工作流各重复运行20次,以衡量结果一致性。在覆盖12个LLM、121,680次有效试验的消融中,79,853次未通过可执行检查,其中67.24%仍正常结束、调用了状态变更工具且未报告最终工具错误。
推荐理由:它把智能体评估从回答与工具调用转向数据库终态,并以连续20次运行揭示单次成功率难以代表工作流可靠性。
OpenAI 发布 GPT-6 系列模型指南,帮助初创公司选择模型并调整推理投入。指南还涵盖提示词与技能优化、工具协调,以及面向生产环境的工作流准备。
AWS 介绍了 Adjudicated Query 模式,并提供可端到端部署的参考实现,用 Amazon Quick 对数万份租约执行合规检查。模型只负责把自然语言问题映射到六个固定 MCP 工具并叙述结果,正式判定由确定性规则引擎完成,完备性回执确保每条记录归入合规、违规、模糊或不可读类别。
推荐理由:该模式将自然语言交互限制在固定工具表面,并以确定性规则和完备性回执隔离高风险判断,提供了可迁移的合规架构。
AWS 介绍如何通过 Amazon Bedrock AgentCore Gateway 为 Claude Desktop 接入 Web Search,并以 JWT 入站鉴权保护通信。
Airbnb 正以“由内而外”路径推进 AI 原生改造,先用 AI 加速产品开发,再将相关能力用于客服和宾客体验。公司称 60% 的代码由 AI 编写,功能与改进同比增加近 80%,工程师平均 PR 吞吐量提升约 1.6x,约一半客服工单已完全由 AI 解决。
推荐理由:Airbnb 将原型协作、组织上下文图、按场景模型评测和异步智能体串成落地路径,为大型软件组织推进 AI 原生改造提供了可迁移框架。
Pi 1.0 与 Pi Durable 更新,前者新增原生 MCP 支持、虚拟模型扩展、延迟工具加载和会话中系统消息等能力。Pi Durable 将 Pi 移植到 TypeScript 并外置有状态组件,可通过任务检查点在进程故障后恢复智能体与子智能体,同时支持并发分支会话、后台上下文压缩、状态同步和代码热更新。
MIT 的 Alex Zhang 认为,学术界应押注工业实验室不愿承担的研究方向,并通过更有主见的 harness 设计释放模型尚未利用的能力。他将 RLM 描述为一种以代码为核心工具、支持上下文卸载和递归调用子智能体的 harness,并讨论了其跨任务组合泛化潜力。访谈还涉及 AI 生成 GPU 内核的验证缺口、多智能体集群中的低效搜索,以及未来语言模型可能以隐藏的智能体集群呈现。
OpenAI 的 Ari Weinstein 认为,Computer Use 近几个月已因自我调试、失败恢复和多种界面机制的结合而显著改变,部分任务可快于普通人。
推荐理由:访谈把 Computer Use 的模型与 harness 进展拆到具体机制,也还原了 Decisions API 一周原型冲刺的技术取舍。
OpenAI 在 DevDay 2026 推出常驻智能体 Dots、GPT-6.1 Sol,以及 Ultrafast、Decisions API、Agents API、ChatGPT Spaces 和 Marketplace,并披露 ChatGPT 达到 1.2 Billion WAU。
推荐理由:文章把 OpenAI DevDay 的模型、智能体和平台更新与独立评测并置,便于比较价格、速度与编码表现。
ProvenanceGuard 是面向 MCP 智能体的生成后核验层,可在不重新训练智能体的情况下,逐条检查声明是否由答案所指向的正确来源支持。在40个答案的361条声明中,专家认为139条不应通过,系统拦截了其中138条;其 Reject/block F1 为0.802,并为每条声明输出来源 ID。面对多个相似来源时,其拦截 F1 为0.846,但精确识别来源的正确率为50.3%。
H Company 发布 Holo4 通用计算机使用智能体模型系列,包含 27B dense 和 35B-A3B 混合专家架构两种规格。Holo4 可通过 GUI、代码、MCP 和 API 操作软件,并同步推出 Holotron4 Nano 更新。
推荐理由:文章给出跨 GUI、代码、MCP 与 API 的训练设计,并公开基准轨迹和成本口径,便于复核性能比较。
当任务需要反复操作、自定义界面或自动化开发流程时,聊天往往不是 GitHub Copilot 的合适交互方式。GitHub Copilot app 的 canvas 是运行在应用内的全栈程序,可与 Copilot 智能体双向通信、调用第三方 API,并在本机执行代码。
推荐理由:文章把重复操作从聊天迁移到可复用的自定义界面,并以数据库和开发流程示例说明如何减少 token 消耗与人工介入。
GitHub Security Lab 开源 Fuzzing Taskflow,可针对 GitHub 上的 C/C++ 项目自动识别入口、生成 harness、运行 AFL++、迭代提升覆盖率并分诊崩溃。
推荐理由:它把覆盖率反馈、语料演进与崩溃分诊串成自动化闭环,并给出智能体决策与 MCP 工具执行分离的工程方法。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近实时视频生成与原生实时对话模型结合,并已在 Gemini Enterprise 提供。
推荐理由:它将实时对话、流式视频与异步工具调用整合进企业智能体,为客服和交互导览提供更连续的多模态交互路径。
GitHub 认为,开发者仍需审查并对 AI 生成代码负责,RAG 并未过时,Skills 与 MCP 解决的是不同问题。审查强度应随风险调整,MCP 提供连接工具和数据的标准方式,Skills 承载项目语境与流程,RAG 补充模型训练数据之外的相关信息。文章还将模型难以理解代码库视为可维护性压力测试,并主张通过实际构建和记录检验观点。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,两款模型面向近实时推理和生产级语音智能体。
推荐理由:两款模型把并行推理、视觉理解和后台工具调用融入近实时对话,为复杂语音智能体提供了更完整的生产级能力组合。
Google Research提出ToolGrad,以答案优先范式和文本“梯度”构建已验证API工作流,降低长链工具使用数据的生成成本。ToolGrad-12B在BFCL得83.1分,接近gemini-2.5-pro的83.2,并高于claude-4.5 Opus与gpt-5。
Mistral 发布 Agentic Search,通过多步检索循环让 AI 系统在复杂文档和多数据源中查找、浏览并核验信息,现已通过 Mistral Search Toolkit 及 Studio、Vibe 中的 Libraries 提供。
推荐理由:多步检索与文档内导航被纳入同一套默认工具栈,两项基准呈现了相对单次 RAG 的准确率、token 和延迟变化。
Hugging Face 梳理 AI 智能体领域的易混术语,将 Scaffold 定义为模型周围决定行为的层,将 Harness 定义为调用模型、处理工具调用并决定何时停止的执行层。文章还区分了模型、智能体、上下文工程、Policy、工具、技能与子智能体,并解释了 RL 训练中的环境、Trainer、Rollout 和 Reward。
推荐理由:文章以模型、Scaffold 与 Harness 的分层关系厘清易混术语,并串联上下文工程和强化学习训练环节,便于跨框架沟通。