Amazon SageMaker 推出 aws-ai-ml 智能体技能,优化生成式 AI 推理
Amazon SageMaker AI 推出 aws-ai-ml 智能体技能,可让 Kiro、Claude Code、Codex 等 MCP 兼容编码智能体执行推理基准测试、推荐部署配置、比较性能结果并生成可执行的 SageMaker Python SDK v3 代码。
推荐理由:文章给出从安装技能到基准测试、实例选型和结果对比的完整流程,可迁移到现有 MCP 编码智能体工作流中。
技术方向
模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。
13 条精选近 30 天 11 条共收录 24 条
Amazon SageMaker AI 推出 aws-ai-ml 智能体技能,可让 Kiro、Claude Code、Codex 等 MCP 兼容编码智能体执行推理基准测试、推荐部署配置、比较性能结果并生成可执行的 SageMaker Python SDK v3 代码。
推荐理由:文章给出从安装技能到基准测试、实例选型和结果对比的完整流程,可迁移到现有 MCP 编码智能体工作流中。
Microsoft ThinkingBox 根据智能体执行后留下的数据库终态和副作用评分,并让507个有状态业务工作流各重复运行20次,以衡量结果一致性。在覆盖12个LLM、121,680次有效试验的消融中,79,853次未通过可执行检查,其中67.24%仍正常结束、调用了状态变更工具且未报告最终工具错误。
推荐理由:它把智能体评估从回答与工具调用转向数据库终态,并以连续20次运行揭示单次成功率难以代表工作流可靠性。
AWS 介绍了 Adjudicated Query 模式,并提供可端到端部署的参考实现,用 Amazon Quick 对数万份租约执行合规检查。模型只负责把自然语言问题映射到六个固定 MCP 工具并叙述结果,正式判定由确定性规则引擎完成,完备性回执确保每条记录归入合规、违规、模糊或不可读类别。
推荐理由:该模式将自然语言交互限制在固定工具表面,并以确定性规则和完备性回执隔离高风险判断,提供了可迁移的合规架构。
Airbnb 正以“由内而外”路径推进 AI 原生改造,先用 AI 加速产品开发,再将相关能力用于客服和宾客体验。公司称 60% 的代码由 AI 编写,功能与改进同比增加近 80%,工程师平均 PR 吞吐量提升约 1.6x,约一半客服工单已完全由 AI 解决。
推荐理由:Airbnb 将原型协作、组织上下文图、按场景模型评测和异步智能体串成落地路径,为大型软件组织推进 AI 原生改造提供了可迁移框架。
OpenAI 的 Ari Weinstein 认为,Computer Use 近几个月已因自我调试、失败恢复和多种界面机制的结合而显著改变,部分任务可快于普通人。
推荐理由:访谈把 Computer Use 的模型与 harness 进展拆到具体机制,也还原了 Decisions API 一周原型冲刺的技术取舍。
OpenAI 在 DevDay 2026 推出常驻智能体 Dots、GPT-6.1 Sol,以及 Ultrafast、Decisions API、Agents API、ChatGPT Spaces 和 Marketplace,并披露 ChatGPT 达到 1.2 Billion WAU。
推荐理由:文章把 OpenAI DevDay 的模型、智能体和平台更新与独立评测并置,便于比较价格、速度与编码表现。
H Company 发布 Holo4 通用计算机使用智能体模型系列,包含 27B dense 和 35B-A3B 混合专家架构两种规格。Holo4 可通过 GUI、代码、MCP 和 API 操作软件,并同步推出 Holotron4 Nano 更新。
推荐理由:文章给出跨 GUI、代码、MCP 与 API 的训练设计,并公开基准轨迹和成本口径,便于复核性能比较。
当任务需要反复操作、自定义界面或自动化开发流程时,聊天往往不是 GitHub Copilot 的合适交互方式。GitHub Copilot app 的 canvas 是运行在应用内的全栈程序,可与 Copilot 智能体双向通信、调用第三方 API,并在本机执行代码。
推荐理由:文章把重复操作从聊天迁移到可复用的自定义界面,并以数据库和开发流程示例说明如何减少 token 消耗与人工介入。
GitHub Security Lab 开源 Fuzzing Taskflow,可针对 GitHub 上的 C/C++ 项目自动识别入口、生成 harness、运行 AFL++、迭代提升覆盖率并分诊崩溃。
推荐理由:它把覆盖率反馈、语料演进与崩溃分诊串成自动化闭环,并给出智能体决策与 MCP 工具执行分离的工程方法。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近实时视频生成与原生实时对话模型结合,并已在 Gemini Enterprise 提供。
推荐理由:它将实时对话、流式视频与异步工具调用整合进企业智能体,为客服和交互导览提供更连续的多模态交互路径。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,两款模型面向近实时推理和生产级语音智能体。
推荐理由:两款模型把并行推理、视觉理解和后台工具调用融入近实时对话,为复杂语音智能体提供了更完整的生产级能力组合。
Mistral 发布 Agentic Search,通过多步检索循环让 AI 系统在复杂文档和多数据源中查找、浏览并核验信息,现已通过 Mistral Search Toolkit 及 Studio、Vibe 中的 Libraries 提供。
推荐理由:多步检索与文档内导航被纳入同一套默认工具栈,两项基准呈现了相对单次 RAG 的准确率、token 和延迟变化。
Hugging Face 梳理 AI 智能体领域的易混术语,将 Scaffold 定义为模型周围决定行为的层,将 Harness 定义为调用模型、处理工具调用并决定何时停止的执行层。文章还区分了模型、智能体、上下文工程、Policy、工具、技能与子智能体,并解释了 RL 训练中的环境、Trainer、Rollout 和 Reward。
推荐理由:文章以模型、Scaffold 与 Harness 的分层关系厘清易混术语,并串联上下文工程和强化学习训练环节,便于跨框架沟通。