Amazon SageMaker 推出 aws-ai-ml 智能体技能,优化生成式 AI 推理
Amazon SageMaker AI 推出 aws-ai-ml 智能体技能,可让 Kiro、Claude Code、Codex 等 MCP 兼容编码智能体执行推理基准测试、推荐部署配置、比较性能结果并生成可执行的 SageMaker Python SDK v3 代码。
推荐理由:文章给出从安装技能到基准测试、实例选型和结果对比的完整流程,可迁移到现有 MCP 编码智能体工作流中。
技术方向
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
15 条精选近 30 天 15 条共收录 32 条
Amazon SageMaker AI 推出 aws-ai-ml 智能体技能,可让 Kiro、Claude Code、Codex 等 MCP 兼容编码智能体执行推理基准测试、推荐部署配置、比较性能结果并生成可执行的 SageMaker Python SDK v3 代码。
推荐理由:文章给出从安装技能到基准测试、实例选型和结果对比的完整流程,可迁移到现有 MCP 编码智能体工作流中。
GitHub 发布 AI 代码审查开放基准 ReviewBench,其 219 个 pull request 来自 187 个公开开源许可仓库,覆盖 19 种语言,分布参考了对 103.9M 个 GitHub pull request 的分析。
推荐理由:公开数据集、评分规则和自助运行器形成可复现评测链路,线上实验案例也展示了离线指标筛选代码审查改进的用法。
Airbnb 正以“由内而外”路径推进 AI 原生改造,先用 AI 加速产品开发,再将相关能力用于客服和宾客体验。公司称 60% 的代码由 AI 编写,功能与改进同比增加近 80%,工程师平均 PR 吞吐量提升约 1.6x,约一半客服工单已完全由 AI 解决。
推荐理由:Airbnb 将原型协作、组织上下文图、按场景模型评测和异步智能体串成落地路径,为大型软件组织推进 AI 原生改造提供了可迁移框架。
GPT-6 Astra Ultrafast 利用 NVIDIA Blackwell 架构进行推理优化,token 生成速度最高可达 Astra Standard 模式的 8x,现已面向 OpenAI API 及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:最高 8x 的 token 生成加速被具体落到编码智能体循环,可用于理解低延迟如何缩短工具调用间的等待。
OpenAI 的 Ari Weinstein 认为,Computer Use 近几个月已因自我调试、失败恢复和多种界面机制的结合而显著改变,部分任务可快于普通人。
推荐理由:访谈把 Computer Use 的模型与 harness 进展拆到具体机制,也还原了 Decisions API 一周原型冲刺的技术取舍。
Google DeepMind 发布 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并计划逐步扩展至开发者、企业和消费者。
推荐理由:多项基准与 Google 内部部署案例覆盖软件工程、知识工作和网络防御,可据此比较模型在长程复杂任务中的表现。
NVIDIA 与 CoreWeave 将新一代智能体 AI 基础设施投入生产,CoreWeave 宣布 NVIDIA Vera Rubin NVL72 可用,并推出连接模型与智能体训练、评估和改进流程的 CoreWeave Forge。
推荐理由:材料结合真实软件工程负载与多项性能数据,可用于评估新基础设施对智能体推理、沙箱运行和训练成本的影响。
OpenAI 在 DevDay 2026 推出常驻智能体 Dots、GPT-6.1 Sol,以及 Ultrafast、Decisions API、Agents API、ChatGPT Spaces 和 Marketplace,并披露 ChatGPT 达到 1.2 Billion WAU。
推荐理由:文章把 OpenAI DevDay 的模型、智能体和平台更新与独立评测并置,便于比较价格、速度与编码表现。
H Company 发布 Holo4 通用计算机使用智能体模型系列,包含 27B dense 和 35B-A3B 混合专家架构两种规格。Holo4 可通过 GUI、代码、MCP 和 API 操作软件,并同步推出 Holotron4 Nano 更新。
推荐理由:文章给出跨 GUI、代码、MCP 与 API 的训练设计,并公开基准轨迹和成本口径,便于复核性能比较。
GitHub Copilot app 可通过 canvases 构建自定义工作流界面,用户在智能体会话中运行 /create-canvas 并用自然语言描述需求,无需手动编写代码或设计布局。提示词应说明界面支持的工作流、用户可执行的操作以及智能体可执行的操作。生成的 canvas 支持双方实时修改共享状态,并可保存为供团队共享或个人使用的扩展。
推荐理由:通过拆解 /create-canvas 的描述要素和双向协作机制,给出将日常流程转换成可复用界面的具体路径。
当任务需要反复操作、自定义界面或自动化开发流程时,聊天往往不是 GitHub Copilot 的合适交互方式。GitHub Copilot app 的 canvas 是运行在应用内的全栈程序,可与 Copilot 智能体双向通信、调用第三方 API,并在本机执行代码。
推荐理由:文章把重复操作从聊天迁移到可复用的自定义界面,并以数据库和开发流程示例说明如何减少 token 消耗与人工介入。
GitHub Security Lab 开源 Fuzzing Taskflow,可针对 GitHub 上的 C/C++ 项目自动识别入口、生成 harness、运行 AFL++、迭代提升覆盖率并分诊崩溃。
推荐理由:它把覆盖率反馈、语料演进与崩溃分诊串成自动化闭环,并给出智能体决策与 MCP 工具执行分离的工程方法。
GitHub Copilot app 重构 Pull Request 视图,使包含 2,200 个文件、超过 100 万行变更和 400 多条行内评审评论的超大 PR 也能流畅打开和滚动。其方案将确定性的代码几何与动态评论块分离,通过视口范围内的惰性测量、滚动锚定和结构优先的数据流减少卡顿。团队还用应用内结构化探针、端到端测试和自动化循环持续发现性能问题。
推荐理由:文章将代码行与评论拆成两套几何系统,并结合惰性测量与滚动锚定,提供了可迁移的超大虚拟化界面优化方法。
GitHub 使用 Copilot app 和 CLI,将 Copilot agent runtime 从 TypeScript 和 Node.js 完整改写为超过 800,000 行生产级 Rust,AI 智能体编写了大部分代码。
推荐理由:这份迁移复盘把增量替换、跨语言互操作、智能体协作和分层审查串成一套可迁移的大型代码库改写方法。
Mistral 帮助一家欧洲能源运营商用 AI 智能体,将 40,000 行 Fortran 77 储层模拟器代码迁移到 C++,这部分是 300,000 行代码库的首个冲刺。团队先建立数值一致性测试框架,再用超过 100 个智能体整理分散的文档。实践最终采用由人类操作编码、测试和审查智能体的模块化工作流,而非完全自主迁移。
推荐理由:这项迁移复盘把数值一致性测试、文档整理和人机协作串成完整流程,可迁移到大型遗留系统改造。