GitHub Security Lab Taskflow Agent 用 LLM 智能体自动化 C/C++ 模糊测试
GitHub Security Lab 开源 Fuzzing Taskflow,可针对 GitHub 上的 C/C++ 项目自动识别入口、生成 harness、运行 AFL++、迭代提升覆盖率并分诊崩溃。
推荐理由:它把覆盖率反馈、语料演进与崩溃分诊串成自动化闭环,并给出智能体决策与 MCP 工具执行分离的工程方法。
GitHub Security Lab 开源 Fuzzing Taskflow,可针对 GitHub 上的 C/C++ 项目自动识别入口、生成 harness、运行 AFL++、迭代提升覆盖率并分诊崩溃。
推荐理由:它把覆盖率反馈、语料演进与崩溃分诊串成自动化闭环,并给出智能体决策与 MCP 工具执行分离的工程方法。
Ringg 基于 GPT-5.6 打造的 AI 智能体可解决最多 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页等多语言场景。相比 GPT-4.1,其成本降低 90%。
Harvey 借助 GPT-6 Astra 生成结构更清晰、更贴合上下文的法律文书,让律师得以专注于策略。
NVIDIA 与合作伙伴在 AI Day Singapore 展示东南亚 AI 进展,以 Nemotron 开放模型和工具推动公共部门及企业规模化部署。新加坡 HTX 正研究 Nemotron 3 Super 与 Nemotron 3 Nano Omni;泰国 iApp Technology 开源法律模型,Thanoy 聊天机器人约有 43,000 名用户。
NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,引入智能体工作流和 ROS Lyrical、Ubuntu 24.04 支持,帮助开发者更快构建和部署机器人应用。新版本提供 FoundationStereo 微调技能、FoundationPose 推理库和 pick and place 技能,并支持从 Jetson Orin Nano 到 Jetson Thor 的可扩展计算。
推荐理由:原文给出了新版本在智能体工作流和平台支持上的具体变化,读者可以据此判断它对机器人开发流程的实际影响。
Parallel 借助 GPT-6 Astra 让智能体研究并综合劳动力市场数据,耗时和成本相比此前模型均减半。
NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。智能体栈中模型、harness 与运行时环境各层都承担安全责任,权限不能随任务自动扩展,敏感操作仍需人工审批。NVIDIA OpenShell 作为开源安全运行时在智能体之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。
Higgsfield AI 借助 GPT-6 Astra,一天内上线新的视频功能,让小微企业制作视频广告更简单,并更快将新创意工具推向市场。
V7 使用 GPT-5.6 将分散的公司文件转化为智能体可用的上下文,以完成复杂的、可溯源的工作,同时将成本削减 78% 并提升准确率。
GitHub 认为,开发者仍需审查并对 AI 生成代码负责,RAG 并未过时,Skills 与 MCP 解决的是不同问题。审查强度应随风险调整,MCP 提供连接工具和数据的标准方式,Skills 承载项目语境与流程,RAG 补充模型训练数据之外的相关信息。文章还将模型难以理解代码库视为可维护性压力测试,并主张通过实际构建和记录检验观点。
Cooley 基于 ChatGPT Work 打造了 GO Public,把智能能力引入 IPO 流程,帮助律师更早发现问题并将判断力集中在最关键之处。
GitHub 使用 Copilot app 和 CLI,将 Copilot agent runtime 从 TypeScript 和 Node.js 完整改写为超过 800,000 行生产级 Rust,AI 智能体编写了大部分代码。
推荐理由:这份迁移复盘把增量替换、跨语言互操作、智能体协作和分层审查串成一套可迁移的大型代码库改写方法。
OpenAI 发布 Astra for Law,为法律行业提供前沿智能、律所自定义工作流、法律数据源接入,以及针对机密客户工作的法律级管控。该产品隶属 OpenAI for Law,具体模型版本、价格与可用性未在原文披露。
OpenAI 推出 AI 驱动的广告新体验,包括 Sponsored Agents 以及面向营销人员的工具,并集成 HubSpot 和 Shopify。
IBM Research 在 ALTK-Evolve 中引入一致性指南,通过一致性分析器定位智能体易翻转的决策点,将 AppWorld 上 GPT-4.1 ReAct 智能体的 Pass^5 从 53.0% 提升至 69.0%,一致性差距从 24.4pp 降至 12.0pp,且平均准确率不降反升。
推荐理由:原文提出用一致性分析器定位智能体易翻转的决策点,并给出可复用的诊断与修复方法。
Fyxer 基于 OpenAI 模型、微调与记忆能力,并结合真实用户反馈,打造出可整理收件箱、按用户本人语气起草邮件的 AI 行政助理。
Perplexity 采用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,且相比早期模型,人工检查频率大幅降低。
GitHub 日本和韩国区营销负责人用 GitHub Copilot 把活动运营流程自动化:以 GitHub Issue 为工作单元,用 Issue forms 收集活动信息、Labels 触发 GitHub Actions 工作流,活动从单个 Issue 自动搭建、每日筛选报名者并在结束后自动清理。
Cognition 用 GPT‑6 Astra 提升 Devin 测试软件并证明其可用的能力,目标是让工程师少审代码、多交付。GPT‑6 Astra 强化了 Devin 对自身工作成果的验证环节。
Google Research提出ToolGrad,以答案优先范式和文本“梯度”构建已验证API工作流,降低长链工具使用数据的生成成本。ToolGrad-12B在BFCL得83.1分,接近gemini-2.5-pro的83.2,并高于claude-4.5 Opus与gpt-5。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行和预览智能体生成的代码变更。diff 面板以绿色和红色高亮显示新增与删除行,终端面板支持运行命令和配置脚本,浏览器面板的 Pick & Polish 工具可选中页面元素并让智能体调整。完成审查、运行和预览后,可直接在应用内接受变更并创建 pull request。
OpenAI 宣布 ChatGPT Work 中的 Data agent 面向所有人开放,可连接公司数据、发现洞察,并用自然语言让 AI 构建交互式仪表盘。
推荐理由:OpenAI 官方披露 ChatGPT Work 数据智能体的连接数据与自然语言建看板能力,可据此判断企业数据工作流的入口变化。
OpenAI 发布 ChatGPT for Financial Services,将内置金融数据与 GPT-6 Astra 结合,用于研究、建模和面向客户的材料制作。
推荐理由:OpenAI 把内置金融数据与 GPT-6 Astra 打包成行业版本,读者可据此判断金融工作流的入口变化。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。
推荐理由:OpenAI 官方发布托管式 Agents API,读者可据此了解云端智能体的编排与长会话能力入口。
Mistral 帮助一家欧洲能源运营商用 AI 智能体,将 40,000 行 Fortran 77 储层模拟器代码迁移到 C++,这部分是 300,000 行代码库的首个冲刺。团队先建立数值一致性测试框架,再用超过 100 个智能体整理分散的文档。实践最终采用由人类操作编码、测试和审查智能体的模块化工作流,而非完全自主迁移。
推荐理由:这项迁移复盘把数值一致性测试、文档整理和人机协作串成完整流程,可迁移到大型遗留系统改造。
OpenAI 发布 GPT-6 Astra,称其为面向企业的最强模型,具备高级推理、计算机操作以及更强的写作与设计判断能力。
推荐理由:OpenAI 公布 GPT-6 Astra 面向企业场景的能力方向,可据此了解其推理与计算机操作定位。
OpenAI 披露内部编码智能体正在重塑 AI 研究,并公开了智能体使用情况、实验速度、任务复杂度与研究加速的早期数据。
Mistral 发布 Agentic Search,通过多步检索循环让 AI 系统在复杂文档和多数据源中查找、浏览并核验信息,现已通过 Mistral Search Toolkit 及 Studio、Vibe 中的 Libraries 提供。
推荐理由:多步检索与文档内导航被纳入同一套默认工具栈,两项基准呈现了相对单次 RAG 的准确率、token 和延迟变化。
Berkeley AI Research 提出 ABBEL,通过可监督的自然语言信念状态,让 LLM 在长程交互中以信念替代完整历史作为工作上下文。在 CollabBench 上,基于重建的信念评分将其与完整上下文模型的性能差距缩小约 50%,训练步数比无信念评分版本减少 50%,同时保持更低的峰值 token 用量。
Berkeley AI Research 作者认为,随着推理成本趋近于零,数据系统需要围绕智能体负载、智能体群体运行和智能体合成系统重新设计。GPT-4 级能力每百万 token 的成本已从 2023 年初约 $30 降至如今不足 $1,部分供应商低于 $0.10;不同基准上的推理价格每年下降 9x 至 900x,中位数接近 50x。
推荐理由:文章把推理成本持续下降与数据系统演进联系起来,提出智能体负载、群体运行底座和系统合成三条研究主线。
Hugging Face 梳理 AI 智能体领域的易混术语,将 Scaffold 定义为模型周围决定行为的层,将 Harness 定义为调用模型、处理工具调用并决定何时停止的执行层。文章还区分了模型、智能体、上下文工程、Policy、工具、技能与子智能体,并解释了 RL 训练中的环境、Trainer、Rollout 和 Reward。
推荐理由:文章以模型、Scaffold 与 Harness 的分层关系厘清易混术语,并串联上下文工程和强化学习训练环节,便于跨框架沟通。