GitHub 发布 AI 代码审查开放基准 ReviewBench
GitHub 发布 AI 代码审查开放基准 ReviewBench,其 219 个 pull request 来自 187 个公开开源许可仓库,覆盖 19 种语言,分布参考了对 103.9M 个 GitHub pull request 的分析。
推荐理由:公开数据集、评分规则和自助运行器形成可复现评测链路,线上实验案例也展示了离线指标筛选代码审查改进的用法。
GitHub 发布 AI 代码审查开放基准 ReviewBench,其 219 个 pull request 来自 187 个公开开源许可仓库,覆盖 19 种语言,分布参考了对 103.9M 个 GitHub pull request 的分析。
推荐理由:公开数据集、评分规则和自助运行器形成可复现评测链路,线上实验案例也展示了离线指标筛选代码审查改进的用法。
GitHub 建议开发者强化三项技能,包括学会指挥 AI 智能体、不轻信 AI 的首次回答,以及用节省的实现时间解决更广泛的问题。开发者仍需定义任务、审查输出并权衡技术方案,还可让第二个模型批评第一个模型的结果;GitHub Copilot 内置的 Rubber Duck 智能体也采用第二个模型审查计划、代码和测试。
GitHub Copilot app 可通过 canvases 构建自定义工作流界面,用户在智能体会话中运行 /create-canvas 并用自然语言描述需求,无需手动编写代码或设计布局。提示词应说明界面支持的工作流、用户可执行的操作以及智能体可执行的操作。生成的 canvas 支持双方实时修改共享状态,并可保存为供团队共享或个人使用的扩展。
推荐理由:通过拆解 /create-canvas 的描述要素和双向协作机制,给出将日常流程转换成可复用界面的具体路径。
当任务需要反复操作、自定义界面或自动化开发流程时,聊天往往不是 GitHub Copilot 的合适交互方式。GitHub Copilot app 的 canvas 是运行在应用内的全栈程序,可与 Copilot 智能体双向通信、调用第三方 API,并在本机执行代码。
推荐理由:文章把重复操作从聊天迁移到可复用的自定义界面,并以数据库和开发流程示例说明如何减少 token 消耗与人工介入。
GitHub Security Lab 开源 Fuzzing Taskflow,可针对 GitHub 上的 C/C++ 项目自动识别入口、生成 harness、运行 AFL++、迭代提升覆盖率并分诊崩溃。
推荐理由:它把覆盖率反馈、语料演进与崩溃分诊串成自动化闭环,并给出智能体决策与 MCP 工具执行分离的工程方法。
GitHub Copilot app 重构 Pull Request 视图,使包含 2,200 个文件、超过 100 万行变更和 400 多条行内评审评论的超大 PR 也能流畅打开和滚动。其方案将确定性的代码几何与动态评论块分离,通过视口范围内的惰性测量、滚动锚定和结构优先的数据流减少卡顿。团队还用应用内结构化探针、端到端测试和自动化循环持续发现性能问题。
推荐理由:文章将代码行与评论拆成两套几何系统,并结合惰性测量与滚动锚定,提供了可迁移的超大虚拟化界面优化方法。
Google 推出 MilleMiglia,一款用 C++ 编写的中程物流实例生成器,可生成逼真且保护隐私的基准数据。它以时空图上的多商品流问题建模跨配送中心运输、换车与暂存,源代码和文档已在 GitHub 提供。
GitHub 认为,开发者仍需审查并对 AI 生成代码负责,RAG 并未过时,Skills 与 MCP 解决的是不同问题。审查强度应随风险调整,MCP 提供连接工具和数据的标准方式,Skills 承载项目语境与流程,RAG 补充模型训练数据之外的相关信息。文章还将模型难以理解代码库视为可维护性压力测试,并主张通过实际构建和记录检验观点。
GitHub 使用 Copilot app 和 CLI,将 Copilot agent runtime 从 TypeScript 和 Node.js 完整改写为超过 800,000 行生产级 Rust,AI 智能体编写了大部分代码。
推荐理由:这份迁移复盘把增量替换、跨语言互操作、智能体协作和分层审查串成一套可迁移的大型代码库改写方法。