GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言、187 个开源仓库的 219 个 PR。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言、187 个开源仓库的 219 个 PR。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明用第二个模型审查第一个模型的计划、代码和测试能发现遗漏问题。
GitHub Copilot 应用中的 canvas 是一种可与 AI 智能体共享的双向自定义界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述工作流,即可生成看板、发布清单或仪表盘等界面,无需编写代码。canvas 会保存为扩展,可随项目共享或作为个人扩展复用,社区已在 Awesome Copilot 分享现成模板。
GitHub Copilot 提出 canvas 概念:一种运行在 GitHub Copilot 应用内、无浏览器外壳的全栈小应用,可与 agent 双向通信,也能调用第三方 API 并在本地执行代码。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力。团队用一个包含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 pull request 做验证。方案将文档高度拆成确定性的代码几何与动态评论块两套几何,评论高度按需测量并锚定到文件、行与侧,避免滚动跳动。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 PR 增量合入 main。
推荐理由:作者以亲历者身份给出把 43 万行 TypeScript 运行时迁到 Rust 的完整工程数据,可迁移到大规模 Agent 协作开发。