Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,预览 API 已在 Mistral Studio 上线,权重将于本月底发布。
推荐理由:Mistral 官方给出 1 万亿参数多模态模型的开放权重路线与自建欧洲算力背景,可据此判断开源前沿模型的竞争格局。
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,预览 API 已在 Mistral Studio 上线,权重将于本月底发布。
推荐理由:Mistral 官方给出 1 万亿参数多模态模型的开放权重路线与自建欧洲算力背景,可据此判断开源前沿模型的竞争格局。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言、187 个开源仓库的 219 个 PR。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明用第二个模型审查第一个模型的计划、代码和测试能发现遗漏问题。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方披露了 Argon 在编码、企业知识与网络安全防御上的能力与定价,可据此判断前沿模型的落地节奏。
GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,但审查力度应随风险分级;Skills 与 MCP 解决不同问题,前者是打包的 Markdown 专家经验,后者是连接工具与数据的标准协议,二者可组合使用;RAG 并未消亡,检索能为模型提供训练数据外的文档、内部知识和代码库上下文,减少 token 浪费并让回答更有依据。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 PR 增量合入 main。
推荐理由:作者以亲历者身份给出把 43 万行 TypeScript 运行时迁到 Rust 的完整工程数据,可迁移到大规模 Agent 协作开发。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐测试框架,用自定义解析器生成调用树并调度上百个智能体补文档,再以人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移,首个冲刺完成 30 万行中的 4 万行。
推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 77 的完整流程,其中先建数值对齐测试再迁移的做法可直接迁移到其他遗留系统改造。