跳到正文
今天10月8日周四1 条
  1. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行轻量级智能体 RL 框架,直接用真实 harness 训练

    微软研究院开源 Agent Lightning v1.0,这是一个约 3500 行代码的轻量级智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入强化学习训练,并给出可复现的编码智能体训练结果。

10月7日周三
  1. Hugging Face Blog66

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    英伟达团队从 Nemotron 3 出发,用 SFT、RL 和生成-验证-改进的推理流程,让 Nemotron-3-Ultra-CC 在 IOI 2026 取得 535.4/600,超过 361.12 的金牌线,也高于人类最高分 498.27;IMO 2026 系统则拿到 30/42,超过 29 分的官方金牌线。

    推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型。

  2. Microsoft Research22

    微软研究播客:AI 会犯哪些错,失败能教给我们什么

    微软研究院播客中,partner research manager Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,讨论评估如何推动当前 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规评测时出现的“意外失败”。Neville 还分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入检查数据的重要性。

10月6日周二
  1. Mistral AI78

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态

    Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,预览 API 已在 Mistral Studio 上线,权重将于本月底发布。

    推荐理由:Mistral 官方给出 1 万亿参数多模态模型的开放权重路线与自建欧洲算力背景,可据此判断开源前沿模型的竞争格局。

  2. Google Research34

    Google 发布智能体隐私与安全报告:从上下文完整性视角看开放与新兴问题

    Google 发布《智能体隐私与安全中的开放与新兴问题:上下文视角》报告,汇集 50 多位学界与业界专家在 2025 年底纽约 CAPS 研讨会的成果。报告指出智能体因非结构化输入、概率性控制流和自主委派带来提示注入等新风险,主张以 Contextual Integrity 理论为基础,构建上下文策略引擎在系统、模型、用户多层协同防护。

10月5日周一
10月4日周日
  1. Hugging Face Blog66

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再按终端后端状态和副作用打分,而非看模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定成败,并给出可复现的 OpenEnv 运行方式。

10月2日周五
  1. Google Research62

    Google 发布基于 TEE 的新一代联邦学习系统

    Google 公布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统。系统通过访问策略公开透明日志、KMS 密钥管理与 TEE 内 Python 训练程序执行,使加密训练数据只能在符合策略的 TEE 中解密处理。Gboard 已用它上线英语和日语下一词预测模型,训练时间从过去的 1-2 个月缩短,目前仅受 TEE 资源限制。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其如何把隐私保证从信任服务器转为可远程验证。

  2. Hugging Face Blog40

    AutoSynthData:为 Enterprise Agents 生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功轨迹,自动生成并验证新的可执行训练任务,并随模型能力提升动态调整课程。该方法在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项属性,配套 verifier 需保证一致性、可靠性与完备性。

10月1日周四
9月30日周三
9月29日周二
  1. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献与研究者的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。

  2. Microsoft Research20

    微软研究院亚洲新加坡分院成立一年:推进前沿 AI 研究、合作与人才培养

    微软研究院亚洲新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来聚焦下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践及生态与人才培养四大方向。该实验室与新加坡医疗生态合作探索多模态医疗 AI 和自进化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与运输 AI 高管圆桌会。

9月28日周一
  1. Hugging Face Blog66

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,提供 27B 稠密和 35B-A3B MoE 两种规格,均可通过 H Models API 调用,权重已在 Hugging Face 以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源。

    推荐理由:Holo4 同时支持 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机智能体的成本与能力取舍。

9月26日周六
  1. GitHub Blog · AI & ML36

    GitHub Copilot 新手教程:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用中的 canvas 是一种可与 AI 智能体共享的双向自定义界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述工作流,即可生成看板、发布清单或仪表盘等界面,无需编写代码。canvas 会保存为扩展,可随项目共享或作为个人扩展复用,社区已在 Awesome Copilot 分享现成模板。

9月25日周五
  1. Google Research66

    Google Research 发布 AI 视频联合导演框架,自动化长视频生成

    Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于自动化多镜头长视频生成,并原生继承 SynthID 水印等安全机制。

    推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与角色保持的评测结果,便于判断多智能体编排在长时程生成中的位置。

  2. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体流水线

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。

9月24日周四
  1. GitHub Blog · AI & ML22

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力。团队用一个包含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 pull request 做验证。方案将文档高度拆成确定性的代码几何与动态评论块两套几何,评论高度按需测量并锚定到文件、行与侧,避免滚动跳动。

  2. Microsoft Research62

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了首次系统性研究,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。

9月21日周一
9月19日周六
  1. Google Research22

    Google Research 发布 MilleMiglia:面向中段物流的真实实例生成器

    Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。中段物流承担区域乃至洲际配送中心之间的大批量货物运输,成本占比高却长期缺乏公开高质量数据,学术研究因此受限。该工作将中段物流建模为时空图上的多商品流问题,以刻画货物在多辆车辆间转运、需在时间窗内赶上接驳班次等约束。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解五大 AI 热梗:该不该读 AI 代码、RAG 已死、Skills 是否杀死 MCP

    GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,但审查力度应随风险分级;Skills 与 MCP 解决不同问题,前者是打包的 Markdown 专家经验,后者是连接工具与数据的标准协议,二者可组合使用;RAG 并未消亡,检索能为模型提供训练数据外的文档、内部知识和代码库上下文,减少 token 浪费并让回答更有依据。

9月17日周四
  1. GitHub Blog · AI & ML80

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 PR 增量合入 main。

    推荐理由:作者以亲历者身份给出把 43 万行 TypeScript 运行时迁到 Rust 的完整工程数据,可迁移到大规模 Agent 协作开发。

9月16日周三
  1. Google Research28

    Google Research 提出 Retrieve-for-Train:用 RL 编译扩散模型绕过推理瓶颈,加速复杂 AI 搜索

    Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,无需测试时 CoT 推理 token,即可满足多样性、覆盖度等集合级属性。

9月10日周四
9月9日周三
  1. Mistral AI62

    Mistral 用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐测试框架,用自定义解析器生成调用树并调度上百个智能体补文档,再以人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移,首个冲刺完成 30 万行中的 4 万行。

    推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 77 的完整流程,其中先建数值对齐测试再迁移的做法可直接迁移到其他遗留系统改造。

9月8日周二
  1. Mistral AI72

    Mistral 完成 30 亿欧元 D 轮融资,估值超 210 亿欧元

    Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 与 PSG Equity 联合领投。Mistral 称这是欧洲科技公司完成的最大规模股权融资,资金将用于扩展前沿研究、算力、基础设施与商业增长。公司目前业务覆盖 20 个国家,服务 125 家以上全球企业,包括 Airbus、ASML 和 HSBC。

    推荐理由:Mistral 以 30 亿欧元 D 轮融资说明欧洲主权开源 AI 路线的资本与产业支持力度。

9月1日周二
8月25日周二
  1. Mistral AI38

    Mistral 与 HUMAIN 达成战略合作,推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布建立战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,合作规模达数亿欧元。双方将优先聚焦网络安全与语音领域,并计划开发阿拉伯语表现强劲的前沿模型,Mistral 还将探索使用 HUMAIN 的数据中心基础设施。双方计划在沙特制定联合市场策略,面向受监管行业提供 AI 解决方案。

8月21日周五
  1. Microsoft Research42

    微软 Skala 1.1 发布:训练数据增 2.5 倍,并集成进 CP2K 等 DFT 软件

    微软研究院发布深度学习 DFT 交换关联泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 的 55 个类别中拿下 32 项第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。