跳到正文
今天10月8日周四1 条
  1. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行轻量级智能体 RL 框架,直接用真实 harness 训练

    微软研究院开源 Agent Lightning v1.0,这是一个约 3500 行代码的轻量级智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入强化学习训练,并给出可复现的编码智能体训练结果。

10月2日周五
  1. Google Research62

    Google 发布基于 TEE 的新一代联邦学习系统

    Google 公布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统。系统通过访问策略公开透明日志、KMS 密钥管理与 TEE 内 Python 训练程序执行,使加密训练数据只能在符合策略的 TEE 中解密处理。Gboard 已用它上线英语和日语下一词预测模型,训练时间从过去的 1-2 个月缩短,目前仅受 TEE 资源限制。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其如何把隐私保证从信任服务器转为可远程验证。

  2. Hugging Face Blog40

    AutoSynthData:为 Enterprise Agents 生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功轨迹,自动生成并验证新的可执行训练任务,并随模型能力提升动态调整课程。该方法在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项属性,配套 verifier 需保证一致性、可靠性与完备性。

10月1日周四
9月28日周一
  1. Hugging Face Blog66

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,提供 27B 稠密和 35B-A3B MoE 两种规格,均可通过 H Models API 调用,权重已在 Hugging Face 以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源。

    推荐理由:Holo4 同时支持 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机智能体的成本与能力取舍。

9月25日周五
9月24日周四
  1. GitHub Blog · AI & ML22

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力。团队用一个包含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 pull request 做验证。方案将文档高度拆成确定性的代码几何与动态评论块两套几何,评论高度按需测量并锚定到文件、行与侧,避免滚动跳动。

  2. Microsoft Research62

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了首次系统性研究,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。

9月17日周四
  1. GitHub Blog · AI & ML80

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 重写为超过 80 万行生产级 Rust,AI 智能体写了其中大部分代码,跨 128 个 PR 增量合入 main。

    推荐理由:作者以亲历者身份给出把 43 万行 TypeScript 运行时迁到 Rust 的完整工程数据,可迁移到大规模 Agent 协作开发。

9月10日周四
9月9日周三
  1. Mistral AI62

    Mistral 用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐测试框架,用自定义解析器生成调用树并调度上百个智能体补文档,再以人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移,首个冲刺完成 30 万行中的 4 万行。

    推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 77 的完整流程,其中先建数值对齐测试再迁移的做法可直接迁移到其他遗留系统改造。

8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search,面向企业复杂文档的多步检索层

    Mistral 发布 Agentic Search,一个让模型在复杂文档中导航、阅读并核实信息的多步检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries 中。

    推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断它与一次性 RAG 的差异。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX 后端,并加入结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核作为知识库适配到 Apple Silicon。

    推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,读者可据此判断跨硬件内核迁移的可行路径。

7月7日周二
  1. Berkeley AI Research34

    智能免费时代,数据系统如何为智能体、由智能体、属于智能体

    伯克利 EPIC Data Lab 提出近零推理成本下数据系统面临三大挑战:为智能体设计(Data Systems For Agents)、由智能体运行(Of Agents)、由智能体合成(By Agents)。GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。

5月8日周五
4月20日周一
  1. Berkeley AI Research38

    GRASP:面向世界模型的梯度规划器,让长时程规划更稳健

    伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型下脆弱的“状态-输入”梯度问题。