跳到正文
  1. Hugging Face Blog66

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    英伟达团队从 Nemotron 3 出发,用 SFT、RL 和生成-验证-改进的推理流程,让 Nemotron-3-Ultra-CC 在 IOI 2026 取得 535.4/600,超过 361.12 的金牌线,也高于人类最高分 498.27;IMO 2026 系统则拿到 30/42,超过 29 分的官方金牌线。

    推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型。

  1. Hugging Face Blog66

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再按终端后端状态和副作用打分,而非看模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定成败,并给出可复现的 OpenEnv 运行方式。

  1. Google Research62

    Google 发布基于 TEE 的新一代联邦学习系统

    Google 公布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统。系统通过访问策略公开透明日志、KMS 密钥管理与 TEE 内 Python 训练程序执行,使加密训练数据只能在符合策略的 TEE 中解密处理。Gboard 已用它上线英语和日语下一词预测模型,训练时间从过去的 1-2 个月缩短,目前仅受 TEE 资源限制。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其如何把隐私保证从信任服务器转为可远程验证。

  1. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献与研究者的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。

  1. Hugging Face Blog66

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,提供 27B 稠密和 35B-A3B MoE 两种规格,均可通过 H Models API 调用,权重已在 Hugging Face 以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源。

    推荐理由:Holo4 同时支持 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机智能体的成本与能力取舍。

  2. Hugging Face Blog62

    Hugging Face Hub 上线 RL Environments 筛选与框架标签

    Hugging Face Hub 新增 RL Environments 筛选,带 rl-environment 标签的数据集仓库会集中展示,无需新建仓库类型、注册表或注册流程。

    推荐理由:Hugging Face 把 RL 环境统一为带标签的数据集仓库,读者可据此判断跨框架复用环境与奖励评测的可行路径。

  1. Google Research66

    Google Research 发布 AI 视频联合导演框架,自动化长视频生成

    Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于自动化多镜头长视频生成,并原生继承 SynthID 水印等安全机制。

    推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与角色保持的评测结果,便于判断多智能体编排在长时程生成中的位置。

  1. Microsoft Research62

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了首次系统性研究,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。

已经到底了