跳到正文
10月7日周三
  1. Hugging Face Blog66

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    英伟达团队从 Nemotron 3 出发,用 SFT、RL 和生成-验证-改进的推理流程,让 Nemotron-3-Ultra-CC 在 IOI 2026 取得 535.4/600,超过 361.12 的金牌线,也高于人类最高分 498.27;IMO 2026 系统则拿到 30/42,超过 29 分的官方金牌线。

    推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型。

9月16日周三
  1. Google Research28

    Google Research 提出 Retrieve-for-Train:用 RL 编译扩散模型绕过推理瓶颈,加速复杂 AI 搜索

    Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,无需测试时 CoT 推理 token,即可满足多样性、覆盖度等集合级属性。

8月17日周一
7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX 后端,并加入结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核作为知识库适配到 Apple Silicon。

    推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,读者可据此判断跨硬件内核迁移的可行路径。

7月26日周日
  1. Berkeley AI Research38

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离并监督为自然语言"信念状态",替代完整交互历史作为智能体工作上下文。在协作编程基准 CollabBench 上,采用基于重构的信念评分后,ABBEL 将全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 长度也显著低于全上下文设置。

5月8日周五
4月20日周一
  1. Berkeley AI Research38

    GRASP:面向世界模型的梯度规划器,让长时程规划更稳健

    伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型下脆弱的“状态-输入”梯度问题。

3月13日周五