OpenAI 发布内部模型产出的 722 篇数学论文,称解决 500 个开放问题中的 90 个
OpenAI 以博客、GitHub 仓库和推文形式公开了一批来自未发布内部前沿模型的数学结果,共 722 篇手稿、归入 372 个相关结果族,来自约 4000 道研究问题的评测,平均每个结果约用 3 小时 ChatGPT Pro 思考算力,模型本身仍未发布。
推荐理由:OpenAI 用内部模型批量产出数学结果并公开仓库,读者可据此了解这批成果的规模、算力成本与外界质疑。
OpenAI 以博客、GitHub 仓库和推文形式公开了一批来自未发布内部前沿模型的数学结果,共 722 篇手稿、归入 372 个相关结果族,来自约 4000 道研究问题的评测,平均每个结果约用 3 小时 ChatGPT Pro 思考算力,模型本身仍未发布。
推荐理由:OpenAI 用内部模型批量产出数学结果并公开仓库,读者可据此了解这批成果的规模、算力成本与外界质疑。
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,在自有的 3800 块 NVIDIA Grace Blackwell GPU 集群上训练,目前通过其 API 提供。
Google 发布图像生成与编辑模型 Nano Banana 2.1,取代 2026 年 2 月发布的 Nano Banana 2,官方称各方面均有提升。价格约为上一代一半,1K 图像从 6.70 美分降至 3.36 美分,4K 从 15.10 降至 7.56 美分。
微软研究院播客中,partner research manager Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,讨论评估如何推动当前 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规评测时出现的“意外失败”。Neville 还分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入检查数据的重要性。
Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。
推荐理由:汇总了 Beam 的架构、训练规模与第三方评测口径,可对照同期开源模型的定位差异。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言、187 个开源仓库的 219 个 PR。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再按终端后端状态和副作用打分,而非看模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定成败,并给出可复现的 OpenEnv 运行方式。
OpenAI 发布 GPT-6.1 Sol,定价为每百万输入/输出 token 2 美元/10 美元,远低于 Astra 的 10 美元/50 美元;据称在 DeepSWE v1.1 上比 GPT-6 Sol 高 6.4 分,在 AutomationBench 上比 Opus 5.5 高 2.2 分。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,首发仅限政府用户与 Fairwind 计划中的可信网络防御者,后续再向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,便于对照其与 Astra、Opus 5.5 的实际差距。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
微软研究院发布深度学习 DFT 交换关联泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 的 55 个类别中拿下 32 项第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
Mistral 发布 Agentic Search,一个让模型在复杂文档中导航、阅读并核实信息的多步检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries 中。
推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断它与一次性 RAG 的差异。
Import AI 469 介绍了新基准 DiG-bench,包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,Opus 5 与 Fable 5 搭配 Claude Code 表现最佳,但仅能在 Tier 7 完成 0.2 的任务,远逊于人类 100% 的成功率。