微软研究播客:AI 会犯哪些错,失败能教给我们什么
微软研究院播客中,partner research manager Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,讨论评估如何推动当前 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规评测时出现的“意外失败”。Neville 还分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入检查数据的重要性。
微软研究院播客中,partner research manager Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,讨论评估如何推动当前 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规评测时出现的“意外失败”。Neville 还分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入检查数据的重要性。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言、187 个开源仓库的 219 个 PR。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再按终端后端状态和副作用打分,而非看模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定成败,并给出可复现的 OpenEnv 运行方式。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
微软研究院发布深度学习 DFT 交换关联泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 的 55 个类别中拿下 32 项第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
Mistral 发布 Agentic Search,一个让模型在复杂文档中导航、阅读并核实信息的多步检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries 中。
推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断它与一次性 RAG 的差异。