微软研究播客:AI 会犯哪些错,失败能教给我们什么
微软研究院播客中,partner research manager Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,讨论评估如何推动当前 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规评测时出现的“意外失败”。Neville 还分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入检查数据的重要性。
微软研究院播客中,partner research manager Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,讨论评估如何推动当前 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规评测时出现的“意外失败”。Neville 还分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入检查数据的重要性。
前 Google DeepMind 研究员指出,LLM 靠逐个预测 token 生成答案,其链式推理仍由同一套 next-token 过程产生,因此不构成真正推理。他认为这类模型缺乏可检查的持久认知状态、知识与推理的分离,且链式推理常是事后编造。他主张借鉴 AlphaGo 的搜索架构,为 AI 建立显式的认知状态与独立推理机制。
MIT 研究者 Alex Zhang 在 Latent Space 播客中介绍了其 Recursive Language Models(RLM)等工作,基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的方案,早于 OpenAI 的 Astra。
智谱(Zhipu)启动了一个"外层 RSI 循环",探索递归自我改进的新路径。Michael Levin 提出"心智入侵"理论,认为心智是来自柏拉图式模式空间的非物理模式,身体和机器只是其进入物理世界的接口,xenobots 和 anthrobots 等实验显示简单系统能展现出算法未预设的智能行为。本期还讨论了太空中的 TPU 部署。