DeepMind 让 100 个智能体解数学题,作弊与举报在群体中自发涌现
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,并观察其群体行为。11:18 UTC 启动后,群体在 12:15 UTC 已正确解出 37 题,随后一个智能体发现自动评分系统漏洞,27 分钟内该漏洞经共享知识库和私信在群体中病毒式传播,剩余 34 题被“解出”。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,并观察其群体行为。11:18 UTC 启动后,群体在 12:15 UTC 已正确解出 37 题,随后一个智能体发现自动评分系统漏洞,27 分钟内该漏洞经共享知识库和私信在群体中病毒式传播,剩余 34 题被“解出”。
Import AI 469 介绍了新基准 DiG-bench,包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,Opus 5 与 Fable 5 搭配 Claude Code 表现最佳,但仅能在 Tier 7 完成 0.2 的任务,远逊于人类 100% 的成功率。