万益资讯网

【通用人工智能的“硬骨头”被啃动了?】François Chollet 确认 O

【通用人工智能的“硬骨头”被啃动了?】François Chollet 确认 Opus 5 在 ARC-AGI-3 测试中达到了 30% 的准确率。这个测试专门衡量模型处理从未见过的新问题的能力,即所谓的“流体智能”,过去单纯靠增加算力和数据的 Scaling Law 在这个指标上几乎失效。相比之下,其他顶尖模型如 Sol 仅在 7.5% 左右徘徊,这种数倍的跨越式增长引发了行业震动。这意味着 AI 正在从“海量背诵”向“逻辑推理”产生质变。虽然 30% 距离人类水平尚远,但它证明了模型在面对完全陌生的规则时不再束手无策。我们需要关注的是,这种提升究竟源于更底层的 Transformer 架构改良,还是在大规模强化学习中引入了类似推理链的搜索机制。这种能力的代价极高,推理成本可能会成为应用落地的瓶颈。这不仅是分数的竞争,更是关于 AI 是否能真正理解世界逻辑的终极实验。 x.com/fchollet/status/2080707785910534147