万益资讯网

下一代AI靠什么前两天刷到了“强化学习之父”萨顿关于 AI 第一性原理的演讲,看

下一代AI靠什么前两天刷到了“强化学习之父”萨顿关于 AI 第一性原理的演讲,看完后感受还是挺多的,而且和这个话题也和契合,所以就来简单的聊聊吧!

现在的大模型,确实越来越强,能写、能算、能推理,还能调用各种工具。但正如萨顿所说它现在学到的东西,大部分还是来自人类已经整理好的文字、图片、代码和视频。

它知道很多,却很少真正经历这些知识是怎么来的。

就像一个人看了很多驾驶教程,也不等于真的会开车。真正上路之后,路况会变,判断会出错,每一次操作都会带来后果。很多东西只有自己经历过,才会慢慢形成判断,萨顿更看重的,就是这种“经验”。

AI 不只是接收数据,还要自己观察、行动、得到反馈,再根据结果调整下一步。这样学到的东西会更接近真实世界,也会包含很多静态资料里没有的内容,这也是为什么世界模型越来越重要。

AI 要完成更复杂的任务,不能只看眼前这一步,还要大概知道接下来可能发生什么。机器人伸手拿杯子,不只是要认出那是杯子,还要判断距离、力度、角度,甚至预估拿歪之后会不会掉,这类能力,光靠多读资料很难直接得到。

萨顿提出的 Oak,大概就是想让智能体在不断试错中,慢慢学会技能,建立对世界的理解,再把不同经验里的共同规律找出来。

他还有一个观点让我印象很深,就是不要总靠人工去改奖励函数,因为奖励决定了 AI 最后会追求什么。规则稍微写偏一点,它就可能找到漏洞。表面上分数很高,实际做出来的事情却完全不是人想要的结果。

这也是强化学习到现在依然很难真正落地到现实世界的原因,现实里的反馈经常来得很慢,也很难判断到底是哪一步导致了最后的结果。机器人试错还有成本,不能像游戏里一样失败了就直接重开。学新东西时,也可能把以前会的东西忘掉。

所以萨顿提出的 Oak ,现在还谈不上是一个成熟方案,更像是一条很长的研究路线,过去几年,大家一直在比参数、算力和数据量。下一阶段可能还要看,AI 能不能在真实环境里待得更久,做更多动作,记住更多结果,再从这些结果里学到新的东西。

模型变大,可以装下更多知识,真正自己去经历,才有机会长出新的知识。

下一代 AI 当然还会继续变大,但只靠吃人类已经留下来的数据,迟早会碰到天花板。谁能先把持续学习、长期记忆、世界模型和真实交互这些问题解决好,谁才更有可能往前走一步。