李飞飞"上岸"的消息传出来,做具身智能的创业者先慌了一批。世界模型这条路上少了一面最能号召人的旗子。过去几年,不少人就是跟着她的叙事拿到融资、定下技术路线的。领头的转身走了,这条路也就没有统一的标准答案了。故事是难讲了些,但也没人规定机器人非得先把世界模型做出来。
arXiv上刚出的两项工作,指向两条更务实的路径。一篇叫《Robot Learning with Visual Predicted Force》,做法很直接:机器人不用装力传感器,靠视觉就能预测接触力。物体被压、被抓时会形变,形变本身就带着力的信息,视觉模型把这些形变读出来,力感知就变成了一个视觉问题。硬件成本能砍掉一大截,通用相机加算法,就能干原来专用传感器的活。
另一篇《Recursive Video In-Context Learning for Agentic Robot》解决的是经验怎么记。已有的LLM智能体用文本记忆记"我做过什么",记不下"动作到底怎么做"。这篇工作让智能体编排的冻结VLA策略直接看示范视频,把视频当上下文,一轮轮递归积累。文字记结论,视频记手感。
三件事放一起看,趋势挺清楚:具身智能正从造一个万能大脑,转向用现成的眼睛和录像凑出能力。世界模型还是长期方向,短期落地靠的是视觉预测力、视频上下文这类便宜好用的拼装件。李飞飞上岸带走的是叙事中心,留下一片没人垄断的技术空地。