AI视频的战场换了。以前比谁生成的片段更漂亮,现在比谁能"让世界保持运行"。PixVerse R2 把 Scaling 这件事搬到了实时世界模型上——模型越大越强,不再是大语言模型的专利。视频模型的扩展曲线,正在被重新画一遍。
钱也在往这个方向砸。芯片巨头豪掷 82 亿美元押注世界模型,赌的不是更好的滤镜,而是当 AI 开始生成"世界",影视、音乐、游戏的内容生产方式会被整体改写。世界模型得记住状态、遵守物理规律、随交互持续演化,而不是播完一段循环视频就结束。
生成能力跑得快,编辑能力还拖着后腿。arXiv 新出的 ViTeX-Bench 专测高保真视频场景文字编辑:改一块招牌、一行字幕,还不能破坏原片的动态与光照。这类局部精确修改,恰恰是内容工业化最需要的能力。评测基准出现,说明这个环节终于有人认真量化了。
三条线索其实指向同一件事。实时世界模型解决"能不能持续运行",巨额算力投入解决"跑不跑得动",编辑基准解决"改得准不准"。三块拼图凑齐,AI 视频才从玩具变成生产工具。下一轮内容入口的争夺,就看谁先把这三件事同时做成。