AI视频生成新突破:攻克长期记忆与高效时空定位
AI技术

AI视频生成新突破:攻克长期记忆与高效时空定位

AI视频领域最近技术迭代极快,模型不再只盯着画面美不美,开始深挖底层逻辑。有研究直接把视频生成模型当成几何学习器来用,利用现成的图像扩散模型来做几何估计。这种思路把几何估计变成了图像条件下的生成任务,省去了从零训练的麻烦。底层结构的创新,给后续的复杂任务打了个好底子。

视频变长之后,模型很容易“失忆”。Ring Forcing框架专门对付自回归视频扩散模型的这个毛病,主打提升几分钟视频的长期一致性。它用环形训练策略逼着模型去翻找较早的历史信息,再配合压缩与时间步组合、稀疏RoPE机制,把超长上下文处理得明明白白。物体重新出现时外观能保持一致,时间连贯性直接秒杀了现有先进方法。

光记得住还不行,还得找得准、算得快。研究人员搞了个叫Parallel Tube Decoding(PTD)的框架,专门用来高效定位视频里的任意目标。它把时间定位和空间定位拆开,空间模块直接并行解码,不管轨迹多长,顺序解码深度死死卡在两轮。在VidSTG基准测试里,延迟降了79倍,吞吐量翻了92倍,一个40亿参数的小模型就能打能抗,还能零样本迁移。

这几项研究分别从底层几何理解、长时记忆和高效推理三个维度补齐了AI视频的短板。模型越来越聪明,也越来越懂怎么省算力。以后AI视频生成和分析的门槛会越来越低,应用落地自然也会跑得更快。