生数科技刚发布了Vidu S2视频大模型系列,直接把AI视频拉进了实时交互时代。这次主打两个核心模型:S2-Avatar专做持续交互的数字角色,S2-Editing能对输入的视频流进行实时编辑。他们甚至把触角伸向了VR头显,搞起了实时空间视频生成与编辑,全链路研发由张金涛带队负责。
光能实时编辑还不够,视频生成的交互控制正在变得更硬核。学术界正猛攻PhysStream这类技术,试图把粗粒度的提示词甩开,转向细粒度、符合物理意义的动态场景操控。简单说,就是让AI生成的视频动作更符合真实物理规律,还能通过结构化场景记忆实现精准控制。
另一方面,面对全球暴涨的视频流量,传统编解码器在处理体育、表演这类以人为中心的内容时显得很笨重。GenStream这类语义流式框架给出了新解法,跳过传统编码那套低效流程,直接搞生成式重建。它更懂结构化内容的语义,传输和重建效率自然就上去了。
别再盯着单纯的文生视频看了,现在的AI视频技术拼的是实时流式处理和深度可控交互。从生数科技的落地产品到学术界的前沿论文,方向出奇地一致。未来的AI视频,绝对是能实时玩、能懂物理、还能省带宽的硬核工具。