9月21日,通义千问团队开源了新一代图像模型Qwen-Image-2.1。视觉生成模块只有70亿参数,文生图、透明图像生成、多种图像编辑,都塞进了同一个模型。官方说在自家评测里超过了多数闭源模型,第三方评测还没出,先打个折扣听。硬件要求不高,RTX 3090这类主流显卡就能跑。
技术上,它的视觉生成用的是32层Single-Stream DiT结构。混合粒度注意力配合KV Cache复用机制,重点优化多图输入时的效率和表现。7B的体量,想在生成效果、推理速度、使用成本之间找个平衡。轻量、开源、能本地部署,这三点凑一起,对中小团队和独立开发者很友好。
开源这件事,放权重只是第一步。arXiv上有个叫Gricea的开放科学平台,专做对话AI研究,它盯的是另一个问题:系统和实验配置的报告太碎,复现和扩展都难。模型开源了,研究方法和评测口径不透明,社区照样接不住。开源要真变成科学,配套的东西跟权重文件一样重要。
Qwen-Image-2.1能不能真叫板闭源巨头,还得等第三方评测。趋势倒是清楚:70亿参数级别的开源模型,在一点点磨掉闭源模型的技术优势。对用户来说,选择更多,成本更低。接下来拼的是谁更开放、更好用。