大模型三连发:模型合并胜自蒸馏,基础模型也能推理
AI大模型

大模型三连发:模型合并胜自蒸馏,基础模型也能推理

大模型想持续学习,靠自我蒸馏可能走错了路。arXiv新论文对比了on-policy自我蒸馏和off-policy模型合并两条路线。结果显示,前者在新数据上做SFT后泛化变差,还会灾难性遗忘;后者把不同模型直接合并,表现更稳。论文干脆把结论写进了标题:合并胜过自我蒸馏。

基础模型不会推理?可能只是没被"点着"。另一篇论文发现,训练数据在回答开头的token和后续推理行为之间建立了强关联。只要固定开头几个token,基础模型就能被带进推理状态,完全不需要微调。开头的词,就是隐形的开关。

多模态方向也有新发现。扩散Transformer(MM-DiT)在生成过程中会用多模态注意力反复更新文本token,形成"上下文token"。这些token不是静态提示词,而是一路随图像生成被改写。搞清它们怎么被读取,才能更好地控制图文生成。

三篇论文指向同一个事实:模型能力强不强,很大程度取决于数据里的隐性结构和推理路径的入口。与其一味堆算力堆数据,不如先把这些开关找出来。