万亿参数、语音失忆、RL新解:大模型三线突围
AI大模型

万亿参数、语音失忆、RL新解:大模型三线突围

智谱把新一代旗舰的参数规模推到了万亿级。GLM-5.4和GLM-5.5两款模型一起跨过这条线,底层架构上还要走两条新路子。官方没公布技术细节,但“双轨”这个说法本身就说明,光堆参数已经不够用了。国产大模型冲AGI,路线选择开始比参数表更关键。

另一条线上,有人打起了强化学习的主意。arXiv上有篇新论文在问:基础模型能不能直接充当RL里的Q函数或策略?结论是有戏——模型自带的先验能缓解RL的老毛病,样本效率低、迁移差。麻烦也在这:基础模型一个token一个token往外吐,查询变成串行,速度被卡住。想让它当RL的大脑,先得解决这个瓶颈。

语音这边的问题更直白:记不住人。墨尔本大学和新南威尔士大学联合推出基准VoxMem,测的是语音AI在长达数小时、几十轮的真实对话里,能不能记住谁在说话、什么语气、背景里有什么声音。结果32K上下文下全员不及格。旧评测只盯转写文字,身份、情绪、环境线索全丢掉了,自然也测不出语音记忆能力。

三件事指向同一个判断:大模型的下一步不在参数量上。智谱赌架构路线,RL那边赌基础模型能不能兼任决策模块,VoxMem则提醒所有人——连“谁在说话”都记不住,长对话理解就是空谈。万亿参数只是入场券,记忆和效率才是真门槛。