开源模型这两天热闹。阿里千问甩出Qwen3.8-Flash-Next——名字拗口,但这是Qwen4的早期架构预览。参数高达1250亿,却靠高度稀疏的MoE设计,每个token只激活60亿参数。还额外塞了510亿参数的N-gram嵌入表和40亿参数的多token预测模块,算力花得少,性能跳了级。原生支持26万token上下文,能扩展到100万。训练成本直接砍到前代的九分之一。API定价也够狠:输入每百万tokens一块钱,输出三块钱。
智谱那边也没闲着。之前以"Stealth"匿名身份上线OpenRouter的神秘模型,现在确认是GLM系列新成员Ox Alpha。这模型在多项基准测试里表现抢眼,主打编码、持续智能工作流和生产环境推理。官方承诺周三开放权重,开发者可以拿去随便魔改,没藏着掖着,直接开源。
两件事放一起看,国产大模型的开源路子已经在拼效率和性价比了。Qwen那套稀疏激活方案,明显冲着降低推理成本去的;智谱则把宝押在垂直场景的实用能力上。方向不同,但都在亮真本事。
开发者手里的选择更丰富了。想要超长上下文和超低API价格,可以试试Qwen3.8-Flash-Next;需要扎实的代码能力和生产环境适配,周三去拉Ox Alpha的权重。中小团队也有机会够到一线模型的能力了。