Jev被请下王座,中国开源AI决策模型登顶
AI大模型

Jev被请下王座,中国开源AI决策模型登顶

开源决策模型的榜首又换人了。StartLux 一口气推出 0.8B、2B、4B、9B 和 27B 五档版本,把 Jev 挤了下去。它还顺手提供了支持本地部署的量化模型,小团队也跑得动。

亚马逊那边也没闲着。新发布的开源决策模型 Strands Decider 2B 同样支持本地部署。在 JevBench 公开数据集上,它的准确率和校准度都不错,2B 级别里排第 3,比所有严格不超过 2B 的对手都强。参数小不等于能力弱,今年这样的例子一个接一个。

企业那边的动作更直接。DoorDash 在 InfoQ 上分享了 GenAI 平台的经验,其中一步就是把 OpenAI 换成开放权重模型,因为长期成本更低。平台要服务 5000 多名内部用户,LLM 代理网关得同时做到延迟低于 200ms、准确率高于 90%,几项性能指标得一起权衡。

三件事串起来看:开源模型在决策类任务上已经能打,2B 到 27B 都有能用的选项。要不要用开放权重,企业早就不纠结了,现在要算的是成本和性能之间的那个点。选型别只盯榜单排名,先算清楚延迟预算和部署条件,再挑参数档位。