万益资讯网

今天凌晨 Code Arena 更新榜单,千问 3.7-Max 得分 1541,

今天凌晨 Code Arena 更新榜单,千问 3.7-Max 得分 1541,超过 GPT-5.5 和 Gemini-3.5-Flash,仅次于 Claude,是唯一进入前四的国产模型,按厂商排名位列全球第二。GLM-5.1 和 Kimi-K2.6 也在榜单上,但分数都没有突破 1540。

Code Arena 考的是从零生成完整 Web 应用,不是刷算法题。开发者出题,模型匿名作答,用户盲测投票。Claude 在这个榜单上长期没有对手,千问 3.7 是第一个真正逼近的中国选手。

我觉得这个成绩有意思的地方在于,千问 3.7 本身定位 Agent 基座模型,强调长程任务执行和工具调用能力,而 Code Arena 测的恰好就是「能不能把一个完整项目做出来」。结合阿里此前透露的消息,千问 3.7 可以持续运行 35 小时、累计超过 1000 次工具调用来完成复杂长程任务。产品定位和榜单表现对上了,1541 分拿得扎实。