Kimi K3 正式发布,Artificial Analysis Intelligence Index 和 Code Arena 上的排名相当亮眼。
Artificial Analysis Intelligence Index 是独立评测机构 Artificial Analysis 的综合智能排名,覆盖 9 项基准测试,包括 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR,评测范围涵盖金融分析、终端操作、科学编码与高难度学术推理。
Claude Fable 5 — 60GPT-5.6 Sol (max) — 59Kimi K3 — 57
Kimi K3 与前两名差距在 2~3 分以内,与第四名 Grok 4.5(54 分)之间存在明显断层。
Code Arena | WebDev 是 LMArena 旗下的前端开发竞技场,基于 48 万次以上人类盲投,评测模型在真实 Web 开发任务中的表现,包括多步推理与工具调用。
Kimi K3 — 1679Claude Fable 5 — 1631GPT-5.6 Sol (xhigh) — 1618
Kimi K3 领先 Claude Fable 5 共 48 分斩获第一。
Kimi K3 这次采用 2.8 万亿参数 MoE 架构,896 个专家中激活 16 个。两项核心架构改进:KDA(Kimi Delta Attention,混合线性注意力机制)优化长序列中的信息流动;Attention Residuals(注意力残差)减少深层网络中的信息损失。官方数据显示,相比 K2 整体扩展效率提升约 2.5 倍。
原生支持视觉理解,1M token 上下文窗口,可用于截图,特别适用于前端开发、游戏开发与 CAD 场景。面向长程编程与端到端知识工作设计,能够持续处理长时间工程任务并协调终端工具。完整模型权重将于 7 月 27 日前开源,是目前全球首个达到 3 万亿参数规模的开源模型。
Kimi K3 定价不便宜,每百万 token,输入 ¥20,输出 ¥100。
但相比 Claude Fable 5($10/$50,约合 ¥72/¥358),Kimi K3 单 token 价格只有它的三分之一。更关键的是,不会被封号!
Artificial Analysis 的"每任务实际成本"指标考虑了真实 token 消耗:Kimi K3 $0.94,GPT-5.6 Sol $1.04,Claude Fable 5 $2.75。在 Intelligence Index 前三名中成本最低。
整体来看,Kimi K3 是国产大模型首次在全球顶级评测中展现出全面竞争力!综合智能、Web 编程能力、性价比三条线同时进入第一梯队。
月之暗面最强模型kimik3发布最强开源模型模型测评

