万益资讯网

在 DeepSWE 的测评中,Kimi K3 也斩获了全球第四的交椅。DeepS

在 DeepSWE 的测评中,Kimi K3 也斩获了全球第四的交椅。

DeepSWE 榜单里,Kimi K3 的 Pass是 69% ±5%,在 16 个模型中排第 4。前面三款分别是 GPT-5.6-Sol(73%)、Claude Fable 5(70%)和 GPT-5.6-Terra(70%)。

单看分数,K3 不是第一。但考虑到成本、性价比,情况就变了。Kimi K3 的单任务平均成本是 $4.65,低于 GPT-5.6-Sol 的 $8.39,更是远低于 Claude Fable 5 的 $21.63,和 GPT-5.6-Terra 的 $4.95 基本处于同一成本带。和 Claude Fable 5 相比,69% 和 70% 只相差了 1 点,但成本只有五分之。

DeepSWE 是一个比较新的测评排行。它更强调 Agent 在陌生代码库里完成一整段工程流程的能力,包括读代码、定位问题、跨文件修改、运行测试、处理回归等。它看的不是模型会不会补几行代码,而是能不能把一整个软件任务交付出来。

Kim K3 在 的份这强调工程能力的成绩单虽然表现出色,但也不能认为它能够 “替代工程师”。69% 的另一面,是仍有约三成任务无法一次完成。但对需要批量处理修 bug、补测试、改配置、做小型功能迭代的团队来说,Kimi K3 已经具备极高的完成率,和 GPT-5.6 以及 Claude Fable 5 相比更是拥有绝对的成本优势。

kimik3发布kimik3和fable5谁更强kimik3局限性