万益资讯网

国外软件工程师对KIMI K3的测试评价,同样的任务Anthropic的Fabl

国外软件工程师对KIMI K3的测试评价,同样的任务Anthropic的Fable 5 在不到一小时就完成了,Kimi却花了将近3小时,原本这将是一个翻车的测试,但结果却让老外相当震惊!

他给了KIMI K3和Fable 5一个相同的任务,制作一个相同要求的3D足球场,结果不出所料,KIMI K3搞了3个小时才完成,但最终却发现,KIMI K3正在运行端到端测试,验证桌面、平板和移动设备,截取屏幕截图,找出故障,修复它们,甚至在继续之前为低端硬件和低FPS进行适配。

然而Fable 5从来没有做过这些。它什么都没做,因为它无法在无头浏览器上运行这个WebGL应用。 Kimi还交付了一个干净的React + Three.js代码库,并且带了适当的组件,而Fable 5,正如你可能检查过的代码库那样,生成了超级大的HTML文件,把所有东西都塞在里面。

用过AI编程的朋友都知道,AI编程非常好用,下个指令就能直接给你做出想要的结果,但是大家也发现了一个问题,做出来的东西AI总是啥都不管,要让你一个个测试,然后告诉它再一个个修改,搞到最后,还有可能一项要求错误理解而在反复修改,到最后改到崩溃,各位大神的想法就是,特*么的还不如老子自己写呢!

似乎这位老外用Fable 5就碰到了这个问题,当然Fable 5也是非常优秀的编程AI,可能是因为某种适配导致无法运行。但是把所有代码都塞进一个HTML文件就有点不应该了,写代码的大佬绝对不会犯这个错误,会把HTML文件规划的很好,路由写好,这才是一个合格的工程文件。

这位测试的工程师最后表示,KIMI K3制作的3D足球场相当不错,完全超出了他的预料!在他发表这条X文留言中,很多网友都保持了类似的看法:

网友A表示:这是一个很好的实际例子,用来证明背后的强大能力。模型需要学会如何优先处理子任务。我相信这5小时会进一步缩短。
作者回复:最让我印象深刻的是,它在不依赖一堆代理的情况下,非常好地优先处理了子任务。

网友B表示:Kimi 在我的测试中也挺慢的,但我理解他们遇到了前所未有的需求,这是有道理的。不过整个过程非常出色,推理聪明且逻辑严密,工具使用合理且实用。 到目前为止,这是我用过的最好的模型。

网友C似乎做了一个完整的总结:

他认为K3是第一,比Fable和GPT-5.6更好。它可能不是很智能,而是调优的对齐方式。
Fable:不遵循指令,使用较少的努力,只给你一些“哇”但可能不做你要求的规格。
GPT5.6:即使指令错误,也过于字面地遵循指令,没有反推,他认为你的要求总是对的!
KIMI K3:实际遵循你的指令,但当它发现指令错误时,会反推并告诉你原因,以及为什么要这么做,不像Fable,当它觉得合适时就给你一些东西而不解释。

收着全球最贵的订阅费的Anthropic被吐槽挺惨的,最近股价暴跌,市值缩水也就成了必然趋势了,都不能让全球开发者满意,而大模型编程是最重要最实用的能力之一,Anthropic在这方面败给KIMI K3,看起来美股股价暴跌还真不冤!