用航空维修标准来管AI怎么说话,听着离谱,但真有人在用。工程师 Tw93 给自己每天用的技能 Waza 加了套新回复规则,来源是 ASD-STE00——一套简化技术英文标准,最早用来写航空维修文档。思路很简单:把模糊表述换成明确的动作和条件。比如AI得说“检查通过后才允许重启”,而不是“建议重启一下”。再用“完成”这类关键词锁死操作时序,避免文件还没传完就被删。
效果是把人机协作的歧义压到最低。工程师要的是能直接执行的指令,不是模棱两可的建议。这套做法最早受 Andrej Karpathy 的分享启发。
另一边,AI编程能力本身怎么量化,也有了更硬的答案。arXiv 上的一篇论文重新审视了 METR 的评测图:所谓 50% 时间跨度,指的是 AI 有 50% 概率搞定的软件任务,人类得花多久完成。这样模型能力就能换算成人能理解的时间单位,而不是一堆抽象跑分。论文统计分析了 228 个任务,检验这个指标到底站不站得住。
JetBrains 则发布了编程模型 Mellum2.1,主打智能体编程。它延续 12B 混合专家架构和开源协议,企业和个人做私有化部署的门槛都不高。训练上最大的变化是强化学习成了核心训练主体,不再只做收尾,还在数百万个沙盒环境里针对软件工程和算法任务做专项强化。官方称高负载下吞吐量是竞品两倍。
三件事指向同一个方向:AI编程正从“能不能写代码”转向工程化落地。规则要清晰到没歧义,能力要能换算成可比较的尺度,推理还得扛得住高并发。谁把这三样做扎实,谁才留得住开发者。