OpenAI Codex产品负责人Tibo在最新访谈中透露,他们为Codex设计了一个专门的实体重置按钮。他直言:“我想什么时候按这个按钮都可以,只要我觉得时机合适就行。”这个按钮并非装饰,而是用于在AI编程模型行为异常时一键重置,给用户最直接的控制权。
实体按钮的存在,反映了AI编程工具在交互设计上的新思路。当模型生成错误代码或陷入死循环,程序员无需复杂操作,直接物理按键就能重置。Tibo强调用户可以自由决定重置时机,这或许能提升开发者对AI的信任度,让工具更易用。
然而,AI编程代理的能力能否匹配这种易用性?一篇arXiv论文提出了SWE Refactor Bench,评估代理能否完成长周期、全仓库的栈迁移。现代软件系统经过数十年开发,技术债务积累严重,迁移工作目前主要靠人工手动完成。虽然编码代理在bug修复上表现越来越强,但面对需要理解整个仓库依赖、重构模块和保持兼容性的迁移任务,它们能否胜任仍是未知数。研究者认为,这类任务目前还无法完全自动化,但代理的进步正在缩小差距。
从实体重置按钮到仓库迁移评估,AI编程领域正在同时关注用户控制力和能力上限。Tibo的按钮代表了对用户信任的重视,而基准测试则揭示了当前代理的短板。两者结合,才能推动AI编程走向真正的实用化。
未来,AI编程工具既需要让用户感到可控,又需要通过严苛的评估证明可靠性。实体按钮和迁移基准都是这条路上不可或缺的尝试。这正是AI编程从演示走向生产的必经之路。