谷歌TPU之父出走引爆AI芯片军备竞赛,长上下文推理成本战开打
AI技术

谷歌TPU之父出走引爆AI芯片军备竞赛,长上下文推理成本战开打

谷歌TPU之父被Anthropic连夜挖走。这是AGI争夺战里最直接的信号:谁掌握了算力,谁就能定义AGI。前沿实验室不再满足于堆GPU,开始把触角伸向芯片架构本身,人才争夺的激烈程度已经白热化。

算力竞争不止在顶层实验室,国内芯片企业的动作同样激进。摩尔线程发布《MTT S5000 Prefill-as-a-Service技术白皮书》,推出一个针对性极强的方案:把填满KV Cache的首阶段和生成Token的解码阶段拆开,分别优化调度。这个思路直接针对问题——长上下文场景下,成本高企不下的根源就在于Prefill阶段消耗大量算力,传统一体式部署的利用率却上不去。

把Prefill按服务售卖,给长上下文推理找了一条兼顾效率和成本的路。AI Agent、代码生成、超长文档分析这些场景,恰恰是被推理成本卡脖子最狠的领域。如果这套模式跑通,算力可以按阶段切分变现,客户不必为整套方案买单,芯片利用率也能大幅提升。

芯片设计本身也在经历变化。六十年来,机器验证昂贵的成本,令它只能服务于那些值得投资的少数项目。生成式AI把这个等式翻转了:当机器验证能以AI速度运行,芯片设计和验证的成本结构将被重构,小团队也能跑大模型级别的验证。

三个信号都说明一件事:AI硬件层的竞争是效率和成本的双重军备竞赛。谁能把算力成本压下来、把利用率提上去,谁就握住了下一个时代的入场券。