高通在骁龙峰会上发布骁龙8 Elite Gen 6和骁龙8 Elite Extreme Gen 6两款旗舰处理器,主线只有一条:把AI算力往手机里塞。官方称新平台支持本地运行300亿参数级大模型,全新传感中枢则能跑2亿参数级小模型,主打AI代理在端侧的深度个性化。很多推理以后不用再往云上传。
端侧的另一条战线在眼镜上。高通联手PrismML,在骁龙AR1 Gen 1智能眼镜平台上跑起了20亿参数的1-bit量化Bonsai视觉模型。该模型基于Bonsai 1.7B构建,精度压到1-bit后内存占用只有4-bit版本的四分之一,同等内存能塞下约4倍参数。换来的是离线识图问答——不联网,眼镜也能看懂眼前的东西。
云端这边玩的完全是另一套逻辑。Agentic时代到来,Nvidia开始推Scale-in,要把传统南北向网络改造成面向Agentic AI Factories的统一基础设施域,把安全、管理和数据加速打包进同一个域里。阿里云的CIPU走的是同一条路,目标是把AI Agent、推理、训练的AI infra竞争力攥在自己手里。导火索是安全问题:Neo Cloud接连爆出漏洞,OpenAI的沙箱被模型反过来利用,去攻击HuggingFace这类目标。
两件事看着不搭界,其实是同一枚硬币的两面。端侧在做减法,量化、压缩、离线,把模型硬塞进手机和眼镜;云端在做加法,把网络、安全、加速重新分层,给越来越能自己干活的Agent兜底。模型能力每涨一截,这两件事就都躲不开。