2022年10月出第一版规则,卡A100、H100;2023年10月打补丁,把A800、H800这些"缩水版"也一起封了;2024年、2025年又陆续加码,把HBM高带宽内存、部分成熟制程设备也纳入清单。
一步一步走,节奏很清楚,目的也很直白,就是想让中国大模型没算力可用。

美方那套算盘,我们拆开看就三层。
第一层,堵EUV光刻机的出口,中芯国际做不出更先进的制程;第二层,掐台积电给大陆客户的代工,尤其是7nm以下;第三层,锁死HBM供应,让芯片就算算力够,也喂不饱数据。三招连着来,看起来滴水不漏。
业内一度也真被压得喘不过气,毕竟单卡打不过就是打不过,这是硬指标。

但业内忽略了一件事。
训练大模型这活儿,从来不是"单卡越猛越好"这么简单。真正的瓶颈藏在两堵墙后面,一堵叫通信墙,一堵叫内存墙。
你买回八千张卡,本质上就是八千台各干各的电脑。它们之间要交换数据,全靠网线传。卡越多,等待越久,实际效率越低。
这也是为什么,业内测出来的规律是:卡数破千之后,扩展效率能从九成掉到四五成。

英伟达当然也知道这毛病。
它的解法叫NVLink,靠自研的高速总线,把72张GPU串成一个通信整体,就是那台被吹得神乎其神的GB200 NVL72机架。72这个数字,一度被业界当成天花板,因为再往上加,工程复杂度呈指数级涨。

可华为这回把牌一亮,直接把数字推到了8192。72和8192之间的距离,不是台阶差别,是山头差别。
支撑这个数字的技术,一共两块硬骨头。第一块叫UB总线协议,华为自己搞的高速互联。
过去要走以太网、要过网卡的那些数据流,现在直接搬到板载总线上跑。现场公布的时延数据挺吓人:单跳延迟200纳秒,集群往返3微秒。
光在真空里,1纳秒才走30厘米。200纳秒的意思是,几千张卡之间传数据,快得几乎感觉不到"跨机"这道坎。

第二块叫统一内存编址。
老集群里,A芯片想读B芯片显存里的东西,得走一长串流程:出显存、过PCIe、进网卡、穿网络、再进对端网卡、最后进显存。跑一趟微秒起步。
华为这套超节点直接把256TB内存做成一个全局大池子,任何一张卡想调另一张卡的数据,给个地址就够了。就像读自己家的显存一样自然。
这才是"8192张卡当一台机器用"的底气所在。组合拳打完,成绩单也就出来了。

FP8精度下1 EFLOPS,FP4精度下2 EFLOPS。EFLOPS这个单位,翻译过来就是每秒百亿亿次浮点运算。
五年前,这是国家级超算才有的数字。现在被塞进一整排机柜里,专门伺候大模型训练。
有测算说,跑一个万亿参数模型的训练周期,能从几个月压到几周。这不是量变,是质变。

我们打个更直白的比方来理解。
传统集群像什么?像把八千个博士关进八千个隔音间,每人智商都高,可算出一步得写在纸上塞信封,让快递员跑长走廊送到隔壁。
一天下来,大部分时间都花在等快递上。华为这套超节点,相当于把墙全拆了,中间摆一块256TB的巨型白板。
八千个博士围坐,谁写谁看,谁看谁接。效率完全两个画风。

其实"单卡不行、架构来凑"这条路,中国走过不止一次。
上世纪八九十年代,西方封锁Cray、IBM的超算,国防科大搞出来的"银河"系列,就是靠并行架构。用不算顶尖的单体芯片,靠精巧调度拼出一流整机。
后来的"天河一号"2010年拿了TOP500世界第一,"神威·太湖之光"2016年再次登顶。骨子里的哲学都一样:单点不够,系统来补。

放到2026年这个节点,这套哲学更值钱。摩尔定律早就不是原来那个摩尔定律了。
晶体管尺寸逼近原子极限,台积电2nm得靠GAA新结构硬撑。就连没被制约的英伟达,也在拼命往NVL72、NVL576这种"机柜即芯片"的方向跑。
这说明什么?说明单卡这条路,全世界都快走到头了。系统级架构,就是下一个战场。
谁在这里占位,谁就拿到下一轮门票。

从产业层面看,昇腾这套超节点的意义不止在展台上。
它把国产AI算力的天花板,从"追赶单卡"这个维度,拉到了"系统超越"这个新赛道。国内大模型厂商这几年最难的事,就是训练资源紧、成本高、供应不稳。
有了国产超节点做底座,起码在自主可控这条线上,脚下踩实了。

据公开信息,多家头部互联网公司都在接触和测试国产大规模训练集群。
话也不能说满。国产芯片跟英伟达最新的Blackwell架构比,单卡浮点性能还有明显差距,这是事实,不用绕。
软件生态、CUDA十几年攒下的开发者习惯,也不是靠一台超节点就能立刻抹平。硬件出来只是第一步,后面还有算子库、编译器、框架适配、行业落地一堆活儿要干。
这条路我们走得肯定不轻松,但至少方向没错,脚步没停。

回头看西方那套"卡算力、饿死中国AI"的思路,到2026年这个时点,副作用已经很明显了。
禁令越紧,国产替代的紧迫感越强,国内厂商砸研发的决心越大。华为、寒武纪、海光、壁仞、燧原这一批做AI芯片的公司,过去几年拿到的订单和融资加起来是一个天文数字。
本来想扼杀,结果扼杀不成,反倒催出一整条自主产业链。有句老话叫"塞翁失马"。

放这场博弈里挺合适。
要是没有2022年那轮制裁,国内厂商可能还在舒舒服服采购英伟达,享受现成的CUDA生态。谁会去啃UB协议、统一内存池、超大规模互联这些又冷又硬的技术?
正是因为退路堵死了,才逼出8192这个数字。历史很多时候就是这样,你以为在筑墙,墙的另一边偏偏长出了梯子。

技术这条路上,从来没有一劳永逸的胜利。西方的封锁还会加码,中国的追赶也远没到头。
3nm、2nm、光互联、存算一体,每一关都是硬仗。
但2026年这个夏天,那台"大电脑"至少告诉世界一件事:想靠单点封锁困住一个14亿人口、拥有完整工业体系的国家,越来越像一厢情愿。这场戏,才刚翻到中场。