(来源:21世纪经济报道)
21世纪经济报道记者 赵云帆
近日,由月之暗面发布的Kimi K3模型,以1679分的成绩,力压GPT、Claude系列两大“轮庄”神话模型,登顶全球三大代码类AI基准平台之一FCA的全模型榜首。
中国原生AI模型,第一次真正意义上触碰到了全球“SOTA(最高水平)”的铁王座——而在这背后,一则更为震撼的中国AI算力叙事,已悄然写下了它的注脚。
过去一段时间,国产算力到底能不能撑起前沿模型的推理需求,在产业、舆论端始终存疑。而在K3同步披露的种种信息中,我们却明确地找到了国产算力与国产模型珠联璧合的种种线索。
比如,在配置声明中,K3将“≥64卡超节点”列为其规模化商用的推荐配置,并将前沿算力“金标准”的英伟达NVL72(GB200/GB300)列为达标底座。
而在随后的世界人工智能大会(WAIC)期间,月之暗面却披露已同步适配包括华为昇腾在内的国产芯片。同期,华为在上海展出的昇腾950 SuperPod 64卡“超节点”机柜,似乎呼应了K3将“≥64卡超节点”作为推荐配置的做法。
在这中间,我们甚至能读到,国产模型与国产算力在工程配置上的“默契”。
突破摩尔定律的“集群”
早在几年前,半导体行业就已预见摩尔定律触及物理极限——当制程微缩难以持续推高单芯片算力时,业界转而通过增加芯片数量、扩大集群规模来延续算力增长格局。
但到了AI时代,新的问题又出现了:AI大模型的并行计算对卡间通信时延极为敏感,单纯的“堆芯片”同样会遇到瓶颈。
就像韩信点兵,“多多益善”的前提是指挥体系能同步调动每一路兵马,否则兵越多,弱点越多。
Kimi K3推荐底座之一——英伟达NVL72,正是为此而生。它通过NVLink五代技术,将72张英伟达高算力GPU焊入同一机柜,构建一个低时延、高带宽的一致性计算域,突破多卡协同中的通信瓶颈。
当然,NVL72仍然是一个非常“娇气”的算力架构。它不能无限扩展其集群,因为单机柜供电有上限,因为卡间要有散热空间,也因为铜线高保真低延迟传输有物理长度限制。
从原理上,GPU 之间要协同工作,最基本的需求是能互相读取缓存空间的数据。但是在微观尺度上,跨卡的数据读取与本卡写入数据会因为传输延迟产生致命冲突。
就像古代行军打仗,“将在外,君命有所不受”,因为战场形势的变化远快于指挥命令的下达。
为了实现GPU跨卡计算,英伟达NVLink配套了一套复杂的硬件机制。这套机制的核心是一颗专门的交换机芯片“NVSwitch”:它的内部维护着一张表格,记录着每张 GPU 的缓存里有哪些数据、状态如何(干净的、脏的、无效的),它可以向所有GPU广播“无效”通知。
用专业的叫法,这叫“缓存一致性”。但之所以它又很“娇气”,是因为从GPU发出读写请求,到NVSwitch转发无效通知,到所有 GPU 确认收到,整个往返必须在极短时间内完成。如果某个 GPU 迟迟收不到通知,它就可能拿着旧数据继续计算,进而造成错误。
因此,为了实现具有“强缓存一致性”的GPU互联,NVL72机柜不得不选择在内部使用铜线互联。
铜线的优点是低延迟、高保真,契合短距离算力集群的通信需求。当然,铜线也有缺点。NVLink 5 的信号速率高达每秒 1120 亿次变化,而高频信号在铜线里跑超过 2 米,信号质量就会差到无法可靠识别。所以NVL72机柜的5000多条铜缆全都被限制在2米以内,NVLink并行GPU的数量,也会受到物理空间和通信延迟极限的双重约束,被控制在非常有限的范围内。
“超节点”的中国解决方案
既然铜缆传输有空间限制,那为什么不用光纤呢?这可能是理解算力集群工作原理之后,第一个冒出来的问题。
光纤具备长距离稳定传输的优势——但芯片只能处理电信号,光电转换本身会引入额外延迟。而在NVLink强缓存一致性架构下,从GPU发出写请求到所有GPU确认收到无效通知,整个往返必须控制在1.5微秒以内。因此,铜线在2米内的传播延迟仅约20纳秒,且无需转换;而光纤方案会面临更高的成本、更大的功耗和更复杂的系统设计。
因此,英伟达等厂商最终选择了“铜光互联”的分层策略:机柜内部走铜线,利用其低延迟满足强一致需求;机柜之间或跨机房通信则切换为光纤,光纤的长距离优势在此发挥作用。
选择以上策略,是受限于英伟达GPU自身已然成型的架构——但若从底层架构上就和英伟达GPU、NVLink等设计思路区分开,更广泛的集群光通信,反而变成了一种可选方案。
以华为的算力芯片NPU,以及其推出的集群连接方案灵衢 UB为例:
在芯片端,华为把光引擎直接集成在NPU封装旁边,而不是像传统方案那样外挂一个可插拔的光模块。这就好比电梯入户,甚至是“地铁入户”,省去了通勤短驳带来的延迟。
而在协议层,华为放弃了英伟达那种“写下去,全世界立刻知道”的强一致缓存语义,改用了“最终一致”。
这是什么意思呢?从微观尺度来看,如果NPU-A写了一块地址X的数据,NPU-B可能在短时间内还会读到旧值,但协议保证“最终”B能看到新值。中间这段时间,软件自己负责处理。
这就像一个单位的文件流转制度:不是每份文件签署后立即传真给所有部门,而是每天下班前统一归档,各部门第二天上班时从档案室调阅最新版本。它的时效性比实时同步低一点,但系统可以做得很大、覆盖范围可以很广。
由于在芯片近端便使用了光通信作为传输介质,中国算力可以横跨多个机柜,组成一个相对低延迟、高带宽的一致性通信域——这也就是华为可以部署高达128个计算柜、32个互联柜、8192个NPU体量的“超节点”的原因。
埋下超越英伟达的可能
那么为什么说这次不仅是Kimi的高光时刻,更是国产算力的高光时刻?
原因藏在Kimi K3随模型披露的技术博客中。
K3模型的参数总数高达2.8万亿,其无疑需要更大规模的多卡协同才能实现模型的加载。
同时,在推理架构上,K3采用了国产模型普遍使用的MoE(混合专家模型)。不过,K3采用的专家数量首次提升至896个。也就是说,K3首次引入了早前还在学术论文中的“WideEP”——即“大规模专家并行”的结构。
具体怎么做呢?在K3的模型算力部署端,896个专家会被平均部署到64张算力卡上,每张卡恰好对应14个专家;这个算力架构要求集群内部具备低时延、高带宽的特点,因此只有包括华为、英伟达在内的“一柜多卡”超级算力集群,才能承接这样的配置需求。
鉴于此,K3才会特地把“64卡及以上超节点”写进官方推荐配置。
但是,英伟达NVL72本身的延展性,无疑受限于铜互联的物理极限。
我们不妨假设一个场景。未来,Kimi或其他国产模型厂商发布了更多基于“大规模专家并行”策略的模型,专家数量、算卡数量需求开始“指数级增长”,那么即便英伟达拥有高带宽的优势,其单域规模上限的劣势,却会被“大规模专家并行”的架构放大。
反倒是国产算力,从算力芯片设计之初,到集群架构总体设计,早就完成了与国产模型工程架构的适配与互补。“大规模专家并行”与“超节点”,反而成了反超海外AI前沿配套的黄金搭档。
国产算力集群固然有其短板,如单卡带宽低、数据同步有延迟。但在“大规模专家并行”策略中,这些问题恰好不那么尖锐。其原因有两条:一是K3的专家权重是固定的,在推理任务时不涉及修改,不需要卡间实时同步;二是K3的缓存数据要么是只读的旧内容,要么是每步新增的新内容,不存在两张卡同时改同一份数据的情况。所以华为用“同步稍慢”换取“域更大、跨机柜”的架构,反而成了K3这种模型最适合的底座。
此外,Kimi K3的种种架构创新,如创新的注意力机制KDA、分发机制Stable Latent MoE等,都体现出对国产算力“单卡不足,集群来补”特点的适应性。
而K3的跑分登顶,恰恰证明了“大规模专家并行”策略的优越性,也进而证明国产算力“超节点”真的可以跑前沿模型。
当然,“超节点”并非毫无缺点——华为NPU的算力相比英伟达GPU仍有差距。这意味着通过堆叠更多机柜构建的超节点,其功耗往往要超过提供同等算力的NVL72。但是,中国在发电量和电网配置能力上有优势,超节点的功耗和成本问题可以被这些优势所弥补。
与此同时,中国在算力设施的基础能力上,拥有更强的光通信产业化基础。这也令以光通信作为主流通信介质的超节点架构非常契合国内的优势产业。
Kimi K3的发布被许多人理解为“DeepSeek时刻”的2.0再现。但是,从算力适配的角度看,K3的发布其实更接近“国产算力1.0时刻”。

相关推荐
Kimi K3“登顶”,正在开启“国产算力1.0时刻”
月之暗面Kimi K3发布48小时算力告急,紧急暂停C端新用户订阅
硅谷警觉、华尔街震荡、马斯克点赞:Kimi K3搅动美国AI圈
2.8万亿!全球参数最大开源模型Kimi K3发布
月之暗面最新公告:算力紧缺,暂停C端新用户订阅
中国企业发布全球最大规模的开源模型Kimi K3
新突破!全球最大规模开源模型Kimi K3发布
马斯克:要追赶kimi,或能超越
K3发布48小时,服务器满载、英伟达暴跌、Anthropic连夜改订阅
国产算力和国产大模型,迎来双赢时刻
网址: Kimi K3“登顶”,正在开启“国产算力1.0时刻” https://m.xishuta.cn/newsview151793.html