当前位置:主页 > 国内 >

三傻大闹宝莱坞

集合8192张卡,华为亮相最强超节点_我的网站

黑金

A |     记者丨何己派 编辑丨鄢子为          7月17日,2026世界人工智能大会(WAIC)首日,现场人头攒动。    记者 陈月芹          7月17日至20日,在2026年世界人工智能大会(WAIC)的H2算力馆内,华为、中科曙光、沐曦股份、中兴通讯、东方算芯、燧原科技、百度昆仑芯、新华三、联想集团等企业,纷纷把自己的超节点机柜搬来展示。         备备受瞩目的华为昇腾950超节点(Atlas 950 SuperPod)真机首次亮相。         其实现业界最大1024卡规模,整套系统最高可扩展到8192张昇腾卡。         相当于,它把8192张卡捏成一台“电脑”,用于万亿级大模型训练与高并发推理。

B |          “未来多年都将是全球最强算力的超节点”,产品发布之时,华为副董事长、轮值董事长徐直军信心满满地表示。

C |          一套超节点的造价动辄数亿元,运输难度大。

D | 多家算力企业把一整排像墙一样、布满GPU(图形处理器)的黑色机柜横放在展台门口,正面和背面都敞开让观众查看,以至于入口非常狭窄,观众常常需要侧身挤入。也有企业把超节点柜贴墙摆放,仅开放展示单个计算“抽屉”。         WAIC现场呈现出了两种参观思路:举着“贵宾参观团”牌子的一批观众,常常站在超节点机柜前,听工作人员详细讲解;股民、技术极客和带着采购任务的企业人士,则不约而同地绕到机柜后方,研究光模块、线缆、散热方案、交换网板……           超节点机柜前挤满了人(陈月芹/摄)          背面更有看头          AI算力不再只拼单张芯片,而是开始竞争超节点与整机柜方案后,市场的关注点更为具体。

E |          一位国企采购人士告诉经济观察报,去年华为在WAIC展出的Atlas 900 A3 SuperPoD(384 超节点),机柜背面是粗壮的高速铜缆,而今年亮相的新一代Atlas 950超节点,用上了800G光模块与高密度光纤,大幅减少了传统粗铜缆的使用。

F | 在数量上,超节点互联规模也从去年的384卡,直接升级至1024卡。         超节点这张牌,关系到华为在全球算力牌桌上的输赢。         力大砖飞          何为“超节点”?          按华为的定义,超节点是计算节点通过高速互联协议组成更大内存空间的计算系统。         注意这个词,“系统”。         国产厂商的单芯片性能,较海外仍有代差,这是不可回避的现实问题。         华为昇腾此次首次展出的业界最大规模超节点Atlas 950 SuperPoD真机,背面还专门挂出长条形的StarMatrix(华为星联系列)800G LPO光模块,观众可上手触摸。         一位算力行业资深从业者向《21CBR》表示,论单芯片性能,国产芯片与英伟达的差距,部分指标可能是八到十年。         既然单芯片制程上吃亏,换个思路,把成百上千张卡“绑”在一起呢?用集团军的体量,对阵精锐部队。         华为超节点机柜背面的光模块和线束被围观(陈月芹/摄)          超节点机柜的正面,一般是高密度计算单元,形态上是一层层的计算“抽屉”或刀片服务器,如常见的8卡NPU/GPU模组化设计,专门负责庞大的矩阵运算与大模型训练和推理。在WAIC现场,多数超节点产品开放了部分区域,供观众拉开“抽屉”观看。         机柜背面的重点则是高速互联、交换网板,供电与配电单元(PDU)以及光模块插槽等,主要负责连接千卡或万卡、解决带宽瓶颈。         超节点不是芯片数量的堆砌。         四五年前,华为就认识到这一点,开始发展超节点技术,在极限制裁下,摸黑前行,找到“超节点+集群”这条新路。

G | 模型参数开始从千亿上升到万亿、训练集群扩张到万卡乃至十万卡量级,企业要比拼的不是单张卡能算多快,而是成千上万张卡能否算到一起。         因此,关注超节点真实效率的行家,想从机柜背面看到各家打通通信瓶颈的解决方案:阿里云磐久AL128围绕AI训练和推理重构机内互联,为超节点之间预留大规模Scale-out(横向扩展)带宽;百度智能云自研XPU-Link互联协议,中兴通讯发布OEX超节点;华为强调灵衢互联,将芯片级、单板级和机柜级通信纳入统一协议。         韩国参观团了解百度昆仑芯的超节点(陈月芹/摄)          中科曙光展出的全国产十万卡AI超集群曙光8000(登峰),是“算力在沸腾”的具象化。         传统集群,由服务器、存储、网络等设备堆叠而成,进行大规模训练时,资源利用率低,故障频发,阻碍AI创新。这是一套采用浸没相变液冷技术的机柜,把芯片泡在特殊的“水”(电子氟化液)里,芯片工作时发热,液体吸热变成一个个气泡,把热量带走,冷却后再变回液体,循环往复。         来源:网络          华为团队探索出的超节点范式,是用高速总线连接多颗NPU,突破互联瓶颈。         一位中科曙光的工作人员介绍,这种电子氟化液约10万元/吨,会挥发,不够可以补加。中科曙光用了近三年时间,才找到合适的液体,完成从液体配方到整机设计的全链条自研。         中科曙光的超节点会“冒泡”(陈月芹/摄)          大模型进化,把压力给到上游          除了超节点,今年WAIC的另一个高频词是Token(词元)工厂。

H |          由此,超节点在物理上由多台机器组成,但逻辑上像一台计算机一样,学习、思考、推理。         徐直军多次强调,华为的核心战略,就是“超节点+集群”。芯片上下游企业不能只卖卡,还需要提供Token服务。

I |          “我们认为,只有依靠超节点和集群,才能突破中国的芯片制造工艺限制,为中国的AI发展提供源源不断的算力支持。

J | ”徐直军说。

K |          中科曙光的超节点会“冒泡”(陈月芹/摄)          一家头部国产GPU企业人士向经济观察报解释,传统GPU最早是做显卡、擅长图形处理的,如果直接拿来用在大模型上,效果不太好。         这条路能不能走通,考验的不是决心,而是工程能力。如果用同一张卡既做Prefill(编码处理输入),又做Decode(解码处理输出),是不划算的。

L | 因此,这家头部国产GPU企业的方案是:用大算力的卡专门处理输入,用小算力但大带宽的卡专门处理输出,使同等成本下的数据处理量实现成倍增长。把上千张卡“绑”成一台电脑,说起来容易,做起来,每一个环节都是硬骨头。         月之暗面是这家头部国产GPU企业的客户之一。近期KIMI K3模型爆火,不少企业在展台询问KIMI K3的降本逻辑。         最大杀器          超节点的系统综合性能,等同于超节点规模与单芯片性能规格的乘积。该头部国产GPU企业人士解释,我们是一个推理芯片的生产工厂,我不关心客户生产的是什么,我在乎的是用最小的成本,让这千张卡一天内能回答更多的问题、提供更多的服务。         “超节点不是单纯比拼卡数量,只看数字也没有意义。         大模型、Agent(智能体)能帮人类处理更多复杂任务,也对上游算力企业提出了更高的要求。无问芯穹联合创始人兼CEO夏立雪认为,Agent推理需求上下文极长、交互轮次极多、缓存命中率极高,对吞吐、时延、缓存复用的要求,远高于传统对话场景。”          某ICT厂商从业者向《21CBR》记者强调,超节点要实现极致效率,靠的是一套系统工程能力。         换句话说,把芯片“暴力”地捏到一起,同时做到算力领先和效能最优,既需要有核心部件的单项能力,也要做好工程化设计,解决超节点面临的高密供电、高效散热等问题。         这里面最难的是互联,可以说,该能力直接决定了超节点的能力。         华为给出的解决方案是灵衢,这是专门为超节点设计的互联协议,全栈自研。仅依靠产能的线性增长去堆叠算力,已经远远无法弥合供需之间持续扩大的缺口。         其从2019年开始秘密研发灵衢,相当于发明了一套“算力普通话”,让所有组件都讲同一种语言,将整个系统的沟通成本降到最低。         昇腾芯片是基础,自研的灵衢,才是华为做超节点最大的杀器。         无问芯穹的解决方案是跨集群异构PD分离架构,用高性价比的广域网以太网把分布在各地的、已经建好的同构数据中心连起来。         这些Token工厂及下游大模型企业眼下的重点,不是“卷”生产单个Token有多便宜,而是计算把一个任务办成要花几个字、调几次、错几次,能不能更快、更高效。         企业正在加速扩产。         来源:网络          华为内部对灵衢信心满满。7月19日,中科曙光相关负责人在向广东省委参观团讲解产业链落地情况时透露,中科曙光计划在广州天河区投资建设一个海光产业创新中心,将数千家生态上下游企业聚合,提供设备适配与展示平台,目前已洽谈到第二轮。         将成百上千张卡“算到一起”,一个超节点整机柜群功耗可能高达400KW(千瓦),单台高密度机柜的功耗在50KW以上,这对供电、散热和承重提出了严苛要求。         一家关注柜式节点的采购企业,把两个问题抛给了多家上游企业:一是整体方案能支持多少张卡,想加上更多卡时能怎么互联;二是和英伟达相比,国产GPU耗电量等后期成本有多高。

M |          2025年9月,灵衢协议与芯片架构师程传宁,对比主流互联协议后给出结论:灵衢可覆盖其他互联应用场景且特性更优,尚无其他公开互联体系能完备覆盖灵衢。

N |          据灵衢系统架构师介绍,灵衢技术很适合高并行、高同步的负载特征场景;在实际应用收益方面,在AI大模型训练场景中,通过超节点互联降低通信占比,端到端性能收益达到20%以上;          在通算数据库场景中,通过三层池化支撑多写多读,TPC-C提升20%。         加速落地          要将性能变为领先优势,华为正加速推动昇腾超节点规模化商用落地。         目前,昇腾384超节点已商用落地750多套,用于互联网、运营商、金融、教育等多个行业。         依托基础软硬件平台与开放的AI生态,昇腾携手3000多家行业合作伙伴,共同孵化7000多套行业解决方案,服务2000多家政企核心客户。他需要计算硬件成本和运维成本的总账。

o |          本次WAIC,昇腾集中展出20多个标杆落地案例,覆盖60多种真实业务场景。         2026年4月,DeepSeek V4系列模型发布,昇腾超节点全系列产品为其提供支持。         当时,DeepSeek在官宣文稿里,写了行小字“吐槽”,亦是预告:“受限于高端算力,Pro的服务吞吐十分有限,预计下半年昇腾950超节点批量上市后,Pro的价格会大幅下调。

p | ”          行业翘首以待950代际产品年底上市。按规划,2027年华为将推出960代际产品。         来源:网络          有券商分析师表示,算力消耗的主力,正从少数巨头的大模型训练,转向百万企业以及亿级用户的推理与微调。

q |          对华为这类算力厂商而言,其营收模式随之改变,过去收的是“一次性建设费”,未来将转向持续的算力建设与运营。

r |          这将带来盈利能力的变化,毛利率从15%-25%跃升至40%以上。

s |          这才是算力生意的性感之处,不是卖机柜,而是嵌入客户经营日常,持续“收租”。华为显然算过这笔账。         图片来源:华为,除标注外。

t |

Current article:http://www.yuejinhuapennuochoudengying.cyou/list_buo4y/zmf.ppt

Published on:15:50:00


相关新闻

最后更新

热门新闻