百度开放天池超节点参考架构:从少数厂商专属,到行业普遍可用
作者:xxinjiang2026.09.03 19:45浏览量:42简介:在 2026 开放数据中心大会暨首届算博会上,百度智能云宣布,将开放百度天池超节点架构设计。产业能够
9 月 3 日,在 2026 开放数据中心大会暨首届算博会上,百度智能云宣布,将开放百度天池超节点架构设计。产业能够直接参考与复用这套经过规模化验证的系统设计,降低超节点设计、验证和部署的门槛,加速超节点走向行业普及。
9 月 14 日起,读者可在「百度智能云技术站」微信公众号后台回复关键字「百度天池超节点」,即可获取《百度天池超节点系统架构设计规范》。
超节点正在成为下一代 AI 算力基础设施的重要形态。
为了让超节点更快被行业广泛采用、真正满足业务需要,百度智能云正式开放百度天池超节点参考架构,将经过规模化验证的系统设计开放给产业,供各方参考与复用。
随着大模型从训练走向推理,AI 算力基础设施正在经历新的变化:过去,超节点主要服务于大模型训练,是少数头部厂商掌握的高端 AI 基础设施;如今,MoE 模型推理对 AI 芯片间高速通信提出更高要求,长上下文场景进一步放大 KV Cache 的传输压力,超节点在推理场景的应用规模也开始快速扩张。
超万亿参数大模型 Kimi K3 的官方部署建议,明确推荐由 64 个或更多加速器组成的超节点(supernode)配置,以更大的高带宽通信域提升推理效率。与此同时,GW 级智算中心单机柜功耗可达数百千瓦,也让算力设备向更高密度、更大规模的超节点形态演进。
但业务需求的增长,并不意味着超节点能够自然实现规模化普及。当前,超节点仍是少数厂商掌握的高端装备,产业尚未形成一套成熟、开放、可复用的超节点架构。对多数行业客户而言,超节点仍处于想用、却难以规模化用起来的阶段。
1. 超节点走向普及,难的不只是设计
超节点不只是把更多 AI 芯片装进一个机柜,而本质上是一项高度耦合的系统工程。相比已经形成成熟产业链的单机 8 卡服务器,超节点的系统边界从一台服务器扩展到一个机柜,互联、供电、散热、机构、管理等多个系统高度耦合,一个局部设计选择往往会牵动整个系统。互联是其中最典型的挑战。
AI 芯片之间、AI 芯片与 CPU 之间、计算板卡与交换板卡之间,都需要大量高速连接。以 GB200 NVL72 为例,其高速背板连接器和铜缆用量是 DGX 架构的 5 倍,相关元器件数量较传统 AI 服务器增加近百倍。
在具体设计上,芯片间走光缆还是铜缆、计算板卡与交换板卡采用 Cable Tray 还是正交互联、AI 芯片与 CPU 采用解耦布局还是就近落位,都存在不同技术路线。
更关键的是,这些选择并非相互独立:互联方式会影响机柜深度,机柜结构又会影响 AI 芯片与 CPU 的布局和线缆长度,最终体现在高速信号传输的稳定性上。供电和散热同样是系统级问题:单机柜功率达到数百千瓦,供电单元需要在供电效率与计算、交换节点的部署空间之间取得平衡;液冷系统则需要在核心组件液冷与其余组件风冷的配比之间持续寻求最优能效平衡。
这也导致目前不同厂商的超节点架构存在明显差异。整机厂商需要自行完成架构探索和系统验证,部件厂商只能围绕不同架构定向开发,产业链尚未形成类似单机多卡服务器那样成熟的协作体系。
而完成设计只是第一步。当超节点进入行业客户的数据中心,还要面对不同的空间、供电、冷却和运维条件。过去围绕单机 8 卡服务器建设的基础设施,并不一定能够直接适配不同形态的超节点;超节点高度集成、规格庞大,也对设备部署、故障定位和部件更换提出了更高要求。
因此,超节点要真正普及,需要解决的不只是如何设计,更是如何让一套设计能够被更多厂商理解、复用,并在不同真实环境中稳定落地。
产业需要一个共同的起点。
2. 开放天池超节点架构设计
要降低超节点走向普及的门槛,首先需要解决架构设计和产业协同问题。基于这一判断,百度智能云正式开放百度天池超节点参考架构,即《百度天池超节点系统架构设计规范》,形成一套可参考、可复用的超节点参考架构。
该规范覆盖机构、计算节点、互联、供电、散热和管理等核心模块,内容包括机柜尺寸、节点内部板卡布局、节点机构尺寸、Cable Tray 设计精度要求及相关注意事项等。
百度希望开放的,不只是一个超节点产品,而是一套经过长期实践和规模化验证的系统设计方法。
让产业不必重复从零探索,是此次开放的核心价值。
这套参考架构来自真实的大规模部署实践。作为国内互联网厂商第一款量产超节点产品,百度天池超节点已支撑过万亿参数大模型的训练负载;目前,数百柜百度天池超节点正在智算中心、金融等行业客户的真实业务环境中稳定运行。
支撑这套架构规模化部署的,是贯穿产品始终的两项设计原则:简单可靠、通用易用。
3. 简单可靠:让复杂的超节点保持稳定
超节点的高密度、高集成度放大了系统复杂度,也放大了单点故障对整体运行的影响。规模越大,对系统长期稳定运行的要求越高。
高速互联是其中最关键的一环。大规模算力协同依赖高速互联链路,任何链路波动都可能引发计算中断或性能下降。为此,百度天池超节点将信号完整性作为互联设计的核心约束。
在计算节点设计上,百度天池超节点将 AI 芯片与 CPU 就近部署,缩短高速信号传输路径,减少长距离传输带来的信号衰减,同时减少转接点位,降低过多点位带来的信号异常,提升核心组件协同运行的稳定性。
在 AI 板卡与交换板卡的连接方式上,百度根据不同规模选择合适的技术路线。对于 32 卡规模的 Scale-up 域,线缆数量相对可控,且 Cable Tray 方案在相同距离下的信号衰减优于正交背板,能够使机构结构更为简洁,并保持良好的扩展性。面向更高的芯片连接数与更大规模的互联域,则推荐全光互联模式,一方面避免多卡二层互联增加延时;另外从运维场景出发,硬件结构化整为零(去除 Cable Tray 和正交),避免复杂的工程和运维设计;同时还可延续机柜标准化,避免非标机柜场景的兼容性问题。
在互联介质选择上,单柜 32/64 卡规模采用铜缆,在满足高速传输需求的同时提供更高的传输可靠性;面向单柜 128 卡及以上的更大规模互联域,则采用全光互联,发挥其集成度高、传输距离远的双重优势,支撑更大规模的算力间「一跳」协同。
不是追求更复杂的技术堆叠,而是在不同规模下选择更合适、更可靠、更简便的技术路径。从当前主流的 32/64卡超节点,到未来 512 ~ 1024 卡乃至更大规模的算力系统,百度天池超节点始终以「简单可靠」为原则,让规模不断扩大,而系统架构保持简洁稳定。
4. 通用易用:让超节点适应更多真实环境
如果说「简单可靠」解决的是超节点如何稳定运行,那么「通用易用」解决的则是超节点如何被更多客户真正用起来。
机房资源有限、运维人力紧缺,是大多数行业客户面临的现实约束。一套超节点方案能否从头部厂商的专属环境走向更多行业客户,关键在于能否适配不同的数据中心基础设施,并降低部署和运维复杂度。
因此,百度天池超节点从设计之初就将「通用易用」作为重要原则。
在基础设施适配上,百度天池超节点采用标准机架尺寸,供电兼容 AC/AC、高压直流、单相、三相等多种方式,管路设计兼容上进水与下进水,并可适配 CDU、风液混合等不同冷却方案,最大限度复用数据中心既有基础设施,减少因超节点形态变化带来的额外改造,让超节点能够更顺畅地进入不同客户的数据中心环境。
在运维侧,百度天池超节点采用「1U 一节点」设计,将数据盘、系统盘等高频更换部件以可插拔形式布置于机柜前窗。出现故障时,运维人员无需拆解机柜结构,单人可在数分钟内完成部件更换,维护体验接近单机服务器的热插拔操作,实现「单人分钟级」运维效率。
超节点不仅要把更多算力组织在一起,也要让这套系统能够被更多人部署、维护和长期使用。
5. 从「各自设计」,走向「开放复用」
百度开放天池超节点架构设计,价值并不只是提供一套设计图纸。更重要的是,将超节点的系统结构、部件关系、设计要求及长期实践经验,以产业链能够理解和复用的方式开放出来。
百度天池超节点已在这套架构下率先跑通一条完整的超节点产业链,形成了从 CPU、内存、SSD、AI 芯片、网卡、交换芯片、Ethernet Retimer、PCI Switch 到高密连接器等关键部件的全栈国产化方案,为整机厂商和部件厂商提供了可直接参考的供应链生态。
对于整机厂商,可以参考已验证的系统架构和供应链生态,降低从零设计和验证的成本,更快推出自己的超节点产品;也可以在统一的架构框架下灵活适配不同 AI 芯片和产品形态,缩短从芯片到超节点整机的产品化周期。
对于部件厂商,可以围绕超节点对性能、密度、可靠性和连接方式的明确要求,提前布局下一代算力基础设施,在板卡设计、电源模组、散热系统、交换芯片、Ethernet Retimer、PCI Switch、高密连接器等关键环节形成更具标准化的产品能力。
对于芯片厂商,可以据此更高效地完成面向超节点形态的产品适配与交付,缩短新一代 AI 芯片从流片到进入超节点整机的周期。
对于产业而言,这意味着超节点可以从各自定义、各自验证,逐步走向更加开放的协同演进。一套经过规模化验证的参考架构,可以成为整机、部件和芯片厂商共同理解、共同复用的起点,加速超节点从少数厂商的定制化产品走向更广泛的产业应用。
6. 从天蝎到天池
将经过大规模实践验证的基础设施经验开放给产业,百度有先例。2011 年,百度开放天蝎标准化项目,将整机柜服务器的架构经验带给产业,基于天蝎架构的整机柜服务器随后被行业广泛采用并实现规模化部署。15 年后,面对正在快速演进的超节点,百度再次选择开放。
这一次,百度希望通过开放天池超节点参考架构,降低产业设计、验证和部署超节点的门槛,让更多厂商能够参与,让更多数据中心能够部署,让更多行业客户能够真正使用。让超节点从少数厂商能做,走向产业能够共同做;从少数客户能用,走向行业能够广泛采用。让算力更高效地组织,让 AI 创新更快落地。

登录后可评论,请前往 登录 或 注册