2026年8月9日,中国首个全国产10万卡AI超集群"曙光8000(登峰)"在国家超算互联网郑州核心节点正式投入运行。这套由中科曙光总包建设的系统,峰值算力相当于全人类持续计算200年,可支撑全国5%至10%的大模型推理需求。它的落成标志着中国AI算力基础设施从万卡时代正式迈入十万卡时代——截至2025年底,全国已建成万卡智算集群42个,十万卡集群此前没有先例(据《数字中国发展报告(2025年)》)。

超智融合:打破算力割裂的架构创新
曙光8000最核心的技术突破在于"原生超智融合"架构。传统模式下,超算与智算分区独立部署:科学计算依赖FP64双精度浮点运算,AI训练则使用BF16或INT8低精度计算,两套系统的硬件和软件互不通用。研究团队在分子动力学模拟与AI预测模型之间切换时,需要在不同集群间迁移数据,格式转换和重新配置消耗大量时间。
曙光8000摒弃了这一思路。该系统在同一套硬件上原生覆盖从FP64到INT8的全精度计算档位,支持灵活混合精度调度,可同步承载科学工程计算、万亿级大模型训练与高并发推理。中科曙光高级副总裁李斌博士公开表示,曙光8000支撑的国家战略性科学工程计算中,已有40%采用AI与数值仿真融合的计算模式。这意味着超智融合并非理论构想,而是已经在实际科研负载中验证可行的工程路径。
以药物研发为例,传统流程需要先在超算上完成分子动力学模拟,再切换至AI集群训练预测模型。在超智融合架构下,两类任务在同一系统内并行执行,数据无需跨系统迁移。这种一体化设计对计算效率的提升是结构性的——它消除的不是某一步的延迟,而是整个流程中因系统切换产生的等待链。
全链路国产化:从芯片到散热的自主可控
曙光8000具备"芯片、计算、存储、网络、散热、应用、服务"七层全链路自主可控能力。底层算力由海光等国产加速芯片与CPU提供,整集群十万张计算卡全部为纯国产硬件,实现"零进口GPU"。系统使用了约30亿颗国产元器件,1600公里互联线缆,单子网可支持超过11万卡部署。
高速互联方面,曙光8000采用自研scaleFabric类IB原生RDMA网络,在十万卡规模下实现0.9微秒级超低时延与高可靠稳定互联。RDMA(远程直接内存访问)技术允许计算卡之间绕过CPU直接读写内存,这对于大规模并行计算至关重要——当十万张卡协同处理同一任务时,网络延迟的微小波动都会被规模放大,导致部分计算单元空等数据。scaleFabric的设计目标正是消除这一瓶颈。
存储系统方面,曙光8000配备ParaStor分布式存储,在2026全球IO500榜单中同时斩获生产型全节点和10节点性能双榜第一。大模型训练和科学计算都涉及海量数据读写,存储吞吐不足会成为整个系统的短板。IO500榜单的评测维度正是衡量存储系统在真实工作负载下的综合性能,双榜第一意味着曙光8000的存储层在规模扩展性和节点级密度上均达到全球领先水平。
系统工程:十万卡规模下的四维挑战
从万卡到十万卡,绝非单纯的规模扩容。某券商分析报告指出,十万卡集群建设需要同步攻克芯片特性、高速网络架构、能源制冷、集群调度运营四大核心技术维度。每个维度的难度在十万卡量级都呈指数级提升。
网络层面,十万卡规模下集群对延迟和稳定性的要求急剧攀升。万卡集群中,单卡故障影响范围有限;十万卡集群中,网络拓扑设计的任何缺陷都可能导致大规模计算节点间的通信拥塞。高性能网络拓扑设计与工程部署成为核心难点。
能源制冷层面,十万卡集群对供电稳定性和散热效率的要求远超万卡系统。曙光8000采用全球首创的高密度机柜结构,单个计算单元的算力密度较同类超节点提升20倍。单机柜集成640张计算卡——若采用传统部署方式,640卡的线缆和空间需求足以占满一个机房。曙光8000将这一密度压缩至普通冰箱大小的机柜内。
曙光8000于上线首周即实现满载运行,单日处理作业峰值突破50万个,日均处理作业超过15万个。这一数据验证了系统在真实任务负载下的稳定性与可靠性——满载运行意味着所有计算资源都被有效利用,没有出现因系统瓶颈导致的大规模资源闲置。
能效革命:浸没式相变液冷的PUE 1.04
曙光8000采用曙光数创自研的浸没式相变液冷技术。工作原理是将计算设备完全浸没在特制国产冷却液中,液体吸收热量后受热相变为气体,带走服务器热量;气体经冷凝器重新凝结为液体,循环使用。配合全年自然冷却方案,系统PUE(能源使用效率)低至1.04。
PUE是数据中心总能耗与IT设备能耗的比值,越接近1.0表示制冷等非计算能耗越低。传统风冷数据中心PUE普遍在1.3至1.5之间,行业公认低于1.1即为顶尖水平。1.04意味着每消耗1度电用于计算,仅额外消耗0.04度电用于制冷——接近理论极限。
据公开数据,该方案使单位算力能耗相比传统风冷降低37%,算力密度提升9.2倍。PUE每降低0.1个百分点,大型数据中心的年度电费差距可达千万级别。在十万卡集群的规模下,能效差异的经济影响被进一步放大。曙光8000的浸没式相变液冷方案将这一指标推至全球数据中心能效的新基准。
应用验证:从蛋白质折叠到万亿参数模型
曙光8000已完成300余项超智融合应用优化,覆盖大模型、机器人、创新药、新材料等20余个领域,其中超过70个应用实现万卡规模扩展。系统已成功支撑蛋白质折叠模拟、万亿原子级水分子动力学模拟、百万亿网格湍流模拟等前沿科研任务,将传统需要数周的计算时间压缩至数天。
这些应用场景的共同特征是:既需要高精度物理模拟,又需要AI模型加速迭代。蛋白质折叠模拟依赖FP64精度计算分子间相互作用力,同时需要AI模型在海量构型空间中快速筛选候选结构。超智融合架构使两类计算在同一系统内协同执行,避免了传统模式下跨系统数据迁移的开销。
在产业端,曙光8000接入国家超算互联网后,打通全国30余家超算与智算中心,平台注册用户超过140万。这意味着其算力并非孤立供给,而是作为全国一体化算力网的关键节点参与跨区域调度。据国海证券测算,2026至2028年国产超节点市场规模将分别达到889亿元、4151亿元和11089亿元,年均复合增长率达341%。曙光8000作为首个全国产十万卡系统的投用,为这一增长预期提供了工程验证基座。
政策驱动与产业意义
曙光8000的落成有明确的政策背景。2025年8月,国务院印发《关于深入实施"人工智能+"行动的意见》(国发〔2025〕11号),明确提出"加快超大规模智算集群技术突破和工程落地"。曙光8000是这一政策方向下落地的首个十万卡级全国产系统。
同日落成仪式上,中科曙光宣布与北京科学智能研究院达成战略合作,启动第二套全国产十万卡原生超智融合算力系统的研制与建设。这表明十万卡级全国产集群正在从单点验证走向规模化复制。
选址郑州并非偶然。国家超算互联网核心节点选址郑州带有"贯通东西、连接南北"的枢纽意图。郑州在能源供给、气候条件、网络延迟和交通枢纽方面具备综合优势,适合承担大规模算力基础设施的集中部署与跨区域调度。河南省借此快速形成算力产业集聚效应:7月24日首批"河南造"众擎T800人形机器人下线,8月初全省人工智能产业规模突破1000亿元,上下游企业超500家。
曙光8000的意义不仅在于规模数字。它验证了一条从芯片到散热全链路国产化的十万卡系统工程技术路线,证明了超智融合架构在真实负载下的可行性,并将PUE 1.04的能效标准推至全球数据中心的新高度。当国产算力从万卡跃升至十万卡,中国AI算力基础设施的竞争重心正在从单卡性能转向系统级工程能力——而这正是曙光8000所代表的核心突破。
