C114讯 7月21日专稿(蒋均牧)大模型技术持续迭代与智能体(Agentic AI)加速落地,正在推动全球AI基础设施迎来结构性变革。
千亿乃至万亿级参数模型的规模化训推、超长序列上下文处理、多智能体并发交互等新兴负载,彻底颠覆了传统算力集群"堆服务器”的底层逻辑——跨节点通信效率与全局内存共享能力取代单芯片峰值性能,成为制约系统效能的短板。对中国算力产业而言,这一变化还有更深一层的含义:先进制程获取受限是客观现实,出路必须从架构层面寻找。

作为解决这一系列矛盾的答案,在2026世界人工智能大会(WAIC 2026)期间,“超节点”成为多家企业的展示核心与产业讨论的热门话题,叠加《超节点定义与实践白皮书》发布,标志着其AI基础设施建设新范式的确立。而在这场国产超节点的“集团冲锋”中,昇腾950超节点(Atlas 950 SuperPoD)凭借真机首秀与卓越人工智能引领者奖(SAIL大奖)的双重曝光,无疑站在了舞台的最中央位置。
划定统一标准:《超节点定义与实践白皮书》发布
超节点要成为一种产业共识与主流产品形态,首先要回答“超节点究竟是什么”。
7月19日,鹏城实验室(PCL)与全球计算联盟(GCC)共同发布了《超节点定义与实践白皮书》。这份由GCC和PCL牵头,联合京东、百度、中国电信、中国移动、华为、商汤科技、清华大学、北京大学等三十余家机构共同编撰的白皮书,首次对超节点给出了完整定义。

白皮书明确:超节点是一种在物理上由多个计算节点通过高效的互联协议紧密连接组成,具备跨物理节点统一内存编址能力,逻辑上具备“一台计算机”特征的计算系统。其中,跨物理节点的统一内存编址是超节点核心架构特征;“内存语义”和“统一内存编址”、超低时延、超大带宽共同构成超节点的三大技术特征。
这一定义的行业价值不容低估。一方面,传统服务器堆叠架构受限于时延、带宽瓶颈,已难以支撑超大模型规模化训练与推理负载。另一方面,长期以来,各家厂商对“超节点”的理解和实现路径各不相同,用户在选型和部署时也缺乏统一的参照系,导致产业链协同壁垒高、落地成本高,严重制约了智算基础设施的规模化演进。白皮书的发布,相当于为整个产业划定了统一的标准、构建起规范化的体系,也为衡量各类产品的成色提供了基准。
白皮书同时收录了大量产业规模化部署与商业化落地案例,以海量实测数据验证了超节点在AI训练、推理全链路场景中的全方位突破:诸如All2All性能相比RoCE提升16倍、长序列训练全局BatchSize大幅提升、推理时延显著降低。这些数据意味着超节点已脱离理论构想阶段,成为可落地、可推广的新型智算基础设施。
引领架构创新:昇腾950超节点真机首秀
如果说白皮书解决了认知问题,那么本届大会上昇腾950超节点的真机首秀回答的则是“超节点能做到什么程度”——作为当下为数不多能全面落地白皮书所示架构特征与核心技术体系的新旗舰产品,昇腾950超节点实现了理论标准与工程实践的深度契合,可谓是目前业界规模最大的一柄“标尺”。
基于灵衢互联协议,昇腾950超节点持续引领架构创新:以单柜64卡为基本单元,实现业界最大1024卡规模,提供1 EFLOPS FP8 、2 EFLOPS FP4澎湃算力,拥有业界最大的256TB全局统一内存编址空间,依托TB级NPU互联超大带宽与3μs 超低RTT时延,突破集群内计算、存储等各类资源的通信瓶颈。

算力竞争正在从单芯片性能转向系统级工程能力,灵衢互联协议代表的底层架构突破成为一大胜负手。这套协议把IO、内存访问与各类处理单元间的通信归一到同一技术体系,让万卡规模的资源可以全量池化、统一调度,也让“以架构换制程”从权宜之计变成了一条可复制、可演进的技术路径。灵衢互联协议去年已向业界开放,所有厂家都可以基于灵衢规范和参考架构打造更先进的算力基础设施。
在WAIC主论坛上,昇腾950超节点从数百个海内外参评项目中脱颖而出,斩获大会最高荣誉SAIL大奖。其所处的Superior超越赛道,用以奖励在特定领域展现出卓越的性能和成果,实现了对现有技术或模式的全面超越,具备显著的竞争优势和不可替代性的项目,竞争空前激烈。昇腾950超节点此次获奖,核心源于其在架构创新、系统工程以及商用能力的超越和领先。
除了面向大规模数据中心的950超节点,昇腾还展出了Atlas 850E风冷超节点。这款产品依托自研VCE相变散热技术与灵衢互联协议,无需对现有风冷机房做液冷改造,标准机柜可直接上架部署,支持单个风冷超节点扩展至96卡商用部署。850E原生覆盖FP8、mxFP8、HiF8、INT8、mxFP4全量低精度格式,搭配4.0TB/s高速内存带宽,可稳定实现10毫秒级时延推理,充分匹配Agent多轮对话、高频KV缓存读写的负载需求。其产业意义在于把超节点技术带入了传统机房,极大降低了该技术规模化落地的门槛。
唯一规模商用:昇腾384超节点发货超750套
任何技术创新最终都要接受市场的检验。华为在本届大会上披露了昇腾AI超节点的最新商业化进展:昇腾384超节点(Atlas 900 A3 SuperPoD)已实现商用落地750多套,成为国内唯一规模商用的超节点,也是国内唯一训练出SOTA(State-of-the-Art)模型的超节点。
这一数据标志着国产超节点正式跨越了“技术可行”到“商业可用”的鸿沟。C114现场了解到,昇腾384超节点已广泛应用于互联网、运营商、金融、教育、医疗、交通、制造等20多个行业的核心生产场景。根据媒体公开信息,7月9日,粤港澳大湾区首个“国芯训国模”昇腾万卡智算集群在广东韶关发布,总计部署30套昇腾384超节点。

在互联网行业,昇腾超节点支撑海量大模型迭代与高并发智能服务落地,满足用户多样化AI交互需求;在运营商领域,为全域算力网络建设提供核心节点支撑,助力算力并网、算力调度、普惠算力落地;在金融、制造等对稳定性、安全性、可靠性要求严苛的行业,昇腾超节点凭借统一资源调度、低时延、高稳定的特性,支撑智能风控、工业质检、智能决策等核心业务常态化运行。
依托开放的昇腾基础软硬件平台,华为已携手3000多家行业合作伙伴,共同孵化了7000多套行业解决方案,服务超过2000家政企核心客户。这一庞大生态体系的构建,使得昇腾能够深入金融智能风控、运营商大模型、制造质检等60多种真实业务场景。大会期间,昇腾集中展出了20多个标杆落地案例,全方位展现了AI产业化从算力底座到商业成果的转化路径。
全面开源开放:推动生态从“好用”向“易用”升级
产业发展规律表明,技术壁垒的固化只会制约产业整体升级,开源共建、协同创新已经成为AI算力领域的主流发展趋势。华为始终坚持底层技术开源开放,通过全栈能力开放、开发者生态共建、行业标准共享等举措,持续降低AI开发门槛,推动昇腾算力生态从“好用”向“易用”全面升级。
基础软件是算力硬件能力释放的核心载体,也是产业生态构建的核心根基。英伟达的护城河一半在芯片、一半在CUDA,这已是行业共识。2025年底,昇腾完成CANN 、Mind系列基础软件全量开源,向开发者无保留开放底层核心能力,沉淀华为研发自身开发调优能力形成各类Skill,同时全量兼容业界编程语言与训练加速库和推理引擎,让每一开发者享受极致吞吐和超低时延,为每一个Token提供高效可靠支持。

截至目前,CANN开源社区的开源项目已经达到67个,平均每3天就有一个新的开源项目上线;开源代码从827万行增加到1244万行,平均每天新增开源的代码量3万行;社区的代码下载量也从开源初期的127万,跨过了千万级别,平均每天有6万多次下载。越来越多的开发者参与社区的共建,平均每月有3500多位开发者活跃在社区。
CANN兼容当下主流的编程语言、训练加速库和推理引擎:深度适配Triton、TileLang、FlagTree、Triton-TLE、DLCompiler等算子开发编程语言与开发范式,支持SGLang、vLLM等600多个开源生态算子;全面兼容verl、AReaL、Slime、Roll、VeOmni、MS-swift、Llama Factory、Xtuner、Twinkle等主流训练加速库;与vLLM、SGLang、xLLM、RTP-LLM、Diffsynth-Engine等推理引擎完成深度联调与原生适配。
为进一步赋能开发者全流程创新,华为将多年积累的算子开发、知识管理、性能优化、工程调试等专家研发经验,沉淀为模块化、可复用的AI技能,全面开源于Ascend agent-skills代码仓。技能库涵盖算子开发、迁移适配、性能分析、自动化测试、工程质量管控等11大类222项核心技能,覆盖AI开发全生命周期。同时配套推出昇腾Model Agent,打造全流程自动化AI开发工具,实现从需求分析、代码生成、调试优化到交付落地的全链路自动化赋能,进一步简化AI开发流程、提升研发效率。
当前,超节点已经成为下一代智算基础设施的主流形态,《超节点定义与实践白皮书》的发布,为全球产业发展划定了统一标准,而昇腾超节点凭借领先的架构技术、成熟的商用实践、繁荣的开源生态,成为标准落地的核心标杆。从昇腾384超节点的规模化普及,到昇腾950超节点的技术登顶,再到全栈开源生态的持续壮大,华为持续夯实国产算力底座,破解行业发展痛点。
AI产业的蓬勃发展,离不开坚实可靠的算力根基。超节点的出现,并非单一硬件参数的升级,而是从互联协议、系统架构、工程设计到软件适配的全维度创新。依托昇腾384超节点的大规模商用沉淀与昇腾950超节点的技术突破,叠加全栈开源生态的持续赋能,昇腾超节点已然构建起“架构引领、技术领先、落地成熟、生态繁荣”的完整产业格局,为全球AI基础设施建设提供了“中国方案”,为世界提供了新选择。

