2026-8-26 14:55

中国移动研究院三篇论文在计算机网络领域顶会SIGCOMM Workshops发表

00:00 00:00

近日,中国移动研究院三篇智算网络方向论文在ACM SIGCOMM 2026 NAIC Workshop和MOSAIC Workshop发表,分别是《Dragonfly-Ultra: A Scalable, Low-Cost Network Architecture for High-Performance AI Clusters》《Delphinus: Ultra-Fast Link Failure Detection and Recovery for AI Data Center Networks》和《Evaluating Link-level Lossless Mechanisms in AI Networks》。SIGCOMM是CCF A类计算机网络领域顶级会议,具有广泛的行业影响力。

《Dragonfly-Ultra: A Scalable, Low-Cost Network Architecture for High-Performance AI Clusters》面向大规模智算网络的扩展性挑战,解决现有主流Clos拓扑和直连拓扑在规模扩展时面临的成本超线性增长及性能瓶颈问题。提出Dragonfly-Ultra架构,通过组间全连接消除组内路径绕行,并结合双水线自适应路由实现快速拥塞缓解、统一亲和编排实现跨组流量均衡,有效缩短集合通信完成时间。两层网络即可支撑超26万GPU规模,网络成本与功耗仅为三层Clos的80%左右。未来团队将基于原型验证平台对Dragonfly-Ultra开展大规模集群部署测试,持续优化架构在真实业务场景下的性能表现。

Dragonfly-Ultra架构示意图

(论文链接:https://dl.acm.org/doi/10.1145/3789240.3828737)

《Delphinus: Ultra-Fast Link Failure Detection and Recovery for AI Data Center Networks》面向智算网络高可靠需求,解决现有链路故障恢复机制探测速度慢、覆盖范围窄的问题,提出了基于交换机数据面的链路故障快速探测与恢复机制。核心设计包括:基于数据面对端口状态的微秒级感知能力,实现链路故障的快速探测;基于远端故障通告与中继机制,实现远端故障的快速恢复,扩大设备快速恢复能力覆盖范围。该机制在可编程交换机上实现,经系统测试,可实现端侧透明、业务无感的亚毫秒级网络故障快速自愈,显著提升链路故障恢复速度和故障恢复能力覆盖范围,为智算业务提供高可靠保障。中国移动研究院积极推动核心机制标准化,牵头IETF相关文稿立项与工作组成立。

Delphinus系统架构图

(论文链接:https://dl.acm.org/doi/10.1145/3789240.3828741

《Evaluating Link-level Lossless Mechanisms in AI Networks》针对智算网络中为保障智算业务稳定高性能常采用的基于信用的流量控制(CBFC)与链路层重传(LLR)机制,首次基于硬件实验平台对二者进行系统评估。结果表明,CBFC能显著降低接收缓冲区占用,LLR能大幅缓解数据包损坏导致的性能劣化,为智算网络链路层无损设计提供了重要参考。

LLR机制有效缓解数据包损坏带来的吞吐劣化实验结果图

(论文链接:https://dl.acm.org/doi/10.1145/3789240.3829346

中国移动研究院在智算网络领域已取得多项核心技术突破,形成自主GSE技术体系,成果获国内外同行广泛认可。本次三篇论文发表,是团队近期研究成果的集中体现。基础所GSE团队将持续深耕智算网络方向,瞄准AI算力集群核心网络痛点,攻坚前沿技术,为公司智算业务提能增效注入技术动能。

来源:C114通信网

相关

网络中国移动ACMAI计算机
本评论 更新于:2026-8-26 15:01:04
在C114 APP中与业内人士畅聊通信行业热点话题!