通信世界网消息(CWW)当大模型从实验室走向大规模产业落地,行业逐渐意识到,AI业务的产出能力,并不完全等同于GPU卡的堆叠数量。即便拥有强悍的单卡算力,一旦多卡之间数据流转受阻,GPU就会陷入空转等待,昂贵的硬件资源无法转化为实际的Token输出能力。
近日,中科曙光正式发布scaleFabric Token加速技术体系,实现IBGDA(InfiniBand GPUDirect Async)技术国内首次规模化落地,通过算‑存‑传三级紧耦合加速通道,打通训练、推理、存储复用全链路的数据堵点。在近日的媒体沟通会上,中科曙光高速网络互联产品部总工程师万伟、中科曙光北京公司scaleFabric产品经理纵瑞博,围绕智算集群现存痛点、技术实现逻辑、产业价值以及未来演进方向,深度解读国产高速网络如何系统级提升大模型的实际运行效能。
数据流转成为大模型集群核心瓶颈
Token是大模型输出文字、内容的基础单元,也是衡量AI集群实际效能、业务成本的核心指标。现在大模型参数量越来越大,单张GPU已经装不下完整模型,必须依靠几十、上百张GPU组成分布式集群协同工作。不管是训练阶段多卡同步更新模型参数,还是推理阶段把KV Cache(推理缓存)在不同显卡之间搬运,海量数据需要在GPU之间来回传递。
“决定Token生成效率的不只是加速卡算力,更是算力、网络和存储之间的数据流转效率。”万伟在采访中表示,不是堆更高规格GPU,就可以获得更强的大模型服务能力,在实际落地中,网络与存储带来的时延,往往成为限制集群整体性能的短板。
大模型训练要做大量多卡同步计算,属于强同步任务。集群里只要有一块卡、一条网络链路出现延迟波动,其余所有GPU都必须停下来等待,直接降低GPU实际利用率MFU,拉长整体训练周期。
推理侧的矛盾则集中体现在用户可直接感知的体验指标。我们平时感受到大模型回复快不快,要看两个关键指标:TTFT(首Token时延,用户发送问题后等到第一个字输出的时间)、TPOT(每生成一个Token消耗的时间)。
“这些指标会直接影响用户使用大模型时的体感,而网络通信往往是其中的重要瓶颈。”万伟介绍,现在行业普遍采用“以存代算”,把推理产生的KV Cache缓存保存下来,减少重复计算;PD分离架构把输入处理(Prefill)和生成回答(Decode)拆到不同服务器。上下文越长,KV缓存体积越大,大量缓存数据要靠网络跨机器搬运,网络延迟会直接影响对话、AI Agent、RAG知识库问答的使用感受。
与此同时,KV Cache、训练数据集、模型Checkpoint大量读写,让存储系统压力陡增。传统路径中,数据要在存储、CPU内存、GPU显存之间多次拷贝,一旦存储访问效率不足,GPU就会处于等待数据的空闲状态,硬件算力被白白浪费。
简单来说,大模型集群比拼,已经不再只看单卡算力,而是看整套系统数据搬运的效率。如何减少数据拷贝、降低通信延迟、打通算力与存储的高速通路,是国产智算底座必须解决的现实问题,scaleFabric Token加速技术体系正是针对这些痛点打造的解决方案。
IBGDA规模落地,“算存传”三级加速Token流转
scaleFabric以原生无损RDMA网络作为底座,搭建“算存传”三级紧耦合的Token加速超级通道,覆盖大模型训练、推理、存储复用完整业务链条,实现Token全流程高速流转。其中,国内首次规模化落地的IBGDA技术,是整套方案的核心亮点。
在计算加速维度,GDR(GPUDirect RDMA)已经实现网卡直接读写GPU显存,绕开CPU内存,减少一次数据拷贝。但GDR仅仅优化了数据传输路径,通信任务下发、元数据处理依旧依赖CPU完成控制面调度。
而IBGDA则是GDR的“二次进化”,它允许GPU内核直接驱动和控制InfiniBand网卡,使得GPU可以不依赖CPU,完全自主地发起和管理节点间的通信。
“当前MoE已经成为大模型的主流架构之一,通信过程中存在大量并发的小消息传递,IBGDA对这类场景非常重要。”万伟解释道,让GPU直接发起和管理数据通信,是当前非常重要的技术思路。scaleFabric很早就支持了IBGDA,可以说,scaleFabric是国内首批规模化应用IBGDA技术的网络产品之一。
纵瑞博补充说明,基于DeepEP等主流通信框架运行时,上层业务代码、AI框架无需改动,只需要底层完成通信库适配即可;目前已经完成NVIDIA生态适配,针对其他国产算力卡,主要工作量集中在底层驱动适配,上层应用保持完全兼容,改造成本可控,业务迁移风险很低。
存储加速通道由NVMe over RDMA、XDS(XPU Direct Storage)、NFS over RDMA三项技术共同组成,三者相互协同,覆盖不同AI业务的存储访问需求。训练数据加载、Checkpoint读写这类面向文件的业务,优先使用NFS over RDMA,让传统NFS文件存储跑在RDMA高速网络之上,不用改动运维习惯,就可以实现零拷贝高速传输,实践中可将GPU利用率由55%提升至95%以上,缩短训练时长30%‑60%;KV Cache卸载、热数据缓存场景,NVMe over RDMA发挥价值,实现远端NVMe存储高速访问;XDS技术则支持加速卡绕过CPU,直接访问远端存储,打造从存储到XPU显存最短访问路径,适配存算分离的前沿架构。
“低时延高性能网络和存储协同优化,未来一定会成为AI集群的标配。”万伟做出判断,AI业务集群化是不可逆的趋势,随着并发提升、上下文变长、模型规模扩张,“算存传”协同优化不再是加分项,而是大规模智算集群的刚需能力。
网络加速通道为整套体系筑牢底层底座。数据显示,scaleFabric单跳转发时延低至260纳秒,网卡端到端时延低于1微秒,与英伟达NDR持平;在部分场景的三跳基准时延性能测试中,端到端时延较主流RoCE方案降低约63%,有效减少多级网络交换带来的时延累积。较低的三跳时延可以减少数据在多级网络中的传输耗时,使IBGDA和存储直通带来的路径优化进一步延伸至大规模集群,推动计算、存储和网络共同作用于Token生成效率。

靠系统级创新夯实国产智算底座
目前,国产算力卡单卡性能距离国际顶尖产品仍存在差距。万伟认为,国内AI基础设施突围,不能单纯对标单卡指标,系统级创新是国产智算重要的发展路径。国内算力发展正在依靠集群和多卡互联,通过增加计算卡数量、改善多卡通信效率,满足大模型发展所需的算力要求。
采用多卡方式构建集群后,多卡之间的数据通信就成为提升整体计算效率的关键因素。IBGDA技术在scaleFabric中的规模化应用,将成为提升多卡效率的重要支撑。
此前,IBGDA的规模化落地始终由国际厂商主导,国产RDMA网卡与GPU直通的落地案例极为罕见。依托scaleFabric原生RDMA无损高速网络,中科曙光自研IBGDA技术已在十万卡级大规模集群中完成验证,实现了这一领域的关键补位。
“我们采用开放架构,希望让scaleFabric网络与更多国产厂商的产品完成适配和优化。在RoCE和NVIDIA InfiniBand之外,为产业提供高性价比的国产原生无损RDMA网络方案,为各类GPU、CPU及其他硬件厂商提供技术支撑。”纵瑞博表示,未来,中科曙光将面向国产CPU、各类国产加速卡开展协同优化,和上下游伙伴共建国产AI底层生态。
值得一提的是,面向产业客户多样化需求,整套scaleFabric技术体系具备灵活适配能力。小规模微调任务,数据交互局限单节点内部,网络优化价值有限;一旦业务扩张到跨节点的数据并行、模型并行,scaleFabric低时延无损网络优势即可充分发挥;RAG检索增强场景,模型同步加上海量知识库读取,存储‑算力之间的高速通路可以显著改善数据加载效率,提升整套业务的吞吐表现;超大模型训练、高并发在线推理,更是算‑存‑传三级加速的核心落地场景。
谈及scaleFabric迭代路线,万伟透露,硬件层面,下一代产品将推出800G网卡与交换机,提升交换容量,兼顾大规模组网的性价比;软件层面持续迭代拥塞控制算法,给到用户更多可调配置,落地多平面、包喷洒、乱序重组等前沿网络技术;同时延续现有优势,强化链路故障快速自愈、免维护的大规模网络管理能力,保障十万卡级别集群稳定运行。
底层硬件平台生命周期很长,中科曙光在产品设计之初就预留软件扩展能力,持续跟进AI领域层出不穷的新技术。“今天是IBGDA,未来还会出现新的技术,我们希望能够快速完成适配,紧跟AI产业发展节奏。”万伟强调,网络基础设施不只是交付硬件设备,更需要持续跟随上层AI框架、模型架构迭代更新,完成软硬件协同演进,才能持续为国产智算底座提供底层支撑。
从比拼单卡算力,走向算‑存‑传全链路协同,国内AI基础设施正在完成认知升级。IBGDA在scaleFabric实现规模化落地,标志国产高速网络迈入GPU直接驱动通信的新阶段。依靠系统级创新,充分释放集群整体效能,将成为国产智算实现高质量规模化发展的重要路径。



