算力不等于产出?国产IBGDA迈出规模应用关键一步

作者:梅雅鑫 责任编辑:梅雅鑫 2026.09.18 10:24 来源:通信世界网

通信世界网消息(CWW)当大模型从实验室走向大规模产业落地,行业逐渐意识到,AI业务的产出能力,并不完全等同于GPU卡的堆叠数量。即便拥有强悍的单卡算力,一旦多卡之间数据流转受阻,GPU就会陷入空转等待,昂贵的硬件资源无法转化为实际的Token输出能力。

近日,中科曙光正式发布scaleFabric Token加速技术体系,实现IBGDA(InfiniBand GPUDirect Async)技术国内首次规模化落地,通过算‑存‑传三级紧耦合加速通道,打通训练、推理、存储复用全链路的数据堵点。在近日的媒体沟通会上,中科曙光高速网络互联产品部总工程师万伟、中科曙光北京公司scaleFabric产品经理纵瑞博,围绕智算集群现存痛点、技术实现逻辑、产业价值以及未来演进方向,深度解读国产高速网络如何系统级提升大模型的实际运行效能。

数据流转成为大模型集群核心瓶颈

Token是大模型输出文字、内容的基础单元,也是衡量AI集群实际效能、业务成本的核心指标。现在大模型参数量越来越大,单张GPU已经装不下完整模型,必须依靠几十、上百张GPU组成分布式集群协同工作。不管是训练阶段多卡同步更新模型参数,还是推理阶段把KV Cache(推理缓存)在不同显卡之间搬运,海量数据需要在GPU之间来回传递。

“决定Token生成效率的不只是加速卡算力,更是算力、网络和存储之间的数据流转效率。”万伟在采访中表示,不是堆更高规格GPU,就可以获得更强的大模型服务能力,在实际落地中,网络与存储带来的时延,往往成为限制集群整体性能的短板。

大模型训练要做大量多卡同步计算,属于强同步任务。集群里只要有一块卡、一条网络链路出现延迟波动,其余所有GPU都必须停下来等待,直接降低GPU实际利用率MFU,拉长整体训练周期。

推理侧的矛盾则集中体现在用户可直接感知的体验指标。我们平时感受到大模型回复快不快,要看两个关键指标:TTFT(首Token时延,用户发送问题后等到第一个字输出的时间)、TPOT(每生成一个Token消耗的时间)。

“这些指标会直接影响用户使用大模型时的体感,而网络通信往往是其中的重要瓶颈。”万伟介绍,现在行业普遍采用“以存代算”,把推理产生的KV Cache缓存保存下来,减少重复计算;PD分离架构把输入处理(Prefill)和生成回答(Decode)拆到不同服务器。上下文越长,KV缓存体积越大,大量缓存数据要靠网络跨机器搬运,网络延迟会直接影响对话、AI Agent、RAG知识库问答的使用感受。

与此同时,KV Cache、训练数据集、模型Checkpoint大量读写,让存储系统压力陡增。传统路径中,数据要在存储、CPU内存、GPU显存之间多次拷贝,一旦存储访问效率不足,GPU就会处于等待数据的空闲状态,硬件算力被白白浪费。

简单来说,大模型集群比拼,已经不再只看单卡算力,而是看整套系统数据搬运的效率。如何减少数据拷贝、降低通信延迟、打通算力与存储的高速通路,是国产智算底座必须解决的现实问题,scaleFabric Token加速技术体系正是针对这些痛点打造的解决方案。

IBGDA规模落地,“算存传”三级加速Token流转

scaleFabric以原生无损RDMA网络作为底座,搭建“算存传”三级紧耦合的Token加速超级通道,覆盖大模型训练、推理、存储复用完整业务链条,实现Token全流程高速流转。其中,国内首次规模化落地的IBGDA技术,是整套方案的核心亮点。

在计算加速维度,GDR(GPUDirect RDMA)已经实现网卡直接读写GPU显存,绕开CPU内存,减少一次数据拷贝。但GDR仅仅优化了数据传输路径,通信任务下发、元数据处理依旧依赖CPU完成控制面调度。

而IBGDA则是GDR的“二次进化”,它允许GPU内核直接驱动和控制InfiniBand网卡,使得GPU可以不依赖CPU,完全自主地发起和管理节点间的通信。

“当前MoE已经成为大模型的主流架构之一,通信过程中存在大量并发的小消息传递,IBGDA对这类场景非常重要。”万伟解释道,让GPU直接发起和管理数据通信,是当前非常重要的技术思路。scaleFabric很早就支持了IBGDA,可以说,scaleFabric是国内首批规模化应用IBGDA技术的网络产品之一。

纵瑞博补充说明,基于DeepEP等主流通信框架运行时,上层业务代码、AI框架无需改动,只需要底层完成通信库适配即可;目前已经完成NVIDIA生态适配,针对其他国产算力卡,主要工作量集中在底层驱动适配,上层应用保持完全兼容,改造成本可控,业务迁移风险很低。

存储加速通道由NVMe over RDMA、XDS(XPU Direct Storage)、NFS over RDMA三项技术共同组成,三者相互协同,覆盖不同AI业务的存储访问需求。训练数据加载、Checkpoint读写这类面向文件的业务,优先使用NFS over RDMA,让传统NFS文件存储跑在RDMA高速网络之上,不用改动运维习惯,就可以实现零拷贝高速传输,实践中可将GPU利用率由55%提升至95%以上,缩短训练时长30%‑60%;KV Cache卸载、热数据缓存场景,NVMe over RDMA发挥价值,实现远端NVMe存储高速访问;XDS技术则支持加速卡绕过CPU,直接访问远端存储,打造从存储到XPU显存最短访问路径,适配存算分离的前沿架构。

“低时延高性能网络和存储协同优化,未来一定会成为AI集群的标配。”万伟做出判断,AI业务集群化是不可逆的趋势,随着并发提升、上下文变长、模型规模扩张,“算存传”协同优化不再是加分项,而是大规模智算集群的刚需能力。

网络加速通道为整套体系筑牢底层底座。数据显示,scaleFabric单跳转发时延低至260纳秒,网卡端到端时延低于1微秒,与英伟达NDR持平;在部分场景的三跳基准时延性能测试中,端到端时延较主流RoCE方案降低约63%,有效减少多级网络交换带来的时延累积。较低的三跳时延可以减少数据在多级网络中的传输耗时,使IBGDA和存储直通带来的路径优化进一步延伸至大规模集群,推动计算、存储和网络共同作用于Token生成效率。

IMG_256

靠系统级创新夯实国产智算底座

目前,国产算力卡单卡性能距离国际顶尖产品仍存在差距。万伟认为,国内AI基础设施突围,不能单纯对标单卡指标,系统级创新是国产智算重要的发展路径。国内算力发展正在依靠集群和多卡互联,通过增加计算卡数量、改善多卡通信效率,满足大模型发展所需的算力要求。

采用多卡方式构建集群后,多卡之间的数据通信就成为提升整体计算效率的关键因素。IBGDA技术在scaleFabric中的规模化应用,将成为提升多卡效率的重要支撑。

此前,IBGDA的规模化落地始终由国际厂商主导,国产RDMA网卡与GPU直通的落地案例极为罕见。依托scaleFabric原生RDMA无损高速网络,中科曙光自研IBGDA技术已在十万卡级大规模集群中完成验证,实现了这一领域的关键补位。

“我们采用开放架构,希望让scaleFabric网络与更多国产厂商的产品完成适配和优化。在RoCE和NVIDIA InfiniBand之外,为产业提供高性价比的国产原生无损RDMA网络方案,为各类GPU、CPU及其他硬件厂商提供技术支撑。”纵瑞博表示,未来,中科曙光将面向国产CPU、各类国产加速卡开展协同优化,和上下游伙伴共建国产AI底层生态。

值得一提的是,面向产业客户多样化需求,整套scaleFabric技术体系具备灵活适配能力。小规模微调任务,数据交互局限单节点内部,网络优化价值有限;一旦业务扩张到跨节点的数据并行、模型并行,scaleFabric低时延无损网络优势即可充分发挥;RAG检索增强场景,模型同步加上海量知识库读取,存储‑算力之间的高速通路可以显著改善数据加载效率,提升整套业务的吞吐表现;超大模型训练、高并发在线推理,更是算‑存‑传三级加速的核心落地场景。

谈及scaleFabric迭代路线,万伟透露,硬件层面,下一代产品将推出800G网卡与交换机,提升交换容量,兼顾大规模组网的性价比;软件层面持续迭代拥塞控制算法,给到用户更多可调配置,落地多平面、包喷洒、乱序重组等前沿网络技术;同时延续现有优势,强化链路故障快速自愈、免维护的大规模网络管理能力,保障十万卡级别集群稳定运行。

底层硬件平台生命周期很长,中科曙光在产品设计之初就预留软件扩展能力,持续跟进AI领域层出不穷的新技术。“今天是IBGDA,未来还会出现新的技术,我们希望能够快速完成适配,紧跟AI产业发展节奏。”万伟强调,网络基础设施不只是交付硬件设备,更需要持续跟随上层AI框架、模型架构迭代更新,完成软硬件协同演进,才能持续为国产智算底座提供底层支撑。

从比拼单卡算力,走向算‑存‑传全链路协同,国内AI基础设施正在完成认知升级。IBGDA在scaleFabric实现规模化落地,标志国产高速网络迈入GPU直接驱动通信的新阶段。依靠系统级创新,充分释放集群整体效能,将成为国产智算实现高质量规模化发展的重要路径。

通信世界网版权及免责声明:
1、凡本网注明“来源:通信世界全媒体”及标有原创的所有作品,版权均属于通信世界网。未经允许禁止转载、摘编及镜像,违者必究。对于经过授权可以转载我方内容的单位,也必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和本站来源。
2、凡本网注明“来源:XXX(非通信世界网)”的作品,均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责。
3、如因作品内容、版权和其它问题需要同本网联系的,请在相关作品刊发之日起30日内进行。
发表评论请先登录
...
热点文章
    暂无内容