“多快好省”!中科曙光ParaCache助力词元加速

作者:梅雅鑫 责任编辑:朱文凤 2026.09.02 13:19 来源:通信世界网

通信世界网消息(CWW)狂热的GPU采购潮之下,大模型落地正在遭遇隐形瓶颈。

过去两年,性能不够、硬件来凑是做AI基建的惯性思维。可现实越来越多证明,单纯堆叠算力,并不能完全解决推理场景存在的重复计算吞噬算力、昂贵显存不够用、跨节点缓存无法共享等问题,企业手握一堆GPU,却跑不出理想的业务效果,TCO居高不下成为规模化落地的“拦路虎”。

一场从“拼算力”走向“算存协同”的范式转换正在发生。8月28日,2026中国国际大数据产业博览会期间,中科曙光正式发布新一代词元加速方案ParaCache。工信智媒(通信世界)记者采访到中科曙光分布式存储产品部总经理石静,一起聊聊大模型推理背后那些现实难题,来拆解这套方案能否解开大模型推理“又慢又贵”的死结。

微信图片_20260902131752_248_9.png

大模型跑业务,光堆GPU已经不够用了大模型从实验室走向真实业务之后,算力重心已经悄悄发生变化。以前大家把目光都放在模型训练上,而现在,推理的算力占比越来越高,也是各家企业落地AI业务的主战场。

很多人不清楚,大模型回答问题,要经历Prefill预填充、Decode解码两个环节。Prefill阶段会计算生成KV Cache,也就是对话过程中产生的键值缓存;Decode阶段就是我们看到的模型一个字一个字往外输出内容。

石静表示:“在多轮对话场景下,用户很多提问、历史上下文都是重复的,如果每一次提问,模型都要把全部历史内容重新算一遍,会产生大量无效的重复计算,白白浪费宝贵的GPU算力。”

为了解决重复计算,业界普遍用上了KV Cache技术,把已经算完的中间结果,放到GPU高速显存HBM里,下次遇到相同内容直接读取缓存,不用再重新计算,以此加快输出速度。

石静表示,通过KV Cache,以存储空间换计算资源来节约算力,已经成为业界共识。

但新的麻烦接踵而至,也就是行业常说的显存墙。GPU的高速HBM显存不仅容量有限,价格还极其昂贵。遇上长文本、几十轮连续对话,KV Cache很快就会把显存占满。

石静解释:“哪怕你的GPU还有富余的计算能力,一旦显存被撑爆,就没办法再接更多用户请求,直接出现回复卡顿、请求排队,业务根本跑不顺畅。”

行业内现在主要有两条解决思路:要么做算法压缩,把KV Cache数据体量做小;要么把缓存数据从昂贵显存里“搬出来”,下沉到内存、SSD、分布式存储这些容量更大、成本更低的介质,做分层调度管理。

可市面上现有的方案,实际落地的时候坑不少。像开源的LMCache,只能做到单机内部的缓存隔离,跨GPU、跨节点是没法共享缓存的,只适合小规模单机使用。大规模集群环境下,缺少全局统一视图,系统搞不清缓存数据该放在哪一层存储,陷入“元数据迷雾”,调度效率大打折扣。

理论上分布式存储本身池化共享的特性,很适合存放冷的KV Cache。但传统分布式存储受分布式锁、IO开销拖累,延迟居高不下,大多时候只能当个冷数据仓库,没法直接参与推理过程里缓存的读取、写入,很难直接投入生产环境使用。

落到企业端,这些技术难题全部转化成真金白银的成本压力。很多企业为了扛住长上下文、高并发业务,只能咬牙采购显存更大的高端GPU,硬件成本蹭蹭往上涨。就算堆了硬件,遇到多轮对话、AI智能体大量重复上下文,GPU依旧在做大量无效计算,算力利用率上不去,整体TCO居高不下;不升级硬件,就会出现AI回复慢、同时在线用户上不去,直接影响产品体验。

石静认为,只靠一味堆砌GPU芯片,已经解决不了推理场景重复计算、显存吃紧、跨节点缓存没法共享的痛点,市场急需一套存算协同的完整解决方案。

从“存数据”到“存智能”,ParaCache做到多、快、好、省针对行业痛点,中科曙光提出了从“存数据”走向“存智能”的概念。石静表示:“这里说的‘智能’,指的就是KV Cache这类大模型算出来的中间张量数据。存储不再只是存放原始文档、原始数据,而是把已经计算完毕的KV Cache,当成一份可以反复使用的数据资产来管理,减少反反复复的重复计算,把GPU算力解放出来干新活。”

据了解,ParaCache以中科曙光自研ParaStor分布式存储作为底座,融合FlashNexus集中式全闪存储,并联合多家主流第三方KV管理厂商做定制开发,打造出一套全层级、池化、可全局管理的完整解决方案。

石静介绍,ParaCache整套方案搭起四层缓存架构:L1层GPUHBM高速显存;L2层CPU DRAM内存;L3层SSD,除了传统本地SSD,它首次把中科曙光FlashNexus Neo集中式存储纳入L3缓存池,多个计算节点可以共用一套集中存储资源;L4层POSIX协议分布式存储。

342ed4a29d695d9ffb6c1f421ec771fd.jpg

方案实现L2、L3、L4三层资源池化,一改过去分布式存储只能归档冷数据的旧局面,L4层可以完整参与缓存卸载、回迁、淘汰、预取整套动态调度。甚至支持L1显存和L4分布式存储直接互通,跳过中间内存、本地SSD环节,减少不必要的数据搬运开销。

想要让分布式存储真正扛下生产级推理,中科曙光做了不少针对性优化。例如,自研XDS技术(与NV的GDS技术相似,但可以兼容国产加速卡),让国产AI加速卡也能直接对接分布式存储,完成缓存的搬出和读回,这也是整套方案可以大规模落地的关键基础。

综合实测结果,ParaCache的实际价值,可以简单概括为多、快、好、省四点。

“多”:高并发场景下,系统每秒处理的词元量最高达到原来的27倍,同样的硬件资源能够承接更多业务请求。

“快”:输入约12万词元时,单轮对话开始回答前的等待时间可降低最多98.5%,至0.4秒;连续20轮对话中,这一时间也能降低80%以上,由43.1秒降至4.9秒。

“好”:兼容主流推理框架和国产AI加速卡,可在现有系统基础上接入,降低部署和迁移成本。

“省”:高频内容保留在显存,其他内容转移至成本更低的存储设备,减少对高成本显存和新增硬件资源的依赖。

石静提到:“在适配的业务场景,内存、SSD硬件采购能够节约大概三分之一。但成本收益没有统一固定数值,高度取决于业务形态,如果业务上下文复用度很低,收益就有限。”

实测落地,哪些业务真正适合用?ParaCache已经完成实打实的生产级验证,可精准适配长文本对话、知识库问答、智能客服、智能体及高并发推理等场景。

目前,ParaCache已在国内某头部互联网企业在线推理业务中落地,模型开始回答前的平均等待时间降低50%以上;在同等硬件条件下,系统可承载的业务请求也提升数倍。

石静强调,ParaCache不是简单提升单张GPU的性能,而是通过减少重复计算,把更多算力用于处理新的任务。

当然,不同行业的诉求差异也很大。大模型训推混合场景看重带宽、低时延与综合成本;教育AI场景知识库多、小文件多,并发波动大;医疗行业堆积大量影像、病理病历,长病历RAG推理需求旺盛,对缓存下沉的需求会更加迫切,ParaCache可以匹配各行各业差异化的现实需要。

总结过去做AI基建,遇到性能瓶颈,大家的第一反应就是买更多更强的GPU。而ParaCache给行业提供了一条新思路。

石静认为:“AI推理的范式正在发生变化。以前GPU是整套架构的绝对中心,KV Cache只是临时中间产物。但现在KV Cache已经变成一类重要数据资产,GPU更多围绕这份资产完成计算。能不能管好KV Cache,会直接影响推理服务的成本、响应速度,还有AI智能体的扩展能力。”

对于大模型推理而言,少一次重复计算,就意味着少一段等待,也少一份算力消耗。算力芯片迭代,提升的是单卡的性能天花板;而缓存、存储层面的优化,目标是把手里现有的GPU算力真正用透。

未来智算中心建设,不再只盯着算力指标,算力、存力、网络、缓存调度一体化规划,会成为行业新趋势,国产存储厂商,也将迎来属于自己的发展机遇。


通信世界网版权及免责声明:
1、凡本网注明“来源:通信世界全媒体”及标有原创的所有作品,版权均属于通信世界网。未经允许禁止转载、摘编及镜像,违者必究。对于经过授权可以转载我方内容的单位,也必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和本站来源。
2、凡本网注明“来源:XXX(非通信世界网)”的作品,均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责。
3、如因作品内容、版权和其它问题需要同本网联系的,请在相关作品刊发之日起30日内进行。
发表评论请先登录
...
热点文章
    暂无内容