让大模型少做重复计算 中科曙光发布ParaCache

责任编辑:梅雅鑫 2026.08.28 18:58 来源:通信世界网

通信世界网消息(CWW)8月28日,2026中国国际大数据产业博览会期间,中科曙光发布新一代词元加速方案ParaCache。该方案通过保存并复用大模型已经完成的计算结果,减少不同请求、不同计算节点之间的重复计算。测试显示,在约12万词元输入下,ParaCache可使模型开始回答前的等待时间最高降低98.5%;高并发场景下,系统每秒处理的词元量最高达到原来的27倍。

2c8d42b642aee3f43c8a62ea5547873

少做重复计算,让算过的直接复用

随着大模型进入长文本、多轮对话、知识库问答和智能体等场景,大量相同或相似内容被反复计算,不仅增加等待时间,也持续消耗算力资源。

ParaCache的思路很直接:把已经算过的结果长时间保存下来,下次需要时直接复用。

该方案统一管理GPU显存、CPU内存、固态硬盘和分布式存储,根据使用频率对计算结果进行分层存放和智能调度,并支持在不同请求、不同计算节点之间共享,实现“一次计算、多次使用”。

ParaCache以曙光分布式存储ParaStor为基础,并融合集中式全闪存储FlashNexus,将存储能力从保存原始数据进一步延伸至保存和复用大模型计算结果,在减少重复计算的同时,降低对高成本显存的占用。

“多快好省”,推理效率全面提升ParaCache带来的价值,可以概括为“多、快、好、省”。

“多”:高并发场景下,系统每秒处理的词元量最高达到原来的27倍,同样的硬件资源能够承接更多业务请求。

“快”:输入约12万词元时,单轮对话开始回答前的等待时间可降至0.4秒;连续20轮对话中,这一时间由43.1秒降至4.9秒。

“好”:兼容主流推理框架和国产AI加速卡,可在现有系统基础上接入,降低部署和迁移成本。

“省”:高频内容保留在显存,其他内容转移至成本更低的存储设备,减少对高成本显存和新增硬件资源的依赖。

目前,ParaCache已在国内某头部互联网企业在线推理业务中落地,模型开始回答前的平均等待时间降低50%以上;在同等硬件条件下,系统可承载的业务请求也提升数倍。

同时,ParaCache已在全国产十万卡AI超集群曙光8000上完成验证,可面向长文本对话、知识库问答、智能客服、智能体及高并发推理等场景。

中科曙光分布式存储产品部总经理石静表示,ParaCache不是简单提升单张GPU的性能,而是通过减少重复计算,把更多算力用于处理新的任务。

过去,存储主要负责保存数据。ParaCache进一步将模型已经完成的计算结果纳入存储和复用体系。对于大模型推理而言,少一次重复计算,就意味着少一段等待,也少一份算力消耗。

围绕本届数博会“词元——数据要素价值释放新路径”主题,ParaCache提供了一条更具体的技术路径:不仅保存数据,也保存数据在计算过程中产生的结果,让一次计算形成的价值被持续复用。

通信世界网版权及免责声明:
1、凡本网注明“来源:通信世界全媒体”及标有原创的所有作品,版权均属于通信世界网。未经允许禁止转载、摘编及镜像,违者必究。对于经过授权可以转载我方内容的单位,也必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和本站来源。
2、凡本网注明“来源:XXX(非通信世界网)”的作品,均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责。
3、如因作品内容、版权和其它问题需要同本网联系的,请在相关作品刊发之日起30日内进行。
发表评论请先登录
...
热点文章
    暂无内容