您现在的位置是:首页 > IT基础架构 > 计算存储 >

从“存数据”向“存智能” 中科曙光ParaCache定义存储新价值

2026-09-02 12:06:19作者:路沙来源:中国信息化周报

摘要中科曙光近日在2026中国国际大数据产业博览会期间发布了新一代词元加速方案ParaCache,对全层级KV Cache进行高效管理。该方案通过保存并复用大模型已经完成的计算结果,减少不同请求、不同计算节点之间的重复计算,核心理念是推动存储系统实现从“存数据”向“存智能”转变。...

  当前,大模型推理业务在整体算力负载中的占比不断攀升,行业对集群算力规模、计算响应速度的需求同步提升。不过,在业务落地过程中则存在两大日益凸显的核心痛点:一方面,大模型的“自回归”推理回答方式,需要大量的重复计算,在业务并发量持续走高带来负载叠加的情况下,导致大模型推理延迟不断抬升,出现“推理越来越慢”的性能瓶颈;另一方面,推理环节核心依赖的KV Cache对显存的高消耗,不仅直接推高了硬件成本,带来“记忆越来越贵”的成本压力,并且在跨对话、跨节点的大集群计算场景中,对推理的加速效用同样衰减严重。

  中科曙光分布式存储产品部总经理石静表示,面对以上难题,现有的技术解决方案都存在明显短板。例如以LMCache为代表的开源方案仅支持单机部署,可实现推理实例隔离,但无法完成跨实例共享;多层级KV Cache存在元数据嵌套,缺少全局视图,难以实现缓存介质的合理调度;分布式存储天然适合承载L4层级KV Cache,但受分布式锁、GPU直连适配不足等问题影响延迟偏高,大多仅作为冷数据仓库使用,无法参与实时推理调度。

  基于上述行业痛点,中科曙光近日在2026中国国际大数据产业博览会期间发布了新一代词元加速方案ParaCache,对全层级KV Cache进行高效管理。该方案通过保存并复用大模型已经完成的计算结果,减少不同请求、不同计算节点之间的重复计算,核心理念是推动存储系统实现从“存数据”向“存智能”转变。

  构建四级缓存架构

  事实上,ParaCache的思路很简单,就是把已经算过的结果长时间保存下来,下次需要时直接复用。为实现这一目标,ParaCache构建GPU HBM、CPU DRAM、本地SSD、分布式共享存储四级缓存架构,实现系统化全层级KV Cache池化与全局统一管理,既能让计算结果按照数据使用频率进行分层存放和智能调度,又能适配GPU节点、超节点、中大规模推理集群的推理优化需求。

  在接受《中国信息化周报》记者采访时,石静谈到了ParaCache搭建四级缓存分层架构的核心逻辑:首先是池化共享,四级架构打破了传统KV Cache单节点存储的局限,通过全域缓存资源池化共享模式,彻底突破单节点缓存容量与资源壁垒,有效支撑推理集群的规模化扩展,为分布式缓存分层调度奠定集群资源基础;其次是元数据统筹管理,在资源池化的前提下,平台通过对全集群元数据的统一管控,精准感知分布式集群中KV Cache的分布位置、资源占用、访问状态等全量信息,实现对KV Cache存储层级的精准定位;最后是场景化智能调度,系统可结合实际业务运行状态,智能完成缓存预取、淘汰、迁移等全流程调度动作,同时支持基于目录维度为不同推理应用配置差异化的缓存淘汰策略,可适配不同业务场景的缓存留存需求。

  “该方案完成了L2、L3、L4缓存池化改造,L4不再局限于冷数据归档。同时,依托AI直通存储技术,支持KV Cache跨层级卸载与回迁,既支持L1直接下沉至L4,也支持L4数据回迁至L1、L2,同时配套缓存淘汰管理机制。不仅如此,ParaCache部署于推理框架下层,可无缝对接vLLM、SGLang等主流推理框架,兼容Prefill—Decode一体化部署、GPU KV分类等多种业务模式。”石静进一步解释说。

  目前,ParaCache价值集中体现在多轮对话、Agent等具备大量可复用KV Cache的业务场景。测试显示,ParaCache已经实现了多维度的效果呈现,例如,在单论对话约12万词元输入下,ParaCache可使模型开始回答前的等待时间最高降低98.5%,多轮会话TTFT(首词输出时间)亦可降低80%以上;在高并发场景下,相比仅使用HBM承载KV Cache,系统每秒处理的词元量最高达到原来的27倍。

  差异化适配全行业AI需求

  石静表示,不同行业对于AI存储需求有着明显差异。大模型行业在训练侧需要高带宽承接Checkpoint风暴,推理测追求低时延、全局共享,以致实现TCO最优;教育行业以知识库、AI助教为主,小文件多,知识库版本迭代频繁,并发访问波动大;医疗行业影像、病理、文献等非结构化数据体量庞大,以辅助诊疗、长病历RAG推理为主,对KV Cache卸载至低成本L3/L4介质需求迫切。

  当前,中科曙光ParaCache高效管理方案已在多个场景落地。例如,国内头部互联网厂商落地同类KV Cache管理优化方案,实现TTFT、P99-TTFT及吞吐量大幅提升;某银行将超节点与ParaCache用于信用卡、线上办卡智能问答业务,业务吞吐量提升约3倍;在教科研场景的RAG知识库AI助学应用中,借助相关缓存优化方案将业务并发能力提升15至20倍。

  石静表示,ParaCache不是简单提升单张GPU的性能,而是通过减少重复计算,把更多算力用于处理新的任务。从中不难看出,ParaCache跳出了传统硬件加速的固有思路,从算力调度与数据缓存的全局视角优化集群资源利用率,实现海量算力的精细化统筹分配,有效破解大模型多并发场景下算力浪费、资源抢占的痛点,全方位提升整个算力集群的业务承载上限。


(本文不涉密)
责任编辑:路沙

站点信息

  • 运营主体:中国信息化周报
  • 商务合作:赵瑞华 010-88559646
  • 微信公众号:扫描二维码,关注我们