中科曙光近日宣布推出新一代词元加速方案ParaCache,旨在通过优化计算资源利用效率,为人工智能大模型应用提供更高效的算力支持。该方案通过智能复用已完成的计算结果,有效减少不同任务和计算节点间的重复运算,从而降低算力消耗并缩短响应时间。
随着大模型在长文本处理、多轮对话、知识库问答等场景的广泛应用,相同或相似内容的重复计算问题日益突出。这种冗余运算不仅延长了用户等待时间,更对算力资源造成持续压力。行业专家指出,通过存储技术优化实现"以存换算"已成为提升AI基础设施效能的关键路径。
ParaCache方案采用分层存储架构,对GPU显存、CPU内存、固态硬盘和分布式存储进行统一管理。系统会根据数据使用频率自动将计算结果分配至不同存储层级,并实现跨任务、跨节点的智能调度与共享。这种设计使"一次计算、多次使用"成为可能,显著提升了资源利用率。
实际测试数据显示,在处理约12万词元的输入任务时,ParaCache可将模型生成响应前的等待时间降低98.5%。在高并发场景下,系统每秒处理的词元量较传统方案提升最高达27倍。这些性能突破为实时交互类AI应用提供了有力支撑。
中科曙光相关负责人表示,存储系统正从传统的被动响应模式向主动数据调度转型。通过缓存复用和计算卸载等技术,存储层正在承担更多算力优化职能,这标志着AI基础设施架构正在发生结构性变革。
目前,ParaCache方案已在某头部互联网企业的在线推理业务中完成部署,并在全国产十万卡规模的曙光8000超算集群上通过验证。该方案特别适用于长文本对话、知识库检索、智能客服等需要高并发处理的场景,为AI大模型商业化落地提供了新的技术路径。










