ITBear旗下自媒体矩阵:

芯展速AI90方案亮相WAIC 2026:首Token延迟降50倍,显存节省39%

   时间:2026-07-20 23:33:31 来源:快讯编辑:快讯 IP:北京 发表评论无障碍通道
 

在近日举办的WAIC 2026展会上,芯展速(GenStorAIGE)向业界展示了其革命性的AI90软硬件一体化AI推理加速方案。该方案通过创新性的存储架构设计,将高性能SSD引入GPU显存体系,构建了HBM+DRAM+SSD三级存储架构,为AI推理性能提升开辟了新路径。

技术突破的核心在于KV Cache卸载机制。通过将原本占用显存的KV Cache数据转移至大容量固态硬盘,该方案成功突破显存容量限制。实测数据显示,首Token生成延迟从秒级压缩至亚秒级,实现50倍加速;系统吞吐量提升5.1倍的同时,显存占用率降低39%。这种存储与计算的协同优化,为处理长序列AI任务提供了高效解决方案。

在多卡协同场景下,AI90方案展现出更显著优势。配合智能P2P多卡互联技术,8卡NVIDIA GeForce RTX 5090集群的推理性能提升达5.8倍,可稳定支持128K以上上下文长度的模型运行。这种性能跃升使得实时处理复杂AI应用成为可能,为对话系统、内容生成等场景带来新的发展机遇。

为支撑高强度数据写入需求,芯展速同步推出PT200Z AI专用SSD。该产品采用pSLC闪存介质与PCIe Gen5接口,具备100 DWPD的超高耐久度。在性能参数方面,顺序读取速度达14.8GB/s,随机读取IOPS突破3100K,读写延迟分别控制在54μs和10μs。这种特性使其成为KV Cache卸载场景的理想存储介质,有效保障了数据持久化的稳定性与实时性。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version