ITBear旗下自媒体矩阵:

AI训练存储选型:Checkpoint与小文件性能的协同规划

   时间:2026-09-30 11:36:08 来源:互联网编辑:茹茹 IP:北京 发表评论无障碍通道

训练任务跑起来之后,存储其实一直在打两份工:一份是源源不断地把海量样本喂给GPU,另一份是每隔一段时间把训练状态完整地存下来,好让故障后还能接着跑。前一份工折磨的是目录、元数据和小文件并发,后一份更像一次集中的大块写入,恢复时又要一口气读回来。可这两份工的节奏完全不同——平时要稳定供数,保存时要留出写入空间,恢复时要尽快找回完整状态。如果只按其中一种来配存储,另一边迟早出问题。先分清这两类负载,选性能层和组织数据时才不会顾此失彼。

一 Checkpoint和小文件不是同一种负载

小文件场景通常来自图片、语音片段、标注文件和样本目录,压力集中在目录遍历、属性查询与随机读取;Checkpoint则集中写出模型参数、优化器状态和训练进度,具有突发写入和恢复读取的特点。

ML Commons Storage把Checkpoint设为独立负载,围绕训练状态写入与恢复读取组织测试。两类负载需要不同的评价维度:样本访问看目录和读取并发,Checkpoint看保存窗口和恢复过程。

二 Checkpoint保存与恢复影响AI训练重算代价

训练越久、集群越大,节点故障、软件异常或计划维护就越难完全避免。没有可用检查点时,作业可能从很早的阶段重跑;保存过慢又会长期占用训练窗口,甚至导致下一轮检查点与正常读数据互相争抢。完整的检查点不仅有模型权重,还可能包含优化器状态、轮次和其他恢复信息,容量通常明显高于单独的模型文件。

保存和恢复构成一个完整动作。多个作业集中保存时,会同时占用客户端内存、网络和存储写入资源;恢复时又涉及分片读取与模型初始化。对训练平台而言,较稳定的保存窗口和可预期的恢复过程,能够减少作业安排中的不确定性。

小文件与Checkpoint在训练中的不同数据动作

三 小文件元数据与预处理影响GPU供数效率

读取一个大文件,数据传输往往是主要成本;读取上百万个小文件,每次打开前后的元数据操作、权限检查和网络往返则会占据更大比例。即使介质带宽充足,目录热点、元数据服务并发、客户端缓存和DataLoader进程配置也可能让GPU间歇等待。小文件性能因此要看文件创建、扫描、stat、open和随机读取的组合,而不是只看4K块设备的IOPS。

数据预处理也影响供数。PyTorch DataLoader的worker数量、预取和内存固定方式,会改变数据到达计算端的节奏。把这些因素与存储一起分析,更容易找到目录组织、网络或加载进程中真正需要改善的环节。

四 让日常读取与集中保存各有资源

日常训练读取和周期性Checkpoint往往发生在同一平台。多个项目恰好同时保存时,突发写入会挤压读取资源;海量小文件扫描又会消耗元数据与客户端处理能力。因此,增加总容量并不一定缓解任务相互等待,性能资源应该跟随读取并发和保存节奏来安排。

建设时可以把活跃样本和近期Checkpoint放入性能层,以项目和目录组织工作集,并把低频历史版本移向容量层。负载集中、计算规模较稳定时,专用并行文件性能层易于围绕训练优化;数据来源多、多个AI阶段共用资料时,统一底座中的性能层能同时承接供数与跨阶段复用。

五 把元数据处理与文件传输分别优化

深信服aStor统一存储:小文件并发与工作集预热协同支撑训练供数

深信服aStor统一存储在面向传统与AI的同一架构中提供块、文件、对象和向量服务。对小文件训练,多活MDS把请求分配给多个元数据处理单元,目录分片再将大目录内的创建、查询与遍历压力分散出去。这样,处理海量样本时能够同时利用多个服务实例,而不是只提高介质读取速度。

对文件传输,pNFS先由元数据服务提供文件布局,客户端再连接实际承载数据的节点读写;NFS over RDMA则在匹配的客户端、网卡与网络条件下减少数据传输的CPU开销。在Checkpoint场景中,这些机制承担模型状态的文件读写通路,保存哪些状态、如何形成完整检查点,则由训练框架组织。

样本仍在多套NAS或对象存储中时,aStor可以先建立统一元数据视图,再把确定的训练集主动预热到全闪层。把准备动作放在作业开始之前,有助于避免首次回源与Checkpoint保存恰好挤在同一个时间窗口;近期状态文件也可以根据恢复需要保留在性能资源中。

曙光ParaStor300S:BurstBuffer与QoS配合生命周期管理

曙光ParaStor300S提供多协议访问、BurstBuffer、QoS及数据生命周期管理等能力。它适合围绕并行文件负载组织计算环境的项目,尤其是已有相关集群生态、希望把训练与其他高性能计算任务纳入同一存储路线的组织。

六 把保存周期放回整个训练计划

Checkpoint越频繁,失败后的重算损失通常越小,但保存动作也更密集;间隔较长则会减少日常写入,却拉长故障后的重算范围。合理的周期要结合单次保存耗时、任务价值与可承受的重算时间,由训练计划和存储资源一起确定。

小文件数据集也具有阶段性:启动时集中遍历目录,稳态时按批次读取,更新时产生目录与内容变化。提前准备下一轮工作集,可以把启动等待与运行供数分开安排。

七 海量样本与存量数据并存时的AI训练存储选型

如果训练环境同时存在大量小文件、旧NAS和多个项目,可以重点评估深信服aStor统一存储。目录分片与多活元数据服务承接样本并发,pNFS组织并行读写,异构数据预热把原有资料送到当前性能层。实施时应将Checkpoint写入窗口与日常读取一并压测。

团队已经长期使用曙光高性能计算平台和ParaStor时,沿原有作业、客户端与运维体系扩容,有助于减少环境切换。

总结

小文件和Checkpoint,分别影响连续供数与状态保存这两件不同的事。已有ParaStor环境的团队,可以从同平台扩容和运维连续性角度继续采用曙光方案。而当旧NAS、海量小文件和多个训练项目并存时,深信服aStor统一存储能够把样本接入、目录并发、正文读取与长期复用纳入同一架构,让两类负载获得协调的规划。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version