智东西 作者 杨京丽 编辑 李水青 一、三节点带宽刷新纪录,保证高效读写效率二、AI进入推理阶段,存储开始管理模型上下文三、补上共享缓存层,KV Cache实现跨节点复用四、从训练到推理,AI存储还要算效率和成本账结语:从高吞吐到高复用,AI存储进入全流程竞争 智东西9月17日报道,9月1日,全球权威AI性能评测组织MLCommons发布MLPerf Storage v3.0基准测试榜单。 焱融全闪AI存储F9000X 在多项基准测试中拿下 第一 ,充分验证其在极限AI训练负载下对高速网络带宽的 高效利用能力 。 ▲数据引用:MLPerf Storage Benchmark v3.0 Suite Results 2026 随着AI产业从模型训练走向规模化推理,存储系统需要处理的数据和承担的任务也在增加。训练阶段, 存储要持续向GPU供给海量数据 ,还要快速保存和恢复模型 Checkpoint;推理阶段,系统又要 管理不断膨胀的KV Cache 。单一的高性能存储产品已经难以覆盖AI全流程需求。 围绕AI的训练与推理场景,焱融已经构建起一套较为完整的 全栈AI存储方案 。F9000X的测试成绩充分验证其 训练侧 能力:本次MLPerf Storage v3.0新增KVCache测试用例,进一步扩展了其对AI全场景工作负载的覆盖能力。 焱融科技近期推出的 YRCache ContextBox一体机 ,就是面向 AI推理场景 的专属KV Cache存储产品,也是其全栈AI存储能力在 KV Cache管理、共享与复用 方向的进一步落地。 从训练数据的高速读写,到推理上下文的共享与复用,焱融是如何应对AI不同阶段的存储需求?这套全栈AI存储方案又能为企业带来怎样的性能和成本价值?本文对此进行了深入解读。 大模型训练需要持续从存储系统读取数据。随着参与训练的GPU数量增加,存储系统需要同时为更多计算节点供给数据。如果数据吞吐能力不足,GPU可能因等待数据而降低利用率。训练过程中还需要定期写入Checkpoint,其读写性能会直接影响模型状态的保存和训练中断后的恢复耗时。 焱融F9000X是面向 大规模AI训练 推出的 全闪存储产品 ,其训练侧实力可以从MLPerf Storage基准测试中得到验证。测试环境包括3台F9000X存储节点和9台x86客户端服务器,节点通过NDR400高速网络互联。 3D U-Net模型训练测试对存储系统的持续带宽输出能力和极限负载稳定性,提出了较高要求。测试中,F9000X三节点集群实现 544GiB/s聚合带宽 ,位列该场景 第一 ,达到了 历届公开测试成绩中的最高水平 。相比此前v2.0测试的478GiB/s,其聚合带宽进一步提升,表明存储系统能够更高效地向GPU提供训练数据。 在Checkpoint 70B测试中,焱融存储集群实现539GiB/s的读带宽和314GiB/s的写带宽, 读写性能均位居第一 ,刷新历届MLPerf Storage公开测试成绩。对于千亿级、万亿级模型训练,Checkpoint是保存阶段性训练状态的关键数据。更快的读写速度,可以 缩短模型存档和恢复耗时 ,降低训练中断造成的算力浪费。 ▲数据引用:MLPerf Storage Benchmark v3.0 Suite Results 2026 对企业而言,焱融F9000X更高的带宽表现不仅能够加快训练数据读写,也有望在满足同等训练需求的情况下减少存储节点投入,从而降低整体硬件投入成本。 随着AI进入推理阶段,存储系统关注的重点转向模型上下文的管理与复用。长文本、多轮对话和Agent应用会产生大量KV Cache,如果这些缓存无法被保存和复用,模型就需要反复计算相同的上下文。与此同时,推理请求的上下文更长、并发更高,KV Cache需要在不同节点之间共享、迁移和复用。 针对这一问题,焱融推出 AI原生推理存储系统YRCache ,对不同层级的KV Cache资源进行统一管理,并将部分缓存从GPU显存卸载至主机内存和本地SSD,减少重复计算。 在YRCache的多级缓存架构中,G1是 GPU HBM ,负责保存当前最活跃、访问频率最高的KV Cache;G2是 主机DRAM ,用于承接暂时无法放入GPU显存的缓存;G3是 本地SSD ,容量更大、单位成本更低,适合保存单节点中的更多缓存;G4则 是传统共享分布式存储 ,主要承载模型、数据集和Checkpoint等需要长期保存的数据。 随着推理集群扩大,本地SSD与传统共享存储之间出现了新的能力空档。参考 英伟达CMX架构 对G3.5 Context Memory的设计,焱融在YRCache体系中引入了 G3.5共享缓存层 ,并推出 YRCache ContextBox一体机 ,面向长上
发表评论