
存储是每个代理式 AI 工作流中不可或缺的组成部分。当智能体检索企业知识、访问持久内存、重用 KV 缓存数据、执行工具并生成新结果时,存储系统必须持续提供和保存驱动智能体推理循环所需的数据。
每个智能体执行步骤都会触发多次存储操作,而随着上下文窗口越来越大,这些操作还会在数以千计的并发智能体中重复执行。要提供和保存这些数据,绝非仅仅进行基本的读写那么简单。AI 推理虽然在 GPU 上运行,但代理式进程、工具调用、数据管理任务以及支持它们的存储服务在 CPU 上运行。
在写入过程中,存储系统可能会压缩和加密数据,并计算校验和以及冗余信息。在读取过程中,存储系统可能需要验证、解密、解压缩或重建数据,然后再将其返回给应用程序。这些功能对于 AI 系统的安全性和可靠性至关重要。当数据通过存储路径传输时,每个功能也还需要额外的 CPU 处理。
随着智能体并发量(多个用户、AI 智能体或任务并行运行)和上下文数据量的增长,存储系统必须在不限制应用响应速度或 Token 生成速度的前提下,执行更多此类工作;它必须以加速计算所需的速率提供数据。
NVIDIA Vera BlueField-4 STX 存储处理器集成了 88 个 Olympus Armv9.2 核心、空间多线程(Spatial Multithreading)、可扩展一致性总线架构(Scalable Coherency Fabric)以及 SOCAMM2 LPDDR5X 内存,可为 AI 原生数据平台提供极高的单线程性能和带宽密集型存储处理能力。
基准测试表明,与 x86 CPU 相比,Vera 在各项性能上均展现出显著的吞吐性能优势:加密和解密性能分别提升了 1.43 倍和 1.29 倍;Reed-Solomon 纠删码恢复性能提升 3.26 倍;CRC32C 数据完整性校验提升 3.67 倍;数据压缩与解压缩性能分别提升 3.29 倍和 1.72 倍;多阶段流水线操作性能提升 3.21 倍。
统一的 Vera CPU 架构使 AI 基础设施能够在更低的 CPU 算力占用、功耗和散热范围内扩展智能体执行和存储处理能力,从而为高级代理式 AI 工作负载提供更高的服务密度和更多的并发数据流支持。
以上为摘要内容,点击“阅读原文”或扫描下方二维码阅读完整内容:
