华为与湖北移动完成全国运营商首个 AI 推理加速方案现网测试，长序列 Token 吞吐率提升 372% (opens in new tab)

IT之家 6 月 26 日消息，6 月 24 日，在 2026 MWC 上海展期间，华为与中国移动通信集团湖北有限公司（IT之家注：以下简称“湖北移动”）联合宣布，双方已成功完成全国运营商首个 AI 推理加速解决方案现网测试。据介绍，该测试基于华为 OceanStor A800 存储与昇腾 A3 超节点架构，搭载 UCM (Unified Cache Manager，推理记忆数据管理)，在长序列 AI 推理场景下，实现了 Token 吞吐率最高可提升 372% 的突破性成果。文章称，随着 AI 应用加速向 Agent（智能体）形态演进，长上下文序列（如代码生成、多轮对话）已成为典型场景，但传统算力卡高带宽内存容量有限，严重制约了 KV Cache 的命中率。华为在 2025 年底重磅推出了 UCM 推理记忆数据管理技术，打破高带宽内存和 DRAM 的容量限制，通过外置存储提供 PB 级的 KV Cache，并对 KV Cache 进行全生命周期的分层管理与调度，不仅在单次对话时大幅扩展上下文窗口，还能在多轮对话中复用历史 KV Cache，避免重复计算。本次测试在湖北移动现网环境...

Read the original article