从数据到 Token:Arm 解读边缘 AI 的计算与存储

9 月 23 日,在 GMIF 2026 全球存储器行业创新峰会上,Arm 全球存储业务负责人 John Xavier Lionel 发表了题为《从数据到 Token:重塑边缘 AI 的计算与存储架构》的主题演讲,围绕生成式人工智能(AI)时代计算与存储的演进趋势分享了最新洞察。

从数据到 Token:Arm 解读边缘 AI 的计算与存储

AI 正在重塑存储需求

随着 AI 模型规模不断扩大、上下文长度持续增长以及并发用户数量快速增加,存储正成为影响 AI 系统能力的关键因素。在推理过程中,解码(Decode)阶段需要持续访问 KV Cache,使内存容量、带宽和数据传输效率直接影响系统性能与吞吐量。因此,对于生成式 AI 而言,系统性能不再仅由计算资源决定,也越来越取决于内存、存储和数据传输系统能否持续、高效地向计算资源提供所需数据。

与此同时,随着生成式 AI 规模化落地,Token(词元)正成为衡量 AI 运营成本的重要单位。例如,100 万台设备每天进行 20 次 AI 交互、每次生成 500 个 Token,就意味着每天将产生约 100 亿个 Token。每一次交互所产生的 Token 都会对应计算、内存、存储、网络和能耗等成本。可见,推理正在从一次性的技术投入,转变为持续性的运营支出。对于产业而言,未来真正重要的问题不再是“能够生成多少 Token”,而是“能够以多高的效率和多低的成本生成有价值的智能”。

AI 时代的竞争,也正在从单纯追求更高 TOPS,转向如何在计算、内存、存储和数据移动之间建立更高效的系统平衡。

分布式 AI 让智能运行在最合适的位置

随着 AI 不断从云端向边缘延伸,产业关注点正在从“云还是边缘”的选择题,转向“如何让合适的 AI 工作负载运行在最合适的位置”。

不同 AI 工作负载对性能、时延、隐私、功耗和成本的要求各不相同,因此需要运行在最合适的计算层级。始终在线感知、唤醒词检测和异常检测等轻量级任务适合在低功耗终端设备本地运行;AI 助手、多模态交互等对时延和隐私敏感的应用更适合在手机、PC、XR 设备和机器人等高性能边缘设备上执行;行业模型和本地化 AI 服务可依托边缘基础设施运行;而超大模型、复杂推理、模型训练以及全球化服务等工作负载,则更适合部署在云端。

通过在云端、边缘基础设施和终端设备之间合理分配 AI 工作负载,企业能够在能力、时延、隐私、成本和能效之间实现更优平衡;而对于用户而言,这意味着更快的响应速度、更好的隐私保护、更可靠的使用体验,以及更加个性化的智能服务。

存储已成为边缘 AI 系统竞争力的关键一环

得益于小语言模型(SLM)、量化技术、异构计算架构以及软件生态的持续进步,边缘 AI 进入快速发展阶段。原本只能运行在云端的 AI 能力正被部署到终端设备,在提升响应速度、保护数据隐私的同时,也让本地智能应用成为可能。与此同时,随着模型规模、本地知识库和用户上下文的持续扩张,边缘 AI 系统对存储容量、内存带宽、模型加载速度、安全性以及功耗管理等的要求也不断提高,并带来了新的系统设计挑战。

例如,生成式 AI 推理需要持续访问模型权重、上下文和键值缓存(KV Cache)。即使拥有强大的 AI 加速器,如果数据无法高效地在存储、内存和计算单元之间流动,系统性能仍然会受到限制。

在这一过程中,存储系统的角色也在发生深刻变化。过去,存储主要用于保存操作系统、应用程序和用户数据;而随着越来越多 AI 能力向设备侧迁移,模型、向量数据、本地知识库以及 Agent 记忆等 AI 资产也开始长期驻留在设备侧。存储承载的不再只是数据,而是模型、知识和智能能力本身。

Armv9 计算平台扩展边缘 AI 能力边界

随着边缘 AI 从始终在线感知、关键词检测和异常检测等轻量级应用,逐步扩展到 AI PC、多模态 AI、机器人和本地生成式 AI 应用,模型和上下文从 MB 级增长到 GB 级,系统对于计算、内存和存储能力提出了更高要求。

对于低功耗边缘设备而言,Arm Cortex-M CPU 能够在有限功耗预算下提供高效 AI 能力,其核心设计原则是:最大限度减少外部数据移动,让活跃数据尽量靠近计算单元,高效地将模型保存在 Flash 中,按需配置 AI 加速能力。

随着模型规模、上下文长度以及本地知识库持续增长,边缘 AI 开始迈向大模型时代。此时,系统挑战已不仅仅来自计算能力本身,而是来自容量、带宽和数据移动效率。基于同样的设计理念,Arm 推出基于 Cortex-A320 CPU 与 Ethos-U85 NPU 的 Armv9 边缘 AI 计算平台,通过增强的内存架构、更高效的数据访问能力以及 CPU 与 NPU 协同计算设计,支持运行超过 10 亿参数的大语言模型,为生成式 AI、多模态 AI 和智能体应用提供更强大的边缘侧计算能力。

AI 时代的下一场竞争,不再只是 TOPS 竞赛,而是在计算、内存、存储和数据移动之间实现最佳协同的系统设计竞争。Arm 正在通过覆盖从低功耗终端到高性能边缘设备的计算平台,以及持续优化的异构计算架构,帮助生态伙伴更高效地释放 AI 能力,推动边缘 AI 迈向十亿参数时代。

– 结束 –

© 版权声明

相关文章

暂无评论

您必须登录才能参与评论!
立即登录
none
暂无评论...