决定AI性能的并非运算速度而是“数据移动”……范式正向以内存为中心的架构转型
人工智能(AI)时代的性能竞争标准正从单纯的运算速度转向“数据移动的效率”。随着AI工作负载的复杂化,如何以更低成本、更高效地移动海量数据已成为决定系统整体性能与成本的核心要素。
人工智能(AI)时代的性能竞争标准正从单纯的运算速度转向“数据移动的效率”。这是因为如何以更少且更高效的方式移动海量数据,已成为决定AI系统整体性能与成本的核心要素。
比起运算,数据移动产生的成本更高的“瓶颈现象”
目前的计算系统是以处理器为中心,通过获取数据进行处理的结构。数据在经过存储器、内存、缓存后移动到运算装置,并重复这一过程。然而,随着AI工作负载的不断高级化,这种以处理器为中心的结构正面临极限。由于数据规模和访问频率激增,数据移动过程中产生的延迟、功耗以及硬件成本,已成为阻碍系统效率的决定性因素。
事实上,在现代计算环境中,内存访问和数据移动产生的成本远高于运算本身。从DRAM中读取一次数据所消耗的能量,可能比单纯的算术运算高出至少150倍,最高可达2,000倍。特别是对于大语言模型(LLM)而言,由于在生成每个Token时都必须参考之前的上下文,对内存容量和带宽的需求急剧增加,导致内存瓶颈进一步加剧。因此,AI基础设施的竞争焦点已不再仅仅是获取更快的运算装置,而是转向将运算装置、内存、存储器和网络共同设计为一个系统,以实现数据移动最小化的方向。
CXL与NVLink:连接内存扩展与高速通信的桥梁
为了解决数据移动瓶颈,核心技术是高速互连(Interconnect)。其作用是拓宽设备之间的通道,并根据工作负载灵活地连接内存与运算装置。代表性技术包括CXL(Compute Express Link)以及NVLink/NVSwitch。
CXL通过扩展处理器、加速器与内存装置之间的连接,实现内存容量的灵活扩展,并为多个设备共享内存提供“内存池化(Memory Pooling)”基础。另一方面,NVLink和NVSwitch负责GPU集群内部的高带宽连接,专注于减少大规模AI模型在多个GPU之间移动时产生的数据瓶颈。虽然这两项技术的应用领域不同,但其共同目标都是通过改善数据移动过程,实现系统资源的有效利用。一旦这些技术基础得以建立,内存和加速器将不再是隶属于特定装置的零部件,而是作为可根据工作负载自由组合的系统资源发挥作用。
“近内存加速器”的兴起:直接在内存附近进行处理
为了克服仅靠提高连接速度所带来的局限性,一种不再将数据移至运算装置,而是在内存附近直接进行处理的“近内存加速(Near-Memory Acceleration)”方式正受到关注。这种方式旨在实现“互连式近内存加速器结构”,即不再由中央运算装置(GPU/NPU/TPU)处理所有数据,而是由内存周边的加速器分担任务,并仅交换必要的结果。
这种方式在HBM(高带宽内存)等3D堆叠内存环境下,对于减少数据往返、降低延迟和功耗非常有效。根据相关研究案例“Tesseract”的设计显示,当通过高速互连将多个近内存加速器连接并应用于并行图处理时,与现有的以处理器为中心的设计相比,实现了约10倍的性能提升以及同等水平的节能效果。最近,为了瞄准LLM推理,出现了将内存扩展结构与近内存处理相结合的CENT设计研究等,旨在革命性地减少数据移动的各种尝试正在不断涌现。
0评论
当前已关闭评论功能。