Lo que determina el rendimiento de la IA no es la velocidad de cálculo, sino el 'movimiento de datos'... Cambio de paradigma hacia una infraestructura centrada en la memoria
El estándar de competencia en la era de la inteligencia artificial está pasando de la velocidad de cálculo a la eficiencia en el movimiento de datos. Debido al aumento del volumen de datos, el enfoque de la infraestructura de IA se está desplazando hacia el diseño conjunto de sistemas para minimizar el movimiento de datos y reducir el consumo de energía.
El estándar de competencia de rendimiento en la era de la inteligencia artificial (IA) se está desplazando de la simple velocidad de cálculo hacia la 'eficiencia en el movimiento de datos'. Esto se debe a que la capacidad de mover grandes volúmenes de datos de la manera más mínima y eficiente se ha convertido en un factor clave que determina el rendimiento total y el costo de los sistemas de IA.
El 'cuello de botella' donde el costo del movimiento de datos es mayor que el del cálculo
Los sistemas informáticos actuales tienen una estructura centrada en el procesador, que extrae y procesa los datos. El proceso consiste en que los datos se mueven a través del almacenamiento, la memoria y la caché hacia la unidad de cálculo, y luego regresan, repitiendo este ciclo. Sin embargo, a medida que las cargas de trabajo de IA se vuelven más avanzadas, esta estructura centrada en el procesador está enfrentando límites. Debido al aumento repentino en la escala de los datos y la frecuencia de acceso, la latencia, el consumo de energía y los costos de hardware que ocurren durante el proceso de movimiento de datos se han convertido en factores decisivos que obstaculizan la eficiencia del sistema.
De hecho, en el entorno informático moderno, se generan costos mucho mayores por el acceso a la memoria y el movimiento de datos que por el cálculo en sí mismo. La energía necesaria para leer datos de la memoria DRAM una vez puede ser entre 150 y 2,000 veces mayor que la de una operación aritmética simple. Especialmente en el caso de los modelos de lenguaje de gran escala (LLM), debido a su naturaleza de tener que referenciar el contexto anterior cada vez que se genera un token, la demanda de capacidad y ancho de banda de memoria aumenta drásticamente, agravando el cuello de botella de la memoria. En consecuencia, el enfoque de la competencia en la infraestructura de IA está avanzando más allá de asegurar dispositivos de cálculo más rápidos, hacia una dirección donde se diseñen conjuntamente el dispositivo de cálculo, la memoria, el almacenamiento y la red como un solo sistema para minimizar el movimiento de datos.
CXL y NVLink, el puente que une la expansión de memoria y la comunicación de alta velocidad
La tecnología clave que ha surgido para resolver el cuello de botella del movimiento de datos es el interconector (Interconnect) de alta velocidad. Este tiene la función de ampliar los canales entre dispositivos y conectar de manera flexible la memoria y los dispositivos de cálculo según la carga de trabajo. Entre las tecnologías representativas se encuentran CXL (Compute Express Link) y NVLink/NVSwitch.
CXL expande la conexión entre procesadores, aceleradores y dispositivos de memoria, permitiendo aumentar la capacidad de memoria de forma flexible y proporcionando una base para el 'memory pooling' (agrupación de memoria), donde múltiples dispositivos pueden compartir la memoria. Por otro lado, NVLink y NVSwitch se encargan de las conexiones de gran ancho de banda dentro de los clústeres de GPU, centrándose en reducir el cuello de botella de datos que ocurre cuando los modelos de IA a gran escala se mueven entre varias GPUs. Aunque estas dos tecnologías tienen áreas de aplicación diferentes, comparten el objetivo común de mejorar el proceso de movimiento de datos para utilizar los recursos del sistema de manera eficiente. Una vez establecida esta base tecnológica, la memoria y los aceleradores funcionarán como recursos del sistema que pueden combinarse libremente según la carga de trabajo, en lugar de ser componentes dependientes de un dispositivo específico.
El auge de los 'aceleradores de memoria cercana' que procesan directamente cerca de la memoria
Para superar la limitación de que aumentar la velocidad de conexión no es suficiente, está ganando atención el método de 'aceleración de memoria cercana', que en lugar de traer los datos a la unidad de cálculo, los procesa directamente cerca de la memoria. Esto apunta a una 'estructura de aceleradores de memoria cercana interconectados' donde, en lugar de que la unidad de cálculo central (GPU/NPU/TPU) procese todos los datos, los aceleradores alrededor de la memoria realizan tareas asignadas y solo intercambian los resultados necesarios.
Este método es efectivo para reducir la latencia y el consumo de energía al disminuir los viajes de ida y vuelta de los datos en entornos de memoria apilada en 3D, como la HBM (memoria de gran ancho de banda). Según el diseño de 'Tesseract', un caso de estudio relacionado, cuando se conectaron varios aceleradores de memoria cercana mediante un interconector de alta velocidad para aplicarlos al procesamiento de grafos en paralelo, se obtuvo una mejora de rendimiento de aproximadamente 10 veces y un efecto de ahorro de energía de un nivel similar en comparación con el diseño centrado en procesadores convencional. Recientemente, continúan sucediendo diversos intentos para reducir innovadoramente el movimiento de datos, como la investigación del diseño CENT, que combina la estructura de expansión de memoria y el procesamiento de memoria cercana con el objetivo de la inferencia de LLM.
0Comentarios
Los comentarios están desactivados por ahora.