Fecha de publicación: 2026.09.19 (sáb)

"Podría ser necesaria 10,000 veces más memoria"... El CEO de Exynos, Kim Jin-young, diagnostica el cuello de botella de la memoria en la era de la IA

Kim Jin-young, CEO de la startup de semiconductores Exynos, analiza cómo la demanda de memoria crecerá exponencialmente debido al aumento del tamaño…

Han Kyungsoo | Publicado 2026.09.19 22:00 | Comentarios 0
"Podría ser necesaria 10,000 veces más memoria"... El CEO de Exynos, Kim Jin-young, diagnostica el…
Dos hombres están sentados frente a una mesa con micrófonos y mantienen una conversación.

A medida que la era de la inteligencia artificial (IA) se intensifica, la demanda de memoria está aumentando explosivamente debido al crecimiento exponencial del volumen de procesamiento de datos y del tamaño de los modelos. En particular, ante el incremento de los datos generados por la IA y la mayor necesidad de memoria para mantener el contexto de las conversaciones, surgen advertencias de que los métodos tradicionales tendrán dificultades para resolver el cuello de botella de la memoria.

Según un video publicado en el canal de YouTube 'Understanding: All the Knowledge in the World', Kim Jin-young, CEO de la startup de semiconductores Exynos, diagnosticó que la memoria se encuentra en el centro de la infraestructura de IA. Kim explicó: "La IA es una herramienta para encontrar valor en los datos que la humanidad ha acumulado. Dado que se puede ganar dinero acumulando y operando más datos, se requiere una inversión masiva en infraestructura para respaldar esto, y la clave es la memoria".

Aumento de modelos, usuarios y contexto... "La demanda de memoria podría aumentar 10,000 veces"

Kim señaló cuatro factores clave para la explosión de la demanda de memoria en la era de la IA: ▲La expansión del tamaño de los modelos de IA, ▲el aumento del número de usuarios, ▲el incremento exponencial de la longitud de los datos de entrada (contexto) y ▲la llegada de la era de la 'Agentic AI', donde múltiples modelos colaboran entre sí. Debido a que estos factores no aumentan de forma independiente, sino que actúan multiplicándose entre sí, la demanda de memoria crece de forma exponencial en lugar de aritmética.

Especialmente, Kim afirmó: "La IA está diseñada de tal manera que los resultados de las etapas intermedias para obtener una sola respuesta deben acumularse continuamente en la memoria. En el pasado, solo era necesario recordar lo que la persona ingresaba, pero ahora la IA debe recordar tanto su respuesta como todo su contexto, por lo que se necesita mucha más memoria". Citando opiniones de expertos del pasado, pronosticó: "Se dice que podría ser necesaria unas 1,000 veces más memoria, pero considerando la velocidad de desarrollo actual, 1,000 veces podría ser una cifra conservadora".

Este aumento explosivo de la demanda conduce a la importancia de la tecnología 'Key-Value Cache'. El Key-Value Cache es una tecnología que almacena los resultados de operaciones anteriores en la memoria para reutilizarlos, evitando que la GPU repita la misma operación cada vez. Kim explicó: "Dado que las operaciones de la GPU son muy costosas y toman mucho tiempo, es eficiente almacenar en la memoria lo que ya se ha calculado para consultarlo después. Cuanto más larga sea la conversación, más Key-Value Cache se necesitará, lo que se traduce directamente en una presión sobre la capacidad de la memoria". De hecho, a medida que la conversación con el usuario se prolonga, aumenta la cantidad de referencias al Key-Value Cache para recordar el contenido anterior, lo que se convierte en un factor clave que determina la eficiencia de la infraestructura.

Duplicar la eficiencia de la nube mediante 'Memory Pooling' basado en CXL

La HBM (memoria de alto ancho de banda), que es la solución central de la infraestructura de IA actual, es una tecnología que maximiza la velocidad de transferencia de datos (ancho de banda) al colocar la GPU y la memoria físicamente cerca. Sin embargo, dado que la HBM debe estar dentro del mismo paquete que el chip de la GPU, tiene límites para aumentar la capacidad de forma ilimitada. La tecnología que está ganando atención como alternativa a esto es precisamente CXL (Compute Express Link).

CXL es un estándar de conexión de próxima generación que conecta diversos dispositivos como CPU y GPU en uno solo. La tecnología en la que se enfoca Exynos es la tecnología de 'Memory Pooling', que utiliza CXL para que varios servidores compartan la memoria como si fuera un espacio común. Según el video, la tasa de utilización de la memoria en los entornos de nube actuales se mantiene en un promedio del 35%. Al aplicar la tecnología de Exynos, esta tasa de utilización podría incrementarse hasta casi el doble.

Kim explicó: "Al permitir que los servidores necesarios accedan directamente a la memoria compartida sin necesidad de copiar y mover los datos, se puede obtener el mismo rendimiento con la mitad de la inversión de capital (CAPEX)". Dado que los CPU y productos que soportan CXL 3.0 se lanzarán al mercado desde finales de este año o principios del próximo, se espera que se entre en una etapa de apertura de mercado en forma de pleno derecho.

Estrategia del chip de memoria inteligente 'MX1' que minimiza el movimiento de datos

Exynos también está llevando a cabo una estrategia paralela para reducir no solo la expansión de la capacidad de memoria, sino también el volumen de movimiento de datos en sí mismo. El núcleo de esto es el 'MX1', un chip de memoria inteligente que filtra solo los datos necesarios cerca de la memoria y realiza incluso operaciones simples.

Mientras que el método tradicional requería transportar grandes cantidades de datos individualmente hacia las unidades de procesamiento (como la GPU), el uso de MX1 permitiría procesar los datos de forma primaria en el nivel de la memoria. La idea es mitigar el cuello de botella de datos de toda la infraestructura y aumentar la eficiencia. Kim declaró que se están concentrando en tecnologías que puedan resolver de inmediato el mayor cuello de botella que enfrentan actualmente los centros de datos.

#Exynos #Kim Jin-young #IA #HBM #CXL #Memory Pooling #Agentic AI #Key-Value Cache
H
Han Kyungsoo
트렌드경제신문 · Redactor
Más de este periodista ›
Derechos de autor ⓒ 트렌드경제신문 Todos los derechos reservados. Prohibida la reproducción, redistribución y uso para entrenamiento de IA.

Artículos relacionados

0Comentarios

Los comentarios están desactivados por ahora.

Sé el primero en comentar.