MemoriasNoticias

Micron investiga integrar memoria flash junto a la GPU para abaratar y acelerar la inferencia de LLM

El desarrollo de módulos NAND de alta resistencia busca crear un nivel de memoria intermedio entre la HBM y el almacenamiento convencional

Seguro que ya lo sabes, pero el tamaño de los modelos de lenguaje actuales es un quebradero de cabeza para el sector. La ejecución de un LLM moderno exige volúmenes masivos de memoria rápida durante la etapa de inferencia. Cuando la complejidad del algoritmo sobrepasa la memoria integrada en el procesador gráfico, el sistema sufre un cuello de botella severo. Esta situación obliga a repartir el trabajo entre varias tarjetas gráficas solo para sumar capacidad de memoria, lo que encarece de forma notable la infraestructura.

Para resolver esta limitación, Micron está investigando el desarrollo de módulos flash NAND de alta resistencia situados muy cerca de la GPU. Este concepto técnico, conocido como near-GPU NAND, busca situarse como un escalón intermedio entre la memoria volátil de alta velocidad y el almacenamiento tradicional del servidor. La propuesta pretende recortar la distancia física entre el procesador y los chips de almacenamiento para acelerar las tareas de la IA.

Un búfer de cientos de gigabytes para romper el cuello de botella en LLM

En los diseños actuales, la memoria flash convencional se ubica lejos del chip gráfico y se comunica mediante protocolos de almacenamiento más lentos. La idea que explora Micron consiste en montar esta memoria secundaria directamente en el encapsulado de la GPU o en su propia PCB. De este modo, el procesador puede acceder a un depósito de cientos de gigabytes adicionales de forma directa.

Este nivel intermedio funcionaría como un búfer ultrarrápido. Su diseño sacrifica parte de la densidad que ofrecen las celdas TLC o QLC estándar para dar prioridad absoluta a las velocidades de entrada y salida, al ancho de banda y a los tiempos de lectura. Al acercar estos módulos al núcleo de cálculo, las tarjetas gráficas pueden procesar cargas de trabajo que no requieren las latencias extremas de la memoria DRAM tradicional.

Micron busca depender de menos tarjetas gráficas y la reducción de costes frente a la memoria HBM

El principal beneficio de esta arquitectura reside en la eficiencia económica. La memoria HBM resulta muy cara de fabricar y cuenta con una disponibilidad limitada en el mercado. Al incorporar memoria NAND cercana, los LLM dejarían de estar estrictamente limitados por el espacio de la memoria principal. Esto permitiría ejecutar modelos de gran envergadura en servidores con menos procesadores gráficos, compensando la capacidad mediante niveles de memoria escalonados.

Micron no es la única compañía que avanza en esta dirección. Fabricantes como SK hynix y Sandisk ya han estandarizado la tecnología High-Bandwidth Flash o HBF bajo un principio similar. Todas las empresas involucradas en esta transición buscan cerrar la brecha de ancho de banda y durabilidad que separa a la memoria flash de los módulos HBM.

Te interesa 👉 Las mejores tarjetas gráficas que puedes comprar

Si este desarrollo llega a buen puerto, la integración de memoria no volátil en la propia GPU cambiará el diseño de los aceleradores para la IA. Las empresas podrán dimensionar sus equipos según las necesidades reales de inferencia, abaratando los costes operativos en el despliegue de nuevos servicios basados en LLM.

Vía
TechPowerUp
Fuente
Digitimes

Edgar Otero

Técnico de sistemas informáticos. Experto en tocar botones, instalar aplicaciones y reconfigurar mi vida digital cada cierto tiempo. Explico experimentos y otros trucos utilizando solamente un teclado.
Los datos de carácter personal que nos facilite mediante este formulario quedarán registrados en un fichero de Miguel Ángel Navas Carrera, con la finalidad de gestionar los comentarios que realizas en este blog. La legitimación se realiza a través del consentimiento del interesado. Si no se acepta no podrás comentar en este blog. Puedes consultar Política de privacidad. Puede ejercitar los derechos de acceso, rectificación, cancelación y oposición en info@profesionalreview.com
Botón volver arriba