Un usuario de Reddit se llevó una sorpresa desagradable tras intentar llevar su equipo al límite con inteligencia artificial con una memoria DDR4.
DDR4: Una memoria colapsa al trabajar con una IA de 35B
Luego de trabajar sin problemas con un modelo de IA de 20 billones de parámetros en su tarjeta gráfica Nvidia RTX 5070 Ti, decidió dar el salto a un modelo más denso y complejo, como el Ornith-1.5-35B-A3B, de 35 billones de parámetros, diseñado para tareas avanzadas en bases de datos.
Como la memoria VRAM de 16 GB de su GPU resultaba insuficiente para sostener semejante carga, el usuario optó por utilizar la memoria del sistema para descargar el exceso de procesamiento. Su configuración contaba con 128 GB de memoria RAM DDR4 ECC distribuidos en varios módulos de 8 GB. Sin embargo, tras dejar el ordenador ejecutando el flujo de trabajo, el sistema colapsó por completo a los 90 minutos.
Al investigar la falla, confirmó que uno de los módulos de 8 GB había muerto literalmente. Lejos de ser un incidente aislado, tras reemplazar la memoria defectuoso y continuar usando el modelo durante 8 o 9 días, los registros de error del sistema indicaron que un segundo módulo de memoria comenzaba a mostrar signos de degradación.
Te recomendamos nuestra guía sobre las mejores memorias RAM del mercado
El usuario aseguró que las temperaturas de la CPU y la GPU nunca superaron los 80 °C, por lo que las temperaturas no parece haber sido un problema. Sin embargo, analistas del sector destacan que no se monitorearon las temperaturas de las memorias. La explicación más probable detrás del fallo apunta a una combinación entre el uso al 100% de las memorias RAM para estas tareas de inteligencia artificial y a unas temperaturas muy elevadas.
Este caso evidencia los riesgos de ejecutar modelos de lenguaje muy grandes en hardware de generación anterior que no está optimizado para estos flujos de trabajo de inteligencia artificial tan intensos. Os mantendremos informados.



