Si has conocido recientemente la noticia del lanzamiento del mini superordenador DGX Spark GB10 de NVIDIA, aquí te comentamos todo lo que deberías conocer de este equipo pequeño, pero con un potencial enorme para los que buscan una máquina para trabajar con IA.
Índice de contenidos
¿Qué es NVIDIA DGX Spark?
El NVIDIA DGX Spark es un “AI computer” de escritorio orientado a construir y ejecutar modelos de IA locales de gran tamaño, integrando en un formato compacto el superchip NVIDIA GB10 (Grace Blackwell) y una pila de software optimizada para desarrollo, y optimizado para la inferencia.
Su propuesta clave es llevar al escritorio capacidades que antes solo vivían en HPC, habilitando cargas de trabajo con modelos de hasta 200.000 millones de parámetros gracias a su memoria unificada y al rendimiento de cómputo especializado en IA.
Te recomiendo leer sobre cómo se mide el rendimiento de un acelerador de IA en TOPS
Características técnicas del DGX Spark
| Componente | Especificación | Detalle relevante |
|---|---|---|
| Superchip | NVIDIA GB10 (Grace Blackwell) | CPU ARMv9 de 20 núcleos + GPU Blackwell en un único paquete |
| CPU | 10x Cortex‑X925 + 10x Cortex‑A725 | Clúster big.LITTLE con cache L3 total de 32 MB |
| GPU | Arquitectura Blackwell | Núcleos Tensor de nueva generación y hasta ~1000 TOPS en NVFP4 |
| Memoria | 128 GB LPDDR5X unificada, 256‑bit de bus | 273 GB/s de ancho de banda y compartida para CPU/GPU |
| Almacenamiento | 1 a 4 TB NVMe M.2 PCIe 4.0 x4 | Opciones con cifrado automático en modelos OEM |
| Red | 10 GbE + ConnectX‑7 SmartNIC | Conectividad avanzada y baja latencia en redes modernas |
| I/O | 4x puertos USB 3.2 Type‑C, 1x puerto HDMI 2.1a | Salida de audio por HDMI, y NVENC/NVDEC 1x/1x |
| Conectividad | Wi‑Fi 7, Bluetooth 5.3/5.4 | Conexión inalámbrica de última generación |
| Software | DGX OS (base Ubuntu) + NVIDIA AI stack | Entorno integrado para desarrollo y ejecución de IA |
| Rendimiento IA | Hasta ~1 PFLOP, ~1000 TOPS (FP4) | Capaz de inferir LLM de hasta ~200B parámetros en local |
| Consumo | ~240 W (máximo aprox.) | Perfil energético de escritorio compacto |
| Formato | Mini‑PC | Listo para conectar a los periféricos y usar |
También te puede interesar conocer otros miniPCs destacados del mercado
Su secreto es el Superchip GB10
El GB10 es el corazón del DGX Spark. Es un superchip monolítico para AI PCs que combina CPU Arm v9 de 20 núcleos y una GPU Blackwell de última generación en un único paquete, empleando fabricación de 3 nm y empaquetado avanzado 2.5D para interconectar los dielets de CPU/memoria y GPU con alta eficiencia. Esta integración reduce latencias, mejora el intercambio de datos y habilita memoria unificada de gran capacidad con alto ancho de banda.
Arquitectura y diseño del GB10
Para mas detalles, decir que en el chip de NVIDIA, se ha implementado:
- Proceso de fabricación: 3 nm de TMSC, empaquetado 2.5D (dos dielets interconectados).
- CPU Arm v9 (20 núcleos): con 10 núcleos de alto rendimiento Cortex‑X925 y 10 núcleos de eficiencia Cortex‑A725, organizados en dos clústeres con caché L2 privada y 32 MB de caché L3 compartida. Este diseño big.LITTLE permite balancear cargas mixtas (servicios, preprocesamiento, inferencia) con buen rendimiento por vatio.
- GPU Blackwell: incluye núcleos Tensor de nueva generación orientados a formatos de baja precisión para IA (FP4/FP8) y cómputo mixto, así como NVFP4. La implementación en GB10 está enfocada a inferencia y fine‑tuning ligero, priorizando throughput y eficiencia energética en un entorno de escritorio. Con 6144 shading units, 48 RT cores, caché L2 ~50 MB según SKU…
- Memoria unificada: en chips LPDDR5X de128 GB y 256‑bit de bus. Consigue un ancho de banda de 273 GB/s, compartido por CPU y GPU, evitando copias explícitas entre espacios y reduciendo la complejidad de programación. Es crucial para el manejo de contextos largos y estructuras de datos grandes en LLMs locales.
- Interconexión y empaquetado: enlaces internos de alta velocidad en empaquetado 2.5D, orientación a maximizar eficiencia y minimizar latencias entre los dielets de cómputo y memoria, favoreciendo la ejecución de grafos de IA con alta reutilización de datos.
- Aceleración de vídeo: NVENC/NVDEC (presentes a nivel de sistema)
- Frecuencia de reloj variables: base ~1665 MHz, boost ~2525 MH.
El DGX Spark también implementa tecnología NVIDIA ConnectX para poder conectar dos de estos equipos mediante una red de alto rendimiento. De esa forma se pueden conseguir trabajar hasta con modelos de IA de hasta 405000 millones de parámetros.
Rendimiento: inferencia de LLM, visión y entrenamiento ligero
El rendimiento del GB10 dentro del DGX Spark se centra en tres ejes: throughput de inferencia en LLMs, latencia sostenida en modelos de visión y capacidad para fine‑tuning/LoRA con límites termales de escritorio.
- LLM de hasta ~200B parámetros en local: la memoria unificada de 128 GB y el ancho de banda de 273 GB/s permiten cargar y servir contextos largos con paginación mínima, empleando cuantización FP4/FP8 para mantener alta velocidad y footprint razonable. Es un salto respecto a PCs convencionales con GPUs discretas y memoria separada.
- Throughput IA (FP4): la métrica de ~1000 TOPS FP4 favorece tareas de inferencia masiva y pipelines de generación, donde la GPU Blackwell acelera kernels de atención y MLP. Además, el scheduling CPU/GPU se beneficia del coherente acceso a memoria al estar unificada.
- Visión por computador: el ancho de banda y los núcleos Tensor ayudan en modelos de segmentación/detección en batch alto, con latencias competitivas cuando se usan operadores cuantilizados y graph execution optimizado de la pila NVIDIA.
- Fine‑tuning ligero (LoRA/QLoRA): el perfil termal (~240 W a nivel de sistema) es adecuado para tuning incremental sin llegar a picos de entrenamiento pleno de servidores. La ganancia radica en el desarrollo “local‑first” y ciclos de iteración cortos.
En cuanto al precio, quizás lo peor que tiene este sistema, se vende a partir de los 3999€, dependiendo del modelo según el SKU del chip y capacidades de almacenamiento. Así que está fuera del alcance de muchos bolsillos, aunque teniendo en cuenta que esas capacidades solo se conseguían con un superordenador, se puede decir que es relativamente barato si necesitas ejecutar esas cargas de IA en local.
No olvides dejar tus comentarios…





