NVIDIA publicó el 11 de agosto de 2026 Nemotron 3.5 Lightning, un modelo abierto de arquitectura MoE (mezcla de expertos) híbrida con 30.000 millones de parámetros totales pero solo 3.000 millones activos por token, destilado de Nemotron 3 Ultra. Está disponible en Ollama desde el mismo día de lanzamiento, con soporte de contexto de hasta 1 millón de tokens y pensado explícitamente para correr en local -- RTX PCs, estaciones RTX PRO, DGX Spark y DGX Station -- en vez de exigir infraestructura de datacenter. Este tutorial cubre cómo ponerlo en marcha en tu homelab con Ollama.
Cómo desplegar NVIDIA Nemotron 3.5 Lightning en tu homelab con Ollama
Comprueba los requisitos de hardware para el diseño MoE
Aunque el modelo tiene 30.000 millones de parámetros totales, el diseño de mezcla de expertos activa solo 3.000 millones por token -- pero toda la estructura del modelo debe residir en memoria aunque no se use entera en cada paso. Antes de descargarlo, confirma que tu GPU (o tu combinación de RAM del sistema más VRAM, si usas descarga a CPU) tiene margen suficiente para cargar el modelo completo, no solo la parte activa por token.
Instala o actualiza Ollama
Si no tienes Ollama instalado, sigue las instrucciones oficiales para tu sistema operativo desde ollama.com. Si ya lo tienes, actualízalo a la última versión antes de continuar, para asegurarte de que reconoce el modelo desde el primer intento.
Descarga el modelo con ollama run
Ejecuta ollama run nemotron-3.5-lightning desde terminal -- el comando descarga el modelo la primera vez y lo deja listo para usar en las siguientes ejecuciones. Si usas Apple Silicon y quieres la variante optimizada para ese hardware, el tag específico es nemotron-3.5-lightning:30b-mlx.
Ajusta la ventana de contexto según tu caso de uso
El modelo soporta hasta 1 millón de tokens de contexto, pero mantener esa ventana al máximo consume memoria proporcionalmente, la uses o no entera. Ajusta el parámetro num_ctx en tu configuración de Ollama (o en el Modelfile si creas una variante propia) al tamaño real que necesite tu caso de uso -- no hace falta correr siempre al máximo de contexto disponible si tus consultas habituales son mucho más cortas.
Conecta un frontend como Open WebUI para uso diario
Ollama por sí solo funciona bien desde terminal, pero para un uso diario más cómodo -- historial de conversaciones, subida de ficheros, múltiples usuarios si compartes el homelab -- despliega Open WebUI apuntando a tu instancia de Ollama local. Es la combinación habitual para tener algo parecido a un ChatGPT propio corriendo enteramente en tu red.
Compara el rendimiento con otros modelos ya desplegados en tu homelab
Si ya tienes otros modelos corriendo localmente (Qwen, LFM2.5 o similares), vale la pena comparar latencia y calidad de respuesta en tus propias tareas habituales antes de convertir a Nemotron 3.5 Lightning en tu modelo por defecto -- las cifras de benchmark de cualquier fabricante son un punto de partida, no un sustituto de probarlo con tu caso de uso real.
Conclusión
El diseño MoE con solo 3.000 millones de parámetros activos por token es la pieza clave para un homelab: el coste de cómputo real por token generado se parece más al de un modelo mucho más pequeño que a sus 30.000 millones de parámetros totales, sin renunciar al conocimiento acumulado del modelo completo. Es de las opciones más razonables ahora mismo para tener un asistente de IA local sin depender de una GPU de gama alta.



