NVIDIA publicó el 11 de agosto Nemotron 3.5 Lightning, un modelo abierto que no compite donde compiten los modelos frontier de OpenAI o Anthropic —razonamiento profundo, tareas complejas de varios pasos— sino en un terreno más discreto y, para quien monta infraestructura de IA en casa, más útil en el día a día: ejecutar rápido las tareas repetitivas que rodean a cualquier flujo de agentes.

Un modelo pensado para la "capa de ejecución", no para el protagonismo

NVIDIA es explícita sobre el objetivo de Nemotron 3.5 Lightning: no está pensado para razonar sobre problemas complejos, sino para ejecutar rápido las tareas de apoyo de un agente de larga duración — tool-calling, validación de resultados, resúmenes, triage de logs — el trabajo mecánico que hoy muchos flujos de agentes delegan, sin necesidad, en un modelo grande y caro.
Es una distinción que se agradece en un mercado saturado de lanzamientos que prometen ser "el mejor en todo": aquí NVIDIA elige un nicho concreto y lo justifica con la arquitectura.

La arquitectura explica la elección

La clave está en el diseño MoE híbrido: 30.000 millones de parámetros totales, pero solo 3.000 millones activos por token, repartidos entre capas Mamba-2 (más eficientes que la atención pura para secuencias largas), Mixture-of-Experts y Attention convencional intercaladas. El resultado es un modelo que en la práctica se comporta, en velocidad, mucho más cerca de un modelo de 3B que de uno de 30B — mientras conserva la capacidad acumulada de un modelo mayor para las tareas puntuales donde hace falta.

Licencia y accesibilidad: la parte que más me ha gustado

OpenMDW-1.1 no es un "open weights" cosmético: NVIDIA libera pesos, datos de entrenamiento y las propias recetas usadas para entrenarlo, con permiso de uso comercial. Es el nivel de apertura que permite auditar de verdad qué hay detrás del modelo, no solo usarlo como caja negra. Combinado con soporte día uno en Ollama, llama.cpp y LM Studio, montar esto en un homelab es tan sencillo como un ollama pull — sin esperar semanas a que la comunidad publique una conversión GGUF no oficial.

El límite real: la VRAM sigue mandando

La versión completa en BF16 exige casi 66 GB de VRAM, fuera del alcance de cualquier GPU de consumo actual — el uso realista para quien no tiene una workstation de IA dedicada pasa por cuantización de 8 o incluso 4 bits (~20 GB), asumible en una sola GPU de gama alta de homelab, con la pérdida de precisión que toda cuantización implica. Merece la pena probar primero el nivel de cuantización más agresivo que tu hardware permita antes de asumir que necesitas más GPU de la que ya tienes.

Para quién tiene sentido ahora mismo

Si ya tienes un flujo de agentes locales montado (Ollama, n8n, lo que sea) y te está costando dinero o latencia mandar cada tarea mecánica a un modelo grande en la nube, Nemotron 3.5 Lightning es exactamente el tipo de pieza que falta: rápido, abierto de verdad, y pensado para vivir en tu propio hardware. Si lo que buscas es un modelo que razone bien sobre problemas difíciles, este no es el lanzamiento que estabas esperando — y NVIDIA no pretende que lo sea.