Meta Superintelligence Labs publicó el 10 de agosto Muse Glimmer, un modelo denso de unos 29.6B de parámetros (más un encoder de percepción ViT-G/14 de otros 1.8B) pensado explícitamente para correr como agente local "always-on" en una sola GPU de consumo — gestión de agenda, organización de ficheros, tareas de código, todo sin depender de una API externa.

Lo que de verdad importa: el camino de cuantización está documentado, no es un rumor

En precisión completa BF16, Muse Glimmer exige unos 64GB de VRAM — fuera del alcance de casi cualquier setup doméstico. Pero Meta ha publicado el camino completo de cuantización con su coste de precisión indicado: K-Quant-Dynamic lo baja a 32GB perdiendo solo un 0.2% de precisión, y la variante más agresiva (K-Quant-17GB) lo deja en 24GB por un ~1%. Con cuantización de 4 bits, la exigencia cae a 18-20GB — el rango de una GPU de consumo potente, no de un servidor de datacenter.
Es la primera vez que veo a un laboratorio grande publicar esa tabla de compromiso precisión/memoria con este nivel de detalle en vez de dejarlo a que la comunidad lo averigüe por su cuenta.

Cómo se instala en la práctica

Hay dos caminos oficiales: Unsloth Desktop, que resuelve la descarga y ejecución con un instalador y una interfaz gráfica (pensado para quien no quiere tocar la terminal), y llama.cpp compilado a mano para quien prefiere control total — descargar el GGUF desde Hugging Face con hf download, compilar con soporte CUDA (o Metal en Mac) y lanzar llama-cli apuntando al fichero de la cuantización elegida. Cubro el proceso completo, con los comandos exactos, en el tutorial que publicamos junto a esta review.

El enfoque agéntico, no solo el tamaño

Lo que diferencia a Muse Glimmer de otro modelo open-weight más no es el número de parámetros — 30B ya no es una cifra que sorprenda a nadie en 2026 —, es que Meta lo ha diseñado y entrenado pensando en que viva encendido en tu máquina de forma continua haciendo tareas de agente, no en que lo invoques puntualmente para generar texto. El contexto de hasta 262.144 tokens encaja con esa idea: un agente que acumula contexto de tu actividad durante horas necesita ventanas así de largas para no perder el hilo.

La cautela de siempre con un lanzamiento de dos días

Esto se publicó hace apenas dos días. Los benchmarks disponibles son los de Meta y los primeros usuarios de la comunidad — todavía no hay el volumen de pruebas independientes que sí tienen modelos con más recorrido. Si te planteas montarlo en tu homelab de IA local, trátalo como lo que es: muy prometedor sobre el papel y en las primeras pruebas, pero sin el rodaje que da la confianza total.