Muse Glimmer, el modelo agéntico de ~30B parámetros que Meta publicó el 10 de agosto de 2026 con pesos abiertos (Apache 2.0), puede correr en local con distintos niveles de cuantización según la VRAM disponible — desde 12-14GB en la variante más agresiva hasta los 64GB de la precisión completa BF16. Este tutorial cubre las dos vías oficiales de instalación: Unsloth Desktop para quien quiere algo rápido con interfaz gráfica, y llama.cpp compilado a mano para quien prefiere control total.
Cómo instalar y ejecutar Muse Glimmer en tu propia GPU
Decide qué variante de cuantización encaja con tu GPU
Meta y Unsloth publican varias variantes oficiales con su coste de memoria y precisión documentado: UD-Q2_K_XL necesita 12-14GB (ej. RTX 4080), UD-Q3_K_XL unos 14-15GB (RTX 4090), UD-Q4_K_XL unos 17GB (encaja en un Mac de 32GB unificados), UD-Q6_K_XL 20-22GB (RTX 5090), y UD-Q8_K_XL hasta 34GB (Mac de 128GB). Tu memoria total disponible debe superar el tamaño del modelo cuantizado, o el rendimiento se degrada notablemente antes de fallar directamente.
Opción rápida: instala Unsloth Desktop
En macOS/Linux:
curl -fsSL https://unsloth.ai/install.sh | sh
En Windows (PowerShell):
irm https://unsloth.ai/install.ps1 | iex
Abre Unsloth, ve a la pestaña Model Hub, busca "Muse Glimmer", elige la cuantización según el paso anterior, y pulsa Run. Es la vía recomendada para una primera prueba sin complicaciones.
Opción avanzada: compila llama.cpp con soporte de GPU
Con GPU NVIDIA (CUDA):
git clone https://github.com/ggml-org/llama.cpp cmake llama.cpp -B llama.cpp/build -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON cmake --build llama.cpp/build --config Release -j --target llama-cli llama-server
En Mac, el soporte de Metal es automático — usa -DGGML_CUDA=OFF en su lugar si compilas en Apple Silicon.
Descarga los pesos desde Hugging Face
pip install huggingface_hub hf download unsloth/Muse-Glimmer-30B-GGUF \ --local-dir unsloth/Muse-Glimmer-30B-GGUF \ --include "*mmproj-BF16*" \ --include "*UD-Q4_K_XL*"
Sustituye UD-Q4_K_XL por la variante elegida en el primer paso.
Lanza la inferencia
./llama.cpp/llama-cli \ --model unsloth/Muse-Glimmer-30B-GGUF/Muse-Glimmer-30B-UD-Q4_K_XL.gguf \ --mmproj unsloth/Muse-Glimmer-30B-GGUF/mmproj-BF16.gguf \ --temp 1.0 --top-p 0.95 --top-k 64
Los parámetros recomendados por Meta son temperatura 1.0, top-p 0.95 y top-k 64 — el modelo soporta un contexto de hasta 262.144 tokens si tu caso de uso lo necesita.
Si vas a exponerlo como servidor para otras apps de tu homelab
Sustituye llama-cli por llama-server (compilado en el mismo paso) para levantar un endpoint compatible con la API de OpenAI, integrable con cualquier cliente que ya uses contra Ollama o LM Studio:
./llama.cpp/build/bin/llama-server \ --model unsloth/Muse-Glimmer-30B-GGUF/Muse-Glimmer-30B-UD-Q4_K_XL.gguf \ --mmproj unsloth/Muse-Glimmer-30B-GGUF/mmproj-BF16.gguf \ --port 8080
Conclusión
Elige la cuantización según tu VRAM real, no según la que te gustaría tener — Q4_K_XL en 17GB es un punto dulce razonable para la mayoría de GPUs de consumo actuales, y el propio modelo advierte que quedarte justo en el límite de memoria disponible degrada el rendimiento antes de fallar directamente. Empieza por Unsloth Desktop si es tu primer modelo local grande; pasa a llama.cpp cuando necesites integrarlo en un flujo o servidor propio.



