Ollama añadió soporte para Meta Muse Glimmer, un modelo multimodal de 30.000 millones de parámetros pensado para cargas de trabajo de agente (coding agents y asistentes personales), en una serie de versiones publicadas entre el 10 y el 12 de agosto de 2026: primero soporte inicial en el motor MLX para Apple Silicon (0.32.7), después soporte ampliado a NVIDIA y AMD (0.32.8), y finalmente, en la 0.32.10, ajustes de rendimiento -- penalización de repetición por defecto a 1.0 y mejoras de velocidad en decodificación especulativa. Es una de las incorporaciones más relevantes de Ollama este mes para quien quiere ejecutar en local un modelo de agente capaz, sin depender de una API externa. Este tutorial cubre cómo actualizar Ollama y poner Muse Glimmer en marcha.
Cómo ejecutar Meta Muse Glimmer en tu homelab con Ollama 0.32
Comprueba tu versión de Ollama
ollama --version
Necesitas como mínimo la versión 0.32.8 para tener soporte de Muse Glimmer en NVIDIA o AMD (la 0.32.7 solo lo soporta en Apple Silicon vía MLX). Se recomienda actualizar directamente a la 0.32.10, que incluye las mejoras de rendimiento más recientes.
Actualiza Ollama a la 0.32.10
# Linux/macOS curl -fsSL https://ollama.com/install.sh | sh # Docker docker pull ollama/ollama:0.32.10 docker compose up -d
Comprueba que tu GPU tiene memoria suficiente
Muse Glimmer es un modelo de 30.000 millones de parámetros -- en cuantización estándar (Q4) necesita aproximadamente 18-20 GB de VRAM para cargarse por completo en GPU. Si tu tarjeta tiene menos, Ollama repartirá capas entre GPU y CPU automáticamente, pero con una caída notable de velocidad. Comprueba la VRAM disponible con nvidia-smi (NVIDIA) o rocm-smi (AMD) antes de continuar.
Descarga y ejecuta el modelo
ollama pull muse-glimmer ollama run muse-glimmer
La primera descarga puede tardar dependiendo de tu conexión, dado el tamaño del modelo. Una vez descargado, ollama run abre una sesión interactiva directa -- pruébalo primero con una tarea sencilla de agente (por ejemplo, pedirle que use una herramienta ficticia de búsqueda) para confirmar que el flujo de function calling responde como se espera antes de integrarlo en un pipeline real.
Expón el modelo vía la API compatible con OpenAI
curl http://localhost:11434/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model": "muse-glimmer", "messages": [{"role": "user", "content": "Resume en una frase que hace este modelo"}]}'Desde la 0.32.6, Ollama estandarizó el endpoint /v1/chat/completions para que coincida con el formato de streaming de OpenAI -- cualquier herramienta o agente que ya sepas integrar contra la API de OpenAI puede apuntar a tu Ollama local cambiando solo la URL base, sin reescribir la integración.
Conclusión
Que Meta haya liberado un modelo de agente multimodal de este tamaño con soporte ya integrado en Ollama en cuestión de días es una buena noticia concreta para el homelab de IA local -- pero 30.000 millones de parámetros siguen exigiendo GPU real, no una tarjeta de gama de entrada. Antes de construir un flujo de trabajo entero alrededor de Muse Glimmer en local, confirma que tu hardware aguanta el modelo con margen, no justo al límite.



