Ollama publicó la versión 0.33.1 el 26 de agosto de 2026. El cambio más visible es el soporte de Qwen 3.8 27B, pensado por Alibaba para tareas de código, investigación y uso agéntico más exigentes que las de modelos más pequeños de la misma familia. Junto a eso llegan varios ajustes que afectan al uso diario aunque no salgan en el titular: transcodificación WebP para los renderizadores de llama-server, mejor manejo de mensajes de sistema que no van en primera posición del historial, y un cambio de comportamiento que conviene tener en cuenta si mantienes Modelfiles propios — los modelos que no fijan explícitamente repeat_penalty pasan ahora a un valor por defecto de 1.0 (desactivado) en vez de 1.1, alineándose con el comportamiento de otros motores de inferencia y acelerando la decodificación especulativa. En hardware Apple Silicon con modelos NVFP4 vía MLX, esta versión trae mejoras de velocidad de prefill de entre un 7% y un 8% en Qwen3.6 y Muse Glimmer gracias a una escala global nueva. Se corrigen además fallos de verificación de blobs y se amplía la compatibilidad general, junto a ajustes de interfaz menores (texto de bienvenida más claro, alineación de la cabecera en macOS con los controles semáforo de la ventana).