El equipo Qwen de Alibaba publicó el 14 de agosto de 2026 los pesos de Qwen3.8-27B en Hugging Face, bajo licencia Apache 2.0 -- un modelo denso de 27.780 millones de parámetros, con entrada multimodal (texto, imagen y vídeo) y un contexto nativo de 262.144 tokens, pensado para correr en una sola GPU de 24GB.
Un modelo pensado para caber en un homelab, no en un clúster
La cifra que más debería llamar la atención de un lector de El Rack no es el tamaño del modelo en sí, sino el requisito de hardware: una sola GPU de 24GB basta para moverlo, con la opción de bajar ese requisito todavía más vía cuantización a 4 bits. Es un salto de accesibilidad real frente a modelos que exigen varias tarjetas de gama alta o infraestructura de clúster -- el tipo de umbral que separa "puedo correr esto en mi propio hardware" de "necesito alquilar cómputo en la nube para probarlo siquiera".
42,2 sobre 13,3 en DeepSWE 1.1 frente a su propio predecesor de 27B es el tipo de salto que, si se confirma con uso real, cambia de verdad qué modelo abierto merece la pena correr en local
Según el propio model card de Alibaba, los saltos de benchmark no son un pico aislado en una única prueba favorable: DeepSWE 1.1 sube de 13,3 a 42,2, SWE-MM de 25,7 a 38,6, Terminal-Bench 2.1 de 63,4 a 73,0, y OSWorld-Verified de 63,9 a 84,3, todos frente al 27B anterior de la misma familia. Añaden además un 90,3% en LiveCodeBench v6 y, la cifra más llamativa de todo el anuncio, 61,7 frente a 53,4 de Claude Opus 4.6 Max en SWE-bench Pro -- un modelo cerrado y considerablemente más caro de usar vía API.
La cautela de siempre: cifras del propio fabricante
Como con cualquier lanzamiento reciente de un laboratorio chino -- el mismo patrón que ya vimos hace unos días con GLM-5.3 de Z.AI -- estas cifras vienen todas de Alibaba, sin contraste todavía de benchmarks independientes que las confirmen en condiciones neutrales. No es motivo para descartarlas sin más, pero sí para tratarlas como un punto de partida prometedor, no como un hecho consumado hasta que la comunidad las reproduzca por su cuenta.
Denso, no MoE -- una decisión de arquitectura con su propio coste
A diferencia de arquitecturas más recientes que activan solo una fracción de sus parámetros por token (como el propio Nemotron 3.5 Lightning de Nvidia, que hemos cubierto por separado esta misma semana), Qwen3.8-27B es un modelo denso: todos sus 27.780 millones de parámetros participan en cada token generado. Eso significa un coste de cómputo por token proporcionalmente más alto que un MoE equivalente en tamaño total, algo a tener en cuenta si tu cuello de botella real es la velocidad de inferencia y no solo la memoria disponible.
Para quién tiene sentido probarlo ya
Si ya tienes una GPU de 24GB o superior en tu homelab y buscas un modelo abierto para tareas de código o agentes con capacidad de trabajar con contexto largo, Qwen3.8-27B es de los lanzamientos más interesantes de este mes para correr en local -- con la licencia Apache 2.0 más permisiva del mercado actual. Si tu hardware se queda corto de esos 24GB, la cuantización a 4 bits es la vía razonable para probarlo igualmente, asumiendo la pérdida de precisión que eso implica frente al modelo completo.



