Alibaba presentó el 18 de septiembre Qwen3.8-Omni-Flash, la última entrega de su familia Qwen y la más ambiciosa en cuanto a modalidades: procesa texto, imagen, audio y vídeo en una sola llamada, con una ventana de contexto de 1 millón de tokens. Según los benchmarks publicados por la propia Alibaba, mejora un 26% de media sobre 30 evaluaciones frente a su predecesor, Qwen3.5-Omni-Plus, con ganancias concretas en agentes de audio-vídeo, código, tareas de contexto largo e interacción multimodal en tiempo real.
El modelo acepta vídeos de hasta 2 horas y 2 GB por URL, y audio de hasta 3 horas en 113 idiomas y dialectos — pero solo devuelve texto, no genera audio ni vídeo de salida.Entre sus capacidades declaradas están el análisis de vídeos largos, resúmenes de reuniones, investigación sobre contenido en vídeo, uso de herramientas multimodal, razonamiento ajustable, llamadas a función, búsqueda web y comprensión de audio espacial.
El precio de entrada es agresivo para lo que ofrece: 0,15 $ por millón de tokens de entrada y 0,47 $ por millón de salida, con el coste de meter audio bajando un 98% y el de audio-vídeo combinado más de un 93% frente a la generación anterior — números que hacen mucho más barato analizar horas de grabación sin recortar antes a mano.
Lo que cambia respecto a otras entregas recientes de la serie Qwen (Qwen3.8-27B, Qwen3.8-Flash-Next), y lo que de verdad importa para un homelab: Qwen3.8-Omni-Flash no tiene pesos descargables. Solo está disponible como API alojada en QwenCloud, Alibaba Cloud Model Studio y Qwen Studio. Si el interés en Qwen viene de poder tirar el modelo en hardware propio, aquí no hay nada que autoalojar — es un servicio cloud más, con la ventaja de precio y la desventaja de siempre: el audio y el vídeo pasan por los servidores de Alibaba antes de ver un resultado.
Fuentes: technode.com · marktechpost.com · datacamp.com



