El proyecto vLLM publicó el 10 de agosto de 2026 la versión 0.27.0, con 561 commits de 242 colaboradores (64 nuevos) -- una de las entregas más activas del proyecto este año. Añade soporte completo para Kimi K3, Qwen3.5 (variantes densas y MoE), K-EXAONE-2.0-750B-A37B y VaultGemma (vía el backend de Transformers), además de integrar la herramienta vllm-bench directamente en la CLI y añadir soporte temprano de hardware para la arquitectura NVIDIA Rubin (sm_107) y ROCm gfx1250. Sube además las versiones mínimas de PyTorch (2.13.0), Transformers (5.14.1) y FlashInfer (0.6.16.post3), y elimina los argumentos max_num_partial_prefills/max_long_partial_prefills junto con el soporte para los modelos Plamo2 y Ouro. Este tutorial cubre cómo actualizar tu despliegue de inferencia local con seguridad.
Cómo actualizar tu vLLM autoalojado a la 0.27.0 (Kimi K3, Qwen3.5 y el nuevo vllm-bench)
Comprueba tu versión actual de vLLM
vllm --version
Revisa si usas algo que se elimina en esta versión
vLLM 0.27.0 elimina los argumentos de arranque max_num_partial_prefills y max_long_partial_prefills, y descontinúa el soporte para los modelos Plamo2 y Ouro. Si tu configuración de despliegue usa alguno de los dos argumentos, o sirves alguno de esos dos modelos, ajusta tu configuración antes de actualizar -- no se avisa en tiempo de ejecución, simplemente deja de reconocerlos.
Actualiza las dependencias base o usa la imagen Docker oficial
Esta versión sube las dependencias mínimas a PyTorch 2.13.0, Transformers 5.14.1 y FlashInfer 0.6.16.post3. Si gestionas tu entorno con pip en un venv propio, actualízalas antes de instalar vLLM; si usas la imagen Docker oficial, ya las trae resueltas.
Actualiza vLLM a la 0.27.0
# pip / venv pip install --upgrade vllm==0.27.0 # Docker docker pull vllm/vllm-openai:v0.27.0 docker compose up -d
Verifica el rendimiento con vllm-bench
vllm bench serve --model tu-modelo --num-prompts 50
vllm-bench ya viene integrado en la CLI en esta versión, sin necesidad de instalarlo aparte. Si vas a servir alguno de los modelos recién soportados (Kimi K3, Qwen3.5, K-EXAONE-2.0-750B-A37B), confirma primero que carga y responde correctamente antes de apuntar tráfico real de producción a él.
Conclusión
Si tu configuración actual usa los modelos Plamo2 u Ouro, o los argumentos de prefill eliminados en esta versión, revísalo antes de actualizar en producción -- el resto de la entrega es, en la práctica, más modelos soportados y mejor observabilidad (health reporting, vllm-bench en la CLI) sin cambios que afecten a un despliegue estándar.



