El proyecto vLLM publicó el 10 de agosto de 2026 la versión 0.27.0, con 561 commits de 242 colaboradores (64 nuevos) -- una de las entregas más activas del proyecto este año. Añade soporte completo para Kimi K3, Qwen3.5 (variantes densas y MoE), K-EXAONE-2.0-750B-A37B y VaultGemma (vía el backend de Transformers), además de integrar la herramienta vllm-bench directamente en la CLI y añadir soporte temprano de hardware para la arquitectura NVIDIA Rubin (sm_107) y ROCm gfx1250. Sube además las versiones mínimas de PyTorch (2.13.0), Transformers (5.14.1) y FlashInfer (0.6.16.post3), y elimina los argumentos max_num_partial_prefills/max_long_partial_prefills junto con el soporte para los modelos Plamo2 y Ouro. Este tutorial cubre cómo actualizar tu despliegue de inferencia local con seguridad.