Cloudflare publicó el 1 de octubre de 2026 Clef y Clef-flash, dos modelos de 27.000 y 9.000 millones de parámetros pensados para un trabajo muy concreto dentro de un flujo de agente: decidir, no conversar. En vez de pedirle a un modelo de lenguaje generalista que escriba un JSON con su decisión («¿aprobar esta acción?», «¿a qué categoría pertenece esto?», «¿qué herramienta llamar?»), Clef devuelve directamente probabilidades tipadas sobre las opciones posibles.

El mismo día, Amazon publicó Strands Decider 2B con el mismo planteamiento. Las tres propuestas —incluida Clef— señalan a Jev, el modelo cerrado «System One» de TypeSafe AI, como la referencia a batir en este nicho de modelos de decisión. La diferencia de Cloudflare frente a Amazon y frente a Jev: Clef publica los pesos completos bajo licencia Apache 2.0 en Hugging Face, no solo acceso por API.

En cifras, los dos modelos manejan 64.000 tokens de contexto y leen imagen y vídeo además de texto, algo inusual en un modelo pensado para clasificación. Clef-flash, la variante pequeña, resuelve en 38,8 milisegundos de mediana, según las cifras publicadas por Cloudflare, frente a los varios cientos de milisegundos que tardaría pedirle lo mismo a un modelo de lenguaje generalista.

Un agente que le pide a un modelo de 27.000 millones de parámetros que escriba JSON está pagando por una capacidad que no usa: ese es el argumento que comparten Cloudflare, Amazon y el propio Jev al que todos apuntan.

Para un homelab que ya tiene un flujo de agentes (n8n, un router de IA, un pipeline con aprobaciones humanas de por medio), el interés de Clef no es sustituir al modelo que ya usas para generar texto, sino quitarle el trabajo de clasificación y enrutado: en vez de preguntarle a tu modelo grande «¿esto es spam o no?» y parsear la respuesta, Clef devuelve una probabilidad tipada, más rápido y más barato de ejecutar. Al estar en Apache 2.0, se puede intentar autoalojar con el runtime habitual (vLLM, llama.cpp o lo que ya tengas montado) en vez de depender de Workers AI de Cloudflare, aunque las demos y el tooling de referencia de Cloudflare están pensados sobre su propia infraestructura: montarlo tú exige algo de trabajo de integración que con Workers AI viene resuelto de fábrica.

Fuentes: marktechpost.com · datanorth.ai · digitalapplied.com