Cloudflare ha lanciato Clef e Clef-flash, due modelli open source pensati per prendere decisioni rapide dentro agenti e workflow AI. A differenza di un normale modello generativo, Clef non deve scrivere una risposta libera: riceve uno stato, una serie di domande tipizzate e restituisce probabilità per le risposte consentite.
Il caso d’uso è molto concreto. Un agente può chiedere a Clef se un ticket è urgente, quale reparto deve gestirlo oppure se una richiesta va bloccata o inoltrata a una persona. Il risultato è già strutturato e può essere usato direttamente dal software senza dover interpretare testo generato.

Che cosa sono Clef e Clef-flash
Nell’annuncio ufficiale del 1 ottobre, Cloudflare definisce Clef un decision model. Il modello non punta a sostituire gli LLM generativi: serve a inserirsi nei punti di un workflow in cui bisogna scegliere tra opzioni già definite.
Questo cambia il tipo di output. Invece di chiedere a un LLM di spiegare quale azione scegliere e poi analizzare la risposta, l’applicazione può inviare a Clef una serie di alternative e ottenere una probabilità per ciascuna. La logica è utile per routing, classificazione, ranking, escalation e controlli che devono restare prevedibili.
Perché Cloudflare li distingue dagli LLM
Un LLM è progettato per gestire richieste aperte: può ragionare, generare testo, scrivere codice e usare strumenti. Questa flessibilità ha però un costo in latenza, token e controllo dell’output. Un decision model lavora invece su uno spazio più ristretto e restituisce risposte già vincolate.
La distinzione è interessante soprattutto negli agenti. Abbiamo già visto come un runtime agentico debba coordinare sessioni, tool e passaggi successivi nella guida a OpenAI Agents API. Clef si posiziona in un punto diverso della catena: può decidere quale strada prendere prima che un modello generativo esegua il lavoro più costoso.

Quanto sono veloci Clef e Clef-flash
Cloudflare pubblica anche dati di latenza sul proprio benchmark. Nel changelog di Workers AI indica una mediana di 209,3 ms per Clef e 38,8 ms per Clef-flash, contro 524,1 ms del modello Jev usato come riferimento.
Questi numeri arrivano dal produttore e non vanno letti come garanzia per ogni applicazione reale. La latenza finale dipende anche dalla rete, dalla dimensione dell’input e dal modo in cui il modello viene inserito nel workflow. Il punto progettuale resta però chiaro: Clef-flash è pensato per stare nel percorso critico di un agente senza trasformare ogni decisione in una lunga generazione.
Dove si possono usare
I due modelli sono già disponibili su Cloudflare Workers AI con gli identificatori @cf/cloudflare/clef e @cf/cloudflare/clef-flash. Cloudflare ha inoltre pubblicato i pesi su Hugging Face con licenza Apache 2.0, quindi possono essere sperimentati anche fuori dal servizio gestito.
Questa doppia disponibilità è rilevante per chi vuole scegliere tra hosting gestito e deployment proprio. Il modello può stare vicino all’applicazione su Workers AI oppure essere eseguito in un’infrastruttura controllata dal team, compatibilmente con requisiti hardware e operativi.
Un esempio pratico: supporto clienti
Immagina un sistema che riceve una richiesta di assistenza. Prima di coinvolgere un LLM, Clef potrebbe valutare tre domande: è urgente?, quale team deve riceverla? e serve un intervento umano?. L’agente utilizza le probabilità restituite per instradare il ticket e chiama un modello generativo soltanto quando serve scrivere, analizzare o eseguire azioni più complesse.
Il vantaggio potenziale non è soltanto la velocità. Una risposta tipizzata riduce il lavoro necessario per validare l’output e rende più semplice imporre regole deterministiche, soglie e fallback.
Clef può sostituire GPT, Gemini o Claude?
No, non è questo l’obiettivo. Clef risolve un problema più specifico. Un modello generativo resta necessario quando bisogna comprendere istruzioni aperte, produrre contenuti, scrivere codice o pianificare attività articolate. Clef è utile quando la domanda è già trasformabile in una decisione tra risposte note.
La combinazione può essere più interessante della sostituzione. Un agente può usare un decision model per filtrare e instradare richieste, e passare a un LLM soltanto i casi che richiedono ragionamento generativo. È la stessa logica di scelta del modello che abbiamo approfondito parlando di prestazioni e costi della famiglia GPT-5.6: non ogni passaggio richiede il modello più potente disponibile.
Cloudflare apre anche il fine-tuning RL
Insieme ai modelli, Cloudflare ha annunciato un servizio di reinforcement learning fine-tuning pensato per adattare Clef ai dati e alle decisioni di uno specifico workload. Il servizio è ancora presentato come percorso per design partner, quindi disponibilità e condizioni possono evolvere.
La novità suggerisce però una direzione precisa: non usare un unico grande modello per ogni passaggio, ma costruire sistemi composti da componenti specializzati, veloci e misurabili. Per gli agenti AI, Clef prova a occupare esattamente quel livello decisionale.
Cosa cambia per chi costruisce agenti AI
Clef non rende automaticamente migliore un agente. Serve quando il workflow contiene decisioni ripetibili e può definire in anticipo le risposte consentite. Se il problema richiede una risposta aperta, un decision model è troppo rigido; se invece bisogna scegliere rapidamente tra poche azioni, usare un LLM completo può essere uno spreco.
La novità di Cloudflare è quindi soprattutto architetturale: separare la fase in cui l’agente decide da quella in cui ragiona o genera. Nei sistemi con molte richieste, questa separazione può diventare importante per latenza, costo e controllo.
Le specifiche e i benchmark aggiornati sono disponibili anche nel changelog ufficiale di Workers AI.