Cloudflare Clef: Modelli Decisionali Open-Weight e Piattaforma di Fine-Tuning RL
Cloudflare entra nell'arena dei modelli decisionali con Clef
Cloudflare è ufficialmente entrata nel settore dei modelli decisionali con il rilascio di Clef e Clef-flash, due modelli open-weight progettati per attività di classificazione strutturata rapide. A differenza dei tradizionali modelli linguistici di grandi dimensioni (LLM) che generano testo libero, i modelli decisionali restituiscono probabilità tipizzate per un insieme di scelte predefinite, rendendoli ideali per flussi di lavoro agentici dove velocità e determinismo sono fondamentali. I modelli sono ora ospitati su Workers AI e disponibili con licenza Apache 2.0 su Hugging Face, a testimonianza dell'impegno di Cloudflare verso un'infrastruttura AI open-source.
Questo lancio arriva in un momento in cui i modelli decisionali stanno guadagnando terreno, con Jev di TypeSafe AI come notevole predecessore. L'ingresso di Cloudflare in questa nicchia non riguarda solo l'aggiunta di un altro modello, ma l'integrazione delle capacità decisionali direttamente nella sua rete periferica, riducendo la latenza per gli agenti AI che devono prendere decisioni in tempo reale. L'azienda ha anche annunciato un servizio di fine-tuning con apprendimento per rinforzo (RL), posizionandosi come fornitore AI full-stack per flussi di lavoro aziendali.
Cosa rende Clef diverso?
Clef si distingue dai modelli decisionali esistenti come Jev in diversi aspetti chiave. Innanzitutto, incorpora un encoder visivo, che gli consente di elaborare e classificare contenuti visivi, una capacità attualmente assente in Jev. Questo amplia la sua utilità oltre agli input testuali, includendo immagini, fondamentale per applicazioni come la moderazione dei contenuti o i controlli di qualità visivi. In secondo luogo, Clef offre una finestra di contesto di 64k, il doppio rispetto ai 32k di Jev, consentendogli di analizzare set di dati di input più grandi in un unico passaggio.
In terzo luogo, Clef è progettato per la velocità. Il processo di inferenza utilizza un passaggio di solo prefill con punteggio parallelo delle scelte dello schema valide, bypassando la generazione autoregressiva token per token che rallenta gli LLM. Questo approccio non autoregressivo consente a Clef di fornire una latenza media di 209,3 ms (e solo 38,8 ms per Clef-flash), rispetto ai 524,1 ms di Jev. Se combinato con le GPU periferiche di Cloudflare, ciò rende Clef adatto per decisioni in percorsi critici in ambienti di produzione.
Prestazioni di benchmark: Clef vs. Jev e altri
Cloudflare riferisce che Clef guida il Jev Decision Index in diversi benchmark chiave. Nella tabella seguente, Clef e Clef-flash superano Jev in attività come BFCL (caso esatto), ToolRet (nDCG@10) e BANKING77 (macro-F1). Tuttavia, Jev mantiene ancora un vantaggio in alcune aree come When2Call e BRIGHT, indicando che i modelli hanno punti di forza complementari a seconda del caso d'uso.
- BFCL (caso esatto): Clef 98,47, Jev 98,76
- ToolRet (nDCG@10): Clef 69,19, Jev 66,43
- BANKING77 (macro-F1): Clef 94,20, Jev 90,93
- When2Call (accuratezza): Clef 72,37, Jev 80,97
Sulla suite WorkflowEvals di Typesafe, Clef e Clef-flash battono Jev in tre dei quattro flussi di lavoro, inclusi elaborazione fatture e servizio clienti. Mentre Jev rimane forte nell'osservabilità delle tracce degli agenti, i modelli di Cloudflare dimostrano prestazioni competitive in un'ampia gamma di attività decisionali, rendendoli una scelta valida per le aziende.
Architettura tecnica: Basato su Qwen con RLCD
Clef è costruito su Qwen, con Clef che utilizza il backbone Qwen3.8-27B e Clef-flash che utilizza Qwen3.5-9B. I modelli congelano la base e aggiungono adattatori low-rank di rango 256, ottimizzando una testa di instradamento che valuta le scelte dello schema in parallelo. Questa architettura, combinata con un processo di instradamento dell'attenzione a due stadi, consente a ciascun campo di interagire con gli altri, preservando l'intento semantico tra le opzioni.
L'addestramento ha coinvolto l'entropia incrociata con smoothing delle etichette e una perdita Brier per la calibrazione, più un nuovo obiettivo di Apprendimento per Rinforzo per Decisioni Calibrate (RLCD). RLCD concede un credito parziale alle scelte ordinali adiacenti, premia gli output precisi e applica una penalità di riferimento per prevenire lo spostamento della distribuzione. Ciò si traduce in una migliore accuratezza e generalizzazione, secondo il team di ingegneria di Cloudflare.
Il nuovo servizio di fine-tuning RL
Cloudflare sta anche lanciando un servizio di fine-tuning con apprendimento per rinforzo, inizialmente offerto in modalità pratica con il suo team di ingegneri sul campo (FDE). Il servizio sfrutta i primitivi esistenti di Cloudflare: AI Gateway per catturare i dati delle richieste, Workers AI per i rollout, Containers per i sandbox RL e un nuovo componente Trainer per aggiornare i pesi del modello. Questa pipeline consente ai clienti di mettere a punto Clef sui propri dati e di ridistribuirlo su Workers AI tramite BYO Model.
Questa mossa posiziona Cloudflare non solo come fornitore di modelli, ma come piattaforma per il processo decisionale AI personalizzato. I casi d'uso interni includono lo smistamento delle richieste di supporto, il rilevamento di bot dannosi e la valutazione delle segnalazioni di Trust & Safety. Offrendo il fine-tuning, Cloudflare mira a soddisfare esigenze aziendali altamente specifiche in cui i modelli generici sono insufficienti.
Distribuzione e compatibilità
Entrambi i modelli sono completamente compatibili con l'API Jev, rendendo la migrazione semplice per gli utenti esistenti. Possono essere accessibili tramite l'API REST di Workers AI, il binding o AI Gateway. Per l'hosting autonomo, i modelli sono stati testati su un singolo H200 con pesi BF16. Cloudflare sottolinea che non legge, memorizza né addestra sulle richieste dei clienti a meno che non scelgano il servizio di fine-tuning, affrontando le preoccupazioni sulla privacy dei dati aziendali.
Perché questo è importante
L'ingresso di Cloudflare nei modelli decisionali con Clef e la sua piattaforma di fine-tuning RL rappresenta un passo significativo verso agenti AI più efficienti e deterministici. Rendendo i modelli open-source e integrandoli nella sua rete periferica, Cloudflare sta democratizzando l'accesso a un AI decisionale ad alte prestazioni. La bassa latenza, le capacità visive e le opzioni di fine-tuning rendono Clef una scelta convincente per gli sviluppatori che costruiscono flussi di lavoro agentici che richiedono decisioni rapide e affidabili.
Con l'evoluzione del panorama AI, la capacità di prendere decisioni rapide e accurate diventerà importante quanto la potenza generativa grezza. Con Clef, Cloudflare scommette che il futuro dell'AI non risiede solo nella generazione di testo, ma nel fare le scelte giuste, rapidamente e in modo affidabile.
Related News

OpenAI e Synopsys Presentano GPT-Synopsys per Rivoluzionare la Progettazione di Chip

OpenDLSS porta NVIDIA DLSS 5 su Vulkan con precisione bit-esatta

GPT-6.1 Sol di OpenAI: Potenza quasi da Astra a una frazione del costo

Il Congresso Dovrebbe Indagare sui Laboratori di IA, Sostiene Cal Newport

Jeff: Modelli AI decisionali compatibili con Jev addestrati in casa raggiungono decisioni in 28ms

