Kev: Clone Open-Source di Jev Porta i Modelli Decisionali sul Tuo Hardware
AI News

Kev: Clone Open-Source di Jev Porta i Modelli Decisionali sul Tuo Hardware

5 min
22/09/2026
Kev AIJev cloneQwen3.5decision models

Il modello Jev di TypeSafe AI, con i suoi tempi decisionali inferiori a 500 millisecondi e costi di output quasi nulli, ha suscitato un notevole interesse nella comunità AI. Ma per gli sviluppatori che preferiscono mantenere i propri dati e l'inferenza sulla propria infrastruttura, un nuovo progetto open-source sta colmando il divario. Kev, creato da Jared Palmer, è una famiglia di piccoli modelli decisionali basati su Qwen3.5 che replica l'architettura e l'API di Jev, offrendo un percorso pratico per eseguire questi efficienti classificatori localmente.

Il progetto, che ha già attirato oltre 1.300 stelle su GitHub, fornisce modelli pre-addestrati in tre dimensioni—0,8B, 4B e 9B—insieme a codice di addestramento e una suite di valutazione congelata. Tutti i pesi sono rilasciati sotto la permissiva licenza Apache-2.0 e l'API è progettata per rispecchiare l'interfaccia System One di TypeSafe, il che significa che gli sviluppatori possono puntare l'SDK Python di TypeSafe al proprio server Kev senza modifiche.

Cosa Rende Diverso Kev

L'innovazione principale di Kev risiede nel modo in cui gestisce il processo decisionale strutturato. Invece di generare token di testo, il modello esegue un singolo passaggio in avanti e legge i logit solo per le opzioni consentite. Questo approccio, condiviso da altri cloni di Jev, elimina la necessità di generazione autoregressiva, rendendo le decisioni drasticamente più veloci ed economiche. Su una singola RTX 3090, ad esempio, SemIf—un altro clone di Jev—risponde a 21 criteri sì/no in 1,023 secondi, rispetto ai 5,332 secondi di un approccio generativo.

Kev estende questo concetto con un formato di domanda flessibile. Una singola richiesta può includere tre tipi di domande: noul (sì/no), choice (scelta multipla) e score (valutazione). Tutte le domande condividono lo stesso testo di input ma sono isolate l'una dall'altra, prevenendo la contaminazione incrociata delle informazioni. Ciò è ottenuto tramite un'attenta mascheratura dell'attenzione o, per l'architettura ibrida di Qwen3.5, eseguendo ogni domanda come una riga indipendente con cache dello stato condiviso.

Prestazioni e Requisiti Hardware

I modelli sono progettati per funzionare su hardware consumer. Le varianti 4B e 9B possono essere eseguite su un Mac da 32 GB utilizzando la precisione bf16, sebbene le prestazioni varino significativamente a seconda della piattaforma. Su un Apple M5, una richiesta di cinque domande con uno stato di circa 230 token richiede circa 779 ms per Kev-4B, mentre il modello 9B impiega circa 2 secondi. Gli utenti CUDA con GPU H100 vedono risultati molto più rapidi, con richieste completate in decine di millisecondi.

Per gli sviluppatori che necessitano di bassa latenza su Apple Silicon, i precedenti modelli basati su Qwen3 rimangono disponibili e sono significativamente più veloci, sebbene non siano più in fase di sviluppo attivo. Un backend MLX per i modelli Qwen3.5 è elencato come prossima modifica pianificata.

Accuratezza e Calibrazione

I risultati di valutazione di Kev mostrano un'accuratezza promettente, in particolare su nuove fonti di dati mai viste. Kev-9B raggiunge 0,812 di accuratezza sui set di sviluppo e 0,837 sui set di test per nuove fonti, rimanendo indietro rispetto a Jev ospitato di circa 4,5 punti. Il modello mostra anche una buona calibrazione su questi compiti, con un punteggio Brier di 0,291 sui dati di sviluppo.

Tuttavia, il progetto è trasparente riguardo ai suoi limiti. Le probabilità non sono ben calibrate su nuove fonti—Kev-4B assegna una probabilità di almeno 0,9 a una risposta errata sull'8,2% delle domande. La messa a punto può anche degradare le capacità del modello di base, in particolare l'aritmetica delle date e i compiti basati sulla conoscenza, dove Kev-9B ottiene 0,74 su MMLU rispetto allo 0,90 di Jev.

continua a leggere sotto...

Addestramento e Personalizzazione

Una delle caratteristiche più interessanti di Kev è la possibilità di mettere a punto i modelli su dati personalizzati. I checkpoint rilasciati sono stati addestrati su un mix di dataset pubblici ed esempi di policy generati, ma gli utenti possono facilmente adattarli ai propri domini. Una breve messa a punto su poche centinaia di esempi etichettati spesso produce miglioramenti significativi rispetto alla sola ingegneria dei prompt.

Il processo di addestramento utilizza adattatori LoRA con rango 16 e una piccola testa puntatrice, mantenendo congelato il modello base Qwen. Questo approccio è abbastanza efficiente da funzionare su una singola H100 tramite Modal, con l'addestramento del modello 4B che richiede circa un'ora. Il progetto include anche un flag --init_from che consente agli utenti di partire da un checkpoint rilasciato, preservando la conoscenza esistente mentre si aggiungono nuove competenze di dominio.

L'Ecosistema Crescente dei Cloni di Jev

Kev fa parte di un movimento più ampio per replicare l'architettura di Jev. Altri progetti degni di nota includono SemIf (2.685 stelle, basato su Qwen3.5-4B), jevlike (1.122 stelle, con un codificatore a livello di byte) e openjev (240 stelle, basato su DiffusionGemma). Ognuno adotta un approccio leggermente diverso, ma tutti condividono il principio fondamentale di leggere i logit direttamente anziché generare token.

La rapida comparsa di questi cloni evidenzia una crescente domanda di modelli decisionali efficienti ed eseguibili localmente. Per le aziende preoccupate per la privacy dei dati o i costi di inferenza, Kev offre un'alternativa valida ai servizi ospitati. La licenza Apache-2.0 del progetto e la suite di valutazione pubblica lo rendono anche una base attraente per ulteriori ricerche e sviluppi.

Come Iniziare con Kev

Per iniziare a usare Kev, gli sviluppatori necessitano di Python 3.12+ e del gestore di pacchetti uv. Il processo di configurazione è semplice:

git clone https://github.com/jaredpalmer/kev.git && cd kev
uv sync --extra serve
KEV_DTYPE=bf16 uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b --port 8009

Una volta che il server è in esecuzione, l'invio di un ticket di supporto con più domande restituisce probabilità strutturate per ogni decisione. Il playground, costruito con Next.js, fornisce un'interfaccia visiva per testare diversi formati di domanda e ordini di opzioni, inclusa una demo di scacchi che mostra le capacità decisionali del modello.

Kev rappresenta un passo significativo verso la democratizzazione dell'accesso a modelli decisionali efficienti. Fornendo pesi aperti, valutazione trasparente e la possibilità di mettere a punto su dati personalizzati, consente agli sviluppatori di costruire e distribuire sistemi decisionali basati su AI alle proprie condizioni.