Ollaya: Esegui Modelli Decisionali in Stile Jev Localmente a Velocità Millisecondali
AI News

Ollaya: Esegui Modelli Decisionali in Stile Jev Localmente a Velocità Millisecondali

5 min
26/09/2026
OllayaDecision ModelsLocal AIOpen Source

Nel panorama in rapida evoluzione dell'AI, un nuovo progetto open-source sta facendo scalpore portando i modelli decisionali—una classe specializzata di AI che fornisce risposte tipizzate e calibrate—su hardware locale. Ollaya, che ha recentemente raggiunto la prima pagina di Hacker News, viene descritto come "Ollama per modelli decisionali open-source in stile Jev." Il progetto promette di consentire agli sviluppatori di eseguire sofisticate intelligenze decisionali sulle proprie macchine, con latenze misurate in millisecondi, mantenendo al contempo i dati privati.

Cos'è Ollaya?

Ollaya è un runtime e un hub di modelli che scarica e serve modelli decisionali aperti localmente. I modelli decisionali, a differenza degli LLM generativi, rispondono a domande strutturate come "Qual è l'intento di questo messaggio del cliente?" o "Questa richiesta è urgente?" con un punteggio di probabilità. Invece di generare token uno per uno, questi modelli eseguono un singolo passaggio in avanti, rendendoli eccezionalmente veloci.

Il progetto è attualmente in beta e offre un'app desktop, uno strumento da riga di comando e un'immagine Docker per server. Supporta macOS, Windows, Linux e persino WSL 2, con accelerazione GPU NVIDIA disponibile sulle piattaforme supportate. Il runtime è concesso in licenza Apache-2.0 e tutti i pesi dei modelli vengono prelevati direttamente dai repository Hugging Face degli autori, fissati a commit specifici e verificati con hash sha256.

Prestazioni Fulminee

La caratteristica principale di Ollaya è la sua velocità. Su una singola NVIDIA RTX 4090, una richiesta di cinque domande al modello Laya richiede circa 8–10 millisecondi end-to-end tramite l'API HTTP. Questo è un miglioramento significativo rispetto alle alternative ospitate. Ad esempio, l'API ospitata TypeSafe Jev ha una latenza mediana delle richieste di 236–276 ms nei benchmark di terze parti, che include il sovraccarico di rete. Anche modelli più piccoli come decider:0.8b funzionano in circa 155 ms localmente, mentre il più grande decider:2b impiega circa 190 ms.

Questo vantaggio prestazionale è un punto di svolta per le applicazioni in tempo reale. Nell'assistenza clienti, nel rilevamento di frodi o in qualsiasi scenario in cui le decisioni devono essere prese istantaneamente, l'inferenza sub-20ms apre la porta all'elaborazione in linea che sarebbe impossibile con modelli più lenti che generano token.

Compatibilità Drop-in con TypeSafe

Una delle mosse più strategiche di Ollaya è la sua compatibilità con l'API di TypeSafe. Il progetto serve gli endpoint /v1/systemone e /v1/models con forme esatte di richiesta e risposta che corrispondono a quelle di TypeSafe. Ciò significa che l'SDK Python ufficiale di TypeSafe (versione 0.7.1) funziona senza modifiche contro un server Ollaya locale.

Gli sviluppatori possono semplicemente impostare TYPESAFE_BASE_URL=http://localhost:11435, utilizzare qualsiasi chiave API fittizia e puntare il loro modello predefinito a laya. Questa compatibilità drop-in abbassa la barriera all'adozione, consentendo ai team di passare da un servizio ospitato a una soluzione locale e privata senza riscrivere il loro codice.

continua a leggere sotto...

Modelli Aperti, Pronti da Scaricare

Ollaya viene fornito con un set curato di modelli a pesi aperti, ciascuno ottimizzato per diverse attività decisionali:

  • Laya (da Convai Innovations): Disponibile in inglese e in una versione multilingue con oltre 100 lingue, ottimizzato per decisioni tipizzate. Dimensioni: 322M e 421M parametri.
  • decider (di Mapika): Basato su Qwen3.5, questo modello legge la risposta dai logit delle lettere delle opzioni in un singolo passaggio in avanti. È pubblicizzato come il modello decisionale aperto più accurato fornito da Ollaya. Dimensioni: 0.75B e 1.9B.
  • nli (di Moritz Laurer): Classificatori zero-shot che valutano ogni opzione come un'ipotesi per l'implicazione. Dimensioni: 396M e 435M.
  • gliclass (di Knowledgator): Un classificatore zero-shot che segue le istruzioni e valuta tutte le opzioni di una domanda in un unico passaggio, quindi il costo cresce a malapena con il numero di opzioni. Dimensione: 439M.

Sono previsti più modelli, tra cui von e modelli decisionali basati su LLM GGUF tramite llama.cpp, che potrebbero espandere ulteriormente l'ecosistema.

Privacy e Calibrazione

Ollaya si posiziona come un'alternativa incentrata sulla privacy. Poiché tutto viene eseguito localmente, i dati sensibili come ticket, email e messaggi degli utenti non lasciano mai la macchina. Il server ascolta su 127.0.0.1 per impostazione predefinita e non ci sono commissioni per token o misurazioni.

La calibrazione è un altro punto chiave. Il progetto afferma che l'errore di calibrazione (ECE) di Laya è 0,081 dopo l'adattamento della temperatura, rispetto a 0,246 per Jev. Ciò significa che le probabilità restituite da Laya sono più affidabili, consentendo agli sviluppatori di impostare soglie con sicurezza.

Supporto della Piattaforma e Installazione

Ollaya mira a essere facile da installare. Un singolo binario e il comando ollaya run laya ti fanno iniziare. Ecco una rapida panoramica del supporto della piattaforma:

PiattaformaApp DesktopRiga di ComandoGPU
macOS Apple siliconSì (.dmg)SìSolo CPU
Windows 10/11 x64Sì (.exe/.msi)Sì (PowerShell)NVIDIA tramite WSL 2
Linux x86-64Sì (AppImage, .deb, .rpm)Sì (script di installazione, systemd)NVIDIA, CUDA 13
Linux ARM64NoSìSolo CPU
WSL 2 LinuxNoSìNVIDIA, CUDA 13
Docker amd64/arm64NoSì (GHCR)NVIDIA (CUDA 13)

Le GPU NVIDIA richiedono il driver R580 o successivo. Gli installer recuperano automaticamente le librerie CUDA solo quando viene rilevata una GPU compatibile.

Perché è Importante

L'emergere di Ollaya segnala una tendenza più ampia nell'AI: il passaggio da modelli centralizzati e ospitati ad alternative locali e aperte. Combinando la velocità dei modelli decisionali con la privacy dell'esecuzione locale, affronta due dei principali punti dolenti per le aziende: latenza e sovranità dei dati.

Il progetto ha già catturato l'attenzione della comunità degli sviluppatori, raggiungendo il #1 su Hacker News. La sua compatibilità drop-in con TypeSafe potrebbe accelerare l'adozione, poiché i team possono testare il terreno senza impegnarsi in una migrazione completa.

Sebbene Ollaya sia ancora in beta, la sua tabella di marcia e la sua esecuzione suggeriscono che potrebbe diventare un punto fermo nel kit di strumenti dell'intelligenza decisionale. Per gli sviluppatori che cercano di costruire sistemi decisionali reattivi, privati ed economici, Ollaya è un progetto da tenere d'occhio.