Mini-AGI: L'apprendimento continuo su 8 GB di VRAM è ora possibile
AI News

Mini-AGI: L'apprendimento continuo su 8 GB di VRAM è ora possibile

5 min
21/09/2026
Mini-AGIcontinual learninglanguage model8GB VRAM

Mini-AGI: Un modello di apprendimento continuo che si adatta a una GPU da 8 GB

Un nuovo progetto open-source chiamato Mini-AGI sta sfidando l'idea che l'addestramento significativo di modelli linguistici richieda hardware su scala da data center. Sviluppato da Alexey Borsky, il sistema è un modello di apprendimento continuo a livello di byte che si addestra da zero su una singola GPU con 8 GB di VRAM, come una RTX 3070 Laptop, e continua ad apprendere da ogni pezzo di testo che legge, senza dimenticanza catastrofica.

Il progetto, pubblicato su Hacker News e che ha rapidamente raccolto 181 punti in 8 ore, non è solo un giocattolo. Mostra un'architettura sofisticata che scambia i pesi tra disco e VRAM, assembla dinamicamente la propria struttura e autoregola il proprio tasso di apprendimento. L'affermazione principale: un'IA veramente personale e in continuo apprendimento è possibile su hardware che la maggior parte degli sviluppatori già possiede.

Come funziona Mini-AGI

Mini-AGI opera su byte piuttosto che su token, utilizzando un vocabolario di 256 valori di byte più 9 marcatori strutturali. Questo elimina la necessità di un tokenizer e permette al modello di leggere direttamente qualsiasi tipo di file. L'architettura elabora ogni carattere attraverso due blocchi preludio densi e poi un blocco ricorrente applicato fino a 24 volte, con ogni applicazione che seleziona i propri primi 8 esperti da un pool condiviso.

Questo design si basa su tre meccanismi chiave:

  • Profondità adattiva (PonderNet): Una testa di arresto valuta ogni carattere a ogni livello e si ferma quando ulteriori calcoli non cambierebbero l'output. I caratteri facili richiedono una riga, quelli difficili molte. Questa profondità dinamica permette al modello di allocare il calcolo in modo efficiente.
  • Routing dinamico degli esperti: Ogni applicazione di blocco sceglie i propri primi 8 esperti da un pool che cresce e si pota da solo. Nessun esperto è assegnato a un argomento; il routing distribuisce la capacità in modo organico, consentendo al modello di combinare frammenti di più esperti per una singola previsione.
  • Paginazione su disco: I pesi sono memorizzati come file su disco, con solo un set di lavoro di 32 esperti (circa 109 milioni di parametri) residente nella VRAM in qualsiasi momento. Il numero di parametri è limitato dallo spazio su disco, non dalla VRAM, permettendo al modello di scalare ben oltre i 540 milioni di parametri che attualmente possiede.

Risolvere la dimenticanza catastrofica

Il risultato tecnico più significativo è affrontare la dimenticanza catastrofica, la tendenza delle reti neurali a sovrascrivere la conoscenza precedentemente appresa quando vengono addestrate su nuovi dati. Gli esperimenti di Borsky mostrano che l'addestramento ingenuo su un singolo argomento (scacchi) per 524.000 caratteri degrada le prestazioni su altri argomenti di +2,23 nats, conservando solo il 50,68% della conoscenza precedente.

La soluzione è stata sorprendentemente semplice: impostare il tasso di apprendimento del tronco a 0,1x il tasso degli esperti. Questo singolo cambiamento ha ridotto la dimenticanza a +0,0067 nats, conservando il 99,84% della conoscenza. Il tronco (embeddings, attenzione, router e testa di arresto) porta il 97,6% della norma del gradiente al quadrato, quindi rallentarlo impedisce che i componenti condivisi vengano sovrascritti.

Il progetto ha anche rivelato un'intuizione controintuitiva: il pool di esperti stesso non è ciò che previene la dimenticanza. Anche quando 93 dei 136 esperti sono stati congelati, il modello è comunque collassato. Il danno è spostamento, non distruzione: la conoscenza che sembra persa può essere recuperata 380 volte più velocemente alla rilettura, suggerendo che i pesi conservano informazioni a cui il routing semplicemente non può accedere.

continua a leggere sotto...

Architettura auto-assemblante e crescita

Mini-AGI non ha un'architettura fissa. Inizia piccolo e cresce nella sua forma. Il pool di esperti inizia con un piccolo numero di esperti e ne aggiunge di nuovi quando tutti e cinque i "freni" sono d'accordo: spazio, utilizzato, guadagno, adatto e onesto. I nuovi esperti vengono creati tramite ricombinazione, prendendo unità nascoste da esistenti, perché i cloni di un singolo genitore non sono abbastanza nuovi e gli esperti casuali sono inutili.

La potatura è altrettanto intelligente. Il sistema tiene traccia di quanto tempo è passato da quando un esperto è stato selezionato, non del suo valore di gate. Borsky ha scoperto che il gate è "anti-preditivo": i gate più piccoli appartengono agli esperti più occupati, mentre esperti con gate alto possono essere morti per centinaia di migliaia di segmenti. Questa intuizione, che ha richiesto una settimana per essere risolta, è uno dei risultati più preziosi del progetto.

Benchmark e scaling

A 318,1 milioni di caratteri letti, il modello raggiunge una perdita su dati esclusi di 0,8336 nats/carattere (1,2026 bit/byte) su otto argomenti. L'argomento con le migliori prestazioni sono gli scacchi (0,552 nats), mentre Wikipedia rimane il più difficile (1,280 nats). Lo scaling dei dati del modello segue una legge di potenza pulita con esponente -0,239, tra lo 0,095 di Kaplan e lo 0,28 di Chinchilla, con R² di 0,96.

Rispetto a MambaByte-353M, che ha letto 94 volte più dati, Mini-AGI mostra uno scaling promettente. La tendenza adattata suggerisce che raggiungere 1,00 BPB sulla propria miscela richiederebbe 0,75 miliardi di byte, circa 6 giorni di addestramento su una GPU laptop. Questo mette le prestazioni vicine alla frontiera alla portata degli hobbisti.

Implicazioni pratiche

Le implicazioni di Mini-AGI vanno oltre la novità tecnica. Rappresenta un cambiamento verso un'IA veramente personale, modelli che si addestrano sui tuoi dati, sul tuo hardware e continuano ad apprendere da ogni conversazione. Il progetto include un semplice comando per leggere i tuoi file, con una modalità di prova per impostazione predefinita e un punteggio su dati esclusi per verificare che nessuna conoscenza venga persa.

L'autore riconosce che il modello è attualmente "a livello di giocattolo" e non competitivo con i modelli all'avanguardia. Ma il punto è diverso: dimostra che l'apprendimento continuo da un singolo flusso di dati è possibile su hardware modesto. Come scrive Borsky, "le capacità sarebbero limitate dall'hardware effettivo, dalla scala e qualità dei dati disponibili e dalla quantità di tempo che si è disposti a dedicare all'addestramento del modello."

Per iniziare

Il progetto è completamente open-source sotto licenza MIT. Per eseguirlo, hai bisogno di una GPU compatibile con CUDA con 8 GB di VRAM e Python 3.10+. La configurazione prevede la clonazione del repository, l'installazione delle dipendenze e la costruzione del corpus (o puntarlo ai tuoi file). I pesi non sono ancora pubblicati: l'esecuzione attuale è ancora al primo passaggio sul corpus, ma il codice è pronto per la sperimentazione.

Per ricercatori e hobbisti, Mini-AGI offre una finestra unica sull'architettura dinamica, l'apprendimento continuo e i limiti pratici dell'hardware consumer. È un promemoria che il futuro dell'IA non riguarda solo la scala, ma l'adattabilità.