Reflection AI presenta Beam: un modello open-weight da 501B progettato per il ragionamento efficiente
Reflection AI entra nell'arena open-weight con Beam
Il 5 ottobre 2026, Reflection AI ha annunciato Beam, il suo primo modello open-weight, segnando un ingresso significativo nel panorama competitivo dell'AI open-source. Beam è un modello sparse Mixture-of-Experts (MoE) con 501 miliardi di parametri totali, ma solo 23 miliardi attivi per token. Questa architettura è progettata per offrire elevate capacità mantenendo gestibili i costi di inferenza.
Il modello è stato costruito con un duplice focus sul pre-addestramento e sull'apprendimento per rinforzo (RL). Reflection ha pre-addestrato Beam su 23,8 trilioni di token curati dal web e da dataset con licenza proprietaria. L'azienda ha quindi condotto un'enorme esecuzione di RL ad alto calcolo, generando oltre 100 milioni di rollout su 10.5K GPU NVIDIA GB300 per quattro settimane. Questa combinazione mira a produrre un modello che sia sia competente che abile in compiti complessi di ragionamento e agentici.
Capacità e prestazioni di benchmark
Lo sviluppo di Beam ha dato priorità ai carichi di lavoro di codifica e agentici, e i risultati dei benchmark riflettono questo focus. Su SWEBench Verified, Beam ha ottenuto un punteggio di 80,9, superando modelli come Inkling (77,6) e Nemotron 3 Ultra (70,7). Su Terminal Bench v2.1, ha raggiunto 80,1, competitivo con GLM 5.2 (81,0) e vicino a Qwen 3.8-Max (86,6).
Nei compiti di ragionamento, Beam ha registrato numeri solidi: 97,8 su AIME 2026, 90,5 su GPQA Diamond e 36,2 su Humanity's Last Exam (senza strumenti). Questi punteggi lo collocano nella fascia alta dei modelli open-weight, sebbene sia inferiore a modelli all'avanguardia come Kimi K3 in termini di capacità grezze. Reflection riconosce questo, posizionando il vantaggio di Beam nell'efficienza dell'inferenza piuttosto che nelle prestazioni assolute.
Il vantaggio dell'efficienza: 3-4x meno calcolo
Un punto di forza chiave per Beam è la sua efficienza. Reflection afferma che Beam raggiunge punteggi comparabili a GLM 5.2 su benchmark di ragionamento avanzato utilizzando 3-4 volte meno calcolo di inferenza. Questa efficienza è ancora più pronunciata se confrontata con modelli più grandi come Qwen 3.8-Max, che richiedono significativamente più calcolo per token.
Questa efficienza è in parte dovuta all'architettura MoE—solo 23B parametri sono attivi per token—e in parte alle innovazioni nell'addestramento. Reflection ha implementato una penalità di lunghezza controllabile durante l'RL che premia le soluzioni di successo scoraggiando token non necessari. Ciò si traduce in un modello in grado di adattare il suo sforzo di ragionamento in base al compito, offrendo un "parametro di sforzo di ragionamento" per gli utenti per bilanciare velocità e profondità.
Scalare l'apprendimento per rinforzo a nuovi livelli
L'infrastruttura RL di Reflection è un importante risultato tecnico. L'azienda ha implementato 10.5K GPU NVIDIA GB300 per quattro settimane, generando oltre 100 milioni di rollout con una lunghezza massima del contesto di 256K token. Hanno utilizzato circa 1,3 miliardi di sandbox e hanno raccolto un milione di ambienti di codifica, agentici e STEM di alta qualità.
Per mantenere la stabilità a questa scala, Reflection ha sviluppato nuovi algoritmi per gestire l'obsolescenza delle politiche nei gradienti di politica asincroni. Anche con un'obsolescenza di un giorno—107 versioni di peso dietro la politica corrente—l'addestramento è rimasto numericamente stabile. L'infrastruttura ha anche supportato una media di 110.000 rollout concorrenti, con aggiornamenti rapidi del modello (mediana di 12 secondi) e resilienza ai fallimenti di inferenza (71 incidenti gestiti senza terminare l'addestramento).
Innovazioni nel pre-addestramento e nell'architettura
Il pre-addestramento di Beam è stato completato in meno di quattro settimane su 6.144 GPU NVIDIA GB300 NVL72. Reflection ha costruito quasi l'intero stack infrastrutturale internamente, inclusi uno scheduler consapevole della topologia e un sistema di rilevamento della corruzione silenziosa dei dati. L'esecuzione ha raggiunto un buon rendimento del 92,3% verso la fine, a testimonianza della robustezza dei loro sistemi.
Dal punto di vista architetturale, Beam incorpora attenzione locale e globale intervallata, esperti instradati con granularità fine e molteplici tecniche di bilanciamento del carico. Il risultato è un'utilizzazione quasi uniforme degli esperti (l'esperto più occupato con un carico di 1,04x), che garantisce che tutti gli esperti siano utilizzati efficacemente durante il ragionamento. Il flusso residuo è gestito attentamente con scaling basato sulla profondità e accumulo FP32 per mantenere una propagazione del segnale sana attraverso tutti i 52 strati.
Approccio alla sicurezza e all'allineamento
Reflection ha utilizzato un metodo di distillazione on-policy multi-insegnante (MOPD) per fondere le capacità di un insegnante RL su larga scala e un insegnante di sicurezza dedicato. I principi di sicurezza sono organizzati in tre livelli: regole da non infrangere, qualità da soddisfare costantemente e stile di interazione predefinito.
L'addestramento alla sicurezza ha utilizzato tecniche di allineamento deliberativo, incorporando la politica di sicurezza direttamente nel ragionamento del modello. Il dataset è stato costruito in modo avversariale, con ogni round che generava prompt che elicitavano comportamenti dannosi o di rifiuto eccessivo e incorporando gli attacchi riusciti nel mix di addestramento. Reflection prevede di rilasciare come open-source le valutazioni di sicurezza sviluppate internamente.
Disponibilità e roadmap
Beam è attualmente nella fase finale di red-teaming, con accesso anticipato disponibile tramite una lista d'attesa sulla piattaforma di Reflection. I pesi completi, il rapporto tecnico, la scheda del modello e gli artefatti per sviluppatori sono programmati per il rilascio entro la fine di ottobre 2026 con licenza Apache 2.0.
Reflection prevede di lanciare Beam con un ampio ecosistema di partner di distribuzione e integrazioni con librerie open-source. Questo è il primo modello di una serie pianificata, con Reflection che sta già addestrando il suo successore. L'obiettivo è avvicinare la frontiera open alla frontiera dell'intelligenza con ogni rilascio.
Beam rappresenta un passo significativo per l'AI open-weight occidentale, offrendo un'alternativa competitiva ai modelli di laboratori cinesi come GLM e Qwen. La sua efficienza e le forti prestazioni in codifica e agentici lo rendono un'opzione interessante per aziende e sviluppatori alla ricerca di un modello potente ma economico.
Related News

OpenAI pubblica 722 articoli matematici generati dall'AI in una spinta alla trasparenza senza precedenti

EmbeddingGemma 2 di Google: Embedding Multimodali su Dispositivo per l'AI Edge

Il rapporto del diario di Claude di Anthropic porta a un'accusa penale per una donna della Florida

Glitch software F1 2026 scatena le proteste dei piloti al GP del Bahrain

Il Responsabile della Sicurezza di OpenAI si Dimette, Definisce la Cultura 'Rotta'

