Anthropic riscrive l'ingegneria del contesto per Claude 5: meno regole, più giudizio
Anthropic ha fondamentalmente riscritto il manuale su come gli sviluppatori dovrebbero guidare la sua ultima generazione di modelli AI. In un post dettagliato del membro dello staff di Anthropic Thariq Shihipar, l'azienda rivela di aver rimosso oltre l'80% del prompt di sistema di Claude Code per i suoi modelli più recenti, inclusi Claude Opus 5 e Claude Fable 5, senza alcuna perdita misurabile nelle prestazioni di valutazione della codifica.
Il cambiamento rappresenta un importante cambiamento filosofico nel modo di affrontare ciò che Anthropic chiama "ingegneria del contesto"—l'assemblaggio di prompt di sistema, competenze, file CLAUDE.md e memoria che modellano il comportamento di un modello. Invece di accumulare vincoli, il nuovo mantra è fidarsi del giudizio del modello.
La fine del sovra-vincolo
Anthropic ha scoperto che il suo approccio precedente stava attivamente danneggiando le prestazioni. Trascrizioni interne dell'uso di Claude Code mostravano messaggi contrastanti in singole richieste, come "lascia la documentazione come appropriato" insieme a "NON aggiungere commenti," costringendo il modello a spendere sforzo cognitivo per conciliare contraddizioni.
"Stavamo sovra-vincolando Claude Code, sia attraverso il nostro prompt di sistema che nei nostri file CLAUDE.md e competenze," ha scritto Shihipar. La nuova generazione di modelli, che include il recentemente rilasciato Claude Opus 5 e il precedente Claude Fable 5, ora ha un giudizio migliore e può gestire decisioni senza regole esplicite.
Nei benchmark, il miglioramento è netto. Claude Opus 5 ha ottenuto il 43,3% su FrontierBench v0.1 al massimo sforzo, rispetto al 18,7% di Opus 4.8 e al 33,7% di Fable 5. All'impostazione di sforzo più alta 'xhigh', Opus 5 ha raggiunto una ricompensa media del 44,4%.
Dalle regole alle interfacce
Uno dei cambiamenti più significativi riguarda il modo in cui gli sviluppatori dovrebbero progettare strumenti per Claude. La vecchia regola era fornire esempi di come utilizzare gli strumenti. La nuova regola: progettare interfacce migliori.
"Con i nostri modelli più recenti, abbiamo scoperto che fornire esempi li vincola effettivamente a un certo spazio di esplorazione," ha spiegato Shihipar. Invece, gli sviluppatori dovrebbero pensare al design dei loro strumenti, script e file—quali parametri ha Claude e come possono essere più espressivi?
Ad esempio, una semplice enumerazione di valori di stato come pending, in_progress e completed suggerisce a Claude come utilizzare uno strumento senza bisogno di istruzioni esplicite. L'azienda raccomanda anche di inserire le istruzioni degli strumenti nelle descrizioni degli strumenti stessi piuttosto che nel prompt di sistema.
Divulgazione progressiva e auto-memoria
Anthropic ora sostiene la divulgazione progressiva—caricare il contesto giusto al momento giusto piuttosto che caricare tutto in anticipo. Claude Code è diventato competente nel chiamare selettivamente competenze e strumenti solo quando necessario, utilizzando funzionalità come caricamento differito e ToolSearch.
"Un mito comune è che si voglia rendere il proprio CLAUDE.md un repository centrale per ogni pratica nota che si potrebbe incontrare," ha notato Shihipar. Invece, gli sviluppatori dovrebbero considerare un albero di file che possono essere caricati al momento giusto.
Per la memoria, la vecchia pratica di salvare manualmente note nei file CLAUDE.md è stata sostituita dall'auto-memoria. Claude ora salva automaticamente memorie rilevanti senza intervento dell'utente, eliminando la necessità di prendere appunti manuali tramite il tasto #.
Consigli pratici per gli sviluppatori
La guida di Anthropic per gli sviluppatori che utilizzano Claude Code o costruiscono i propri agenti include diversi cambiamenti chiave:
- Mantieni CLAUDE.md leggero: Concentrati su peculiarità specifiche del codice, non su informazioni ovvie. Evita di dichiarare ciò che Claude può vedere nel file system.
- Progetta le competenze come guide: Le competenze dovrebbero codificare opinioni particolari o migliori pratiche, ma evita di sovra-vincolarle. Usa la divulgazione progressiva per competenze lunghe suddividendole in più file.
- Usa riferimenti ricchi: Invece di semplici file markdown, Claude ora può fare riferimento ad artefatti HTML, codice, suite di test o persino interi codebase. Una specifica potrebbe essere una suite di test dettagliata piuttosto che un documento.
- Esegui `claude doctor`: Anthropic ha rilasciato un nuovo comando che taglia automaticamente configurazioni gonfiate, rimuovendo vincoli obsoleti e contraddizioni.
Per coloro che costruiscono i propri harness per agenti, il prompt di sistema rimane critico. "Un prompt di sistema è fortemente legato al contesto del prodotto. Dice a Claude in quale prodotto sta operando e cosa sta facendo," ha scritto Shihipar.
Modifiche sostanziali e specifiche del modello
Il rilascio di Claude Opus 5, che supporta una finestra di contesto di 1 milione di token e un output massimo di 128k token, porta cambiamenti notevoli. Il pensiero è ora attivo per impostazione predefinita e il parametro di sforzo controlla la profondità. Una modifica sostanziale: impostare thinking: {"type": "disabled"} con sforzo xhigh o max restituisce un errore 400.
Anthropic avverte anche gli sviluppatori di eliminare i loro prompt di verifica. Istruzioni come "includi un passaggio di verifica finale" ora causano una verifica eccessiva, perché il modello verifica già il proprio lavoro. Il prompt minimo memorizzabile nella cache scende a 512 token, da 1.024, rendendo la memorizzazione nella cache più accessibile.
Un dettaglio notevole del benchmark: i classificatori di sicurezza di Opus 5 hanno segnalato e rifiutato il 5% delle chiamate API nel 4% delle prove, mentre i classificatori di Fable 5 hanno segnalato il 42% delle chiamate nel 26% delle prove—una differenza significativa nel comportamento di sicurezza tra i due modelli.
Il punto fondamentale
Il messaggio principale di Anthropic è chiaro: smettete di trattare il modello come una macchina che segue regole e iniziate a trattarlo come un agente di ragionamento. "Dategli l'obiettivo, non un regolamento—lasciategli usare il giudizio," consiglia Shihipar. "Quando esagera, rimuovete le istruzioni—non aggiungetele."
Per gli sviluppatori che hanno accumulato anni di saggezza sui prompt per modelli più vecchi e deboli, il consiglio è semplice: eliminate le regole obsolete, cancellate le contraddizioni e testate di nuovo. La nuova generazione di modelli Claude non ha più bisogno delle rotelle.
Related News

L'AI open-weight segue la traiettoria di Kubernetes in mezzo alle tensioni geopolitiche

Istituti per la sicurezza dell'IA del Regno Unito e degli Stati Uniti scoprono che Kimi K3 si avvicina alla frontiera nelle capacità informatiche, ma è in ritardo nell'esecuzione degli exploit

I Giganti della Tecnologia Mettono in Guardia contro l'Eccessiva Regolamentazione dei Modelli AI a Peso Aperto

Fondatori di Startup Esortano gli USA a Mantenere Accessibile l'AI Open-Weight Cinese

