Anthropic ha presentato ufficialmente Claude Fable 5.1 e Claude Mythos 5.1, la nuova evoluzione dei suoi modelli più avanzati per coding, knowledge work, ricerca scientifica e attività agentiche di lunga durata.
La distinzione tra i due modelli è particolare: Fable 5.1 e Mythos 5.1 condividono lo stesso modello sottostante, ma utilizzano livelli differenti di safeguard. Fable 5.1 è disponibile generalmente, mentre Mythos 5.1 è riservato a organizzazioni e professionisti verificati attraverso programmi di accesso dedicati alla cybersecurity e alle life sciences.
Anthropic descrive Fable 5.1 come il proprio modello generalmente disponibile più capace per attività ambiziose e di lunga durata. L'annuncio ufficiale di Anthropic mette soprattutto in evidenza coding agentico, problem solving prolungato, ricerca scientifica e una maggiore efficienza economica nei workload che riutilizzano molto contesto.
Un modello pensato per lavorare per ore
La novità più importante di Fable 5.1 non riguarda semplicemente la qualità della risposta a un singolo prompt. Il modello è stato progettato per mantenere il controllo di task complessi durante sequenze molto più lunghe, utilizzando strumenti, verificando il proprio lavoro e recuperando quando uno step fallisce.
Anthropic cita attività che possono durare ore e attraversare applicazioni differenti: elaborare backlog, operare tramite browser, lavorare autonomamente come managed agent o affrontare modifiche software che coinvolgono un intero codebase.
Nel coding, Fable 5.1 può scrivere test per verificare autonomamente le proprie modifiche, utilizzare capacità visive per confrontare un risultato con il design originale e proseguire con cicli di verifica senza richiedere costante supervisione umana.
Anche la configurazione dell'effort diventa importante. Anthropic afferma che, impostato su Low o Medium effort, Fable 5.1 può raggiungere risultati simili o superiori a Fable 5 con un costo inferiore. Claude Code utilizza High effort di default, mentre Claude Cowork e Claude.ai utilizzano Medium.
I benchmark di Claude Fable 5.1
Anthropic ha pubblicato un confronto tra Fable 5.1, Fable 5, Opus 5 e GPT-5.6 Sol su benchmark dedicati a ricerca scientifica agentica, coding, computer use, reasoning e workflow aziendali.
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 Agentic scientific research | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 Agentic coding | 55.8% 60.9% Mythos 5.1 | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 Knowledge work | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 Computer use — partial | 77.9% | 72.9% | 75.4% | — |
| OSWorld 2.0 Computer use — strict | 41.7% | 36.1% | 39.6% | — |
| Humanity's Last Exam Multidisciplinary reasoning — no tools | 60.9% | 57.8% | 56.6% | — |
| Humanity's Last Exam Multidisciplinary reasoning — with tools | 65.0% | 63.8% | 63.6% | — |
| AutomationBench Business workflows | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 Agentic coding | 73.4% | 70.5% | 70.0% | 67.2% |
Dove si vede il salto generazionale
Il risultato più evidente arriva da Terminal-Bench-Science 0.1. Nel setup utilizzato da Anthropic, Fable 5.1 raggiunge il 52,6%, rispetto al 24,7% di Fable 5: un miglioramento di quasi 28 punti percentuali.
Anthropic invita però a interpretare il dato con cautela: su Terminal-Bench-Science l'errore standard dichiarato è compreso tra ±3,5 e ±4,5 punti per modello. Il leaderboard pubblico, con tre trial per task e Claude Code come harness, assegna inoltre 30,0% a Opus 5 e 21,4% a Fable 5; il setup Anthropic riproduce rispettivamente 29,0% e 24,7%, risultati considerati entro il margine di rumore.
Il miglioramento è rilevante anche su AutomationBench, dove Fable 5.1 raggiunge il 31,4% contro il 17,1% di Fable 5. Su Terminal-Bench 4.0, Fable 5.1 arriva al 55,8%, mentre Mythos 5.1 raggiunge il 60,9%.
La differenza tra Fable e Mythos è particolarmente interessante perché i due condividono lo stesso underlying model. Anthropic spiega che il gap deriva da task nei quali i safeguard cybersecurity della versione Fable sono intervenuti. L'azienda si aspetta che questa differenza diminuisca con la nuova generazione di controlli più precisi.
Su CursorBench 3.2.0, dedicato al coding agentico, Fable 5.1 raggiunge il 73,4%, contro il 70,5% di Fable 5, il 70,0% di Opus 5 e il 67,2% di GPT-5.6 Sol.
Una nota importante sui benchmark
Fable 5.1 è stato valutato con i safeguard di produzione attivi. Anthropic specifica che quando tali controlli sono intervenuti su determinati task, Fable 5.1 e Fable 5 hanno ricevuto uno zero su OSWorld 2.0 e Fable 5 ha ricevuto uno zero su AutomationBench.
Negli altri casi di intervento, i task cybersecurity sono stati completati da Claude Opus 4.8 e quelli di biologia da Claude Opus 5. Questo significa che i safeguard possono ridurre artificialmente le performance riportate per Fable nei benchmark che includono attività sensibili.
Anche i risultati di OSWorld 2.0 richiedono cautela: utilizzano la release dei task di agosto 2026 e Anthropic ha rieseguito Fable 5 e Opus 5 alle stesse condizioni. Poiché i file dei task sono differenti dalle release precedenti, questi numeri non sono direttamente confrontabili con vecchi risultati OSWorld.
I test nel mondo reale
Oltre ai benchmark standardizzati, Anthropic ha pubblicato diversi risultati riportati dai partner early-access.
Millennium racconta un caso particolarmente interessante: un crash estremamente raro, circa uno ogni milione di esecuzioni, non era stato spiegato dal team per quattro o cinque anni. Secondo l'azienda, Fable 5.1 è stato il primo modello a individuarne la causa analizzando una libreria esterna, confrontandola con il core dump e riconducendo il problema a un bug della libreria stessa.
MongoDB riferisce invece che Fable 5.1 ha realizzato un prototipo complesso in circa tre giorni, partendo dall'analisi dei servizi e della documentazione e procedendo poi per ore senza supervisione attraverso cicli di verifica autonomi.
Ramp ha riportato una sessione non supervisionata durata 38 ore su un problema di machine learning. Secondo l'azienda, il modello ha identificato un artefatto nelle label, corretto il problema, avviato sei esperimenti paralleli durante la notte e restituito risultati e passi successivi.
Browserbase dichiara invece che Fable 5.1 ha completato l'82% dei task nel proprio benchmark interno più difficile per browser agent, contro il 74% di Opus 5 e il 57% di Fable 5.
Questi dati sono valutazioni interne riportate dai partner e non benchmark indipendenti standardizzati: sono quindi utili soprattutto per comprendere il tipo di workload su cui le aziende stanno sperimentando il modello.
La ricerca scientifica diventa centrale
Una parte importante dell'annuncio è dedicata alle capacità scientifiche di Fable 5.1 e Mythos 5.1.
Anthropic ha utilizzato Fable 5.1 per addestrare una rete neurale capace di creare una nuova mappa altimetrica ad alta risoluzione di circa un terzo della superficie di Venere. Il lavoro utilizza immagini radar raccolte dalla missione Magellan della NASA oltre trent'anni fa e una mappa precedentemente disponibile per circa un quinto del pianeta.
Secondo Anthropic, la nuova ricostruzione consente di osservare dettagli nell'ordine di 2–3 chilometri, rispetto ai precedenti 10–20 chilometri, e migliora fino al 25% l'accuratezza delle altezze. La mappa è stata pubblicata con licenza Creative Commons in vista delle future missioni NASA VERITAS ed ESA EnVision.
Mythos 5.1 è stato testato anche nel protein design. Su tre target provenienti dalle competizioni Adaptyv Bio, Anthropic riporta affinità di binding fino a 10 volte superiori rispetto ai migliori design presentati alle competizioni. Su 12 target il modello ha inoltre raggiunto un hit rate vicino al 50%, mentre Anthropic indica valori tipici del 10–15% nel protein design moderno.
In computational biology, Mythos 5.1 ha scritto kernel GPU personalizzati e utilizzato caching dei risultati intermedi per accelerare sette modelli open source di deep learning fino a 2,5 volte, mantenendo output identici. Anthropic stima riduzioni dei costi GPU comprese tra il 30% e il 60% in alcune analisi genomiche su larga scala.
Fable 5.1 vs Mythos 5.1
La differenza tra i due modelli non è quindi l'intelligenza di base. Fable 5.1 e Mythos 5.1 sono lo stesso modello, ma Mythos utilizza safeguard più permissivi per professionisti verificati.
Anthropic prevede due programmi di accesso. Il Cyber Verification Program è rivolto alla sicurezza informatica difensiva e in futuro includerà accesso ai modelli Mythos. Il Life Sciences Verification Program, sviluppato in collaborazione con il governo statunitense, permette invece a professionisti delle life sciences di utilizzare Mythos 5.1 con controlli adattati alle attività professionali di ricerca e sviluppo.
Anche Claude Mythos rimane limitato a organizzazioni verificate. Claude Security, il prodotto Anthropic che analizza codebase alla ricerca di vulnerabilità e suggerisce patch da sottoporre a revisione umana, utilizza ora Mythos 5.1.
Safeguard cybersecurity più precisi
Fable 5.1 introduce un cambiamento importante per chi lavora nella sicurezza software. Anthropic consente ora al modello di essere utilizzato per identificare vulnerabilità nel codice sorgente, ampliandone le possibilità per attività difensive.
Secondo Anthropic, i nuovi safeguard cybersecurity producono in media circa il 60% di interventi in meno per sessione Claude Code rispetto ai controlli precedentemente utilizzati con Fable 5.
Restano tuttavia soggette a restrizioni o routing verso altri modelli alcune attività dual-use, tra cui penetration testing, exploit generation e vulnerability scanning basato su binari.
Anche i safeguard biologici sono stati resi più precisi: Anthropic afferma che intervengono l'85% meno frequentemente su richieste innocue relative a biologia di base e questioni mediche rispetto alla configurazione con cui Fable 5 era stato inizialmente lanciato.
Enterprise Frontier Safeguards
Un'altra novità significativa è rappresentata dagli Enterprise Frontier Safeguards (EFS), un'architettura progettata per combinare sistemi automatici di rilevamento degli abusi con requisiti enterprise di privacy e zero data retention.
Con EFS, i dati rimangono nell'infrastruttura cloud controllata dal cliente invece di essere archiviati nei sistemi Anthropic. Anche l'eventuale revisione umana viene effettuata, di default, dal cliente stesso.
Anthropic afferma di aver sviluppato EFS insieme a oltre 100 clienti appartenenti a settori come servizi finanziari, healthcare, manufacturing, telecomunicazioni, diritto, retail e pubblica amministrazione, oltre ai partner cloud AWS, Google Cloud e Microsoft Azure.
EFS verrà distribuito progressivamente a partire dall'autunno 2026 e sarà supportato su Claude Code, Claude Enterprise, Claude Platform, Amazon Bedrock, Claude Platform on AWS, Google Agent Platform e Microsoft Foundry.
Nuove protezioni contro la model distillation
Fable 5.1 introduce anche meccanismi più aggressivi contro la distillation, cioè il processo attraverso il quale le capacità di un modello avanzato possono essere estratte sistematicamente e utilizzate per addestrarne altri.
Per i nuovi account API creati dal giorno del rilascio non è più possibile modificare manualmente il precedente contesto di Claude durante una conversazione multi-turn mantenendo allo stesso tempo la trascrizione del precedente reasoning del modello.
Anthropic afferma che questa modifica blocca una tecnica di distillation documentata pubblicamente. Gli account esistenti non sono inizialmente interessati dalla modifica, ma Anthropic prevede che il comportamento venga esteso ai futuri model release.
Il watermark testuale richiesto dall'EU AI Act
Il lancio include anche una novità importante per la trasparenza dei contenuti AI. Anthropic ha firmato nel luglio 2026 il Code of Practice on Transparency of AI-Generated Content collegato all'EU AI Act.
Per i modelli rilasciati dopo il 2 agosto 2026, Anthropic ha quindi introdotto un watermark testuale invisibile. Non si tratta di una scritta aggiunta al testo, ma di un segnale numerico utilizzabile per stimare la probabilità che Claude abbia contribuito alla generazione di un contenuto.
Secondo Anthropic, il watermark non contiene informazioni sull'utente, sull'organizzazione o sulle conversazioni e non ha un impatto pratico sulla qualità o sul contenuto degli output.
L'azienda sta inoltre distribuendo una detection API in private preview. L'accesso iniziale è rivolto a organizzazioni idonee come autorità di regolamentazione, forze dell'ordine, media, fact-checker, ricercatori indipendenti, istituzioni educative e gruppi della società civile europea, oltre alle imprese soggette a specifici obblighi di verifica.
Prezzi: il vero cambiamento è nella cache
Il prezzo base di Claude Fable 5.1 rimane uguale a quello di Fable 5: 10 dollari per milione di token in input e 50 dollari per milione di token in output.
La novità più importante riguarda invece le cache read, cioè i token di contesto che il modello ha già elaborato e può riutilizzare. Il prezzo scende del 75% e arriva a 0,25 dollari per milione di token.
Questo dettaglio ha un impatto particolarmente importante sui coding agent e sui workflow di lunga durata. Un agente che lavora per ore sullo stesso repository può dover rileggere continuamente file, istruzioni e parti del contesto già elaborate. Quando la maggior parte del traffico proviene dalla cache, ridurne il prezzo modifica sensibilmente il costo dell'intera sessione.
Anthropic stima che Fable 5.1 costi circa il 25% in meno sui workload tipici rispetto a Fable 5. Nei task complessi di coding e nei workload altamente agentici, il risparmio può invece arrivare fino a circa il 45%.
Perché Fable 5.1 è interessante per gli sviluppatori
Fable 5.1 rende sempre più evidente il cambiamento in corso nel modo in cui vengono valutati i coding model. La capacità di generare correttamente una funzione o uno snippet isolato non è più sufficiente per descrivere ciò che un modello frontier dovrebbe saper fare.
Un vero coding agent deve comprendere un repository, seguire dipendenze tra servizi, modificare più file, eseguire test, analizzare errori, verificare il risultato e continuare a lavorare fino a quando il task non è realmente completato.
Proprio per questo i miglioramenti su Terminal-Bench, AutomationBench e CursorBench sono forse più interessanti dei piccoli incrementi ottenuti nei benchmark di reasoning tradizionale: misurano capacità più vicine a quelle necessarie per costruire agenti software realmente autonomi.
Disponibilità
Claude Fable 5.1 è disponibile sulle piattaforme Anthropic e attraverso i principali provider cloud, compresi Amazon Web Services, Google Cloud e Microsoft Azure.
Gli sviluppatori possono utilizzare il modello tramite Claude API con l'identificatore claude-fable-5-1. Per iniziare è disponibile la Claude Platform.
Per utenti individuali e organizzazioni, Anthropic indica Fable 5.1 come disponibile sui piani Pro, Max, Team ed Enterprise.
Conclusioni
Claude Fable 5.1 non sembra un aggiornamento pensato soltanto per aggiungere qualche punto ai benchmark. Il focus è molto più chiaramente rivolto a modelli capaci di lavorare più a lungo, utilizzare strumenti, verificare autonomamente i propri risultati e completare workflow complessi con meno supervisione.
Il passaggio dal 24,7% al 52,6% su Terminal-Bench-Science e dal 17,1% al 31,4% su AutomationBench mostra dove si concentra una parte importante del salto generazionale. Allo stesso tempo, la riduzione del costo delle cache read rende economicamente più sostenibile proprio il tipo di workload che richiede grandi contesti e numerose iterazioni.
La competizione tra frontier model potrebbe quindi spostarsi sempre più da una domanda relativamente semplice — quale modello genera la risposta migliore? — verso una molto più concreta: quale modello può ricevere un obiettivo, lavorarci autonomamente per ore e restituire un risultato verificato e realmente utilizzabile?
Fonti e approfondimenti: Anthropic — Claude Fable 5.1 and Mythos 5.1, Anthropic — Claude Fable, Anthropic — Claude Mythos, Claude Platform.