Antropic lancia i suoi modelli di intelligenza artificiale di punta
Anthropic ha svelato i suoi modelli di intelligenza artificiale più avanzati, Claude Fable 5.1 e Claude Mythos 5.1, progettati per la programmazione, il lavoro di conoscenza e la ricerca scientifica. Questi due modelli applicano diversi livelli di sicurezza al medesimo modello di base, con il lancio, che avviene poco prima dell’offerta pubblica iniziale dell’azienda, che segna un significativo miglioramento delle prestazioni in compiti complessi e prolungati.
L’annuncio dei modelli è avvenuto tramite il blog aziendale il giorno 1 del mese (ora locale). Fable 5.1 sarà accessibile agli utenti e alle imprese in tutto il mondo, compresa la Corea del Sud, mentre Mythos 5.1 sarà fornito su base limitata solo a istituzioni di cybersecurity e scienze della vita selezionate negli Stati Uniti. Mythos 5.1 non è un modello separato con prestazioni superiori rispetto a Fable 5.1; piuttosto, è una cornice di accesso che allenta le misure di sicurezza sullo stesso modello di base, permettendo così capacità di ricerca specializzate.
Prestazioni delle nuove versioni di Claude
Nei benchmark, Fable 5.1 ha ottenuto un punteggio del 52.6% nel Terminal-Bench-Science 0.1, raddoppiando il 24.7% ottenuto dal suo predecessore Fable 5 e superando di gran lunga il 29% del modello ad alte prestazioni Opus 5. Nel benchmark GDPval-AA v2, relativo al lavoro di conoscenza, ha totalizzato 1.853 punti, superando Fable 5 (1.723 punti) e Opus 5 (1.824 punti). Nel AutomationBench, che misura l’automazione dei compiti, è risultato 31.4%, davanti a Fable 5 (17.1%) e Opus 5 (26.9%).
Risultati nel campo della programmazione e della scienza
Nella programmazione, Fable 5.1 ha ottenuto un punteggio del 73.4% su CursorBench 3.2.0, superando Fable 5 (70.5%) e Opus 5 (70%). Per quanto riguarda la manipolazione dei terminali, Fable 5.1 ha registrato il 55.8% su Terminal-Bench 4.0, mentre Mythos 5.1, con le misure di sicurezza allentate, ha totalizzato il 60.9%. Anthropic ha spiegato che il punteggio più elevato di Mythos deriva dall’attivazione delle misure di sicurezza di Fable in determinate attività di cybersecurity.
Uno degli aspetti più interessanti di questa nuova generazione di modelli è l’applicazione nel campo della ricerca scientifica. Mythos 5.1 ha utilizzato strumenti open-source di progettazione e previsione delle strutture proteiche per progettare leganti proteici, raggiungendo un tasso di successo di circa il 50% in esperimenti di laboratorio esterni su 12 target, mentre i tassi normali nel design proteico si aggirano tra il 10% e il 15%.
Dettagli della cartografia di Venere e codifica ottimizzata
Fable 5.1 è stato addestrato su dati radar catturati dalla sonda Magellan della NASA oltre 30 anni fa, producendo una mappa topografica ad alta risoluzione che copre circa un terzo della superficie di Venere. Questa mappa ha migliorato il livello di dettaglio da una gamma di 10-20 km in mappe esistenti a 2-3 km e ha aumentato l’accuratezza della misura dell’elevazione fino al 25%. La mappa è stata rilasciata con licenza Creative Commons e servirà come materiale di riferimento per le missioni di esplorazione VERITAS della NASA e EnVision dell’Agenzia Spaziale Europea.
Inoltre, Mythos 5.1 ha ottimizzato il codice di sette modelli di deep learning open-source nel campo della genomica, raggiungendo velocità di inferenza fino a 2.5 volte più veloci su GPU Nvidia H100, promettendo una riduzione dei costi per la ricerca di circa il 30-60%. Anthropic ha annunciato l’intenzione di rilasciare il codice di ottimizzazione come open source.
Strategie di prezzo e misure di sicurezza per le imprese
La strategia di prezzo di Fable 5.1 rimane invariata rispetto al predecessore, con costi di input e output di $10 e $50 per milione di token rispettivamente. Tuttavia, il prezzo per la lettura della cache è stato ridotto del 75% a $0.25 per milione di token. Anthropic prevede che questa mossa ridurrà i costi di utilizzo di circa il 25% rispetto a Fable 5, con riduzioni fino al 45% per attività che impiegano contesti estesi.
In aggiunta, Anthropic ha presentato il nuovo sistema Enterprise Frontier Safeguard (EFS), progettato per proteggere i dati dei clienti aziendali. Questo sistema consente di memorizzare i dati su infrastrutture cloud gestite direttamente dall’impresa piuttosto che da Anthropic, individuando e rispondendo a usi malevoli dell’IA. Sarà implementato a fasi a partire dall’autunno.
Controlli anti-distillazione e miglioramenti nella cybersecurity
Anthropic ha anche annunciato misure per bloccare la “distillazione”, una pratica che comporta la raccolta delle tracce di ragionamento di Claude per addestrare altri modelli. A partire dalla data di rilascio di Fable 5.1, i nuovi account API non potranno più mantenere registri di pensiero precedenti durante la modifica del contesto di conversazione. I conti esistenti non saranno influenzati per il momento, ma questa politica sarà estesa a tutti gli utenti con il prossimo rilascio di modelli.
I miglioramenti nei controlli della cybersecurity hanno ridotto i falsi positivi del 60% rispetto alla versione precedente, consentendo compiti di ricerca nel campo della sicurezza software, anche se alcune attività di sfruttamento rimangono limitate. Mythos 5.1 offre privilegi di accesso differenti agli utenti selezionati tramite il Cyber Verification Program e il Life Sciences Verification Program stabilito in coordinazione con il governo degli Stati Uniti.

