
Il 28 settembre 2026 Anthropic ha presentato Claude Sonnet 5.5.
Nell’ annuncio di Claude Sonnet 5.5 (*) ripreso da Tom’s Hardware c’è un numero che salta agli occhi: su Terminal-Bench 4.0, un test di programmazione, il nuovo modello raggiunge il 70,6%, contro il 10,3% del predecessore.
(*) fonte : www.tomshw.it/hardware/con-claude-sonnet-55-anthropic-alza-ancora-lasticella-dellia-ecco-tutte-le-novita
Sotto l’articolo un lettore si chiede se il vecchio modello andasse davvero così male, oppure se qualcosa non torni.
È la domanda giusta. Ogni mese escono nuovi modelli di intelligenza artificiale, ciascuno accompagnato da tabelle di punteggi, sigle e percentuali.
Per chi lavora in azienda la difficoltà raramente è trovare informazioni: è capire quali contano per le proprie decisioni.
Questo articolo prova a mettere ordine, con un piccolo glossario per chi usa l’AI ogni giorno e una serie di criteri per chi deve decidere se adottarla.
La stessa notizia, due letture
In azienda circolano molte informazioni condivise: un report, un annuncio, una demo vista a una fiera.
Ciascuno le legge con gli occhi del proprio ruolo, e ciascuno cerca risposte diverse. È una ricchezza: le decisioni migliori nascono quando quelle letture si incontrano intorno allo stesso tavolo.
Chi usa l’AI ogni giorno
Il collaboratore che scrive testi, analizza dati o prepara presentazioni legge l’annuncio con una domanda pratica:
- che cosa riesco a fare meglio, o più in fretta, con questo strumento?
Gli servono le parole giuste per capire le schede tecniche e per spiegare ai colleghi che cosa funziona e che cosa no.
Chi decide se adottarla
L’imprenditore legge lo stesso annuncio con altre domande.
- Conviene?
- Quanto è affidabile sui nostri processi?
- Che cosa cambia per le persone?
Dietro l’ultima domanda c’è spesso un timore concreto, quello di dover ridurre il personale.
Un’adozione fatta con metodo parte proprio da qui: decidere prima come usare il tempo liberato dalle attività ripetitive, che può spostarsi su compiti a maggior valore o tornare alle persone sotto forma di orari più sostenibili.
Che cosa sono i modelli di intelligenza artificiale
Un modello di intelligenza artificiale è il motore che sta dietro strumenti come ChatGPT, Claude o Gemini: un sistema addestrato su enormi quantità di testi, immagini o dati, che ha imparato a riconoscere schemi e a produrre risposte.
L’applicazione che usi ogni giorno è la carrozzeria; il modello è il motore, e lo stesso motore può equipaggiare prodotti diversi.
Se vuoi approfondire la differenza fra intelligenza artificiale e machine learning, la trovi spiegata in un articolo dedicato.
Modelli generali e modelli specializzati
I modelli generali sanno scrivere, riassumere, tradurre, ragionare su documenti e immagini.
I modelli specializzati sono addestrati o adattati per un compito preciso: riconoscere difetti su una linea di produzione, leggere contratti, prevedere la domanda.
Spesso un produttore offre più versioni della stessa famiglia: una più potente per i compiti complessi e una più rapida ed economica per il lavoro quotidiano.
È il caso di Claude Opus e Claude Sonnet, pensati per completarsi a vicenda.
Perché escono nuove versioni ogni pochi mesi
La concorrenza fra i produttori è intensa, e ogni versione promette più capacità, più velocità o costi più bassi. Per un’azienda la conseguenza pratica è una sola: la scelta di un modello è rivedibile.
Conviene costruire processi che permettano di cambiarlo senza ricominciare da capo.
I termini per usare l’AI
Sono le parole che il collaboratore incontra nell’uso quotidiano. Conoscerle aiuta a chiedere allo strumento la cosa giusta e a parlarne con i colleghi usando lo stesso vocabolario.
AI generativa, modelli linguistici e prompt
L’AI generativa produce contenuti nuovi: testi, immagini, audio, codice.
I modelli linguistici di grandi dimensioni (in inglese large language model, LLM) ne sono la forma più diffusa: hanno imparato dalle lingue umane a prevedere, parola dopo parola, la continuazione più plausibile di un testo.
Il prompt è la richiesta che scriviamo al modello: più è chiaro sul contesto e sul risultato atteso, più la risposta è utile.
NLP e computer vision
L’elaborazione del linguaggio naturale (NLP) è il ramo dell’AI che comprende e produce linguaggio: permette a un assistente di rispondere ai clienti o di smistare le email in arrivo.
La computer vision fa lo stesso con le immagini: riconosce oggetti, legge etichette, individua difetti. In un’azienda di moda può verificare la qualità di un tessuto; in un magazzino, leggere i codici dei colli.
RPA e agenti AI
La RPA (robotic process automation) automatizza attività ripetitive seguendo regole fisse, come copiare dati da un gestionale a un foglio di calcolo.
Un agente AI fa un passo in più: riceve un obiettivo e decide da sé la sequenza di azioni per raggiungerlo, usando più strumenti.
La differenza è simile a quella fra una ricetta seguita alla lettera e un cuoco che adatta il piatto agli ingredienti disponibili.
I termini per valutarla
Sono le parole degli annunci e delle schede tecniche, quelle che rendono difficile leggere notizie come quella da cui siamo partiti.
Benchmark, punteggi e versioni dei test
Un benchmark è un test standardizzato: una serie di compiti uguali per tutti i modelli, che permette di confrontarli. Il punteggio indica la percentuale di compiti svolti correttamente.
Anche i test hanno versioni, e un confronto ha senso solo sulla stessa versione.
Nell’annuncio di Sonnet 5.5 compaiono tre benchmark di programmazione:
- Terminal-Bench 4.0 risultato del 70,6%
- FrontierCode 1.1 risultato del 46,2%
- CursorBench 4.0 risultato del 55,5%.
Token, finestra di contesto e costo per task
Il token è l’unità con cui il modello legge e scrive: un frammento di parola.
I servizi si pagano a token, distinguendo quelli in ingresso, cioè ciò che inviamo, da quelli in uscita, cioè ciò che il modello produce.
La finestra di contesto è la quantità di testo che il modello considera in una volta, come la memoria di lavoro di una persona.
Il costo per task sposta l’attenzione dal prezzo unitario al costo di un compito completo: un modello più caro a token può costare meno se ne usa meno per arrivare al risultato.
È ciò che Anthropic rivendica per Sonnet 5.5, fino al 30% in meno per attività rispetto al predecessore.
Livello di ragionamento e compiti lunghi
Alcuni modelli permettono di scegliere quanto ragionare prima di rispondere: è il livello di ragionamento, chiamato anche effort.
Più ragionamento significa in genere risposte migliori sui problemi complessi, con più tempo e più token.
Per questo il 46,2% di Sonnet 5.5 su FrontierCode, ottenuto al livello massimo, va letto sapendo che nell’uso quotidiano l’impostazione può essere diversa.
I compiti lunghi, detti anche agentici, misurano invece la capacità di portare a termine attività in molti passaggi.
Il test su Pokémon Red, completato da Sonnet 5.5 guardando soltanto gli screenshot del gioco, serve proprio a questo: verificare se il modello interpreta ciò che vede e mantiene la rotta su un arco di tempo lungo.
Come si legge il punteggio di un benchmark AI?
Il punteggio di un benchmark AI indica la percentuale di compiti standard che un modello risolve correttamente.
Va letto con quattro verifiche:
- chi ha condotto il test,
- quale versione è stata usata,
- con quale livello di ragionamento
- quanto quei compiti somigliano al lavoro reale dell’azienda.
Senza queste verifiche, il numero confronta i modelli e dice poco sulla loro utilità.
Chi ha fatto il test
I risultati pubblicati negli annunci sono spesso misurati dal produttore stesso.
Questo non li rende scorretti; suggerisce di attendere le verifiche indipendenti, come le classifiche pubbliche e le prove di terze parti, prima di trattarli come un dato acquisito.
Il modello aveva già visto le domande?
I modelli imparano da enormi quantità di testi pubblici.
Se le domande di un benchmark circolano online, possono finire nei dati di addestramento: è come uno studente che ha visto il compito in anticipo.
Per questo i test si aggiornano in nuove versioni, e un salto molto ampio, come quello dal 10,3% al 70,6%, merita di essere letto insieme ai risultati su altri test.
Quanto somiglia il test al tuo lavoro
Un benchmark di programmazione dice molto a chi sviluppa software e poco a chi riassume contratti o risponde agli ospiti di un hotel.
Il test più utile è quello che somiglia al proprio processo.
Nell’annuncio, Anthropic cita una prova interna in cui il modello ha prodotto una presentazione di dieci slide giudicata utilizzabile senza modifiche: un’indicazione vicina al lavoro d’ufficio, tuttavia misurata su compiti scelti dal produttore.
Quali criteri usare per scegliere un modello di intelligenza artificiale per l’azienda?
Per scegliere un modello di intelligenza artificiale conviene partire dal processo da migliorare, prima che dalla classifica.
I criteri principali sono sei: risultato su una prova reale con i propri dati, costo per compito completo, riservatezza dei dati, integrazione con i sistemi esistenti, limiti noti del modello e possibilità di sostituirlo in futuro.
La prova sul tuo processo, prima del contratto
Una prova pilota di poche settimane su un processo circoscritto dice più di qualunque classifica: si scelgono dieci o venti casi reali, si confrontano due o tre modelli, si misura il risultato insieme alle persone che quel lavoro lo fanno ogni giorno.
Nel metodo FARO by Factory questa fase si chiama Focalizzare: definire obiettivo, processo e metrica prima di scegliere lo strumento.
È il punto di partenza per chi vuole introdurre l’intelligenza artificiale in azienda con risultati misurabili.
Dati, riservatezza e investimento
Prima di confrontare le prestazioni conviene sapere dove vengono trattati i dati, se vengono usati per addestrare il modello e con quali condizioni contrattuali.
L’investimento dipende da fattori precisi: il volume di utilizzo, la complessità del processo, le integrazioni con gestionale e CRM, la formazione delle persone. Il modello è una parte del costo totale, spesso nemmeno la più grande.
Limiti e bias dei modelli
Ogni modello ha i suoi limiti: può produrre informazioni plausibili e sbagliate, riflettere distorsioni presenti nei dati di addestramento, i cosiddetti bias, e comportarsi in modo diverso in italiano rispetto all’inglese.
Per questo serve sempre una persona che verifica e approva il risultato.
Adottare l’AI in modo etico significa anche questo: stabilire chi controlla, e dichiarare a clienti e collaboratori dove la si usa.
Cinque domande prima di fidarsi di un benchmark
Una checklist rapida da tenere a portata di mano al prossimo annuncio, utile sia a chi usa l’AI sia a chi decide.
La checklist in cinque domande
- Chi ha misurato il risultato: il produttore o una terza parte?
- Su quale versione del test, e con quale livello di ragionamento?
- Il confronto è fatto con modelli della stessa categoria, sulla stessa versione del test?
- I compiti del test somigliano ai processi della mia azienda?
- Come si comporta il modello in una prova con i miei dati, e quanto costa ogni compito completo?
Dalla lettura alla decisione
Le cinque domande aiutano a leggere un annuncio.
Le parole di questo articolo servono a leggere gli annunci. Le decisioni partono da un’altra parte.
Nei progetti in cui accompagno le aziende che vogliono introdurre l’intelligenza artificiale, modelli, token e benchmark arrivano in fondo alla conversazione.
Le prime domande riguardano il valore che l’AI può creare per l’imprenditore, per l’azienda e per chi ci lavora:
- quali processi sono ripetitivi
- dove i flussi possono diventare più semplici
- quali informazioni si perdono per strada
- quali vanno condivise e quali è giusto che restino riservate.
Usare un’AI per preparare una bella presentazione è alla portata di chiunque, e online si trovano ottimi tutorial.
Introdurla in azienda in modo etico, con una visione di medio-lungo periodo, è un lavoro di metodo: parte dalle persone e dai processi, e sceglie lo strumento solo alla fine.
Vuoi capire come portare l’AI nella tua Azienda? Richiedi un meeting gratuito.
Domande frequenti sui modelli di intelligenza artificiale
Fra i modelli generali più diffusi ci sono le famiglie GPT di OpenAI, Claude di Anthropic e Gemini di Google, accanto a modelli aperti come quelli di Mistral e Meta.
La scelta dipende dal compito, dalla lingua, dal trattamento dei dati e dalle integrazioni con gli strumenti già in uso in azienda.
Un benchmark AI è un test standardizzato: una serie di compiti uguali per tutti i modelli, che permette di confrontarne le prestazioni.
Il risultato si esprime di solito come percentuale di compiti svolti correttamente e ha senso solo nel confronto fra modelli misurati sulla stessa versione del test.
Sono affidabili come strumento di confronto, meno come misura dell’utilità in azienda.
Conviene verificare chi ha condotto il test, se le domande potevano essere già note al modello e quanto i compiti somigliano ai propri processi. Una prova sui propri dati resta il riscontro più solido.
Il token è l’unità con cui un modello legge e scrive testo: un frammento di parola.
I servizi di AI si pagano in base ai token in ingresso e in uscita, e la finestra di contesto indica quanti token il modello riesce a considerare in una sola volta.
Dipende dal processo da migliorare. Conviene confrontare due o tre soluzioni con una prova pilota su casi reali, valutando qualità del risultato, costo per compito completo, gestione dei dati, integrazione con i sistemi esistenti e assistenza.
La classifica generale è un punto di partenza, non una risposta.
Le metriche più utili sono quelle del processo: tempo impiegato per compito, errori e rilavorazioni, volume gestito, soddisfazione di clienti e collaboratori.
Vanno misurate prima e dopo l’introduzione dell’AI, sullo stesso processo e per un periodo sufficiente a vedere un andamento stabile.
L’AI sostituisce attività, più che persone. Le aziende che la adottano con metodo decidono in anticipo come usare il tempo liberato: compiti a maggior valore, formazione, relazione con i clienti, in alcuni casi orari più sostenibili.
Coinvolgere i collaboratori fin dall’inizio è la condizione perché il cambiamento funzioni.
Dipende dal volume di utilizzo, dalla complessità del processo, dalle integrazioni con gestionale e CRM, dalla qualità dei dati di partenza e dalla formazione delle persone.
Il costo del modello è solo una parte: l’investimento complessivo si definisce sul progetto, dopo aver chiarito obiettivi e processi.