Quando un’azienda confronta due modelli AI, il prezzo per milione di token è una delle metriche più immediate. Con l’arrivo degli agenti, però, rischia di diventare anche una delle più fuorvianti.
Anthropicha annunciato Claude Opus 5.5 il 22 settembre. Il modello costa4 dollari per milione di token in input e 20 dollari in output, il 20% meno di Opus 5. Ma Anthropic stima che i workload tipici fatturati a token costino complessivamente circail 40% in meno, perché Opus 5.5 utilizza anche meno token per completare il lavoro. Le cache read scendono inoltre a $0,20 per milione di token, il 60% meno di Opus 5.
Dal prezzo del token al costo del risultato
Questi sono ifatti dichiarati dal produttore. La conseguenza interessante per le azienderichiede invece un cambio di prospettiva.
Un chatbot può produrre una risposta con una singola interazione. Un agente può pianificare un’attività, recuperare contesto, chiamare strumenti, coordinare subagenti, verificare risultati, correggersi e continuare a lavorare per ore.
In questo scenario due modelli con prezzi per token diversi possono produrre un costo finale sorprendentemente simile, oppure il modello apparentemente più caro può risultare più economico se termina il task in meno passaggi.
La metrica utile diventa quindicosto per risultato verificato.
Meno passaggi possono valere più di token economici
Anthropic descrive Opus 5.5 come il proprio modello Opus più forte per coding, agenti e knowledge work. Dichiara capacità di orchestrare task multi-tool, coordinare subagenti, utilizzare memoria tra sessioni e portare avanti lavori prolungati con supervisione ridotta.
Nelle testimonianze pubblicate da Anthropic, Microsoft riferisce che in VS Code il modello ha risolto più task terminali di Opus 5 in meno della metà dei passaggi. Lovable parla di un terzo o metà passaggi in meno, mentre un altro early adopter racconta un’attività di engineering eseguita autonomamente per oltre 18 ore.
Sono testimonianze selezionate dal produttore, non benchmark indipendenti. Illustrano però bene il problema economico: ogni passaggio evitato può ridurre token, chiamate agli strumenti, tempi di esecuzione e possibilità di errore.
Una metrica più utile per PMI e studi
Ecco i 4 parametri che le aziende dovrebbero progressivamente misurare insieme
Questi sono i 4 parametri che Aziende, PMI e Studi Professionali dovrebbero tenere d’occhio:
- costo totale del task,
- tempo necessario,
- percentuale di task completati correttamente,
- quantità di intervento umano richiesta.
Un agente che costa 30 centesimi invece di 20 ma completa correttamente il processo al primo tentativo può avere un’economia migliore di quello apparentemente più economico che richiede retry o verifiche manuali.
Questo vale soprattutto nei processi ripetibili: analisi documentale, classificazione, ricerca, preparazione di pratiche, sviluppo software o automazioni interne. Il confronto dovrebbe avvenire sulworkflow reale dell’organizzazione, non soltanto sul listino del provider.
Il prezzo per token continuerà a essere importante. Ma nell’AI agentica la domanda economica più utile potrebbe diventare molto più semplice:quanto costa ottenere questo risultato, con questa qualità e questo livello di supervisione?
Gol-IApermette di combinare modelli e workflow differenti, rendendo possibile scegliere l’infrastruttura in funzione del processo. Questo rende naturale valutare i modelli non soltanto per capacità, ma anche per costo operativo del risultato.

