Un agente AI può completare correttamente un’attività e, allo stesso tempo, avere compiuto un’azione che non avrebbe dovuto eseguire. È uno dei problemi che emergono quando l’intelligenza artificiale passa dal generare risposte all’utilizzare strumenti, API e dati aziendali.
Googleha portato in Private PreviewAgent Anomaly DetectionsullaGemini Enterprise Agent Platform. L’obiettivo è individuare comportamenti anomali analizzando non soltanto il risultato finale, ma la sequenza di azioni compiute dall’agente durante una sessione.
Fonte ufficiale Google Developers
Una risposta corretta non racconta tutta la storia
Google descrive un problema molto concreto. Un agente può chiudere un ticket con una risposta apparentemente normale, mentre durante l’esecuzione ha utilizzato un tool che non avrebbe dovuto toccare oppure ha agito su una richiesta che ha ampliato implicitamente il proprio accesso.
In casi del genere nulla fallisce in modo evidente. Le metriche tradizionali possono quindi considerare la sessione riuscita.
Ilfatto documentato da Googleè cheAgent Anomaly Detection nasce per analizzare queste traiettorie e individuare deviazioni comportamentali. Il servizio è attualmente in Private Preview.
Dall’output alla traiettoria dell’agente
La conseguenza più interessante è architetturale.
Quando un LLM viene utilizzato come chatbot, valutare qualità e correttezza della risposta può coprire buona parte del problema. Un agente operativo, invece, può scegliere strumenti, effettuare chiamate, consultare database e modificare sistemi.
La miainferenzaè che l’osservabilità debba quindi spostarsi progressivamente dall’output allatraiettoria completa dell’esecuzione.
Diventa utile poter ricostruire chi ha avviato il task, quale modello ha ragionato, quale agente ha scelto un determinato strumento, quali API sono state chiamate, con quali permessi e quale risultato è stato prodotto.
Perché le regole statiche con un Agente AI non bastano sempre
Permessi minimi, allowlist degli strumenti e approvazioni umane restano fondamentali. Ma un agente può comportarsi in modo problematico anche senza violare una regola semplice.
Il rischio può emergere dalla combinazione di azioni singolarmente consentite o da una sequenza inconsueta rispetto al comportamento normale.
È qui che il rilevamento delle anomalie può aggiungere un livello ulteriore: non sostituire i controlli preventivi, ma evidenziare comportamenti che meritano attenzione anche quando il task sembra essere terminato correttamente.
Una lezione per l’AI aziendale
Per PMI e Studi Professionali il principio è applicabile anche senza adottare la piattaforma Google.
Più autonomia viene concessa agli agenti, più diventa importante registrare tool call, autorizzazioni, passaggi decisionali ed effetti prodotti sui sistemi aziendali. Non soltanto per diagnosticare gli errori, ma per distinguere un comportamento normale da uno inatteso.
La domanda quindi cambia: non basta chiedere“l’agente ha risposto correttamente?”.Bisogna poter chiedere anche “cosa ha fatto per arrivarci?”.
Gol-IAsta evolvendo verso un’orchestrazione in cui modelli, conoscenza, strumenti e workflow possano essere osservati come parti dello stesso processo. L’obiettivo è rendere l’autonomia utile senza perdere visibilità su ciò che accade durante l’esecuzione.

