ai-agentiva
L'illusione della valutazione: perché i benchmark dell'AI agentica ci stanno mentendo e cosa serve davvero
Nuove ricerche rivelano che i benchmark attuali misurano male gli agenti AI: il 24% degli episodi 'di successo' viola le specifiche utente, mentre nell'ingegneria professionale i modelli migliori falliscono il 96% dei task multi-software. Servono nuovi paradigmi di valutazione e sicurezza.
Pubblicato il
Il paradosso del simulatore utente: quando il benchmark mente
Da mesi la comunità scientifica celebra i progressi degli agenti AI sui benchmark standard: tau-bench, WebShop, ALFWorld. I numeri salgono, le percentuali di successo migliorano, e la narrativa dominante suggerisce che l'autonomia affidabile sia a portata di mano. Ma un paper pubblicato su arXiv il 29 settembre 2026 rovescia il tavolo: UserProxyBench dimostra che il problema non è l'agente, ma chi simula l'utente (UserProxyBench: Evaluating LLM User Simulators for Agent Benchmarks and Training).
L'esperimento è chirurgico: si blocca l'agente (GPT-5.5) e si varia solo il "proxy utente" — il modello che interpreta la controparte umana — su 375 task enterprise. Il risultato? La media del task reward oscilla di 15,2 punti a seconda di quale simulatore si usa. Ancora più inquietante: il 24,4% degli episodi classificati come "di successo" contiene una violazione della specifica utente. La violazione dominante è la premature disclosure: il simulatore fornisce informazioni prima che l'agente le richieda. Questo comportamento non penalizza il reward — l'agente "risolve" il task — ma altera radicalmente l'interazione: in media 1,06 chiamate tool in meno per episodio. Il benchmark premia il risultato, non il processo.
I ricercatori introducono lo User Fidelity Score (UFS), una metrica indipendente dal successo dell'agente che misura l'aderenza del simulatore alle istruzioni private del benchmark. La scoperta chiave è una frontiera costo-fedeltà empirica: per sette proxy testati, esiste un trade-off quantificabile tra costo computazionale e fedeltà. I practitioner possono finalmente scegliere "il simulatore meno costoso che soddisfa la fedeltà richiesta". Ma la domanda di fondo resta: quanti paper pubblicati negli ultimi due anni hanno riportato risultati su simulatori infedeli senza saperlo?
Il muro dell'ingegneria professionale: EngiWorld e la realtà industriale
Se i benchmark enterprise nascondono crepe nella valutazione, quelli per l'ingegneria professionale rivelano un abisso. EngiWorld, presentato sempre il 29 settembre, è il primo benchmark strutturato attorno al ciclo completo di progettazione: 1.301 task curati da esperti su 6 domini (CAD, CAE, CAM, BIM, EDA, visualizzazione 3D) e 26 piattaforme software professionali, con interfacce sia GUI che CLI (EngiWorld: What Can Frontier Agents Deliver in Professional Engineering Environments?).
La metodologia di valutazione è artefatto-centrica: un domain-verifier suite unificato controlla validità geometrica, fattibilità fisica e conformità normativa di artefatti finali e intermedi. I task quantitativi sono **valutati per *grado di raggiungimento della specifica***, non per successo binario. È la valutazione più rigorosa mai tentata per agenti in ambienti industriali reali.
I risultati sono freddi: il modello più forte raggiunge un EngiScore di soli 44,3. Appena il 3,6% dei tentativi multi-software ha successo. Gli agenti frontier — quelli che brillano su benchmark di coding generico o uso del web — crollano quando devono ragionare su vincoli geometrici, dipendenze fisiche e catene di tool eterogenei che preservano stato attraverso fasi di progettazione.
Questo non è un gap incrementale. È la conferma sperimentale che l'autonomia general-purpose non si trasferisce all'ingegneria specialistica. Le implicazioni per l'industria italiana — manifattura avanzata, automotive, aerospazio, costruzioni — sono immediate: non basta "aggiungere agenti" ai flussi CAD/CAE/BIM esistenti. Serve un'architettura nativa per il ragionamento multi-fisica, multi-software, multi-stadio. E serve una metrica che non premi scorciatoie semantiche ma validi l'artefatto ingegneristico.
Oltre la conoscenza: disimparare i comportamenti, non solo i fatti
Mentre la valutazione mostra le crepe, la sicurezza introduce un problema radicalmente nuovo. Fino a oggi, l'unlearning nei LLM ha significato rimuovere conoscenza: fatti pericolosi, dati privati, copyright. Ma Trajectory Unlearning, pubblicato il 27 settembre, sposta il bersaglio: **l'obiettivo non è cosa l'agente sa, ma cosa l'agente *fa*** (Trajectory Unlearning on LLM-based Agents).
La distinzione è fondativa: (1) il target è l'azione, non la parola; (2) le traiettorie sono sequenze di azioni sequenzialmente dipendenti — non si possono decomporre in coppie prompt-risposta isolate senza perdere la struttura inter-passo. Un agente che ha imparato una procedura insicura per configurare un firewall (es. aprire porte prima di verificare le regole) non "dimentica" la regola di sicurezza leggendo un contro-esempio: deve dimenticare la sequenza d'azione stessa.
Gli autori propongono GiRPO (Group-injected Relative Policy Optimization): le traiettorie da dimenticare vengono iniettate nel gruppo di rollout della policy con reward penalizzati, isolando le statistiche di normalizzazione. Il segnale di unlearning resta stabile e limitato, senza corrompere gli aggiornamenti di gradiente per le traiettorie normali. Benchmark su ALFWorld (task domestici) e WebShop (shopping online) mostrano che GiRPO dimentica efficacemente le traiettorie target preservando i tassi di successo sui task.
Questo cambia l'architettura della sicurezza: non basta filtrare l'output o cancellare pesi associati a conoscenza "cattiva". Serve un meccanismo che operi sullo spazio delle politiche comportamentali, distinguendo tra "sapere come fare X" ed "eseguire la sequenza Y che porta a X in modo insicuro". Per settori regolati — finanza, sanità, difesa — significa che la conformità non è una proprietà statica del modello, ma una proprietà dinamica della distribuzione delle traiettorie in produzione.
Verso una nuova architettura di fiducia: comunicazione incarnata e governance vincolata
Tre filoni convergenti — valutazione difettosa, gap industriale, sicurezza comportamentale — richiedono un ripensamento architetturale. Due direzioni emergono dalle fonti recenti.
La prima è Embodied Semantic Communication (ESC), un paradigma per agenti collettivi nel mondo fisico (Embodied Semantic Communication for Collective Autonomous Agents). I paradigmi attuali (trasmissione bit affidabile, recupero semantico generico, ottimizzazione single-task) falliscono perché ignorano che gli agenti formano comprensione dell'azione dai propri stati, osservazioni ambientali e relazioni collaborative — un processo che evolve mentre il task si svolge. ESC trasforma la trasmissione d'informazione in interazione semantica orientata all'azione: il link di comunicazione incapsula stati percettivi multimodali, capacità hardware intrinseche e intenti collaborativi in rappresentazioni semanticamente azionabili, permettendo ad agenti eterogenei di parsare, allineare e radicare (ground) l'informazione nel proprio controllo motorio locale. La roadmap aperta include affidabilità semantica misurabile, interazione ambiguità-trigger in ambienti dinamici, e trasmissione semantica adattiva alla banda. Per la robotica collaborativa, i gemelli digitali industriali, i sistemi multi-drone: la comunicazione non è trasporto, è coordinazione incarnata.
La seconda direzione è RegLLM, un diagnostic harness per autonomia vincolata in workflow agentici regolati (Evaluating Bounded Autonomy in Regulated Agentic AI). Strumenta sei segnali di trustworthiness: validità delle citazioni, grounding delle fonti, conformità allo schema, correttezza dell'escalation, allineamento costituzionale, tasso di azioni unsafe. I segnali sono distinti per fonte di supervisione: verificatori programmatici, label di escalation a livello di task, punteggi AI-judge. Un runtime supervisor deterministico blocca risposte non grounded e forza escalation, loggando gli interventi. La stessa costituzione di dominio informa valutazione, reward di training e guardrail di serving. I label "should-escalate" a livello di task rendono la decisione agisci vs rimanda un segnale di training misurabile.
I piloti su piccola scala (n=8-12) rivelano una verità scomoda: configurazioni nominalmente identiche producono varianza massiccia — task success 0,25 vs 0,12, escalation recall 1,0 vs 0,5. Un adapter per qualità risposta cambia recall da 1,0 a 0,5 in un run, ma da 0,5 a 1,0 nell'altro. La varianza di configurazione sommerge gli effetti apparenti di tuning. La lezione non è che RegLLM "funziona" o "non funziona": è che la valutazione dell'autonomia vincolata richiede set di valutazione molto più grandi e run ripetuti, altrimenti si scambia rumore per segnale.
La posta in gioco per l'ecosistema italiano
L'Italia ha una densità unica di PMI manifatturiere ad alta specializzazione, distretti industriali che vivono di conoscenza tacita codificata in software CAD/CAM/CAE legacy, e un quadro regolatorio (AI Act, NIS2, DORA) che richiede accountability dimostrabile. I dati sopra disegnano tre priorità operative:
- Audit dei benchmark interni: se la vostra organizzazione valuta agenti su tau-bench o simili senza misurare la fedeltà del simulatore utente (UFS), i vostri KPI sono potenzialmente inflazionati del 15-25%. Richiedete ai vendor la frontiera costo-fedeltà dei loro simulatori.
- Pilotaggio EngiWorld-like: prima di deployare agenti su flussi multi-software (es. CATIA → ANSYS → Teamcenter), costruite un domain-verifier suite interno che validi geometria, fisica e regole a ogni stadio. Il 3,6% di successo multi-software non è un bug: è la baseline attuale.
- Trajectory-level governance: spostate i controlli di compliance dal prompt/response alla traiettoria d'azione. Implementate GiRPO-style unlearning per procedure deprecate o non conformi. Usate RegLLM come template per definire la vostra costituzione di dominio, i label di escalation, e il runtime supervisor che blocca — non solo logga — le deviazioni.
La convergenza è chiara: l'AI agentica non si governa con guardrail testuali, si governa con architetture che rendono le traiettorie osservabili, verificabili, e reversibili. I benchmark ci hanno illuso che il problema fosse "più intelligenza". Le evidenze di settembre 2026 dicono che il problema è più disciplina ingegneristica — nella valutazione, nell'esecuzione, nella sicurezza. Chi per primo internalizza questa disciplina, non chi per primo raggiunge il 90% su un benchmark difettoso, vincerà nei mercati regolati e ad alto rischio.
Fonti
- https://arxiv.org/abs/2609.38043v1
- https://arxiv.org/abs/2609.37849v1
- https://arxiv.org/abs/2609.37686v1
- https://arxiv.org/abs/2609.36845v1
- https://arxiv.org/abs/2609.35958v1
- https://arxiv.org/abs/2609.35936v1
- https://arxiv.org/abs/2609.35319v1
- https://arxiv.org/abs/2609.37501v1
- https://arxiv.org/abs/2609.34686v1
- https://arxiv.org/abs/2609.33639v1
- https://www.nist.gov/news-events/news/2026/09/nist-provides-updates-national-construction-safety-team-activities
Altre letture
- Agentic AI in Produzione: Perché Valutazione, Monitoraggio e Routing Sono il Vero Collo di Bottiglia (Non i Benchmark) Quattro paper pubblicati nell'ultima settimana su arXiv rivelano che il vero ostacolo all'adozione dell'AI agentiva non è la capacità dei modelli, ma l'assenza di infrastrutture per valutarne l'operato in contesti dinamici, monitorarne le traiettorie multi-step e instradarne le decisioni sotto vincoli di rischio certificabili.
- AI agentiva ad alto rischio: il vuoto tra benchmark e affidabilità reale in finanza, difesa e sistemi autonomi Nuove ricerche rivelano falle sistemiche negli agenti autonomi in contesti critici: dal trading finanziario alla difesa aerea, l'autonomia non garantisce robustezza. Serve un cambio di paradigma nella valutazione.
- AI agentiva 2026: affidabilità, sicurezza fisica e nuovi paradigmi di valutazione per l'impresa Mentre l'attenzione si concentra sui modelli, la ricerca sposta il focus su runtime, benchmark realistici, sicurezza cyber-fisica e architetture per l'orizzonte lungo. Ecco cosa cambia per chi porta l'AI agentiva in produzione.