ai-agentiva

L'AI agentiva diventa architetto di sistemi fisici: chip, robot e reti veicolari sotto il controllo di agenti autonomi

Dalla progettazione di circuiti RF alla navigazione robotica, passando per la modellazione elettrochimica e lo scheduling industriale: i nuovi framework multi-agente non scrivono solo codice, ma co-progettano hardware e sistemi fisici con vincoli reali. Una svolta che ridefinisce il confine tra intelligenza artificiale e ingegneria.

Pubblicato il

Quando l'agente non si ferma al software

Da mesi il dibattito sull'AI agentiva ruota attorno a concetti come autonomia, pianificazione, uso di tool e valutazione. Ma una silenziosa rivoluzione sta avvenendo nei laboratori dove il codice incontra la materia: agenti basati su LLM stanno iniziando a progettare, validare e ottimizzare sistemi fisici reali — circuiti analogici a 60 GHz, robot mobili che navigano in ambienti sconosciuti, reattori elettrochimici, reti veicolari time-sensitive. Non si tratta più di generare snippet di codice o orchestrare API: l'agente diventa co-architetto di sistemi dove le leggi della fisica, i vincoli di latenza e i limiti di fabbricazione non sono astrazioni, ma confini invalicabili.

Le pubblicazioni degli ultimi giorni su arXiv disegnano un quadro coerente: l'AI agentiva sta uscendo dal dominio puramente digitale per entrare in quello cibernetico, dove ogni decisione ha un corrispettivo misurabile in volt, millisecondi, nanometri o newton. E lo sta facendo con architetture che separano rigorosamente il ragionamento simbolico dall'esecuzione deterministica, proprio come richiedono i contesti ad alto rischio.

RFChipAgent: il primo flusso multi-agente end-to-end per chip analogici/RF

La progettazione di circuiti analogici e a radiofrequenza rimane "uno dei passaggi più laboriosi nello sviluppo di chip" (RFChipAgent: Multi-Agentic AI Flow for Analog/RF Chip Design). Standard emergenti come Wi-Fi 7 e 6G impongono requisiti stringenti, ma l'expertise umano è scarsa e costosa. RFChipAgent affronta il problema con un'architettura che include quattro agenti specializzati (topologia, schematico, testbench, sizing) supportati da un sistema RAG multimodale con indicizzazione FAISS per estrarre conoscenza da documentazione ingegneristica privata, e da un database di simulazioni "trust-scored" che accumula dati verificati per guidare le iterazioni successive. Il motore di sizing a ciclo chiuso combina ottimizzazione TPE e CMA-ES con simulatore-in-the-loop.

Validato su una famiglia di LNA mm-wave a 60 GHz in tecnologia GF22FDSOI, il sistema dimostra generazione automatica di topologie, esplorazione dello spazio di progettazione guidata da specifiche, e ottimizzazione guidata da simulazione con riduzioni sostanziali dello sforzo progettuale mantenendo qualità da sign-off. Il punto chiave: l'agente non "immagina" il circuito — lo costruisce, lo simula, ne verifica le prestazioni contro modelli fisici reali, e itera. La fiducia non deriva dal prompt, ma dal ciclo di verifica simulatore-in-the-loop.

iAm.md e NavGPT-3: l'introspezione agente per la robotica embodied

Se RFChipAgent opera nel dominio della microelettronica, iAm.md e NavGPT-3 affrontano la sfida speculare: agenti che devono agire nel mondo fisico attraverso corpi robotici. Il problema centrale è il "grounding failure": l'LLM genera piani plausibili che il robot reale non può eseguire per limiti cinematici, sensoriali o ambientali (iAm.md: Robot Skill Self-Assessment through Agentic Introspection for Unknown Open-Vocabulary Domains).

iAm.md introduce uno standard Markdown e un framework di generazione che ancora la generazione di comportamento a evidenze di deployment reali. Attraverso mapping semantico open-vocabulary, combina rilevazioni vision-language locali e segmentazione degli oggetti, riferendole a record oggetto persistenti in una rappresentazione intermedia standardizzata. Questo permette "introspezione agentica": l'agente può auto-valutare le proprie skill rispetto a ciò che il robot e l'ambiente effettivamente supportano. Testato su un TIAGo simulato in task navigation-and-manipulation, il framework supporta congiuntamente auto-valutazione delle skill e generalizzazione di task eseguibili.

NavGPT-3 spinge oltre: connette un modello linguistico addestrato con RL a lungo orizzonte a una policy di azione (NavGPT VLA, 8B parametri, addestrata su 19,28M esempi) tramite un runtime simile a un OS (NavGPT-3: Harnessing Context in a Hierarchical Navigation Runtime). Ragionamento, azione e monitoraggio girano come thread con contesto, tool e permessi propri; lo scheduler decide quale thread controlla il moto del robot, permettendo reazione a eventi improvvisi tramite interruzione e context switching. Risultati: state-of-the-art su R2R-CE (81,51% SR) e, per la prima volta, livello umano su RxR-CE (90,43% vs 90,4% success rate umano, 78,47 vs 77,7 nDTW path fidelity) a 1 min 22 s per episodio contro ~3 min umani. Quando la policy d'azione esegue la rotta, il loop di ragionamento si accorcia e il tempo di reazione minimo scende da 3-19 s per decisione LLM a 0,5-1 s per step di policy (1-2 Hz).

Modellazione multifisica e scheduling: l'agente come ingegnere di dominio vincolato

Due lavori mostrano come lo stesso paradigma — specifica formale verificabile + agente che implementa + verifica deterministica — si applichi a domini diversissimi.

Per dispositivi elettrochimici (riduzione CO2 a CO in elettrodi a diffusione gassosa), un agente LLM costruisce modelli multifisica completi in Julia open-source partendo da una specifica leggibile automaticamente contenente equazioni governanti, parametri, metodi numerici, fasi di build logiche e checkpoint verificabili umanamente (LLM-Assisted Generation of Transparent, Open-Source Multiphysics Models of Electrochemical Devices). Modelli costruiti autonomamente concordano con un'implementazione COMSOL equivalente entro lo 0,7% della densità di corrente parziale di CO di picco, e tra loro entro lo 0,04%. Errori introdotti sistematicamente dimostrano l'importanza di specifiche esplicite per la riproducibilità e rivelano capacità e limiti dell'agente nel debugging della fisica del modello.

Per lo scheduling di produzione, agenti general-purpose formulano e implementano modelli di constraint programming da descrizioni in linguaggio naturale (Agentic AI-Assisted Modeling for Production Scheduling: Assessment in Constraint Programming). Le architetture single e multi-agente sono integrate con un Model Context Protocol server per recupero documentazione solver context-aware. Il workflow multi-agente alza la quota di script eseguibili correttamente dal 14,8% (chiamata LLM diretta) al 59,3%, raggiungendo l'80,6% sui quattro problemi meno complessi (flow-shop, job-shop, flexible job-shop, warehouse scheduling resource-constrained). I modelli intralogistici strettamente accoppiati rimangono una sfida aperta. Qui l'agente non scrive solo codice: traduce vincoli industriali in modelli matematici risolvibili, colmando il gap tra descrizione del problema e implementazione solver.

Reti veicolari time-sensitive: MARL deadline-aware per il edge

Nel vehicular edge computing (VEC), la latenza non è una metrica: è un vincolo contrattuale. Deadline-Aware Multi-Agent Reinforcement Learning for TSN-Based Vehicular Edge Networks assegna a ogni coda TSN un agente autonomo che impara congiuntamente ordine di servizio e durata di time-slot per minimizzare deadline miss sotto requisiti di latenza dipendenti dalla velocità (Deadline-Aware Multi-Agent Reinforcement Learning for TSN-Based Vehicular Edge Networks). MAPPO (Multi-Agent Proximal Policy Optimization) abilita decisioni di scheduling coordinate ma autonome. Contro baseline single-agent, multi-agent e non-learning, MAPPO riduce latenza di servizio fino al 66,2% e migliora affidabilità fino al 271,8%. A differenza di euristiche basate sull'urgenza, garantisce scheduling bilanciato con tempi di inferenza inferiori ad altri metodi MARL. Qui l'agente è il controller di rete in tempo reale, non un pianificatore offline.

Il filo conduttore: harness, specifiche e verifica deterministica

Cosa accomuna RFChipAgent, iAm.md, NavGPT-3, la modellazione multifisica, lo scheduling CP e il MARL veicolare? Tre principi architetturali ricorrenti:

  1. L'harness come superficie mutabile unica. Come argomentato nel lavoro su pipeline di credito (The Harness as the Only Mutable Surface: Compliance-Bounded Self-Evolution of LLM Agents in Credit Pipelines, with a Measured Admission Gate), l'auto-evoluzione è revisionabile solo se confinata all'harness runtime (testo istruzioni, logica tool-call, composizione primitive) mentre i pesi del modello restano fissi. Ogni adattamento è un diff con causa e test allegati. Un "admission gate" scrive record hash-chained prima del deployment. In simulazione, il gate ha ammesso 144 su 7.449 cambiamenti candidati, nessuno dei quali ha peggiorato l'errore sui dati held-out, ripristinando il false-positive rate al livello oracolo. Senza gate, lo stesso loop ha ammesso 309 cambiamenti dannosi.
  1. Separazione rigorosa tra ragionamento LLM e computazione deterministica. ARGUS per la genomica regolatoria "separa strettamente computazione biologica deterministica da ragionamento mediato da LLM" (Unlocking the Regulatory Genome by ARGUS: An Evidence-Constrained Agentic Framework for Interpreting Single Nucleotide Variants). Un planner seleziona fonti di evidenza basandosi sull'incertezza corrente, un verifier interpreta deterministicamente ogni osservazione, e i risultati intermedi cambiano il percorso d'indagine. Su varianti oncologiche, lo stesso planner produce traiettorie divergenti per diversi fattori di trascrizione, astenendosi quando l'evidenza è mista o assente. Nessuna allucinazione: ogni osservazione proviene da query reali ad ADASTRA, JASPAR, ENCODE cCRE.
  1. Tracciabilità forense dell'attività agente. GROB dimostra che tracce pubbliche sparse possono rimanere utili per ricostruire attività agente candidate anche prima che il loro significato sia compreso pienamente (GROB: A Multi-Agent Architecture for Public-Trace Investigation of Candidate Agentic Activity). In un corpus congelato di settembre 2026, identificatori catturati il 9 settembre sono stati in seguito collegati a specifiche richieste Census del 16-17 giugno. L'identità di esecuzione rimane una questione aperta: la continuità di identità dell'agente è un problema di ricerca attivo.

Implicazioni per l'industria italiana: dall'automotive al manifatturiero avanzato

L'Italia ha una posizione unica in questa transizione. La filiera automotive e componentistica (Magneti Marelli, Brembo, Dallara, ecc.) è un candidato naturale per RFChipAgent-type flows: chip analogici/RF per radar, lidar, comunicazione V2X, gestione batteria. La robotica industriale e di servizio (Comau, Humanoid, startup di manipolazione) può adottare paradigmi iAm.md/NavGPT-3 per robot che si auto-valutano in ambienti non strutturati — magazzini, cantieri, assistenza. Il manifatturiero avanzato (macchine utensili, packaging, farmaceutico) beneficia direttamente di agentic CP scheduling per linee flessibili e changeover rapidi. L'elettrochimica applicata (batterie, idrogeno, carbon capture) trova nella modellazione multifisica agent-driven un acceleratore per digital twin fisicamente fedeli. Le reti veicolari e infrastrutture intelligenti (progetti C-Roads, 5G Italia, TSN per trasporti) richiedono proprio quel controllo deadline-aware distribuito che il MARL veicolare dimostra.

Il denominatore comune non è "usare LLM", ma costruire harness verificabili che vincolano l'agente entro i confini della fisica, della normativa e della sicurezza operativa. Chi padroneggia questo pattern — specifica formale, agente come implementatore, verifica deterministica, gate di ammissione — non "adotta AI": ingegnerizza sistemi ibridi dove l'intelligenza artificiale è un componente certificabile, non una scatola nera.

Oltre il benchmark: la metrica è il sign-off

I benchmark agentici (MLE-Bench, Zork, R2R, RxR) misurano capacità astratte. I lavori qui recensiti spostano l'asticella: la metrica è il sign-off. Sign-off qualità per tape-out chip. Livello umano per navigazione reale. Concordanza 0,7% con COMSOL per reattori elettrochimici. 80%+ script eseguibili per scheduling industriale. 66% latenza in meno, 271% affidabilità in più per reti veicolari. Zero cambiamenti dannosi ammessi per pipeline di credito.

Questo è il nuovo standard per l'AI agentiva in contesti ad alto valore e alto rischio: non "funziona nel benchmark", ma "passa il sign-off dell'ingegnere responsabile". E l'ingegnere responsabile, in Italia come altrove, firma su specifiche, test, tracciabilità e conformità — non su prompt ben congegnati.

Fonti