robotica
Robotica 2026: automiglioramento in tempo di test, coordinazione semantica e nuovi benchmark per l'autonomia adattiva
Nuovi framework (RPG, InterEvolve, DuoMind, GlassGuard) consentono ai robot di auto-migliorarsi in esecuzione, coordinarsi semanticamente e navigare ambienti complessi senza riaddestramento. Benchmark e modelli mondo-azione efficienti aprono all'orchestrazione di flotte eterogenee nell'industria italiana.
Pubblicato il
La robotica sta vivendo un cambio di paradigma silenzioso ma profondo. Fino a poco tempo fa, il ciclo di vita di un sistema autonomo seguiva uno schema lineare: addestramento offline, deployment, e — se qualcosa andava storto — ritorno in laboratorio per un nuovo ciclo di addestramento. Oggi, una serie di lavori pubblicati nella prima settimana di ottobre 2026 su arXiv segnala una convergenza verso architetture che imparano durante l'esecuzione, senza aggiornare i pesi dei modelli, e che coordinano tra agenti eterogenei scambiandosi informazioni semantiche invece di traiettorie grezze. Non si tratta più solo di sim-to-real o zero-shot, ma di test-time evolution: la capacità di un robot — o di una squadra di robot — di migliorare le proprie prestazioni mentre opera, diagnosticando errori, componendo competenze riutilizzabili e negoziando ruoli con partner le cui limitazioni fisiche possono essere sconosciute.
Questo articolo esplora quattro fronti complementari emersi dagli ultimi preprint: l'automiglioramento guidato da diagnosi simboliche (RPG), l'evoluzione di programmi di ricompensa per umanoidi (InterEvolve), l'inferenza di vincoli fisici per coordinazione zero-shot (Watch, Infer, Coordinate), e un'architettura gerarchica a comunicazione semantica per squadre multi-robot (DuoMind). Insieme, disegnano un panorama in cui l'affidabilità non deriva più solo da dati massivi, ma da cicli di feedback strutturati, modelli del mondo compatti e interfacce linguaggio-azione che separano ragionamento ed esecuzione.
Automiglioramento senza riaddestramento: RPG e la pratica simulata
Il framework Reconstruct, Practice, Go Real (RPG) (Fonte 1) affronta il collo di bottiglia dell'ingegneria umana: sviluppare e mantenere competenze, progettare funzioni di ricompensa, integrare percezione e controllo. RPG parte da un dataset offline di manipolazione, identifica capacità latenti e costruisce task di pratica in simulazione. Durante la pratica, usa tre segnali — feedback di esecuzione, stato privilegiato del simulatore, video del dataset — per diagnosticare i fallimenti. Da queste diagnosi genera nuove competenze simboliche riutilizzabili, raffina quelle esistenti e aggiorna il system prompt che guida un LLM multimodale nell'orchestrazione percezione-controllo.
Il ciclo include una fase di cross-task evaluation: ogni modifica candidata viene testata singolarmente e in combinazione prima di entrare nella libreria. I risultati sono notevoli: su 22 task di manipolazione held-out, il tasso di successo passa dal 28,6% dopo il primo round al 95,0% dopo 15 round, superando ASPIRE (75,5%) e CaP-Agent0 con GPT-6 Astra Pro (60,0%). Dopo una procedura comune di calibrazione e adattamento hardware, il sistema congelato (nessun aggiornamento pesi) riesce in tutti i 30 tentativi fisici (10 per task su 3 task). Il progetto è consultabile su rpg-robot.github.io.
La lezione architetturale è chiara: separare la generazione di competenze (simboliche, ispezionabili, componibili) dall'esecuzione neurale permette cicli di miglioramento veloci, verificabili e trasferibili. Non serve riaddestrare; serve un simulatore, un dataset di riferimento e un meccanismo di diagnosi che trasformi l'errore in conoscenza strutturata.
Evoluzione in tempo di test per umanoidi: InterEvolve e i programmi di ricompensa
Mentre RPG lavora su bracci manipolatori, InterEvolve (Fonte 3) sposta il focus sulla loco-manipolazione umanoide — compiti che richiedono coordinazione corpo-oggetto in movimento. L'intuizione centrale: un controller broad (addestrato su molti task) possiede già gran parte della competenza motoria necessaria per task nuovi; serve un'interfaccia espressiva ma misurabile tra pianificazione e controllo per sbloccare questa competenza.
InterEvolve realizza questa interfaccia con due componenti. Primo, un modello comportamentale forward-backward (FB) object-aware: residui oggetto su un body prior congelato trasformano una nuova ricompensa (sul corpo o sugli oggetti) in comportamento di loco-manipolazione in tempo di test. Secondo, i task sono specificati come programmi di ricompensa: ricompense a stadi con condizioni di completamento e costanti regolabili. Un agente LLM revisiona la struttura del programma nel contesto, attingendo a feedback di esecuzione e a una libreria di programmi verificati; un ottimizzatore numerico accorda le costanti. Ogni candidato viene verificato in scenari simulati paralleli.
Il risultato: le ricompense progettate dall'uomo lasciano inespressa gran parte della competenza del modello FB, mentre i programmi evoluti da InterEvolve la rilasciano, talvolta attraverso strategie nuove. Le competenze evolute girano autonomamente su un Unitree G1 fisico tramite telecamera egocentrica. Questo segna un passaggio decisivo: non imparare nuovi movimenti, ma scoprire come comporre quelli già noti per obiettivi nuovi, con garanzie di verifica simulata prima della messa in opera.
Coordinazione multi-robot: inferire i vincoli, parlare per simboli
La manipolazione cooperativa — trasportare oggetti grandi, assemblare strutture — richiede che i robot conoscano i limiti reciproci. Watch, Infer, Coordinate (Fonte 4) studia se un robot helper può inferire i vincoli fisici di un partner (degradazione hardware, guasti attuatori) osservandolo coordinarsi con un terzo robot, per poi coordinarsi con esso su un task nuovo zero-shot. La difficoltà: una dimostrazione mostra cosa il robot vincolato ha fatto, non cosa avrebbe potuto fare; inoltre, l'altro robot può aver compensato, mascherando il limite.
L'intuizione chiave: i vincoli plasmano il comportamento congiunto della squadra, rendendo le azioni di entrambi i robot informative sulla capacità del partner vincolato. Il benchmark copre tre scenari di manipolazione fisicamente accoppiati; l'approccio di inferenza valuta candidati vincoli usando il comportamento congiunto osservato. Su tutti e tre gli scenari, il metodo migliora sostanzialmente inferenza e coordinazione zero-shot, avvicinando un oracolo che conosce i veri vincoli.
A monte di questa inferenza, DuoMind (Fonte 5) propone un'architettura distribuita gerarchica a comunicazione semantica per coordinazione multi-robot a lungo orizzonte. Ogni robot ha: un VLA (Vision-Language-Action) per esecuzione low-level e un VLM (Vision-Language Model) come orchestratore high-level per ragionamento e coordinazione inter-agente. A ogni passo di pianificazione, l'orchestratore ragiona su istruzione, osservazioni locali e messaggi ricevuti; genera istruzioni low-level per il VLA e messaggi semantici per gli altri robot.
L'architettura sfrutta i punti di forza complementari: ragionamento semantico dei VLM + generazione d'azione precisa dei VLA. Per colmare la scarsità di benchmark, gli autori introducono RoboPoly: task di manipolazione a lungo orizzonte che richiedono esecuzione closed-loop coordinata sotto controllo distribuito. Su RoboPoly e RoboTwin, DuoMind migliora le prestazioni; gli studi di ablazione confermano i contributi di orchestrazione gerarchica e comunicazione semantica. Il progetto è su duomind-project.github.io.
Umanoidi che usano attrezzi: il divario tra selezione ed esecuzione
L'uso di strumenti estende i limiti fisici intrinseci degli umanoidi, ma richiede selezione dell'attrezzo giusto e coordinazione manipolazione-locomozione. HumanoidToolBench (Fonte 8) introduce un benchmark di 18 task su tre scenari, tre livelli di esecuzione e due modalità di set attrezzi, con ToolBook: 3.1k dimostrazioni in simulazione e su Unitree G1 reale. La valutazione di sette policy in simulazione e tre sul robot reale rivela divari sostanziali tra selezione corretta e completamento del task. Sonde focalizzate su GR00T N1.7 mostrano accuratezza di selezione ridotta su attrezzi non visti e persistenza nell'esecuzione sotto istruzioni non correlate — un segnale di overfitting comportamentale che i benchmark tradizionali non catturano. Codice e dati: snu-pi.github.io/HumanoidToolBench.
Questo benchmark espone una verità operativa: selezionare lo strumento non basta; serve mantenerne l'uso coerente per tutto l'orizzonte del task, adattando locomozione e manipolazione in closed-loop. È qui che framework come InterEvolve (evoluzione programmi di ricompensa) e DuoMind (coordinazione semantica) diventano complementari: il primo per comporre competenze motorie per l'uso dello strumento, il secondo per negoziare ruoli se più umanoidi condividono attrezzi o spazi.
Implicazioni per l'industria italiana: dall'integrazione all'orchestrazione
Per le imprese italiane — manifattura avanzata, logistica, ispezione infrastrutturale, agricoltura di precisione — questi sviluppi spostano il fuoco da "quale robot comprare" a "quale architettura software orchestra la flotta". Tre direttrici operative emergono:
- Automiglioramento in produzione: Framework come RPG permettono a celle robotiche di affinarsi durante turni notturni o lotti di cambio prodotto, accumulando competenze simboliche certificate. Non serve fermare la linea per riaddestrare; serve un gemello digitale sufficientemente fedele per la pratica e un meccanismo di cross-task evaluation prima del commit. Le PMI italiane con alta variabilità di lotti (es. macchinari per packaging, lavorazione metalli) possono ridurre i tempi di riattrezzaggio da ore a minuti.
- Team eterogenei e legacy: Watch, Infer, Coordinate e DuoMind abilitano coordinazione tra robot di generazioni diverse — un braccio collaborativo nuovo accanto a un gantry di dieci anni fa con ridotta corsa su un asse. L'inferenza di vincoli evita costosi adeguamenti sensoriali; la comunicazione semantica ("sposta il pallet in posa 3") sostituisce lo scambio di traiettorie joint-space, rendendo l'integrazione indipendente dal fornitore.
- **Umanoidi come general-purpose in ambienti non strutturati: HumanoidToolBench e InterEvolve segnalano che gli umanoidi (Unitree G1, ma anche piattaforme europee in arrivo) stanno uscendo dai laboratori. Per cantieri navali, impianti energetici, magazzini verticali italiani, la capacità di prendere un attrezzo, camminare, usarlo, riporlo** — e migliorare la procedura la volta dopo — trasforma l'umanoide da demo a risorsa operativa. La chiave non è l'hardware (ormai commoditizzato) ma lo stack software: world-action model compatto (SkeleWAM (Fonte 6), UniWAM (Fonte 9)), evoluzione programmi di ricompensa, orchestrazione semantica.
Il mercato italiano, forte di system integrator specializzati e distretti manifatturieri densi, ha l'opportunità di standardizzare interfacce semantiche e protocolli di verifica cross-task prima che lo facciano i grandi fornitori esteri. Chi definisce come i robot si scambiano intenti, come certificano competenze apprese in simulazione, come inferiscono affidabilità reciproca — cattura il valore dell'orchestrazione, non solo dell'hardware.
Navigazione sicura in ambienti vetrati: GlassGuard e la mappatura verificata
Un fronte spesso trascurato ma critico per logistica al chiuso, automazione nel retail e ispezione edifici: superfici trasparenti e speculari. GlassGuard (Fonte 7) affronta il fallimento classico del LiDAR-SLAM: i raggi laser attraversano il vetro, lasciando confini di collisione assenti dalla mappa; tentativi di ricostruzione creano falsi positivi che contaminano lo spazio libero traversabile. GlassGuard formula il successo come copertura vetro + assenza contaminazione spazio libero, e applica questo principio in tutta la pipeline: proposal verification e global map construction. Un foundation vision model fornisce maschere istanza-vetro; indizi 3D strutturali generano ipotesi piano metriche; geometria proiettiva 2D depth-free ne verifica l'orientamento prima della consolidazione in mappa globale.
Valutato in nove scene a scala edificio (diverse strutture vetrate, scale spaziali, illuminazione), con oltre un'ora e 2,1 km di percorrenza reale, GlassGuard raggiunge 85% copertura totale vetro (versione panoramica) e 82% con input pinhole contro al massimo 61% dei baseline, producendo 5-17x meno falsi voxel per frame. Esempi qualitativi con planner di navigazione mostrano i piani ricostruiti bloccare percorsi attraverso vetro lasciando rotte traversabili aperte. Progetto: glassguardproject.github.io.
Per aziende che impiegano AMR in showroom, aeroporti, musei, stabilimenti con pareti vetrate: non è opzionale. Una mappa che crede di vedere un corridoio dove c'è una vetrata è un rischio sicurezza e continuità operativa. GlassGuard dimostra che visione + geometria proiettiva + verifica orientamento batte approcci puramente LiDAR o puramente ricostruttivi.
Efficienza dei modelli mondo-azione: SkeleWAM e UniWAM
Due lavori completano il quadro architetturale. SkeleWAM (Fonte 6) introduce un World-Action Model compatto che rappresenta la scena come scheletro 3D sparso (giunti robot, centri oggetti, punti interazione), costruito online da RGB-D e propriocettività. Lo scheletro fornisce stato geometrico unificato per generazione azione e predizione scheletro futuro — supervisione geometrica addizionale senza ricostruzione visiva. All'inferenza, genera azioni da scheletro corrente + istruzione linguistica; Medoid Action Consensus (MAC) serve come strategia di consenso per campioni stocastici. Su LIBERO-Plus: 85,9% successo con 57,1M parametri, +3,7 pp su Cosmos-Policy. Progetto: skelewam-project.github.io.
UniWAM (Fonte 9) unifica physical reasoner, world generator, action predictor per apprendimento congiunto di comprensione semantica, generazione visiva, predizione azione. Pipeline rigorosa di pulizia/annotazione dati (umano egocentrico + robot); azioni low-level rappresentate in linguaggio naturale; pre-training con supervisione complementare da VQA, dati egocentrici umani, demo robot. Post-training: future visual noise augmentation riduce dipendenza da predizioni future precise; history-conditioned flow matching usa storia azioni codificata per inizializzare generazione azione — riduce drasticamente step di denoising. UniWAM raggiunge SOTA su valutazioni multiple: in-distribution, robustezza, generalizzazione, instruction following, long-horizon. Scopre legge di scaling log-lineare per co-training umano-robot su larga scala.
Insieme, SkeleWAM e UniWAM indicano la direzione: modelli mondo-azione che separano geometria di controllo (scheletro) da semantica (linguaggio), addestrati su miscela umano-robot, efficienti abbastanza per girare su dispositivi edge. Per l'industria italiana: meno GPU in cloud, più intelligenza onboard; meno dati proprietari necessari, più trasferimento da dataset umani egocentrici pubblici.
Apprendimento per rinforzo on-policy più affidabile: FERPO
Chiude il quadro algoritmico FERPO (Forward Entropy-Regularized Policy Optimization) (Fonte 2). I metodi SOTA di RL online in continuous control usano gradienti d'azione di un critic appreso; ma critic addestrati a predire ritorni non garantiscono derivate accurate → aggiornamenti policy inaffidabili. FERPO è un algoritmo on-policy maximum entropy RL che migliora la policy usando valori del critic senza differenziarlo rispetto alle azioni. Deriva una distribuzione target azione ottimale da obiettivo policy-improvement regolarizzato da entropia e divergenza KL; adatta l'attore a questo target minimizzando forward-KL stimato con self-normalized importance sampling (SNIS) da azioni della policy di rollout. La regolarizzazione KL mantiene i pesi di importanza ben comportati. A differenza di reverse-KL (che favorisce un sottoinsieme di modi), forward-KL incoraggia copertura di modi multipli ad alto valore → esplorazione. Su MuJoCo Playground e ManiSkill: performance competitive e guadagni di sample efficiency; benchmark computazionali: aggiornamenti attore più veloci di REPPO.
Per chi integra RL in produzione: FERPO riduce il rischio di aggiornamenti distruttivi (gradienti del critic rumorosi) e accelera il ciclo di miglioramento policy — coerente con il tema test-time adaptation di RPG e InterEvolve, ma sul versante policy optimization puro.
Simulazione idrodinamica integrata: H-SPAR per robotica marina
Infine, H-SPAR (Fonte 10) affronta un dominio trascurato: robotica ambientale marina. Campionamento robotico richiede considerare la duplice influenza delle correnti: su moto del robot e su trasporto particelle (plancton, inquinanti, sedimento). Simulatori esistenti modellano flusso, autonomia, target separatamente. H-SPAR integra campi velocità spaziotemporali, trasporto lagrangiano particelle, campionamento probabilistico, autonomia USV ROS 2/Gazebo. Campi flusso precalcolati condivisi guidano advezione particelle e forze corrente durante esecuzione closed-loop. Esperimenti path-planning: planner current-aware **SVF-RRT ottiene 69,4% costo contro corrente inferiore a RRT in fase di pianificazione, ma riduzione scende a 41,7% durante esecuzione sotto correnti tempo-varianti — riflettendo variazione flusso temporale, vincoli di moto del veicolo, deviazioni di percorso omesse in pianificazione. Esperimenti coverage: orientamento di spazzolamento cambia tasso di campionamento particelle fino al 22,2%** sotto configurazione H-SPAR completa. Codice: github.com/naviiidz/h-spar-sim.
Per l'Italia — 8.000 km coste, monitoraggio lagune, porti, acquacoltura, bonifiche — simulazione integrata pianificazione-esecuzione-trasporto non è accademica: è prerequisito per missioni autonome credibili. H-SPAR fornisce baseline open-source su cui costruire toolchain nazionali.
La convergenza di questi lavori — automiglioramento simbolico, evoluzione programmi di ricompensa, inferenza vincoli partner, comunicazione semantica, benchmark uso attrezzi, navigazione vetro verificata, world-action model efficienti, RL on-policy robusto, simulazione multi-fisica integrata — disegna una robotica 2026 che non aspetta il prossimo dataset massivo, ma usa il feedback dell'esecuzione reale (o simulata ad alta fedeltà) per chiudere il ciclo tra percezione, ragionamento, azione e coordinazione. Per l'ecosistema italiano, la partita si gioca sull'architettura di orchestrazione: chi definisce gli standard di scambio semantico, verifica cross-task, e composizione competenze modulari, governa la filiera.
Fonti
- https://arxiv.org/abs/2610.02204v1
- https://arxiv.org/abs/2610.02198v1
- https://arxiv.org/abs/2610.02196v1
- https://arxiv.org/abs/2610.02170v1
- https://arxiv.org/abs/2610.02161v1
- https://arxiv.org/abs/2610.02120v1
- https://arxiv.org/abs/2610.02110v1
- https://arxiv.org/abs/2610.02089v1
- https://arxiv.org/abs/2610.02054v1
- https://arxiv.org/abs/2610.01985v1
- https://www.nist.gov/news-events/news/2026/09/nist-provides-updates-national-construction-safety-team-activities
Altre letture
- Il divario di affidabilità nell'IA incarnata 2026: perché percezione, ragionamento e interazione falliscono nel mondo reale Nonostante i progressi nei modelli Vision-Language-Action, la robotica del 2026 rivela fragilità critiche: *reward model* instabili, percezione multimodale sotto stress, ragionamento procedurale limitato e interazione uomo-robot ancora imperfetta. Le implicazioni per l'industria italiana.
- Robotica 2026: La corsa ai modelli fondamentali cross-embodiment, dalla simulazione universale al deployment in tempo reale Nuovi paper su arXiv rivelano come l'addestramento cross-embodiment su dati video eterogenei stia creando simulatori fisici universali zero-shot, mentre architetture streaming come FlashVLA abilitano controllo a 30 Hz su singola GPU e i framework state-aware colmano il divario tra pianificazione LLM ed esecuzione reale.
- Robotica 2026: Oltre la Fabbrica, le Nuove Frontiere tra Spazio, Mare e Chirurgia Autonoma Dall'estrazione di risorse sugli asteroidi alla navigazione costiera senza GPS, passando per l'endovascolare autonomo: la robotica 2026 esce dagli stabilimenti per conquistare ambienti estremi. Nuovi algoritmi auto-miglioranti e percezione multimodale abilitano l'autonomia dove l'uomo non può arrivare.