robotica

Dai laboratori alla fabbrica: uso degli strumenti, adattamento a tempo di test e policy optimization per l'umanoide operativo

Mentre l'hardware degli umanoidi matura, tre nuovi lavori definiscono le frontiere software: un benchmark rigoroso per l'uso degli strumenti, un framework che riprogramma le skill a tempo di test senza riaddestramento, e un algoritmo di reinforcement learning che ottimizza le policy senza derivare il critico.

Pubblicato il

La robotica umanoide sta vivendo una fase di transizione cruciale. Dopo anni in cui la sfida principale era far camminare un bipede senza cadere, l'attenzione si sposta ora sulla competenza operativa: la capacità di manipolare oggetti, usare utensili, adattarsi a compiti imprevisti e farlo con efficienza computazionale compatibile con il mondo reale. Tre contributi pubblicati su arXiv il 1° ottobre 2026 — HumanoidToolBench, InterEvolve e FERPO — fotografano questo passaggio dall'abilità locomotoria all'intelligenza incarnata, offrendo strumenti di valutazione, architetture di adattamento e fondamenti algoritmici che parlano direttamente alle esigenze dell'industria manifatturiera e logistica italiana.

Non si tratta più di dimostrare che un robot può camminare, ma di misurare quanto bene lavora. La piattaforma Unitree G1, comparsa sia nel benchmark HumanoidToolBench che nella validazione fisica di InterEvolve, sta diventando il riferimento de facto per questa nuova generazione di esperimenti, segnando una convergenza tra accessibilità hardware e ambizione software che ricorda i primi giorni della robotica mobile su ROS.

Il banco di prova mancante: HumanoidToolBench e il divario selezione-esecuzione

Fino a oggi, la letteratura sull'uso degli strumenti negli umanoidi era frammentata: alcuni lavori si concentravano sulla selezione visiva dello strumento giusto, altri sulla presa, altri ancora sulla traiettoria di manipolazione. HumanoidToolBench (HumanoidToolBench: Benchmarking Humanoid Tool Use from Selection to Mobile Execution) colma questo vuoto proponendo un benchmark unificato di 18 task articolati su tre scenari, tre livelli di esecuzione (stazionario, mobile, loco-manipolazione) e due modalità di tool-set (predefinito vs. aperto).

Il dato più rivelatore non sta nel tasso di successo assoluto, ma nel divario tra selezione ed esecuzione. La valutazione di sette policy in simulazione e tre sul robot reale Unitree G1 mostra che "sapere scegliere lo strumento non basta a completare il task". Le sonde mirate su GR00T N1.7 evidenziano un calo di accuratezza nella selezione su strumenti unseen e una persistenza nell'esecuzione anche sotto istruzioni non correlate — sintomo di una generalizzazione superficiale, non composizionale.

A supporto del benchmark, gli autori rilasciano ToolBook: un dataset di 3.100 dimostrazioni raccolte sia in simulazione che sul G1 reale. Per l'industria italiana, abituata a convivere con l'alta varietà di utensili e la bassa ripetitività dei lotti, ToolBook rappresenta una risorsa rara: dati multimodali (visione, propriocezione, azione) su task che richiedono coordinazione bimanuale, cambio di presa e riposizionamento della base mobile. È il tipo di dato su cui si addestrano i foundation model per la manipolazione, e averlo aperto su una piattaforma accessibile come G1 abbassa la barriera d'ingresso per PMI e centri di ricerca.

InterEvolve: quando l'umanoide riprogramma se stesso sul campo

Se HumanoidToolBench misura la competenza, InterEvolve (InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation) propone un meccanismo per espanderla senza riaddestrare i pesi della rete. L'intuizione centrale è che un controller loco-manipolazione già addestrato (un "behavioral foundation model" object-aware, detto FB) possiede una competenza latente molto più ampia di quella espressa dai reward function progettati a mano. Il problema è l'interfaccia: come specificare un nuovo task in modo che il controller possa "capirlo" ed eseguirlo, imparando dai propri tentativi?

InterEvolve risponde con due componenti. Primo, un modello forward-backward (FB) object-aware i cui object residuals su un body prior congelato trasformano un nuovo reward (sul corpo o sugli oggetti) in comportamento loco-manipolativo a tempo di test. Secondo, la specifica del task come reward program: una sequenza di reward a stadi con condizioni di completamento e costanti regolabili. Un agente LLM revisiona la struttura del programma nel contesto, attingendo a una libreria di programmi verificati e al feedback di esecuzione, mentre un ottimizzatore numerico regola le costanti. Ogni candidato viene verificato in parallelo su scenari simulati diversi.

Il risultato: i reward progettati dall'uomo lasciano inespressa gran parte della competenza del modello FB, mentre i programmi evoluti da InterEvolve la sbloccano, talvolta scoprendo strategie nuove. Le skill evolute vengono eseguite autonomamente su un Unitree G1 fisico con telecamera egocentrica. Per un'azienda italiana che deve riprogrammare una cella robotica per un nuovo componente ogni poche settimane, questo paradigma — test-time evolution invece di re-training — cambia l'economia dell'automazione flessibile: il robot diventa un apprendista che affina il proprio metodo provando, non un automa che attende il nuovo codice dell'integratore.

FERPO: ottimizzazione della policy senza derivare il critico, per un RL più esplorativo ed efficiente

Sotto l'architettura di alto livello (benchmark, reward program, LLM orchestrator) c'è il motore di apprendimento: il reinforcement learning continuo. FERPO (FERPO: Forward Entropy-Regularized Policy Optimization) affronta un problema sottile ma pervasivo: i metodi state-of-the-art di online RL (come SAC, TD3, o i recenti REPPO) migliorano la policy usando i gradienti dell'azione del critico. Ma il critico è addestrato a predire i ritorni, non le derivate rispetto all'azione; predizioni di valore accurate non garantiscono gradienti accurati, portando ad aggiornamenti di policy inaffidabili.

FERPO propone un algoritmo on-policy maximum entropy che fa policy improvement usando i valori del critico senza derivare il critico rispetto alle azioni. Deriva una distribuzione target ottimale da un obiettivo di policy improvement regolarizzato da entropia e divergenza KL, poi adatta l'attore a questa target minimizzando una forward-KL stimata con self-normalized importance sampling (SNIS) su azioni campionate dalla policy di rollout. La regolarizzazione KL mantiene i pesi di importanza ben comportati; a differenza della reverse-KL (che collassa su un modo), la forward-KL incoraggia la copertura di più modi ad alto valore, promuovendo l'esplorazione.

Su MuJoCo Playground e ManiSkill, FERPO mostra prestazioni competitive e guadagni in sample efficiency; i benchmark computazionali mostrano aggiornamenti dell'attore più veloci di REPPO. Per l'umanoide operativo, questo significa: policy che esplorano meglio lo spazio delle soluzioni (cruciale nella loco-manipolazione a contatto ricco), aggiornamenti più rapidi sul computer di bordo, e minore fragilità dovuta a gradienti di critico rumorosi. È un miglioramento fondamentale che si propaga a valle in ogni stack che usa RL per il controllo di basso livello — incluso, potenzialmente, il controller FB di InterEvolve o le policy valutate su HumanoidToolBench.

Implicazioni per l'ecosistema robotico italiano: manifattura flessibile, logistica e ispezione

Leggere questi tre lavori in controluce suggerisce una traiettoria chiara per la robotica italiana nei prossimi 18-24 mesi. La manifattura ad alta variabilità (macchine utensili, assemblaggio elettromeccanico, lavorazioni legno/ceramica) trova in HumanoidToolBench un metro di giudizio realistico per valutare fornitori e soluzioni interne: non "il robot prende il trapano", ma "il robot seleziona il trapano giusto, si posiziona, fora, cambia punta, riposiziona e verifica il foro" — tutto misurato su task standardizzati con dati reali.

La logistica di magazzino e last-mile beneficia dell'adattamento a tempo di test di InterEvolve: pallet non standard, carichi danneggiati, corridoi ristretti diventano nuovi reward program che l'umanoide evolve in ore di pratica simulata/parallela, non mesi di integrazione. La validazione sul G1 — piattaforma dal costo contenuto e form factor compatibile con spazi umani — accelera il time-to-pilot.

Infine, FERPO abbassa il costo computazionale e alza l'affidabilità del RL on-board, rendendo plausibile l'addestramento continuo (continual learning) su robot edge senza GPU farm dedicate. Questo è abilitatore per l'ispezione in ambienti non strutturati (impianti chimici, gallerie, infrastrutture idriche) dove l'umanoide deve adattare la locomozione e la manipolazione a condizioni mai viste in addestramento, con budget energetico e computazionale stretti.

L'Italia ha una tradizione forte in meccatronica, automazione flessibile e PMI manifatturiere che hanno bisogno di robot che usino i loro stessi utensili, nei loro stessi spazi, con i loro stessi ritmi di cambio prodotto. La convergenza tra benchmark realistici (HumanoidToolBench), architetture che imparano sul campo (InterEvolve, RPG (Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents)) e algoritmi di policy robusti ed efficienti (FERPO) disegna un percorso credibile dal paper al pilota industriale. La prossima sfida non è più "far camminare il robot", ma integrare questi pezzi in uno stack certificabile, manutenibile e scalabile — il vero collo di bottiglia per l'adozione diffusa.

Fonti