llm
LLM oltre l'attenzione: architetture ricorrenti, ragionamento 3D e memoria a biografie di entità per l'AI che abita il mondo fisico
Mentre l'attenzione classica mostra i suoi limiti, nuove architetture a stati ricorrenti, modelli multimodali che "immaginano" scene 3D tramite Gaussian Splatting e memorie a biografie di entità stanno ridefinendo come i LLM elaborano contesti lunghi e interagiscono con lo spazio fisico.
Pubblicato il
La corsa ai modelli linguistici sempre più grandi ha mascherato a lungo un problema architetturale fondamentale: l'attenzione quadratica non scala, e la comprensione dello spazio fisico rimane superficiale. A settembre 2026, la letteratura tecnica segnala una convergenza silenziosa ma decisiva. Da un lato, le architetture ad attenzione lineare — Gated DeltaNet, Kimi Delta Attention — sostituiscono le cache KV crescenti con stati ricorrenti a dimensione fissa, promettendo contesti infiniti a costo costante. Dall'altro, i modelli multimodali iniziano a costruire rappresentazioni 3D compatte prima di rispondere, mentre i sistemi di memoria per video lunghi abbandonano le linee temporali a favore di biografie di entità fisiche tracciate nel tempo. Non sono esperimenti isolati: sono i pilastri di un'AI che deve operare nel mondo reale, non solo nello spazio dei token.
Il collo di bottiglia non è più solo la potenza di calcolo, ma la fedeltà con cui l'informazione persiste e si struttura attraverso passaggi sequenziali. Quantizzare uno stato ricorrente senza degradare il modello richiede di capire quando e dove l'errore conta. Insegnare a un MLLM a ragionare in 3D richiede di superare la corrispondenza pixel-per-pixel per abbracciare una geometria grossolana ma semantica. Mantenere l'identità di un oggetto attraverso ore di video richiede di ancorare le osservazioni a un'entità persistente, non a una descrizione testuale. Tre problemi, una radice comune: la rappresentazione.
Stati ricorrenti sotto pressione: la quantizzazione come leva architetturale
L'adozione di architetture ibride ad attenzione lineare (GDN, KDA) ha spostato il collo di bottiglia dall'attenzione allo stato ricorrente. Leggere e aggiornare ripetutamente uno stato fisso in bassa precisione accumula errori di arrotondamento che si propagano per migliaia di passi di decodifica. Due lavori pubblicati lo stesso giorno su arXiv affrontano il problema da angolazioni complementari (STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization) (LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization).
STEPQuant analizza la sensibilità spaziale e temporale: errori in righe di chiave a lunga vita persistono per molti step; righe diverse impattano l'output in modo asimmetrico; le magnitudini variano drasticamente tra righe e colonne. La soluzione alloca bit in base a lifetime e magnitude dell'errore, adattando scale per riga di chiave e colonna di valore. Su Qwen3.8-27B e Kimi-Linear-48B-A3B-Instruct, 6 bit bastano per eguagliare FP32, con compressione 5x dello stato e riduzione fino al 68,7% della memoria di serving, integrata in SGLang con kernel GPU ottimizzati.
LeapQuant adotta una strategia training-free a 8 bit: quantizza lo stato solo alla fine di una finestra di token (per-window quantization), calcolando gli output da stato a bassa precisione più aggiornamenti ad alta precisione bufferizzati dentro la finestra. Mantiene i maggiori outlier come pochi Compensator Tokens ad alta precisione che condividono il percorso di aggiornamento, poi liscia il residuo prima di quantizzare. Risultato: speedup 2–3,7x a livello kernel e 1,47x end-to-end su B200, RTX PRO 6000 e RTX 5090, con qualità pari a FP32 su famiglie Qwen, Kimi, GLM.
Entrambi i lavori rivelano una verità operativa: lo stato ricorrente non è un blob opaco. Ha struttura — righe che contano di più, colonne che durano di più, outlier che reggono l'accuratezza. Chi gestisce inference su larga scala deve smettere di trattare la quantizzazione come post-processing uniforme e iniziare a progettare memory-aware scheduling che rispetti la topologia dell'errore.
Immaginare la scena: quando il 3D nasce dalla ricostruzione, non dall'iniezione
I MLLM odierni gestiscono bene singole immagini, ma falliscono nell'integrare evidenze multi-vista in una comprensione 3D coerente. Gli approcci correnti iniettano feature da modelli fondazionali 3D o forzano corrispondenze pixel-level cross-view. Imagine3D-LLM rovescia il paradigma: imita il ragionamento spaziale umano — identificare oggetti comuni tra viste, inferire geometria relativa, assemblare un layout 3D grossolano — e lo rende differenziabile (Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering).
L'architettura aggiunge un piccolo set di summary tokens learnable dopo i token immagine, li decodifica in una rappresentazione 3D Gaussian Splatting compatta supervisionata da una loss fotometrica di ricostruzione, e addestra congiuntamente con la next-token prediction. Il punto chiave: sebbene solo i summary tokens ricevano supervisione diretta di ricostruzione, l'obiettivo induce corrispondenze cross-frame più forti dentro le feature immagine del LLM. Imparare a ricostruire propaga segnali 3D-aware attraverso tutto il modello.
Su benchmark di spatial reasoning e 3D understanding, Imagine3D-LLM supera costantemente i metodi che iniettano geometria pixel-wise. La lezione per l'industria: **non serve iniettare conoscenza 3D preconfezionata; basta costringere il modello a generare una rappresentazione 3D minima e coerente come passo intermedio**. La ricostruzione come obiettivo ausiliario diventa un regolarizzatore architetturale che allinea lo spazio latente alla geometria fisica — cruciale per robotica, digital twin, ispezione industriale.
Memoria a biografie: l'identità fisica come primitiva di retrieval
Video lunghi (giorni, settimane) pongono un problema che le memorie cronologiche o basate su entità testuali non risolvono: diversi oggetti condividono una descrizione; lo stesso oggetto appare diverso tra eventi. Recuperare clip rilevanti non recupera la biografia dell'istanza fisica specifica. Grounded Entity Biographies (GEB) introduce un framework che raggruppa osservazioni visivamente ancorate della stessa istanza fisica tra clip in biografie recuperabili, preservando il contesto di ogni momento (Beyond the Timeline: Augmenting Long-Video Memory with Grounded Entity Biographies).
Durante il QA, la biografia viene recuperata insieme all'evidenza episodica, permettendo al modello di seguire un'entità attraverso eventi usando link di identità stabiliti durante la costruzione della memoria. Su quattro benchmark (inclusi recording giornalieri/settimanali), GEB migliora sia multiple-choice che open-ended QA. Su EgoLifeQA: 72,0% accuracy, +4,4 pp sul best published. Ablazioni confermano che associazione di identità ancorata e lettura di biografia contribuiscono entrambe; descrizioni aggiuntive da sole non bastano.
L'implicazione architetturale: la memoria non è un log, è un grafo di entità persistenti con ancoraggio visivo. Per le aziende che processano flussi video (sorveglianza, manifattura, logistica), questo sposta il paradigma da "retrieval per similarità testuale" a "tracking per identità fisica". La privacy by design ne beneficia: l'identità è visiva, non biometrica nominativa.
Feedback latente in pretraining: rompere il collo di bottiglia feed-forward
I Transformer sono feed-forward: le rappresentazioni deep non tornano agli strati shallow; l'unico canale discendente cross-step è il token decodificato. LIFT (Latent Information Feedback Transformer) rimuove il collo di bottiglia durante il pretraining: trasforma l'apprendimento dello stato ricorrente in un problema di teacher-forced prediction (Pretraining Latent Information Feedback Transformers with Teacher Supervision).
Ogni token di input è accoppiato a uno stato information-dense, derivato dalla distribuzione next-token di un LM pre-addestrato off-the-shelf. Il modello, esteso con pochi parametri addizionali, impara a predire sia il next token che il next state. Gli stati di input sono precalcolati → pretraining resta fully parallel across positions. In inference, gli stati predetti dal modello vengono re-iniettati (feedback deep-to-shallow), con overhead che decresce con la taglia del modello.
Esperimenti 135M–1B parametri: LIFT batte Transformer standard e baseline su language modeling, reasoning downstream, task procedurali a budget token-matched, ed è on-par o ahead a compute-matched. Su task di state-tracking, un tiny LIFT batte Transformer same-size addestrati su 8x più dati, anche quando addestrato con stati di un Transformer che fallisce il task.
La portata: il feedback latente non richiede architetture ricorrenti complesse in inference; si impara durante il pretraining via distillazione di stato da un teacher. Questo apre la strada a modelli che "pensano in stati" non solo in token, con implicazioni per reasoning a passi lunghi, planning, e coerenza cross-documento — senza il costo computazionale di architetture ricorrenti native.
Convergenza: verso modelli che abitano lo spazio e il tempo
Tre vettori stanno convergendo:
- Stati ricorrenti quantizzati con consapevolezza topologica (STEPQuant, LeapQuant) rendono l'attenzione lineare praticabile in produzione, comprimendo la memoria senza sacrificare accuratezza.
- Ricostruzione 3D come obiettivo ausiliario (Imagine3D-LLM) allinea lo spazio latente multimodale alla geometria fisica, abilitando spatial reasoning senza supervisione 3D densa.
- Memoria a entità ancorate (GEB) e feedback latente in pretraining (LIFT) forniscono primitivi per persistenza identitaria e propagazione di stato cross-layer.
Non sono feature: sono primitive architetturali per LLM che devono operare su orizzonti temporali lunghi, in ambienti 3D, con coerenza di stato. Per le aziende italiane che valutano deployment di AI su edge industriale, robotica, monitoraggio infrastrutture, gestione asset video: la domanda non è "quale modello scegliere", ma "quale architettura supporta le primitive di cui ho bisogno — stato ricorrente compresso, grounding 3D, identità persistente, feedback latente?".
Il prossimo ciclo di procurement non valuterà benchmark su chat, ma architettural fitness per il carico di lavoro fisico-temporale dell'azienda. Chi progetta sistemi oggi deve parlare la lingua degli stati ricorrenti, delle Gaussian Splatting latenti, delle biografie di entità — non solo quella dei token e dell'attenzione.
Fonti
- https://arxiv.org/abs/2609.38178v1
- https://arxiv.org/abs/2609.38177v1
- https://arxiv.org/abs/2609.38176v1
- https://arxiv.org/abs/2609.38169v1
- https://arxiv.org/abs/2609.38166v1
- https://arxiv.org/abs/2609.38165v1
- https://arxiv.org/abs/2609.38161v1
- https://arxiv.org/abs/2609.38157v1
- https://arxiv.org/abs/2609.38155v1
- https://arxiv.org/abs/2609.38149v1
- https://www.nist.gov/news-events/news/2026/09/nist-provides-updates-national-construction-safety-team-activities
Altre letture
- LLM e mondo fisico: il divario tra linguaggio e realtà che frena l'adozione industriale Nuove ricerche rivelano che i modelli linguistici faticano a interiorizzare vincoli fisici e misurazioni oggettive. Dalla robotica alla generazione di colore, l'embodiment richiede architetture radicalmente diverse.
- Oltre lo Scaling: Come l'Inference-Time Computing e la Curazione dei Dati Stanno Ridefinendo l'Efficienza degli LLM La ricerca più recente sposta il focus dall'aumento dei parametri all'ottimizzazione dell'inferenza, alla qualità dei dati di addestramento e alla memoria persistente degli agenti. Nuovi framework come CritICL, TTPO e WikiSkill dimostrano che modelli più piccoli possono superare quelli grandi se guidati intelligentemente.
- LLM 2026: L'Era dei Modelli Multimodali per la Difesa dei Contenuti Digitali e la Sicurezza Visiva Nel 2026 i modelli linguistici multimodali stanno ridefinendo l'analisi integrata di testo, immagini e video, aprendo nuove strade per contrastare minacce come deepfake e manipolazioni visive. Scopriamo come le aziende italiane possono sfruttare queste tecnologie per rafforzare la protezione dei dati e la resilienza operativa.