llm

Oltre l'addestramento standard: come la ricerca riscrive le regole dei LLM — valutazione clinica, ragionamento token-level e privacy differenziale

Dall'ottimizzazione dei prompt per la diagnostica medica alle nuove leggi di scaling per architetture ricorrenti, passando per il ragionamento a livello di token e l'addestramento privacy-preserving: i paper di fine settembre 2026 mostrano un campo che abbandona le scorciatoie per affrontare i nodi strutturali.

Pubblicato il · Aggiornato il

La letteratura sui large language models ha vissuto anni di corsa alla scala: più parametri, più dati, contesti più lunghi. Ma l'ondata di preprint pubblicati su arXiv tra il 29 e il 30 settembre 2026 racconta una transizione silenziosa ma profonda. Non si tratta più solo di «quanto grande» ma di «quanto bene» — e «quanto sicuro». Cinque lavori, apparentemente distanti per dominio (clinica, matematica, privacy, scaling laws, federated learning), convergono su un punto: le architetture e le ricette di addestramento ereditate dal paradigma pre-ChatGPT nascondono assunzioni che, sotto stress, si rompono. Chi sviluppa o adotta LLM in ambito enterprise — banche, sanità, PA, manifattura avanzata — deve iniziare a guardare sotto il cofano di metriche, funzioni di loss e scelte architetturali che davamo per scontate.

La trappola dell'accuracy: quando il 90% non basta in corsia

Il paper Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis (Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis) apre una ferita nota ma spesso ignorata: i dataset clinici sono sbilanciati per natura. Una malattia rara colpisce l'1% dei pazienti; un classificatore che predice sempre «sano» fa 99% di accuracy e zero utilità clinica. Gli autori propongono Ranking-PE, un'evoluzione del prompt search (ispirata a GEPA) che sostituisce la matrice di correttezza per-istanza con una matrice di ordinamento pairwise (positivo vs negativo). La media di colonna diventa AUROC empirico — metrica threshold-free e invariante al bilanciamento delle classi.

Il risultato è netto: su MIMIC, l'ottimizzazione basata su accuracy degrada il ranking, mentre Ranking-PE guadagna +5,8 pp AUROC su Qwen3-VL-8B fine-tunato e +16,2 pp su MedGemma-4B. L'ablation più importante però è un'altra: un visual backbone medical-grade (via vision-encoder-tuned SFT o pretraining medico) è prerequisito non sostituibile dalla prompt search. In sintesi: non si può fare prompt engineering per uscire da un deficit di rappresentazione. Per le aziende italiane che valutano LLM multimodali in sanità (referti radiologici, triage, telemedicina), il messaggio è operativo: prima di ottimizzare prompt, validare backbone e metriche. L'AUROC non è un dettaglio accademico; è la differenza tra un sistema che allerta e uno che rassicura falsamente.

Ragionamento a credito token-level: SCAPO e la stabilità semifactual

Mentre la clinica insegna a misurare bene, Semifactual Credit-Augmented Policy Optimization (Semifactual Credit-Augmented Policy Optimization) insegna a premiare bene. Il Reinforcement Learning with Verifiable Rewards (RLVR) — oggi standard per il reasoning matematico (GRPO, Group Relative Policy Optimization) — assegna lo stesso advantage derivato dall'esito a ogni token della risposta. Ma i token non sono uguali: alcuni sono ancorati al ragionamento, altri sensibili a feature irrilevanti del prompt (formulazione, ordine, stile).

Gli autori introducono interventi semifactuali: perturbano il prompt preservando problema e risposta, misurano la deriva di probabilità token-level e usano questa instabilità come segnale negativo durante l'addestramento iniziale. SCAPO riduce l'advantage per token instabili, senza dare credito extra per la stabilità da sola. Su Qwen3-4B-Base e Qwen3-1.7B-Base, SCAPO batte GRPO di 5,63 e 4,17 pp su AIME 2024-2026, e domina su benchmark out-of-distribution. La lezione per chi fine-tuna modelli per coding, legal reasoning o financial modeling: il credit assignment granulare batte il reward shaping grossolano. Non basta «la risposta è giusta»; serve sapere quali token hanno portato alla risposta giusta per le ragioni giuste.

Weight tying sotto DP-SGD: l'eredità architetturale che costa memoria e utility

La privacy differenziale non è un opzionale per banche, PA e sanità italiane soggette a GDPR e NIS2. Is Weight Tying Still Beneficial for Decoder-Only LLMs in Private Settings Under DP-SGD? (Is Weight Tying Still Beneficial for Decoder-Only LLMs in Private Settings Under DP-SGD?) mette sotto torchio una scelta architetturale ubiqua: il weight tying tra embedding di input e output (condivisi in GPT-2, LLaMA, Mistral, ecc.). In setting non-privato riduce parametri e migliora perplexity. Sotto DP-SGD, però, le cose si ribaltano.

Su GPT-2 e DistilGPT2, untied embeddings vincono costantemente: +4,74 pp accuracy su SST-2, QNLI, QQP. Più cruciale: slegare gli embedding abilita ghost clipping memory-efficient per DP-SGD. Il weight tying crea dipendenze di parametri condivisi che rompono il calcolo della ghost norm, annullando i vantaggi computazionali. Modelli untied usano oltre il 60% di memoria in meno preservando i benefici del ghost clipping. Per i team MLOps che devono fare fine-tuning privato su dati sensibili (cartelle cliniche, transazioni, documenti legali), la ricetta è controintuitiva ma chiara: raddoppiare gli embedding conviene. Meno memoria, più accuracy, pipeline DP-SGD più snella. Una revisione architetturale che costa zero inference extra e paga dividendi in compliance.

Leggi di scaling per Looping + MoE: due assi, una frontiera

Se privacy e ragionamento spingono verso efficienza, Scaling Laws for Looped Mixture of Experts (Scaling Laws for Looped Mixture of Experts) fornisce la bussola teorica. Looping (ricorrenza: lo stesso layer riapplicato) e MoE (sparsità: esperti attivati a turno) sono stati studiati in isolamento. Questo lavoro introduce Loop Scaling Laws, prima legge che modella congiuntamente ricorrenza, sparsità, model size e dati. Il cuore è una mappatura di ricorrenza condizionata alla sparsità, limitata, che quantifica il guadagno di parametri effettivi dal looping e come la sparsità alza questo guadagno.

I numeri parlano: sparsità ≈ 3× efficienza parametri attivi, ricorrenza ≈ 2× efficienza parametri totali su reasoning, scaling congiunto sposta ulteriormente la frontiera. A compute di training pari, un looped MoE con ricorrenza derivata dalla legge e guaglia un MoE non-loopato ~2× più grande sui benchmark di reasoning, abilitando test-time scaling via ricorrenza extra. Per i CTO che pianificano cluster GPU 2027-2028: non scalate solo width e depth. La prossima generazione di modelli open-weight (LLaMA-4, Nemotron, Qwen4) userà architetture looped-MoE dimensionate da queste leggi — non per moda, perché la curva compute/performance lo impone.

Compression footprints: la difesa dal model poisoning che viaggia gratis

Chiudiamo con la sicurezza della supply chain di training. Compression Footprints as Security Signals for Model-Poisoning Defense in Federated Learning (Compression Footprints as Security Signals for Model-Poisoning Defense in Federated Learning) ribalta un assunto: la lossy compression in Federated Learning (FL) è vista come rumore da tollerare. Gli autori la trattano come segnale di sicurezza. Il compression footprint — vettore low-dim di statistiche di ricostruzione, direzionalità, sparsità, payload indotte dal compressore — separa update onesti da malevoli.

Nasce CRAFT (Compression-guided Robust Aggregation via Footprint Trust): aggregazione server-side robusta che usa footprint verificabili dal server, nessun metadata client-side, nessuna conoscenza del numero di attacker, zero overhead comunicativo oltre la pipeline FL compressa. Con error-bounded lossy compressor (EBLC), CRAFT batte 6 baseline su 18 setting (36% clienti malevoli, 6 attacchi, 3 dataset) e sta entro 1,7 pp dal meglio negli altri. Per le aziende italiane che federano modelli su filiere (automotive, pharma, energia), la compressione non è solo risparmio di banda: è intrusion detection gratis. Integrare CRAFT nei server FL esistenti richiede solo lo swap dell'aggregatore — nessun cambio client, nessun accordo contrattuale aggiuntivo.

Cosa cambia per l'ecosistema italiano

Questi cinque lavori non sono esercizi accademici: sono segnali di dove il mercato andrà nei prossimi 18-24 mesi. Le imprese italiane che adottano LLM — sia via API che self-hosted — dovrebbero:

  • Auditare le metriche di valutazione: sostituire accuracy con AUROC, F1 macro, calibration curves ovunque ci sia class imbalance (sanità, fraud detection, quality control).
  • Richiedere ai vendor trasparenza su credit assignment: GRPO-style training è opaco; SCAPO-style token-level stability è verificabile via semifactual probes.
  • Rivedere le architetture per DP-SGD: se fate fine-tuning privato, testate untied embeddings + ghost clipping. Il risparmio memoria si traduce in batch size più grandi o GPU in meno.
  • Pianificare la capacità per looped-MoE: i prossimi modelli open-weight (LLaMA-4, Nemotron, Qwen4) useranno ricorrenza + sparsità. Dimensionate cluster e inference budget di conseguenza.
  • Attivare CRAFT su ogni FL pipeline: costo zero, guadagno sicurezza immediato. Se il vostro fornitore FL non lo supporta, chiedete perché.

La ricerca di fine settembre 2026 non promette AGI domani. Promette LLM più misurabili, più ragionati, più privati, più scalabili, più sicuri. È il tipo di progresso che si vede in produzione — non nei benchmark.

Fonti