Cos'è la LoRA (Low-Rank Adaptation)?
Tecnica di fine-tuning che allena piccole matrici aggiuntive invece di tutto il modello: stessi risultati pratici, una frazione del costo.
La LoRA (Low-Rank Adaptation) è una tecnica che esegue il fine-tuning senza toccare i pesi originali del modello. Invece di aggiornare miliardi di parametri, li congela e aggiunge accanto a ogni strato interessato una coppia di matrici molto più piccole, che vengono addestrate sui tuoi dati. Alla fine il comportamento del modello cambia quasi come con un fine-tuning completo, ma quello che hai allenato e devi salvare è una frazione minuscola dei parametri totali. Il nome deriva dal fatto che l'aggiornamento viene forzato a una forma di "rango basso", una scorciatoia matematica che riduce drasticamente il numero di parametri liberi senza perdere gran parte dell'espressività del fine-tuning completo. In pratica un adattatore LoRA per un modello di grandi dimensioni, che con un fine-tuning tradizionale richiederebbe decine di gigabyte e un cluster di GPU per giorni, si allena in poche ore su hardware più modesto e si salva in un file di pochi megabyte, facile da versionare e scambiare senza toccare il modello base condiviso.
Come funziona
Matematicamente, l'aggiornamento che un fine-tuning applicherebbe a una matrice di pesi viene approssimato come prodotto di due matrici di rango basso, molto più piccole della matrice originale. Solo queste due matrici vengono addestrate; il resto del modello resta congelato e invariato. Il risultato pratico: un adattatore LoRA per un modello di grandi dimensioni può pesare pochi megabyte invece di decine di gigabyte, si allena in ore su una singola GPU invece che su cluster interi, e più adattatori diversi possono convivere e essere scambiati sullo stesso modello base a seconda del compito.
Perché conta per la tua azienda
La LoRA ha reso il fine-tuning economicamente accessibile: prima era un'operazione riservata a chi aveva budget da grande laboratorio, ora un team con un dataset di qualità e una GPU può specializzare un modello in un pomeriggio. Una variante, la QLoRA, comprime anche il modello base con la quantizzazione prima di applicare gli adattatori, riducendo ulteriormente i requisiti hardware: è la combinazione tipica per fare fine-tuning on-premise quando i dati non possono uscire dall'azienda.
Le varianti: quanto puoi ridurre ancora
Dopo la LoRA originale sono nate varianti che spingono lo stesso principio, congelare il modello e allenare solo un piccolo aggiornamento, sempre più in profondità. La LoRA-FA congela anche una delle due matrici aggiuntive e allena solo l'altra, dimezzando ulteriormente i parametri da salvare rispetto alla LoRA classica. La QLoRA, come detto, non tocca l'idea delle due matrici ma comprime a 4 bit il modello base congelato, così l'adapter resta identico mentre cala l'ingombro in memoria. All'estremo opposto c'è la TinyLoRA: invece di allenare due matrici, fissa un tensore casuale condiviso da tutti gli strati e allena solo un piccolo vettore che lo combina linearmente, arrivando a poche decine di parametri addestrabili per l'intero modello. È un caso limite più da laboratorio di ricerca che da produzione, ma mostra bene il principio comune a tutta la famiglia: l'aggiornamento utile che serve a un modello per un compito specifico occupa uno spazio molto più piccolo dei suoi pesi totali, e più aggressiva è la parametrizzazione, meno margine resta per adattarsi bene a compiti complessi o dataset rumorosi.
Termini correlati
- Fine-tuning · Addestrare ulteriormente un modello pretrainato sui tuoi esempi: ottimo per stile, formato e compiti ricorrenti, sbagliato per i fatti che cambiano ogni giorno.
- SLM · Modello linguistico piccolo e specializzato: costa una frazione di un LLM, gira anche on-premise e per compiti mirati basta e avanza.
- Quantization (quantizzazione) · Comprimere i pesi di un modello a precisione numerica più bassa: costa meno, gira su hardware più piccolo, con una perdita di qualità gestibile.
Un termine che ti riguarda da vicino? Parliamone.
CONTATTAMI