Il sito usa solo cookie tecnici necessari al funzionamento: nessun tracciamento, nessuna profilazione. Cookie Policy

Salta al contenuto
Tutti i termini

Cos'è la quantizzazione di un modello?

Comprimere i pesi di un modello a precisione numerica più bassa: costa meno, gira su hardware più piccolo, con una perdita di qualità gestibile.

La quantizzazione è la tecnica che riduce la precisione numerica con cui sono rappresentati i pesi di un modello, tipicamente da 16 o 32 bit a 8 o addirittura 4 bit per parametro. Il modello occupa meno memoria, richiede meno banda per essere caricato e risponde più in fretta, a fronte di una perdita di accuratezza che nella maggior parte dei compiti è piccola. Si può applicare dopo l'addestramento, la via più comune, oppure simularla già durante l'addestramento per adattare il modello alla precisione ridotta fin dall'inizio. In pratica è la leva che rende un modello grande utilizzabile su hardware più modesto: un modello a 4 bit occupa circa un quarto della memoria della sua versione a 16 bit, il che significa poterlo far girare su una GPU aziendale invece che su un cluster cloud dedicato, con costi di inferenza sensibilmente più bassi.

Come funziona

Ogni peso del modello, normalmente un numero in virgola mobile con molte cifre di precisione, viene approssimato con un numero rappresentato con meno bit, secondo uno schema che minimizza l'errore introdotto. Alcuni approcci quantizzano dopo l'addestramento (post-training quantization), altri simulano la precisione ridotta già durante l'addestramento per adattarsi meglio. Il risultato tipico: un modello a 4 bit occupa circa un quarto della memoria di un modello a 16 bit, con una perdita di qualità che va da trascurabile a percettibile a seconda del compito e di quanto si spinge la compressione.

Perché conta per la tua azienda

La quantizzazione è quello che rende praticabile far girare uno SLM, o anche un modello di dimensioni medie, su un server aziendale invece che su un cluster cloud dedicato: meno memoria video necessaria, costi di inferenza più bassi, possibilità concreta di tenere i dati e il modello dentro il perimetro aziendale. Il compromesso va misurato caso per caso: per compiti di classificazione o estrazione la perdita è spesso impercettibile, per compiti che richiedono ragionamento fine può farsi sentire, ed è proprio per questo che serve una suite di valutazione prima di scegliere quanto comprimere. E non tutti i quant si equivalgono: su carichi agentici reali, una versione a 8 bit pubblicata da un membro della community ha retto le chiamate agli strumenti meglio della release ufficiale a 8 bit dello stesso modello, mentre una variante a 4 bit le mandava in errore in modo ripetibile (Level1Techs, agosto 2026). La scelta del checkpoint quantizzato è una decisione di qualità, non solo di ingombro.

  • SLM · Modello linguistico piccolo e specializzato: costa una frazione di un LLM, gira anche on-premise e per compiti mirati basta e avanza.
  • LoRA · Tecnica di fine-tuning che allena piccole matrici aggiuntive invece di tutto il modello: stessi risultati pratici, una frazione del costo.
  • Inferenza · L'uso di un modello AI già addestrato per produrre risposte: ogni domanda a ChatGPT è inferenza, ed è dove oggi si concentrano i costi.
  • BitNet b1.58 (LLM a 1 bit) · Modello linguistico con pesi ternari addestrati nativamente a 1,58 bit: gira su CPU, senza GPU dedicata.
  • LLM locale · Un modello linguistico che gira su hardware che controlli tu, senza inviare i dati a un'API esterna.

Un termine che ti riguarda da vicino? Parliamone.

CONTATTAMI