Guida · aggiornata il 2026-07-23

Come fare il fine-tuning di un LLM sulla tua GPU (NVIDIA o AMD)

Chiedi su un qualsiasi forum se puoi fare il fine-tuning di un modello linguistico sulla tua macchina e la risposta piu votata di solito e "il tuo PC non e abbastanza potente - usa il cloud." Quel consiglio e superato. Con la tecnica giusta, una singola GPU consumer basta per fare il fine-tuning di modelli reali - e mantieni i tuoi dati e il tuo modello su hardware che possiedi.

La tua GPU ce la puo davvero fare?

Il motivo per cui la gente pensa che il fine-tuning locale sia impossibile e che immagina il fine-tuning completo - aggiornare ogni peso del modello. Quello richiede davvero un datacenter. Ma non ne hai quasi mai bisogno. LoRA (Low-Rank Adaptation) addestra un piccolo insieme di pesi aggiuntivi sopra un modello base congelato. Raggiunge gran parte della qualita del fine-tuning completo usando una frazione della memoria.

Una guida realistica alla VRAM con LoRA in bf16:

Se hai una GPU da gaming degli ultimi anni, puoi fare il fine-tuning di qualcosa di utile gia oggi.

Punta piu in alto: modelli di livello agente, non giocattoli

Qui e dove diventa interessante. Quei numeri valgono per il bf16 standard. Passa alla quantizzazione a 4-bit (QLoRA) e il limite si alza: quantizzi il modello base congelato a 4-bit, cosi un modello che richiederebbe ~48 GB in bf16 sta in circa un quarto di quello spazio. Gli adattatori LoRA che addestri restano a precisione piena, quindi la qualita regge.

Questo cambia tutta la conversazione. Una singola scheda da 24 GB non si ferma piu a 8B - raggiunge modelli di classe ~30B, la dimensione in cui un modello e genuinamente capace di guidare un agente: uso di strumenti, ragionamento multi-step, output strutturato. Non sei piu limitato a fare il fine-tuning di giocattoli sul tuo hardware; puoi plasmare un vero modello di livello agente su di esso.

Questa non e teoria. Facciamo il fine-tuning di un modello Qwen 27B su una singola Radeon RX 7900 XTX - una scheda AMD consumer da 24 GB - e gira bene. Un modello capace, di scala agentica, addestrato su hardware che puoi comprare in negozio, con i tuoi dati che non lasciano mai la macchina.

Cosa gli fornisci davvero

Il fine-tuning e insegnare a un modello i tuoi esempi. Fornisci coppie input/output - una domanda e la risposta che vuoi, un'istruzione e la risposta ideale, una chat e come dovrebbe rispondere l'assistente. Qualche decina di buoni esempi gia sposta un modello; da qualche centinaio a qualche migliaio e un dataset solido. Il modello impara il tuo stile, il tuo formato, il tuo dominio.

NVIDIA (CUDA) - Windows o Linux

Se hai una scheda NVIDIA, sei sul percorso piu comune. L'addestramento gira tramite CUDA e funziona sia su Windows che su Linux. I mattoni sono PyTorch (la build CUDA), piu le librerie Hugging Face (transformers, PEFT, accelerate). Il modello, i tuoi dati e l'intero addestramento restano sulla tua macchina.

Questa e la via principale - la stragrande maggioranza del fine-tuning locale avviene su GPU NVIDIA, da una 3060 di un laptop a una RTX 4090.

AMD (ROCm) - Linux

Ecco la parte che la maggior parte delle guide salta: non ti serve NVIDIA. Su Linux, le GPU AMD si addestrano tramite ROCm, l'equivalente AMD di CUDA. L'intuizione chiave e che PyTorch astrae il backend - lo stesso codice di addestramento gira su CUDA e ROCm, devi solo installare la build ROCm di PyTorch. Quantinia e testato end-to-end sulla Radeon RX 7900 XTX e la pipeline identica gira su NVIDIA. Un solo strumento, entrambe le schede.

(Su Windows, il supporto all'addestramento AMD e ancora scarso, quindi per ora il fine-tuning AMD significa Linux. NVIDIA copre entrambi.)

La parte difficile di cui nessuno ti avverte

L'addestramento in se e poche righe. Il dolore e l'ambiente: abbinare la build corretta di PyTorch alla tua GPU e al tuo driver esatti, fissare le versioni di transformers e PEFT cosi che non si rompano a vicenda, domare CUDA o ROCm e fare il debug di errori criptici prima ancora di aver addestrato un singolo step. E qui che la maggior parte delle persone si arrende e ripiega su un notebook cloud.

Il modo senza codice

Questa e esattamente la lacuna che Quantinia colma. E un'app desktop, non una libreria o un notebook:

Per essere chiari: se vivi gia in Python e vuoi la massima velocita, una libreria ottimizzata come Unsloth addestrera piu velocemente. Quantinia non cerca di vincere sul throughput grezzo. Vince su facilita, proprieta e girare allo stesso modo su qualsiasi GPU - possiedi il modello, i tuoi dati non lasciano mai la tua macchina e funziona e basta, che la tua scheda sia verde o rossa.

Scarica Quantinia

FAQ

Puoi fare il fine-tuning di un LLM sul tuo PC?

Si. Con LoRA, una GPU consumer con 8-24 GB di VRAM puo fare il fine-tuning di modelli da 0.5B fino a 8B parametri. Ti serve la tecnica giusta e la build corretta di PyTorch per la tua GPU, non un datacenter.

Quanta VRAM mi serve?

Con LoRA in bf16, all'incirca: 8 GB fino a ~1.5B, 12-16 GB fino a ~3B, 24 GB fino a ~7-8B. Con la quantizzazione a 4-bit (QLoRA) il limite quadruplica all'incirca - una scheda da 24 GB raggiunge modelli di classe ~30B. Il fine-tuning completo richiede molto di piu; LoRA e la quantizzazione sono cio che rende realistico l'addestramento locale.

Posso fare il fine-tuning di un modello grande, di livello agente, sulla mia GPU?

Si. Usando la quantizzazione a 4-bit, una singola scheda da 24 GB puo fare il fine-tuning di modelli di classe ~30B - abbastanza grandi da guidare un agente (uso di strumenti, ragionamento multi-step). Facciamo il fine-tuning di un modello Qwen 27B su una singola Radeon RX 7900 XTX, una scheda AMD consumer.

Posso fare il fine-tuning su una GPU AMD?

Si, su Linux con ROCm. Lo stesso codice che gira su NVIDIA CUDA gira su AMD ROCm. Quantinia e testato sulla RX 7900 XTX.

Devo scrivere codice?

No. Unsloth e lo stack Hugging Face richiedono Python. Quantinia e un'app desktop - installa, aggiungi esempi, ottieni un modello.