Guida · aggiornata il 2026-07-23
Come fare il fine-tuning di un LLM sulla tua GPU (NVIDIA o AMD)
Chiedi su un qualsiasi forum se puoi fare il fine-tuning di un modello linguistico sulla tua macchina e la risposta piu votata di solito e "il tuo PC non e abbastanza potente - usa il cloud." Quel consiglio e superato. Con la tecnica giusta, una singola GPU consumer basta per fare il fine-tuning di modelli reali - e mantieni i tuoi dati e il tuo modello su hardware che possiedi.
La tua GPU ce la puo davvero fare?
Il motivo per cui la gente pensa che il fine-tuning locale sia impossibile e che immagina il fine-tuning completo - aggiornare ogni peso del modello. Quello richiede davvero un datacenter. Ma non ne hai quasi mai bisogno. LoRA (Low-Rank Adaptation) addestra un piccolo insieme di pesi aggiuntivi sopra un modello base congelato. Raggiunge gran parte della qualita del fine-tuning completo usando una frazione della memoria.
Una guida realistica alla VRAM con LoRA in bf16:
- 8 GB - modelli fino a ~1.5B parametri (ottimo per test e piccole attivita)
- 12-16 GB - fino a ~3B parametri
- 24 GB (es. RTX 4090, RX 7900 XTX) - fino a ~7-8B parametri
Se hai una GPU da gaming degli ultimi anni, puoi fare il fine-tuning di qualcosa di utile gia oggi.
Punta piu in alto: modelli di livello agente, non giocattoli
Qui e dove diventa interessante. Quei numeri valgono per il bf16 standard. Passa alla quantizzazione a 4-bit (QLoRA) e il limite si alza: quantizzi il modello base congelato a 4-bit, cosi un modello che richiederebbe ~48 GB in bf16 sta in circa un quarto di quello spazio. Gli adattatori LoRA che addestri restano a precisione piena, quindi la qualita regge.
Questo cambia tutta la conversazione. Una singola scheda da 24 GB non si ferma piu a 8B - raggiunge modelli di classe ~30B, la dimensione in cui un modello e genuinamente capace di guidare un agente: uso di strumenti, ragionamento multi-step, output strutturato. Non sei piu limitato a fare il fine-tuning di giocattoli sul tuo hardware; puoi plasmare un vero modello di livello agente su di esso.
Questa non e teoria. Facciamo il fine-tuning di un modello Qwen 27B su una singola Radeon RX 7900 XTX - una scheda AMD consumer da 24 GB - e gira bene. Un modello capace, di scala agentica, addestrato su hardware che puoi comprare in negozio, con i tuoi dati che non lasciano mai la macchina.
Cosa gli fornisci davvero
Il fine-tuning e insegnare a un modello i tuoi esempi. Fornisci coppie input/output - una domanda e la risposta che vuoi, un'istruzione e la risposta ideale, una chat e come dovrebbe rispondere l'assistente. Qualche decina di buoni esempi gia sposta un modello; da qualche centinaio a qualche migliaio e un dataset solido. Il modello impara il tuo stile, il tuo formato, il tuo dominio.
NVIDIA (CUDA) - Windows o Linux
Se hai una scheda NVIDIA, sei sul percorso piu comune. L'addestramento gira tramite CUDA e funziona sia su Windows che su Linux. I mattoni sono PyTorch (la build CUDA), piu le librerie Hugging Face (transformers, PEFT, accelerate). Il modello, i tuoi dati e l'intero addestramento restano sulla tua macchina.
Questa e la via principale - la stragrande maggioranza del fine-tuning locale avviene su GPU NVIDIA, da una 3060 di un laptop a una RTX 4090.
AMD (ROCm) - Linux
Ecco la parte che la maggior parte delle guide salta: non ti serve NVIDIA. Su Linux, le GPU AMD si addestrano tramite ROCm, l'equivalente AMD di CUDA. L'intuizione chiave e che PyTorch astrae il backend - lo stesso codice di addestramento gira su CUDA e ROCm, devi solo installare la build ROCm di PyTorch. Quantinia e testato end-to-end sulla Radeon RX 7900 XTX e la pipeline identica gira su NVIDIA. Un solo strumento, entrambe le schede.
(Su Windows, il supporto all'addestramento AMD e ancora scarso, quindi per ora il fine-tuning AMD significa Linux. NVIDIA copre entrambi.)
La parte difficile di cui nessuno ti avverte
L'addestramento in se e poche righe. Il dolore e l'ambiente: abbinare la build corretta di PyTorch alla tua GPU e al tuo driver esatti, fissare le versioni di transformers e PEFT cosi che non si rompano a vicenda, domare CUDA o ROCm e fare il debug di errori criptici prima ancora di aver addestrato un singolo step. E qui che la maggior parte delle persone si arrende e ripiega su un notebook cloud.
Il modo senza codice
Questa e esattamente la lacuna che Quantinia colma. E un'app desktop, non una libreria o un notebook:
- Installala su Windows o Linux - una procedura guidata rileva la tua GPU e configura automaticamente la build corretta di PyTorch.
- Inserisci i tuoi esempi.
- Ricevi indietro un modello fine-tuned. Nessun terminale, nessun inferno di dipendenze, nessun Python.
Per essere chiari: se vivi gia in Python e vuoi la massima velocita, una libreria ottimizzata come Unsloth addestrera piu velocemente. Quantinia non cerca di vincere sul throughput grezzo. Vince su facilita, proprieta e girare allo stesso modo su qualsiasi GPU - possiedi il modello, i tuoi dati non lasciano mai la tua macchina e funziona e basta, che la tua scheda sia verde o rossa.
FAQ
Puoi fare il fine-tuning di un LLM sul tuo PC?
Si. Con LoRA, una GPU consumer con 8-24 GB di VRAM puo fare il fine-tuning di modelli da 0.5B fino a 8B parametri. Ti serve la tecnica giusta e la build corretta di PyTorch per la tua GPU, non un datacenter.
Quanta VRAM mi serve?
Con LoRA in bf16, all'incirca: 8 GB fino a ~1.5B, 12-16 GB fino a ~3B, 24 GB fino a ~7-8B. Con la quantizzazione a 4-bit (QLoRA) il limite quadruplica all'incirca - una scheda da 24 GB raggiunge modelli di classe ~30B. Il fine-tuning completo richiede molto di piu; LoRA e la quantizzazione sono cio che rende realistico l'addestramento locale.
Posso fare il fine-tuning di un modello grande, di livello agente, sulla mia GPU?
Si. Usando la quantizzazione a 4-bit, una singola scheda da 24 GB puo fare il fine-tuning di modelli di classe ~30B - abbastanza grandi da guidare un agente (uso di strumenti, ragionamento multi-step). Facciamo il fine-tuning di un modello Qwen 27B su una singola Radeon RX 7900 XTX, una scheda AMD consumer.
Posso fare il fine-tuning su una GPU AMD?
Si, su Linux con ROCm. Lo stesso codice che gira su NVIDIA CUDA gira su AMD ROCm. Quantinia e testato sulla RX 7900 XTX.
Devo scrivere codice?
No. Unsloth e lo stack Hugging Face richiedono Python. Quantinia e un'app desktop - installa, aggiungi esempi, ottieni un modello.