Non serve un data center per iniziare. Una singola scheda grafica consumer basta per eseguire un modello compatto - e una scheda da 24 GB basta per fare il finetuning del tuo. Scala a più GPU o a un cluster quando ti serve un modello più grande.
Se ha abbastanza memoria e uno stack di driver supportato, funziona. Le due grandi famiglie di GPU sono coperte.
RTX 3090, 4090 e 5090 aprono la strada, con il resto della serie RTX 30/40/50 subito dietro - fino alle schede da data center (A100, H100, H200) per i modelli grandi. Il percorso più ampiamente testato.
Addestra & eseguiRadeon RX 7900 XTX / 7900 XT, con la 7900 XTX da 24 GB come punto ideale, fino agli acceleratori serie Instinct MI. Un percorso di training completo di prima classe.
Addestra & eseguiLa VRAM è ciò che conta di più. Eseguire un modello compatto è leggero; farne il finetuning richiede un po' più di margine.
QLoRA mantiene bassa la memoria caricando la base in 4-bit. I limiti esatti cambiano con la dimensione del modello e il rank dell'adapter - queste sono linee guida pratiche, non soglie rigide. I modelli più grandi scalano su più GPU o su un cluster.
Linux è il percorso più fluido sia per NVIDIA che per AMD, e Windows funziona tramite WSL. I modelli stessi sono semplici file - non gli importa quale OS li ha creati.
Se ci puoi giocare a giochi moderni, probabilmente ci puoi fare il finetuning di un modello - e quando ti serve di più, la stessa pipeline gira su un cluster.
Scopri come funziona →