Ghid · actualizat 2026-07-23
Cum să faci fine-tuning la un LLM pe propriul GPU (NVIDIA sau AMD)
Întreabă pe orice forum dacă poți face fine-tuning la un model de limbaj pe propria mașină, iar răspunsul de top este de obicei "PC-ul tău nu este destul de puternic - folosește cloud-ul." Sfatul ăsta este depășit. Cu tehnica potrivită, un singur GPU de consum este suficient pentru fine-tuning la modele reale - și îți păstrezi datele și modelul pe hardware care îți aparține.
Poate GPU-ul tău chiar să facă asta?
Motivul pentru care lumea crede că fine-tuning-ul local este imposibil este că își imaginează fine-tuning complet - actualizarea fiecărei ponderi din model. Asta chiar are nevoie de un datacenter. Dar aproape niciodată nu ai nevoie de el. LoRA (Low-Rank Adaptation) antrenează un set minuscul de ponderi suplimentare deasupra unui model de bază înghețat. Atinge cea mai mare parte din calitatea unui fine-tuning complet folosind o fracțiune din memorie.
Un reper realist de VRAM cu LoRA în bf16:
- 8 GB - modele până la ~1.5B parametri (excelent pentru testare și sarcini mici)
- 12-16 GB - până la ~3B parametri
- 24 GB (de ex. RTX 4090, RX 7900 XTX) - până la ~7-8B parametri
Dacă ai un GPU de gaming din ultimii câțiva ani, poți face fine-tuning la ceva util chiar azi.
Mergi mai mare: modele de nivel agent, nu jucării
Aici devine interesant. Numerele acelea sunt pentru bf16 standard. Coboară la cuantizare pe 4 biți (QLoRA) și plafonul sare: cuantizezi modelul de bază înghețat la 4 biți, așa că un model care ar avea nevoie de ~48 GB în bf16 încape în aproximativ un sfert din atât. Adaptoarele LoRA pe care le antrenezi rămân la precizie completă, deci calitatea se menține.
Asta schimbă întreaga discuție. O singură placă de 24 GB nu se mai oprește la 8B - ajunge la modele din clasa ~30B, dimensiunea la care un model este cu adevărat capabil să conducă un agent: folosire de unelte, raționament în mai mulți pași, output structurat. Nu mai ești limitat la fine-tuning pe jucării pe propriul hardware; poți modela un model real, de nivel agent, pe el.
Asta nu este teorie. Facem fine-tuning la un model Qwen de 27B pe un singur Radeon RX 7900 XTX - o placă AMD de consum de 24 GB - și rulează bine. Un model capabil, la scară agentică, antrenat pe hardware pe care îl poți cumpăra din comerț, cu datele tale care nu părăsesc niciodată mașina.
Ce îi dai de fapt
Fine-tuning-ul înseamnă să înveți un model exemplele tale. Îi oferi perechi de intrare/ieșire - o întrebare și răspunsul dorit, o instrucțiune și răspunsul ideal, o conversație și modul în care ar trebui să răspundă asistentul. Câteva zeci de exemple bune deja mișcă un model; câteva sute până la câteva mii formează un set de date puternic. Modelul învață stilul tău, formatul tău, domeniul tău.
NVIDIA (CUDA) - Windows sau Linux
Dacă ai o placă NVIDIA, ești pe calea cea mai comună. Antrenarea rulează prin CUDA și funcționează atât pe Windows, cât și pe Linux. Cărămizile de construcție sunt PyTorch (build-ul CUDA), plus bibliotecile Hugging Face (transformers, PEFT, accelerate). Modelul, datele tale și antrenarea rămân toate pe mașina ta.
Aceasta este ruta principală - marea majoritate a fine-tuning-ului local se întâmplă pe GPU-uri NVIDIA, de la un 3060 de laptop până la un RTX 4090.
AMD (ROCm) - Linux
Iată partea pe care majoritatea ghidurilor o sar: nu ai nevoie de NVIDIA. Pe Linux, GPU-urile AMD antrenează prin ROCm, echivalentul AMD al CUDA. Ideea cheie este că PyTorch abstractizează backend-ul - același cod de antrenare rulează pe CUDA și ROCm, doar instalezi build-ul ROCm de PyTorch. Quantinia este testat cap-coadă pe Radeon RX 7900 XTX, iar pipeline-ul identic rulează pe NVIDIA. O singură unealtă, oricare placă.
(Pe Windows, suportul AMD pentru antrenare este încă subțire, așa că fine-tuning-ul pe AMD înseamnă Linux deocamdată. NVIDIA acoperă ambele.)
Partea grea despre care nimeni nu te avertizează
Antrenarea în sine înseamnă câteva linii. Durerea este mediul: potrivirea build-ului corect de PyTorch cu GPU-ul și driverul tău exact, fixarea versiunilor de transformers și PEFT ca să nu se strice reciproc, lupta cu CUDA sau ROCm și depanarea erorilor criptice înainte să fi antrenat un singur pas. Aici renunță majoritatea oamenilor și se retrag la un notebook în cloud.
Metoda fără cod
Exact acest gol îl închide Quantinia. Este o aplicație desktop, nu o bibliotecă sau un notebook:
- O instalezi pe Windows sau Linux - un wizard îți detectează GPU-ul și configurează automat build-ul corect de PyTorch.
- Îți pui exemplele.
- Primești înapoi un model fine-tuned. Fără terminal, fără iadul dependențelor, fără Python.
Ca să fim sinceri: dacă trăiești deja în Python și vrei viteză maximă, o bibliotecă optimizată precum Unsloth va antrena mai repede. Quantinia nu încearcă să câștige la throughput brut. Câștigă la ușurință, proprietate și rulare la fel pe orice GPU - deții modelul, datele tale nu părăsesc niciodată mașina ta și pur și simplu funcționează, fie placa ta verde sau roșie.
Întrebări frecvente
Poți face fine-tuning la un LLM pe propriul PC?
Da. Cu LoRA, un GPU de consum cu 8-24 GB de VRAM poate face fine-tuning la modele de la 0.5B până la 8B parametri. Ai nevoie de tehnica potrivită și de build-ul potrivit de PyTorch pentru GPU-ul tău, nu de un datacenter.
De cât VRAM am nevoie?
Cu LoRA în bf16, aproximativ: 8 GB până la ~1.5B, 12-16 GB până la ~3B, 24 GB până la ~7-8B. Cu cuantizare pe 4 biți (QLoRA) plafonul se cam împătrește - o placă de 24 GB ajunge la modele din clasa ~30B. Fine-tuning-ul complet are nevoie de mult mai mult; LoRA și cuantizarea sunt cele care fac antrenarea locală realistă.
Pot face fine-tuning la un model mare, de nivel agent, pe propriul GPU?
Da. Folosind cuantizare pe 4 biți, o singură placă de 24 GB poate face fine-tuning la modele din clasa ~30B - suficient de mari cât să conducă un agent (folosire de unelte, raționament în mai mulți pași). Facem fine-tuning la un model Qwen de 27B pe un singur Radeon RX 7900 XTX, o placă AMD de consum.
Pot face fine-tuning pe un GPU AMD?
Da, pe Linux cu ROCm. Același cod care rulează pe NVIDIA CUDA rulează pe AMD ROCm. Quantinia este testat pe RX 7900 XTX.
Trebuie să scriu cod?
Nu. Unsloth și stack-ul Hugging Face au nevoie de Python. Quantinia este o aplicație desktop - instalezi, adaugi exemple, obții un model.