Nu ai nevoie de un datacenter ca să începi. O singură placă grafică de consumator e suficientă ca să rulezi un model compact - iar o placă de 24 GB e suficientă ca să-ți finetunezi propriul model. Scalezi la mai multe GPU-uri sau un cluster când ai nevoie de un model mai mare.
Dacă are destulă memorie și un stack de drivere suportat, funcționează. Cele două familii mari de GPU sunt acoperite.
RTX 3090, 4090 și 5090 dau tonul, cu restul seriilor RTX 30/40/50 aproape în urmă - până la plăci de datacenter (A100, H100, H200) pentru modele mari. Calea cea mai testată.
Antrenează & ruleazăRadeon RX 7900 XTX / 7900 XT, cu 7900 XTX de 24 GB ca punctul optim, până la acceleratoare din seria Instinct MI. O cale de antrenare complet suportată.
Antrenează & ruleazăVRAM-ul contează cel mai mult. Rularea unui model compact e ușoară; finetuningul unuia cere puțin mai mult spațiu de manevră.
QLoRA menține memoria scăzută încărcând modelul de bază pe 4 biți. Limitele exacte se schimbă cu mărimea modelului și rangul adaptorului - acestea sunt ghiduri practice, nu praguri fixe. Modelele mai mari scalează pe mai multe GPU-uri sau un cluster.
Linux e calea cea mai netedă atât pentru NVIDIA, cât și pentru AMD, iar Windows funcționează prin WSL. Modelele în sine sunt simple fișiere - nu le pasă pe ce OS au fost făcute.
Dacă poți juca jocuri moderne pe ea, probabil poți finetuna un model pe ea - iar când ai nevoie de mai mult, același pipeline rulează pe un cluster.
Vezi cum funcționează →