Anleitung · aktualisiert 2026-07-23

Wie man ein LLM auf der eigenen GPU feinabstimmt (NVIDIA oder AMD)

Frag in einem beliebigen Forum, ob du ein Sprachmodell auf deinem eigenen Rechner feinabstimmen kannst, und die Top-Antwort lautet meist "dein PC ist nicht leistungsstark genug - nutz die Cloud." Dieser Rat ist veraltet. Mit der richtigen Technik reicht eine einzige Consumer-GPU aus, um echte Modelle feinabzustimmen - und du behaeltst deine Daten und dein Modell auf Hardware, die dir gehoert.

Schafft deine GPU das wirklich?

Der Grund, warum die Leute lokale Feinabstimmung fuer unmoeglich halten, ist, dass sie sich vollstaendige Feinabstimmung vorstellen - das Aktualisieren jedes Gewichts im Modell. Das braucht tatsaechlich ein Rechenzentrum. Aber du brauchst es fast nie. LoRA (Low-Rank Adaptation) trainiert einen winzigen Satz zusaetzlicher Gewichte oben auf einem eingefrorenen Basismodell. Es erreicht nahezu die Qualitaet vollstaendiger Feinabstimmung, waehrend es nur einen Bruchteil des Speichers nutzt.

Eine realistische VRAM-Orientierung mit LoRA in bf16:

Wenn du eine Gaming-GPU aus den letzten Jahren hast, kannst du heute schon etwas Nuetzliches feinabstimmen.

Groesser gedacht: agentenfaehige Modelle, keine Spielzeuge

Hier wird es interessant. Diese Zahlen gelten fuer standardmaessiges bf16. Wechsle zu 4-Bit-Quantisierung (QLoRA) und die Obergrenze springt nach oben: du quantisierst das eingefrorene Basismodell auf 4-Bit, sodass ein Modell, das in bf16 ~48 GB braeuchte, in etwa einem Viertel davon passt. Die LoRA-Adapter, die du trainierst, bleiben in voller Praezision, sodass die Qualitaet erhalten bleibt.

Das veraendert die ganze Diskussion. Eine einzige 24-GB-Karte hoert nicht mehr bei 8B auf - sie erreicht Modelle der ~30B-Klasse, die Groesse, in der ein Modell wirklich in der Lage ist, einen Agenten anzutreiben: Werkzeugnutzung, mehrstufiges Schlussfolgern, strukturierte Ausgabe. Du bist nicht mehr darauf beschraenkt, Spielzeuge auf deiner eigenen Hardware feinabzustimmen; du kannst darauf ein echtes, agentenfaehiges Modell formen.

Das ist keine Theorie. Wir stimmen ein 27B Qwen-Modell auf einer einzigen Radeon RX 7900 XTX feinab - einer 24-GB-Consumer-AMD-Karte - und es laeuft gut. Ein leistungsfaehiges Modell auf Agenten-Ebene, trainiert auf Hardware, die du von der Stange kaufen kannst, wobei deine Daten den Rechner nie verlassen.

Was du ihm tatsaechlich gibst

Feinabstimmung bedeutet, einem Modell deine Beispiele beizubringen. Du lieferst Eingabe-/Ausgabe-Paare - eine Frage und die gewuenschte Antwort, eine Anweisung und die ideale Reaktion, einen Chat und wie der Assistent antworten soll. Ein paar Dutzend gute Beispiele bewegen ein Modell bereits; ein paar Hundert bis ein paar Tausend sind ein starker Datensatz. Das Modell lernt deinen Stil, dein Format, deine Domaene.

NVIDIA (CUDA) - Windows oder Linux

Wenn du eine NVIDIA-Karte hast, bist du auf dem gaengigsten Weg. Das Training laeuft ueber CUDA, und es funktioniert sowohl unter Windows als auch unter Linux. Die Bausteine sind PyTorch (der CUDA-Build) sowie die Hugging Face-Bibliotheken (transformers, PEFT, accelerate). Das Modell, deine Daten und das gesamte Training bleiben auf deinem Rechner.

Das ist der Mainstream-Weg - die ueberwaeltigende Mehrheit der lokalen Feinabstimmung findet auf NVIDIA-GPUs statt, von einer Laptop-3060 bis zur RTX 4090.

AMD (ROCm) - Linux

Hier ist der Teil, den die meisten Anleitungen ueberspringen: du brauchst kein NVIDIA. Unter Linux trainieren AMD-GPUs ueber ROCm, AMDs Gegenstueck zu CUDA. Die zentrale Erkenntnis ist, dass PyTorch das Backend abstrahiert - der gleiche Trainingscode laeuft auf CUDA und ROCm, du installierst einfach den ROCm-Build von PyTorch. Quantinia ist durchgehend auf der Radeon RX 7900 XTX getestet, und dieselbe Pipeline laeuft auf NVIDIA. Ein Werkzeug, jede der beiden Karten.

(Unter Windows ist die AMD-Trainingsunterstuetzung noch duenn, daher bedeutet AMD-Feinabstimmung vorerst Linux. NVIDIA deckt beide ab.)

Der schwierige Teil, vor dem dich niemand warnt

Das Training selbst sind ein paar Zeilen. Der Schmerz ist die Umgebung: den richtigen PyTorch-Build auf deine genaue GPU und deinen Treiber abzustimmen, die Versionen von transformers und PEFT festzupinnen, damit sie sich nicht gegenseitig zerlegen, mit CUDA oder ROCm zu ringen und kryptische Fehler zu debuggen, bevor du einen einzigen Schritt trainiert hast. Hier geben die meisten Leute auf und ziehen sich in ein Cloud-Notebook zurueck.

Der No-Code-Weg

Genau diese Luecke schliesst Quantinia. Es ist eine Desktop-App, keine Bibliothek und kein Notebook:

Um ehrlich zu sein: wenn du bereits in Python zu Hause bist und maximale Geschwindigkeit willst, wird eine optimierte Bibliothek wie Unsloth schneller trainieren. Quantinia versucht nicht, beim reinen Durchsatz zu gewinnen. Es gewinnt bei Einfachheit, Eigentum und dem gleichen Ablauf auf jeder GPU - dir gehoert das Modell, deine Daten verlassen nie deinen Rechner, und es funktioniert einfach, egal ob deine Karte gruen oder rot ist.

Quantinia herunterladen

FAQ

Kann man ein LLM auf dem eigenen PC feinabstimmen?

Ja. Mit LoRA kann eine Consumer-GPU mit 8-24 GB VRAM Modelle von 0,5B bis 8B Parametern feinabstimmen. Du brauchst die richtige Technik und den passenden PyTorch-Build fuer deine GPU, kein Rechenzentrum.

Wie viel VRAM brauche ich?

Mit LoRA in bf16 grob: 8 GB bis ~1,5B, 12-16 GB bis ~3B, 24 GB bis ~7-8B. Mit 4-Bit-Quantisierung (QLoRA) vervierfacht sich die Obergrenze etwa - eine 24-GB-Karte erreicht Modelle der ~30B-Klasse. Vollstaendige Feinabstimmung braucht weit mehr; LoRA und Quantisierung machen lokales Training realistisch.

Kann ich ein grosses, agentenfaehiges Modell auf meiner eigenen GPU feinabstimmen?

Ja. Mit 4-Bit-Quantisierung kann eine einzige 24-GB-Karte Modelle der ~30B-Klasse feinabstimmen - gross genug, um einen Agenten anzutreiben (Werkzeugnutzung, mehrstufiges Schlussfolgern). Wir stimmen ein 27B Qwen-Modell auf einer einzigen Radeon RX 7900 XTX feinab, einer Consumer-AMD-Karte.

Kann ich auf einer AMD-GPU feinabstimmen?

Ja, unter Linux mit ROCm. Derselbe Code, der auf NVIDIA CUDA laeuft, laeuft auf AMD ROCm. Quantinia ist auf der RX 7900 XTX getestet.

Muss ich Code schreiben?

Nein. Unsloth und der Hugging Face-Stack brauchen Python. Quantinia ist eine Desktop-App - installieren, Beispiele hinzufuegen, Modell erhalten.