Guide · mis à jour le 2026-07-23
Comment affiner un LLM sur votre propre GPU (NVIDIA ou AMD)
Demandez sur n'importe quel forum si vous pouvez affiner un modèle de langage sur votre propre machine et la réponse la plus votée est généralement "votre PC n'est pas assez puissant - utilisez le cloud." Ce conseil est dépassé. Avec la bonne technique, un seul GPU grand public suffit pour affiner de vrais modèles - et vous gardez vos données et votre modèle sur du matériel qui vous appartient.
Votre GPU peut-il vraiment le faire ?
La raison pour laquelle les gens pensent que le fine-tuning local est impossible, c'est qu'ils imaginent un fine-tuning complet - la mise à jour de chaque poids du modèle. Cela nécessite bel et bien un centre de données. Mais vous n'en avez presque jamais besoin. LoRA (Low-Rank Adaptation) entraîne un tout petit ensemble de poids supplémentaires par-dessus un modèle de base figé. Il atteint l'essentiel de la qualité d'un fine-tuning complet tout en utilisant une fraction de la mémoire.
Un guide réaliste de la VRAM avec LoRA en bf16 :
- 8 Go - des modèles jusqu'à ~1,5B de paramètres (parfait pour les tests et les petites tâches)
- 12-16 Go - jusqu'à ~3B de paramètres
- 24 Go (par ex. RTX 4090, RX 7900 XTX) - jusqu'à ~7-8B de paramètres
Si vous avez un GPU de jeu des dernières années, vous pouvez affiner quelque chose d'utile dès aujourd'hui.
Voir plus grand : des modèles de niveau agent, pas des jouets
C'est là que ça devient intéressant. Ces chiffres valent pour le bf16 standard. Passez à la quantification 4 bits (QLoRA) et le plafond bondit : vous quantifiez le modèle de base figé en 4 bits, donc un modèle qui aurait besoin de ~48 Go en bf16 tient dans environ un quart de cela. Les adaptateurs LoRA que vous entraînez restent en pleine précision, donc la qualité tient bon.
Cela change toute la donne. Une seule carte de 24 Go ne plafonne plus à 8B - elle atteint des modèles de classe ~30B, la taille à laquelle un modèle est réellement capable de piloter un agent : usage d'outils, raisonnement multi-étapes, sortie structurée. Vous n'êtes plus limité à affiner des jouets sur votre propre matériel ; vous pouvez y façonner un vrai modèle de niveau agent.
Ce n'est pas de la théorie. Nous affinons un modèle Qwen 27B sur une seule Radeon RX 7900 XTX - une carte AMD grand public de 24 Go - et il tourne bien. Un modèle performant, à l'échelle agentique, entraîné sur du matériel que vous pouvez acheter en magasin, avec vos données qui ne quittent jamais la machine.
Ce que vous lui donnez concrètement
Affiner, c'est enseigner vos exemples à un modèle. Vous fournissez des paires entrée/sortie - une question et la réponse que vous voulez, une instruction et la réponse idéale, une conversation et la façon dont l'assistant doit répondre. Quelques dizaines de bons exemples font déjà bouger un modèle ; quelques centaines à quelques milliers constituent un jeu de données solide. Le modèle apprend votre style, votre format, votre domaine.
NVIDIA (CUDA) - Windows ou Linux
Si vous avez une carte NVIDIA, vous êtes sur la voie la plus courante. L'entraînement passe par CUDA, et cela fonctionne à la fois sur Windows et Linux. Les briques de base sont PyTorch (la version CUDA), plus les bibliothèques Hugging Face (transformers, PEFT, accelerate). Le modèle, vos données et l'entraînement restent tous sur votre machine.
C'est la voie grand public - l'écrasante majorité du fine-tuning local se fait sur des GPU NVIDIA, d'un 3060 portable à une RTX 4090.
AMD (ROCm) - Linux
Voici la partie que la plupart des guides passent sous silence : vous n'avez pas besoin de NVIDIA. Sur Linux, les GPU AMD s'entraînent via ROCm, l'équivalent AMD de CUDA. L'idée clé, c'est que PyTorch fait abstraction du backend - le même code d'entraînement tourne sur CUDA et ROCm, il vous suffit d'installer la version ROCm de PyTorch. Quantinia est testé de bout en bout sur la Radeon RX 7900 XTX, et le pipeline identique tourne sur NVIDIA. Un seul outil, l'une ou l'autre carte.
(Sur Windows, la prise en charge de l'entraînement AMD reste limitée, donc le fine-tuning AMD signifie Linux pour l'instant. NVIDIA couvre les deux.)
La partie difficile dont personne ne vous prévient
L'entraînement en lui-même tient en quelques lignes. La douleur, c'est l'environnement : faire correspondre la bonne version de PyTorch à votre GPU et votre pilote exacts, épingler les versions de transformers et PEFT pour qu'elles ne se cassent pas entre elles, jongler avec CUDA ou ROCm, et déboguer des erreurs obscures avant même d'avoir entraîné une seule étape. C'est là que la plupart des gens abandonnent et se replient sur un notebook dans le cloud.
La manière sans code
C'est exactement l'écart que Quantinia comble. C'est une application de bureau, pas une bibliothèque ni un notebook :
- Installez-la sur Windows ou Linux - un assistant détecte votre GPU et configure automatiquement la bonne version de PyTorch.
- Déposez-y vos exemples.
- Récupérez un modèle affiné. Pas de terminal, pas d'enfer des dépendances, pas de Python.
Pour être clair : si vous vivez déjà dans Python et que vous voulez un maximum de vitesse, une bibliothèque optimisée comme Unsloth entraînera plus vite. Quantinia ne cherche pas à gagner sur le débit brut. Il gagne sur la simplicité, la propriété et le fait de tourner de la même façon sur n'importe quel GPU - vous possédez le modèle, vos données ne quittent jamais votre machine, et ça marche, que votre carte soit verte ou rouge.
FAQ
Peut-on affiner un LLM sur son propre PC ?
Oui. Avec LoRA, un GPU grand public doté de 8 à 24 Go de VRAM peut affiner des modèles de 0,5B jusqu'à 8B de paramètres. Il vous faut la bonne technique et la bonne version de PyTorch pour votre GPU, pas un centre de données.
De combien de VRAM ai-je besoin ?
Avec LoRA en bf16, à peu près : 8 Go jusqu'à ~1,5B, 12-16 Go jusqu'à ~3B, 24 Go jusqu'à ~7-8B. Avec la quantification 4 bits (QLoRA), le plafond quadruple à peu près - une carte de 24 Go atteint des modèles de classe ~30B. Le fine-tuning complet nécessite bien plus ; LoRA et la quantification sont ce qui rend l'entraînement local réaliste.
Puis-je affiner un modèle volumineux de niveau agent sur mon propre GPU ?
Oui. En utilisant la quantification 4 bits, une seule carte de 24 Go peut affiner des modèles de classe ~30B - assez grands pour piloter un agent (usage d'outils, raisonnement multi-étapes). Nous affinons un modèle Qwen 27B sur une seule Radeon RX 7900 XTX, une carte AMD grand public.
Puis-je affiner sur un GPU AMD ?
Oui, sur Linux avec ROCm. Le même code qui tourne sur NVIDIA CUDA tourne sur AMD ROCm. Quantinia est testé sur la RX 7900 XTX.
Dois-je écrire du code ?
Non. Unsloth et la stack Hugging Face ont besoin de Python. Quantinia est une application de bureau - installez, ajoutez des exemples, obtenez un modèle.