Aucun datacenter requis pour démarrer. Une seule carte graphique grand public suffit à faire tourner un modèle compact - et une carte de 24 GB suffit à finetuner le vôtre. Montez en puissance vers plusieurs GPU ou un cluster quand vous avez besoin d'un plus grand modèle.
Si elle a assez de mémoire et une pile de pilotes prise en charge, ça marche. Les deux grandes familles de GPU sont couvertes.
Les RTX 3090, 4090 et 5090 ouvrent la voie, avec le reste des séries RTX 30/40/50 juste derrière - jusqu'aux cartes datacenter (A100, H100, H200) pour les grands modèles. La voie la plus largement testée.
Entraîner & faire tournerRadeon RX 7900 XTX / 7900 XT, avec la 7900 XTX de 24 GB comme point idéal, jusqu'aux accélérateurs de la série Instinct MI. Une voie d'entraînement complète et de premier rang.
Entraîner & faire tournerLa VRAM est ce qui compte le plus. Faire tourner un modèle compact est léger ; en finetuner un demande un peu plus de marge.
QLoRA maintient la mémoire basse en chargeant la base en 4-bit. Les limites exactes varient avec la taille du modèle et le rang de l'adaptateur - ce sont des repères pratiques, pas des seuils stricts. Les plus grands modèles montent en échelle sur plusieurs GPU ou un cluster.
Linux est la voie la plus fluide pour NVIDIA comme pour AMD, et Windows fonctionne via WSL. Les modèles eux-mêmes sont de simples fichiers - peu importe le système qui les a produits.
Si vous pouvez y jouer à des jeux modernes, vous pouvez probablement y finetuner un modèle - et quand vous avez besoin de plus, le même pipeline tourne sur un cluster.
Voir comment ça marche →