Guia · atualizado 2026-07-23

Como fazer fine-tuning de um LLM na sua propria GPU (NVIDIA ou AMD)

Pergunte em qualquer forum se voce pode fazer fine-tuning de um modelo de linguagem na sua propria maquina e a resposta principal costuma ser "o seu PC nao e potente o suficiente - use a nuvem." Esse conselho esta desatualizado. Com a tecnica certa, uma unica GPU de consumo e suficiente para fazer fine-tuning de modelos reais - e voce mantem os seus dados e o seu modelo em hardware que voce possui.

A sua GPU realmente consegue?

A razao pela qual as pessoas acham que o fine-tuning local e impossivel e que imaginam o fine-tuning completo - atualizar cada peso do modelo. Isso realmente precisa de um datacenter. Mas voce quase nunca precisa disso. O LoRA (Low-Rank Adaptation) treina um pequeno conjunto de pesos extras sobre um modelo base congelado. Ele alcanca a maior parte da qualidade do fine-tuning completo usando uma fracao da memoria.

Um guia realista de VRAM com LoRA em bf16:

Se voce tem uma GPU de jogos dos ultimos anos, pode fazer fine-tuning de algo util hoje.

Va mais longe: modelos de nivel de agente, nao brinquedos

Aqui e onde fica interessante. Esses numeros sao para bf16 padrao. Reduza para quantizacao de 4 bits (QLoRA) e o limite salta: voce quantiza o modelo base congelado para 4 bits, entao um modelo que precisaria de ~48 GB em bf16 cabe em cerca de um quarto disso. Os adaptadores LoRA que voce treina permanecem em precisao total, entao a qualidade se mantem.

Isso muda toda a conversa. Uma unica placa de 24 GB nao para mais em 8B - ela alcanca modelos da classe ~30B, o tamanho no qual um modelo e genuinamente capaz de conduzir um agente: uso de ferramentas, raciocinio em multiplas etapas, saida estruturada. Voce nao esta mais limitado a fazer fine-tuning de brinquedos no seu proprio hardware; voce pode moldar um modelo real, de nivel de agente, nele.

Isto nao e teoria. Nos fazemos fine-tuning de um modelo Qwen de 27B numa unica Radeon RX 7900 XTX - uma placa AMD de consumo de 24 GB - e ele roda bem. Um modelo capaz, de escala agentica, treinado em hardware que voce pode comprar de prateleira, com os seus dados nunca saindo da maquina.

O que voce realmente fornece a ele

Fine-tuning e ensinar a um modelo os seus exemplos. Voce fornece pares de entrada/saida - uma pergunta e a resposta que voce quer, uma instrucao e a resposta ideal, um chat e como o assistente deve responder. Algumas dezenas de bons exemplos ja movem um modelo; algumas centenas a alguns milhares e um conjunto de dados forte. O modelo aprende o seu estilo, o seu formato, o seu dominio.

NVIDIA (CUDA) - Windows ou Linux

Se voce tem uma placa NVIDIA, esta no caminho mais comum. O treinamento roda atraves do CUDA, e funciona tanto no Windows quanto no Linux. Os blocos de construcao sao o PyTorch (a versao CUDA), mais as bibliotecas da Hugging Face (transformers, PEFT, accelerate). O modelo, os seus dados e todo o treinamento permanecem na sua maquina.

Esta e a rota principal - a esmagadora maioria do fine-tuning local acontece em GPUs NVIDIA, de uma 3060 de notebook a uma RTX 4090.

AMD (ROCm) - Linux

Aqui esta a parte que a maioria dos guias pula: voce nao precisa de NVIDIA. No Linux, as GPUs AMD treinam atraves do ROCm, o equivalente da AMD ao CUDA. A percepcao chave e que o PyTorch abstrai o backend - o mesmo codigo de treinamento roda no CUDA e no ROCm, voce apenas instala a versao ROCm do PyTorch. A Quantinia e testada de ponta a ponta na Radeon RX 7900 XTX, e o pipeline identico roda na NVIDIA. Uma ferramenta, qualquer placa.

(No Windows, o suporte de treinamento AMD ainda e limitado, entao o fine-tuning AMD significa Linux por enquanto. A NVIDIA cobre ambos.)

A parte dificil que ninguem te avisa

O treinamento em si sao algumas linhas. A dor e o ambiente: combinar a versao certa do PyTorch com a sua GPU e driver exatos, fixar versoes de transformers e PEFT para que nao quebrem umas as outras, lidar com CUDA ou ROCm, e depurar erros cripticos antes de voce ter treinado um unico passo. E aqui que a maioria das pessoas desiste e recua para um notebook na nuvem.

A forma sem codigo

Esta e exatamente a lacuna que a Quantinia fecha. E um aplicativo desktop, nao uma biblioteca ou um notebook:

Para ser direto sobre isso: se voce ja vive em Python e quer velocidade maxima, uma biblioteca otimizada como o Unsloth vai treinar mais rapido. A Quantinia nao esta tentando vencer em throughput bruto. Ela vence em facilidade, propriedade e rodar da mesma forma em qualquer GPU - voce possui o modelo, os seus dados nunca saem da sua maquina, e simplesmente funciona, seja a sua placa verde ou vermelha.

Baixar Quantinia

FAQ

Voce pode fazer fine-tuning de um LLM no seu proprio PC?

Sim. Com o LoRA, uma GPU de consumo com 8-24 GB de VRAM pode fazer fine-tuning de modelos de 0.5B ate 8B parametros. Voce precisa da tecnica certa e da versao certa do PyTorch para a sua GPU, nao de um datacenter.

Quanta VRAM eu preciso?

Com LoRA em bf16, aproximadamente: 8 GB ate ~1.5B, 12-16 GB ate ~3B, 24 GB ate ~7-8B. Com quantizacao de 4 bits (QLoRA) o limite aproximadamente quadruplica - uma placa de 24 GB alcanca modelos da classe ~30B. O fine-tuning completo precisa de muito mais; LoRA e quantizacao sao o que tornam o treinamento local realista.

Posso fazer fine-tuning de um modelo grande, de nivel de agente, na minha propria GPU?

Sim. Usando quantizacao de 4 bits, uma unica placa de 24 GB pode fazer fine-tuning de modelos da classe ~30B - grandes o suficiente para conduzir um agente (uso de ferramentas, raciocinio em multiplas etapas). Nos fazemos fine-tuning de um modelo Qwen de 27B numa unica Radeon RX 7900 XTX, uma placa AMD de consumo.

Posso fazer fine-tuning numa GPU AMD?

Sim, no Linux com ROCm. O mesmo codigo que roda na NVIDIA CUDA roda na AMD ROCm. A Quantinia e testada na RX 7900 XTX.

Preciso escrever codigo?

Nao. Unsloth e o stack da Hugging Face precisam de Python. A Quantinia e um aplicativo desktop - instale, adicione exemplos, obtenha um modelo.