Hardware suportado

Da GPU que você tem
a um cluster completo.

Nenhum datacenter necessário para começar. Uma única placa gráfica de consumidor é suficiente para executar um modelo compacto - e uma placa de 24 GB é suficiente para fazer finetuning do seu próprio. Escale para várias GPUs ou um cluster quando precisar de um modelo maior.

Que placas funcionam

Se tiver memória suficiente e uma stack de drivers suportada, funciona. As duas grandes famílias de GPU estão cobertas.

🟩

NVIDIA

CUDA

As RTX 3090, 4090 e 5090 lideram, com o resto da série RTX 30/40/50 logo atrás - até placas de datacenter (A100, H100, H200) para modelos grandes. O caminho mais amplamente testado.

Treinar e executar
🟥

AMD

ROCm

Radeon RX 7900 XTX / 7900 XT, com a 7900 XTX de 24 GB como o ponto ideal, até aceleradores da série Instinct MI. Um caminho de treino completo e de primeira classe.

Treinar e executar

O que pode fazer, por memória

A VRAM é o que mais importa. Executar um modelo compacto é leve; fazer finetuning de um precisa de um pouco mais de folga.

Memória de GPU
Executar um modelo
Finetuning de um modelo
Placas típicas
8 GBentrada
modelos mais pequenos
-
RTX 3060, RX 7600
12-16 GBmainstream
confortável
modelos mais pequenos
RTX 4070, RX 7800 XT
24 GBrecomendado
a maioria dos modelos
modelos de tamanho médio
RTX 4090 / 3090, RX 7900 XTX
48 GB+workstation / cluster
modelos grandes
modelos grandes, multi-GPU
RTX 5090 (x N), A100/H100/H200

O QLoRA mantém a memória baixa carregando a base em 4-bit. Os limites exatos mudam com o tamanho do modelo e o rank do adaptador - estas são orientações práticas, não cortes rígidos. Modelos maiores escalam por várias GPUs ou um cluster.

🐧 Sistema operativo

O Linux é o caminho mais suave tanto para NVIDIA como para AMD, e o Windows funciona através do WSL. Os próprios modelos são apenas ficheiros - não se importam com o OS que os fez.

Uma boa placa é o seu laboratório de IA inteiro.

Se consegue jogar jogos modernos nela, provavelmente consegue fazer finetuning de um modelo nela - e quando precisar de mais, o mesmo pipeline roda num cluster.

Veja como funciona →
Quantinia
© 2026 Quantinia