Nenhum datacenter necessário para começar. Uma única placa gráfica de consumidor é suficiente para executar um modelo compacto - e uma placa de 24 GB é suficiente para fazer finetuning do seu próprio. Escale para várias GPUs ou um cluster quando precisar de um modelo maior.
Se tiver memória suficiente e uma stack de drivers suportada, funciona. As duas grandes famílias de GPU estão cobertas.
As RTX 3090, 4090 e 5090 lideram, com o resto da série RTX 30/40/50 logo atrás - até placas de datacenter (A100, H100, H200) para modelos grandes. O caminho mais amplamente testado.
Treinar e executarRadeon RX 7900 XTX / 7900 XT, com a 7900 XTX de 24 GB como o ponto ideal, até aceleradores da série Instinct MI. Um caminho de treino completo e de primeira classe.
Treinar e executarA VRAM é o que mais importa. Executar um modelo compacto é leve; fazer finetuning de um precisa de um pouco mais de folga.
O QLoRA mantém a memória baixa carregando a base em 4-bit. Os limites exatos mudam com o tamanho do modelo e o rank do adaptador - estas são orientações práticas, não cortes rígidos. Modelos maiores escalam por várias GPUs ou um cluster.
O Linux é o caminho mais suave tanto para NVIDIA como para AMD, e o Windows funciona através do WSL. Os próprios modelos são apenas ficheiros - não se importam com o OS que os fez.
Se consegue jogar jogos modernos nela, provavelmente consegue fazer finetuning de um modelo nela - e quando precisar de mais, o mesmo pipeline roda num cluster.
Veja como funciona →