No se necesita un datacenter para empezar. Una sola tarjeta gráfica de consumo basta para ejecutar un modelo compacto - y una tarjeta de 24 GB basta para ajustar el tuyo. Escala a varias GPUs o a un clúster cuando necesites un modelo más grande.
Si tiene memoria suficiente y una pila de drivers compatible, funciona. Las dos grandes familias de GPU están cubiertas.
Las RTX 3090, 4090 y 5090 lideran el camino, con el resto de la serie RTX 30/40/50 pisándoles los talones - hasta tarjetas de datacenter (A100, H100, H200) para modelos grandes. La vía más ampliamente probada.
Entrena y ejecutaRadeon RX 7900 XTX / 7900 XT, con la 7900 XTX de 24 GB como el punto óptimo, hasta aceleradoras de la serie Instinct MI. Una vía de entrenamiento de primera clase completa.
Entrena y ejecutaLa VRAM es lo que más importa. Ejecutar un modelo compacto es ligero; ajustarlo necesita un poco más de margen.
QLoRA mantiene baja la memoria cargando la base en 4-bit. Los límites exactos cambian con el tamaño del modelo y el rango del adaptador - son pautas prácticas, no cortes rígidos. Los modelos más grandes escalan a través de varias GPUs o un clúster.
Linux es la vía más fluida tanto para NVIDIA como para AMD, y Windows funciona a través de WSL. Los modelos en sí son simples archivos - no les importa qué SO los creó.
Si puedes jugar a juegos modernos en ella, probablemente puedas ajustar un modelo en ella - y cuando necesites más, el mismo pipeline funciona en un clúster.
Ver cómo funciona →