Guía · actualizada 2026-07-23
Cómo ajustar un LLM en tu propia GPU (NVIDIA o AMD)
Pregunta en cualquier foro si puedes ajustar un modelo de lenguaje en tu propia máquina y la respuesta más votada suele ser "tu PC no es lo bastante potente - usa la nube". Ese consejo está desactualizado. Con la técnica adecuada, una sola GPU de consumo basta para ajustar modelos reales - y mantienes tus datos y tu modelo en hardware que es tuyo.
¿Puede tu GPU hacerlo de verdad?
La razón por la que la gente cree que el ajuste local es imposible es que imaginan un ajuste completo - actualizar cada peso del modelo. Eso sí necesita un centro de datos. Pero casi nunca lo necesitas. LoRA (Low-Rank Adaptation) entrena un pequeño conjunto de pesos adicionales sobre un modelo base congelado. Alcanza la mayor parte de la calidad del ajuste completo usando una fracción de la memoria.
Una guía realista de VRAM con LoRA en bf16:
- 8 GB - modelos de hasta ~1.5B parámetros (genial para pruebas y tareas pequeñas)
- 12-16 GB - hasta ~3B parámetros
- 24 GB (por ejemplo RTX 4090, RX 7900 XTX) - hasta ~7-8B parámetros
Si tienes una GPU de gaming de los últimos años, puedes ajustar algo útil hoy mismo.
Ve a por más: modelos de nivel agente, no juguetes
Aquí es donde se pone interesante. Esos números son para bf16 estándar. Baja a cuantización de 4 bits (QLoRA) y el límite se dispara: cuantizas el modelo base congelado a 4 bits, así que un modelo que necesitaría ~48 GB en bf16 cabe en aproximadamente una cuarta parte de eso. Los adaptadores LoRA que entrenas se mantienen en precisión completa, por lo que la calidad se conserva.
Eso cambia toda la conversación. Una sola tarjeta de 24 GB ya no se topa con un techo en 8B - alcanza modelos de clase ~30B, el tamaño en el que un modelo es realmente capaz de impulsar un agente: uso de herramientas, razonamiento multipaso, salida estructurada. Ya no estás limitado a ajustar juguetes en tu propio hardware; puedes moldear un modelo real, de nivel agente, en él.
Esto no es teoría. Ajustamos un modelo Qwen de 27B en una sola Radeon RX 7900 XTX - una tarjeta AMD de consumo de 24 GB - y funciona bien. Un modelo capaz, de escala agéntica, entrenado en hardware que puedes comprar sin más, con tus datos sin salir nunca de la máquina.
Qué le das realmente
El ajuste consiste en enseñar a un modelo tus ejemplos. Le proporcionas pares de entrada/salida - una pregunta y la respuesta que quieres, una instrucción y la respuesta ideal, un chat y cómo debería responder el asistente. Unas pocas docenas de buenos ejemplos ya mueven a un modelo; de unos cientos a unos miles es un conjunto de datos sólido. El modelo aprende tu estilo, tu formato, tu dominio.
NVIDIA (CUDA) - Windows o Linux
Si tienes una tarjeta NVIDIA, estás en la vía más común. El entrenamiento corre a través de CUDA, y funciona tanto en Windows como en Linux. Los componentes básicos son PyTorch (la versión CUDA), más las bibliotecas de Hugging Face (transformers, PEFT, accelerate). El modelo, tus datos y el entrenamiento se quedan todos en tu máquina.
Esta es la ruta mayoritaria - la inmensa mayoría del ajuste local ocurre en GPU NVIDIA, desde una 3060 de portátil hasta una RTX 4090.
AMD (ROCm) - Linux
Aquí está la parte que la mayoría de las guías omite: no necesitas NVIDIA. En Linux, las GPU AMD entrenan a través de ROCm, el equivalente de AMD a CUDA. La clave es que PyTorch abstrae el backend - el mismo código de entrenamiento corre en CUDA y en ROCm, solo instalas la versión ROCm de PyTorch. Quantinia está probado de principio a fin en la Radeon RX 7900 XTX, y el pipeline idéntico corre en NVIDIA. Una herramienta, cualquiera de las dos tarjetas.
(En Windows, el soporte de entrenamiento en AMD sigue siendo limitado, así que el ajuste en AMD significa Linux por ahora. NVIDIA cubre ambos.)
La parte difícil que nadie te advierte
El entrenamiento en sí son unas pocas líneas. El dolor es el entorno: encontrar la versión correcta de PyTorch para tu GPU y driver exactos, fijar versiones de transformers y PEFT para que no se rompan entre sí, lidiar con CUDA o ROCm, y depurar errores crípticos antes de haber entrenado un solo paso. Aquí es donde la mayoría de la gente se rinde y se refugia en un notebook en la nube.
La forma sin código
Esta es exactamente la brecha que cierra Quantinia. Es una aplicación de escritorio, no una biblioteca ni un notebook:
- Instálala en Windows o Linux - un asistente detecta tu GPU y configura la versión correcta de PyTorch automáticamente.
- Suelta tus ejemplos.
- Recupera un modelo ajustado. Sin terminal, sin infierno de dependencias, sin Python.
Para ser claros: si ya vives en Python y quieres máxima velocidad, una biblioteca optimizada como Unsloth entrenará más rápido. Quantinia no intenta ganar en rendimiento bruto. Gana en facilidad, propiedad y funcionar igual en cualquier GPU - eres dueño del modelo, tus datos nunca salen de tu máquina, y simplemente funciona ya sea tu tarjeta verde o roja.
Preguntas frecuentes
¿Se puede ajustar un LLM en tu propio PC?
Sí. Con LoRA, una GPU de consumo con 8-24 GB de VRAM puede ajustar modelos desde 0.5B hasta 8B parámetros. Necesitas la técnica adecuada y la versión correcta de PyTorch para tu GPU, no un centro de datos.
¿Cuánta VRAM necesito?
Con LoRA en bf16, aproximadamente: 8 GB hasta ~1.5B, 12-16 GB hasta ~3B, 24 GB hasta ~7-8B. Con cuantización de 4 bits (QLoRA) el límite se cuadruplica aproximadamente - una tarjeta de 24 GB alcanza modelos de clase ~30B. El ajuste completo necesita mucho más; LoRA y la cuantización son lo que hace realista el entrenamiento local.
¿Puedo ajustar un modelo grande, de nivel agente, en mi propia GPU?
Sí. Usando cuantización de 4 bits, una sola tarjeta de 24 GB puede ajustar modelos de clase ~30B - lo bastante grandes para impulsar un agente (uso de herramientas, razonamiento multipaso). Ajustamos un modelo Qwen de 27B en una sola Radeon RX 7900 XTX, una tarjeta AMD de consumo.
¿Puedo ajustar en una GPU AMD?
Sí, en Linux con ROCm. El mismo código que corre en NVIDIA CUDA corre en AMD ROCm. Quantinia está probado en la RX 7900 XTX.
¿Necesito escribir código?
No. Unsloth y el stack de Hugging Face necesitan Python. Quantinia es una aplicación de escritorio - instala, añade ejemplos, obtén un modelo.