Fine-tuning de modelos pequeños: adapta IA a tu caso de uso sin salir de casa

Qué es el fine-tuning y por qué importa en 2026

El fine-tuning es el proceso de tomar un modelo de lenguaje pre-entrenado —como Llama 3, Mistral o Qwen— y re-entrenarlo con datos específicos de tu dominio para que se comporte de una forma determinada. Imagina un médico generalista que sabe de todo: el fine-tuning lo convierte en cardiólogo, conservando su conocimiento general pero respondiendo con expertise especializado.

La diferencia fundamental respecto al pre-entrenamiento es abismal en costes y recursos:

Pre-entrenamientoFine-tuning
Entrena desde cero con billones de tokensAdapta un modelo ya entrenado
Requiere miles de GPUs durante semanasPuede hacerse con 1 GPU en horas
Coste: millones de dólaresCoste: 10-500 euros (depende del tamaño)
Conocimiento generalComportamiento específico del dominio
Lo hacen OpenAI, Meta, GoogleLo puede hacer cualquier persona con GPU de consumo

En 2026, el fine-tuning se ha democratizado gracias a técnicas como LoRA y QLoRA, que reducen los requisitos de hardware entre 10 y 100 veces. Lo que antes requería infraestructura empresarial, ahora cabe en una GPU de gaming.

Fine-tuning vs RAG vs Prompting: cuándo usar cada uno

Esta es la pregunta que más confusión genera. La respuesta corta: dependen de qué necesites exactamente.

Usa prompting cuando estás experimentando o necesitas flexibilidad máxima. No requiere datos, solo sabes escribir buenas instrucciones. El coste recurrente es alto si usas APIs de pago por token, y la personalización es limitada.

Usa RAG (Retrieval-Augmented Generation) cuando necesitas que el modelo «sepa» información actualizada o específica de tu organización: documentación interna, bases de conocimiento, FAQs. Los datos se mantienen en tu servidor, pero el comportamiento del modelo sigue siendo genérico.

Usa fine-tuning cuando necesitas que el modelo «se comporte» de una forma específica: tono profesional, formato estructurado, jerga técnica de tu sector, patrones de respuesta consistentes. Requiere cientos o miles de ejemplos de entrenamiento, pero el coste recurrente es mínimo y la personalización es máxima.

Regla práctica: si necesitas que el modelo sepa algo → RAG. Si necesitas que el modelo actúe de cierta forma → fine-tuning. Si necesitas ambos → combina RAG + fine-tuning, la arquitectura más potente en 2026.

Técnicas disponibles: LoRA, QLoRA y DPO

No todo el fine-tuning es igual. Las técnicas modernas evitan re-entrenar todos los parámetros del modelo —un proceso prohibitivamente caro— y se centran en adaptar solo partes específicas.

LoRA (Low-Rank Adaptation)

LoRA no modifica todos los parámetros del modelo. En su lugar, entrena «adaptadores» de bajo rango que se añaden a las capas existentes. Estos adaptadores son matrices pequeñas —típicamente con rango entre 8 y 64— que se insertan en las capas de atención del transformer.

El resultado: reduces la necesidad de VRAM entre 10 y 100 veces, manteniendo entre el 95 y 99 por ciento de la calidad de un fine-tuning completo. Los adaptadores se guardan como archivos separados, lo que permite tener múltiples versiones especializadas del mismo modelo base.

QLoRA (Quantized LoRA)

QLoRA combina cuantización de 4 bits con LoRA. La cuantización reduce la precisión de los pesos del modelo base de 16 bits a 4 bits, ocupando 4 veces menos memoria. Sobre ese modelo cuantizado, se aplican los adaptadores LoRA en precisión 16 bits.

Esta técnica permite hacer fine-tuning de modelos de 65 mil millones de parámetros en una sola GPU de consumo con 24 GB de VRAM. Es la innovación que democratizó el fine-tuning en 2024-2025.

DPO (Direct Preference Optimization)

DPO es una alternativa más simple a RLHF (Reinforcement Learning from Human Feedback). En lugar de entrenar un modelo de recompensa separado, DPO optimiza directamente las preferencias humanas comparando pares de respuestas.

Requiere menos infraestructura que RLHF y produce resultados comparables en alineación con preferencias humanas. Es especialmente útil cuando quieres que el modelo adopte un tono o estilo específico sin recolectar miles de ejemplos etiquetados.

TécnicaComplejidadGPU necesariaMejora principal
LoRABaja-mediaBaja (10-100x menos VRAM)Comportamiento + eficiencia
QLoRAMediaMuy baja (1 GPU consumo)Modelos gigantes en hardware modesto
DPOMediaMediaAlineación simplificada

Modelos recomendados para fine-tuning en 2026

No todos los modelos responden igual al fine-tuning. La elección depende de tu caso de uso, hardware disponible y requisitos de licencia.

Mistral 7B: según experiencia documentada de múltiples equipos de desarrollo, es el más fiable para fine-tuning general. Licencia Apache 2.0, ecosistema maduro en HuggingFace, y un ratio calidad-parámetros excepcional. Funciona bien en GPUs con 12 GB de VRAM usando QLoRA.

Llama 3 (8B y 70B): tiene el ecosistema más amplio, con soporte nativo en prácticamente todas las herramientas. La versión 8B es ideal para empezar; la 70B requiere QLoRA y al menos 24 GB de VRAM, pero ofrece calidad cercana a modelos propietarios.

Qwen 2.5 (7B, 14B, 72B): fuerte en multilingüe y matemáticas. Licencia Apache 2.0. Particularmente competente en español y lenguas latinas. La versión 7B es una alternativa sólida a Mistral.

Gemma 2B y 7B (Google): licencias permisivas, ideales para edge y mobile. El modelo de 2B cabe incluso en teléfonos modernos. Calidad sorprendente para su tamaño, aunque limitada en tareas complejas de razonamiento.

Phi-3 (3B) (Microsoft): ultra-ligero con calidad inesperada. Licencia MIT. Perfecto para prototipado rápido y casos de uso con restricciones severas de recursos.

Lección crítica: prueba siempre 2-3 modelos antes de comprometerte. Hay casos documentados donde DeepSeek generaba caracteres chinos no solicitados, o Llama mostraba degradación inesperada en tareas específicas. El modelo «mejor en benchmarks» no siempre es el mejor para tu caso concreto.

Requisitos de hardware: qué GPU necesitas

Los requisitos dependen del tamaño del modelo y la técnica usada. Para QLoRA —la opción más eficiente— estos son los mínimos reales:

GPUVRAMModelo 7BModelo 13B
RTX 3060 / 406012 GBSí, cómodoNo cabe
RTX 308010-12 GBSí, ajustado en 10 GBMarginal en 12 GB
RTX 3090 / 409024 GBSí, muy cómodoSí, cómodo
Mac Studio M1/M2/M332-64 GB unificadosSí (vía MLX)Sí (vía MLX)

En Mac con Apple Silicon, el framework MLX de Apple permite fine-tuning eficiente usando memoria unificada. Con 32 GB de RAM, puedes ajustar modelos de hasta 13B parámetros sin problemas. La ventaja: silencio total, consumo eléctrico mínimo y sin necesidad de GPU dedicada.

Para entrenamiento en la nube, opciones económicas incluyen Google Colab (gratis con límites), Kaggle (30 horas semanales gratis), Lambda Labs (desde 1,10 euros/hora) y RunPod (desde 0,35 euros/hora). Un fine-tuning básico de 7B toma 2-4 horas en Colab gratis.

Cómo preparar los datos de entrenamiento

La calidad del dataset importa más que el tamaño. Quinientos ejemplos excelentes superan a cinco mil mediocres en la mayoría de tareas.

El formato estándar en 2026 es ChatML, que estructura conversaciones multi-turno:

Formato básico con mensajes:

System: Eres un analista de soporte técnico especializado en redes.
User: Tengo 500 intentos de login fallidos desde la IP 10.0.0.1
Assistant: Severidad: Alta. Categoría: Fuerza bruta. Acción recomendada: Bloquear IP temporalmente y notificar al administrador.

Para tareas más simples, el formato Alpaca funciona bien:

Instrucción: Resume esta consulta de soporte en una frase.
Entrada: Usuario no puede iniciar sesión tras restablecer contraseña. El token aparece expirado.
Salida: Usuario no puede loguearse después de reset de password por token expirado.

Reglas de oro para datasets:

  • Calidad sobre cantidad: 200-500 ejemplos para cambios de estilo o formato. 1.000-3.000 para adaptación de dominio. 5.000+ solo si necesitas inyectar conocimiento factual masivo.
  • Formato consistente: el modelo aprende patrones. Si un día usas «Respuesta:» y otro día «Output:», aprenderá inconsistencia.
  • Incluye edge cases: ejemplos difíciles o poco frecuentes que quieres que el modelo maneje bien.
  • Divide train/test: guarda un 10 por ciento de tus datos para evaluación posterior. Nunca evalúes con los mismos datos que entrenaste.

Herramientas recomendadas: Unsloth y HuggingFace

Unsloth es el framework más eficiente en 2026. Reescribe los pasos de backpropagation en kernels de Triton optimizados a mano, logrando ser 2 veces más rápido y usar 70 por ciento menos de VRAM que el setup estándar de HuggingFace + PEFT, sin pérdida medible de precisión.

Soporta Llama 3.x, Qwen, Gemma, Mistral, DeepSeek y la mayoría de arquitecturas populares. La instalación es directa: pip install unsloth. Desde ahí, cargar el modelo, aplicar adaptadores LoRA y entrenar sigue una API limpia de pocas líneas.

HuggingFace Transformers + PEFT sigue siendo la opción más compatible. PEFT (Parameter-Efficient Fine-Tuning) es la librería oficial que implementa LoRA, QLoRA y otras técnicas. Es más lenta que Unsloth, pero tiene soporte para más modelos y más opciones de configuración.

Para evaluación, herramientas como LLM Judge permiten usar un modelo más grande para puntuar las respuestas del modelo fine-tuneado. Métricas tradicionales como accuracy o F1-score funcionan para tareas de clasificación; para generación de texto, la evaluación humana o asistida por LLM sigue siendo el gold standard.

Privacidad y cumplimiento normativo

Una ventaja decisiva del fine-tuning local: tus datos nunca salen de tu infraestructura. Con APIs en la nube, cada prompt —potencialmente sensible— viaja a servidores de terceros. Para sectores regulados como fintech, salud o legal, esta diferencia es determinante.

El EU AI Act, con deadline de 2 de agosto de 2026, plantea una pregunta sin respuesta clara: ¿un modelo fine-tuneado es un «nuevo» sistema de IA? Si modificas sustancialmente el comportamiento del modelo, puede clasificarse como nuevo sistema y requerir compliance obligatorio. Si el fine-tuning es menor —adaptación de tono o formato—, probablemente no.

Recomendación práctica: documenta el proceso de fine-tuning, los datos usados, y las evaluaciones realizadas. Si tu modelo toma decisiones en sanidad, finanzas o contratación, asume que necesitas compliance. Las multas pueden llegar a 35 millones de euros o 7 por ciento de facturación global.

Errores comunes al hacer fine-tuning

1. Fine-tunear cuando deberías usar RAG o prompting: el fine-tuning no añade conocimiento nuevo, solo adapta comportamiento. Si necesitas que el modelo sepa información actualizada, usa RAG. Si solo estás experimentando, mejora el prompt primero.

2. Dataset pequeño o ruidoso: menos de 200 ejemplos de baja calidad producen degradación en lugar de mejora. Limpia manualmente los ejemplos, elimina duplicados y verifica formato consistente antes de entrenar.

3. No evaluar contra test set: siempre reserva un 10 por ciento de datos para evaluación. Si el modelo fine-tuneado no mejora al menos 5-10 por ciento frente al modelo base en tu test set, el fine-tuning no valió la pena.

4. Overfitting agresivo: entrenar demasiadas épocas o con learning rate muy alto hace que el modelo memorice los ejemplos en lugar de aprender patrones generales. Empieza con 1-3 épocas y learning rate de 2e-4.

5. Ignorar el coste de inferencia: un modelo fine-tuneado necesita hosting. Si usas una GPU de 24 GB solo para inferencia, el coste mensual (200-400 euros en cloud) puede superar a una API para volúmenes bajos. Calcula el punto de equilibrio antes de comprometerte.

6. No documentar el proceso: para cumplimiento normativo y reproducibilidad, guarda registro de: versión exacta del modelo base, commit del código de entrenamiento, hyperparámetros usados, dataset completo (o hash si es sensible), y métricas de evaluación.

Caso práctico: combinación RAG + fine-tuning

El Instituto de Ingeniería del Conocimiento de la Universidad Autónoma de Madrid documentó un caso real de chatbot para soporte técnico académico:

  • Sin fine-tuning: Chatbot RAG con GPT-3.5 obtuvo 3,59 sobre 5 en calidad de respuesta. Las respuestas eran correctas pero genéricas en tono y formato.
  • Con fine-tuning: mismo setup RAG, pero con modelo Mistral 7B fine-tuneado en 800 ejemplos de respuestas ideales del servicio de soporte. Mejora medible en calidad (4,31 sobre 5) y control total de formato: estructura consistente, longitud apropiada, tono institucional.
  • Conclusión: RAG aporta conocimiento actualizado; fine-tuning aporta comportamiento consistente. La combinación supera a ambos enfoques por separado.

Preguntas frecuentes

¿Qué es el fine-tuning y en qué se diferencia del pre-entrenamiento?

El fine-tuning es el proceso de adaptar un modelo de lenguaje pre-entrenado con datos específicos para que se comporte de una forma determinada. A diferencia del pre-entrenamiento, que entrena desde cero con miles de GPUs y un coste de millones, el fine-tuning puede hacerse con una sola GPU en horas y por un coste de 10 a 500 euros.

¿Cuándo debería usar fine-tuning en lugar de prompting o RAG?

Debes usar fine-tuning cuando necesitas que el modelo ‘se comporte’ de una forma específica, como adoptar un tono profesional o seguir un formato estructurado. Usa RAG si necesitas que el modelo ‘sepa’ información actualizada, y prompting si solo estás experimentando y necesitas flexibilidad máxima.

¿Qué GPU necesito para hacer fine-tuning de un modelo de 7B usando QLoRA?

Para hacer fine-tuning de un modelo de 7B con QLoRA de forma cómoda, necesitas una GPU como la RTX 3060 o 4060 con 12 GB de VRAM. También es posible utilizar un Mac Studio con Apple Silicon y 32 GB de RAM unificada usando el framework MLX de Apple.

¿Cuántos ejemplos de entrenamiento necesito para preparar los datos de fine-tuning?

La calidad del dataset importa más que el tamaño, por lo que 500 ejemplos excelentes pueden ser suficientes para cambios de estilo o formato. Para adaptación de dominio se recomiendan entre 1.000 y 3.000 ejemplos, y solo necesitarás más de 5.000 si quieres inyectar conocimiento factual masivo.

¿Qué herramientas se recomiendan para realizar el fine-tuning en 2026?

Unsloth es el framework más eficiente en 2026, siendo 2 veces más rápido y usando un 70 por ciento menos de VRAM que el setup estándar. Por otro lado, HuggingFace Transformers junto con la librería PEFT sigue siendo la opción más compatible, aunque es un poco más lenta que Unsloth.

Resumen práctico

  • El fine-tuning adapta el comportamiento del modelo, no añade conocimiento nuevo. Para conocimiento actualizado, usa RAG.
  • LoRA y QLoRA democratizaron el fine-tuning: reducen requisitos de VRAM 10-100 veces, permitiendo entrenar en GPUs de consumo.
  • Mistral 7B y Llama 3 8B son los modelos más fiables para empezar en 2026. Prueba 2-3 modelos antes de comprometerte.
  • Necesitas 200-500 ejemplos de calidad para cambios de estilo, 1.000-3.000 para adaptación de dominio. Calidad importa más que cantidad.
  • Unsloth es 2x más rápido y usa 70 por ciento menos VRAM que HuggingFace estándar, sin pérdida de precisión.
  • Con 12 GB de VRAM puedes fine-tunear modelos 7B; con 24 GB, modelos 13B. Mac con 32 GB RAM usa MLX.
  • Tus datos nunca salen de tu servidor con fine-tuning local. Ventaja crítica para sectores regulados.
  • EU AI Act (agosto 2026) puede requerir compliance si el fine-tuning modifica sustancialmente el comportamiento. Documenta todo.
  • Errores comunes: fine-tunear cuando bastaba RAG, dataset ruidoso, no evaluar, overfitting, ignorar costes de inferencia.
  • Combinación óptima: RAG + fine-tuning. RAG para conocimiento, fine-tuning para comportamiento consistente.

Referencias externas:

Berythium

Modelos: gpt-5 + dall-e 2