Fine-tuning de modelos pequeños: adapta IA a tu caso de uso sin salir de casa

Qué es el fine-tuning y por qué importa en 2026

El fine-tuning es el proceso de tomar un modelo de lenguaje pre-entrenado —como Llama 3, Mistral o Qwen— y re-entrenarlo con datos específicos de tu dominio para que se comporte de una forma determinada. Imagina un médico generalista que sabe de todo: el fine-tuning lo convierte en cardiólogo, conservando su conocimiento general pero respondiendo con expertise especializado.

La diferencia fundamental respecto al pre-entrenamiento es abismal en costes y recursos:

Pre-entrenamientoFine-tuning
Entrena desde cero con billones de tokensAdapta un modelo ya entrenado
Requiere miles de GPUs durante semanasPuede hacerse con 1 GPU en horas
Coste: millones de dólaresCoste: 10-500 euros (depende del tamaño)
Conocimiento generalComportamiento específico del dominio
Lo hacen OpenAI, Meta, GoogleLo puede hacer cualquier persona con GPU de consumo

En 2026, el fine-tuning se ha democratizado gracias a técnicas como LoRA y QLoRA, que reducen los requisitos de hardware entre 10 y 100 veces. Lo que antes requería infraestructura empresarial, ahora cabe en una GPU de gaming.

Fine-tuning vs RAG vs Prompting: cuándo usar cada uno

Esta es la pregunta que más confusión genera. La respuesta corta: dependen de qué necesites exactamente.

Usa prompting cuando estás experimentando o necesitas flexibilidad máxima. No requiere datos, solo sabes escribir buenas instrucciones. El coste recurrente es alto si usas APIs de pago por token, y la personalización es limitada.

Usa RAG (Retrieval-Augmented Generation) cuando necesitas que el modelo «sepa» información actualizada o específica de tu organización: documentación interna, bases de conocimiento, FAQs. Los datos se mantienen en tu servidor, pero el comportamiento del modelo sigue siendo genérico.

Usa fine-tuning cuando necesitas que el modelo «se comporte» de una forma específica: tono profesional, formato estructurado, jerga técnica de tu sector, patrones de respuesta consistentes. Requiere cientos o miles de ejemplos de entrenamiento, pero el coste recurrente es mínimo y la personalización es máxima.

Regla práctica: si necesitas que el modelo sepa algo → RAG. Si necesitas que el modelo actúe de cierta forma → fine-tuning. Si necesitas ambos → combina RAG + fine-tuning, la arquitectura más potente en 2026.

Técnicas disponibles: LoRA, QLoRA y DPO

No todo el fine-tuning es igual. Las técnicas modernas evitan re-entrenar todos los parámetros del modelo —un proceso prohibitivamente caro— y se centran en adaptar solo partes específicas.

LoRA (Low-Rank Adaptation)

LoRA no modifica todos los parámetros del modelo. En su lugar, entrena «adaptadores» de bajo rango que se añaden a las capas existentes. Estos adaptadores son matrices pequeñas —típicamente con rango entre 8 y 64— que se insertan en las capas de atención del transformer.

El resultado: reduces la necesidad de VRAM entre 10 y 100 veces, manteniendo entre el 95 y 99 por ciento de la calidad de un fine-tuning completo. Los adaptadores se guardan como archivos separados, lo que permite tener múltiples versiones especializadas del mismo modelo base.

QLoRA (Quantized LoRA)

QLoRA combina cuantización de 4 bits con LoRA. La cuantización reduce la precisión de los pesos del modelo base de 16 bits a 4 bits, ocupando 4 veces menos memoria. Sobre ese modelo cuantizado, se aplican los adaptadores LoRA en precisión 16 bits.

Esta técnica permite hacer fine-tuning de modelos de 65 mil millones de parámetros en una sola GPU de consumo con 24 GB de VRAM. Es la innovación que democratizó el fine-tuning en 2024-2025.

DPO (Direct Preference Optimization)

DPO es una alternativa más simple a RLHF (Reinforcement Learning from Human Feedback). En lugar de entrenar un modelo de recompensa separado, DPO optimiza directamente las preferencias humanas comparando pares de respuestas.

Requiere menos infraestructura que RLHF y produce resultados comparables en alineación con preferencias humanas. Es especialmente útil cuando quieres que el modelo adopte un tono o estilo específico sin recolectar miles de ejemplos etiquetados.

TécnicaComplejidadGPU necesariaMejora principal
LoRABaja-mediaBaja (10-100x menos VRAM)Comportamiento + eficiencia
QLoRAMediaMuy baja (1 GPU consumo)Modelos gigantes en hardware modesto
DPOMediaMediaAlineación simplificada

Modelos recomendados para fine-tuning en 2026

No todos los modelos responden igual al fine-tuning. La elección depende de tu caso de uso, hardware disponible y requisitos de licencia.

Mistral 7B: según experiencia documentada de múltiples equipos de desarrollo, es el más fiable para fine-tuning general. Licencia Apache 2.0, ecosistema maduro en HuggingFace, y un ratio calidad-parámetros excepcional. Funciona bien en GPUs con 12 GB de VRAM usando QLoRA.

Llama 3 (8B y 70B): tiene el ecosistema más amplio, con soporte nativo en prácticamente todas las herramientas. La versión 8B es ideal para empezar; la 70B requiere QLoRA y al menos 24 GB de VRAM, pero ofrece calidad cercana a modelos propietarios.

Qwen 2.5 (7B, 14B, 72B): fuerte en multilingüe y matemáticas. Licencia Apache 2.0. Particularmente competente en español y lenguas latinas. La versión 7B es una alternativa sólida a Mistral.

Gemma 2B y 7B (Google): licencias permisivas, ideales para edge y mobile. El modelo de 2B cabe incluso en teléfonos modernos. Calidad sorprendente para su tamaño, aunque limitada en tareas complejas de razonamiento.

Phi-3 (3B) (Microsoft): ultra-ligero con calidad inesperada. Licencia MIT. Perfecto para prototipado rápido y casos de uso con restricciones severas de recursos.

Lección crítica: prueba siempre 2-3 modelos antes de comprometerte. Hay casos documentados donde DeepSeek generaba caracteres chinos no solicitados, o Llama mostraba degradación inesperada en tareas específicas. El modelo «mejor en benchmarks» no siempre es el mejor para tu caso concreto.

Requisitos de hardware: qué GPU necesitas

Los requisitos dependen del tamaño del modelo y la técnica usada. Para QLoRA —la opción más eficiente— estos son los mínimos reales:

GPUVRAMModelo 7BModelo 13B
RTX 3060 / 406012 GBSí, cómodoNo cabe
RTX 308010-12 GBSí, ajustado en 10 GBMarginal en 12 GB
RTX 3090 / 409024 GBSí, muy cómodoSí, cómodo
Mac Studio M1/M2/M332-64 GB unificadosSí (vía MLX)Sí (vía MLX)

En Mac con Apple Silicon, el framework MLX de Apple permite fine-tuning eficiente usando memoria unificada. Con 32 GB de RAM, puedes ajustar modelos de hasta 13B parámetros sin problemas. La ventaja: silencio total, consumo eléctrico mínimo y sin necesidad de GPU dedicada.

Para entrenamiento en la nube, opciones económicas incluyen Google Colab (gratis con límites), Kaggle (30 horas semanales gratis), Lambda Labs (desde 1,10 euros/hora) y RunPod (desde 0,35 euros/hora). Un fine-tuning básico de 7B toma 2-4 horas en Colab gratis.

Cómo preparar los datos de entrenamiento

La calidad del dataset importa más que el tamaño. Quinientos ejemplos excelentes superan a cinco mil mediocres en la mayoría de tareas.

El formato estándar en 2026 es ChatML, que estructura conversaciones multi-turno:

Formato básico con mensajes:

System: Eres un analista de soporte técnico especializado en redes.
User: Tengo 500 intentos de login fallidos desde la IP 10.0.0.1
Assistant: Severidad: Alta. Categoría: Fuerza bruta. Acción recomendada: Bloquear IP temporalmente y notificar al administrador.

Para tareas más simples, el formato Alpaca funciona bien:

Instrucción: Resume esta consulta de soporte en una frase.
Entrada: Usuario no puede iniciar sesión tras restablecer contraseña. El token aparece expirado.
Salida: Usuario no puede loguearse después de reset de password por token expirado.

Reglas de oro para datasets:

  • Calidad sobre cantidad: 200-500 ejemplos para cambios de estilo o formato. 1.000-3.000 para adaptación de dominio. 5.000+ solo si necesitas inyectar conocimiento factual masivo.
  • Formato consistente: el modelo aprende patrones. Si un día usas «Respuesta:» y otro día «Output:», aprenderá inconsistencia.
  • Incluye edge cases: ejemplos difíciles o poco frecuentes que quieres que el modelo maneje bien.
  • Divide train/test: guarda un 10 por ciento de tus datos para evaluación posterior. Nunca evalúes con los mismos datos que entrenaste.

Herramientas recomendadas: Unsloth y HuggingFace

Unsloth es el framework más eficiente en 2026. Reescribe los pasos de backpropagation en kernels de Triton optimizados a mano, logrando ser 2 veces más rápido y usar 70 por ciento menos de VRAM que el setup estándar de HuggingFace + PEFT, sin pérdida medible de precisión.

Soporta Llama 3.x, Qwen, Gemma, Mistral, DeepSeek y la mayoría de arquitecturas populares. La instalación es directa: pip install unsloth. Desde ahí, cargar el modelo, aplicar adaptadores LoRA y entrenar sigue una API limpia de pocas líneas.

HuggingFace Transformers + PEFT sigue siendo la opción más compatible. PEFT (Parameter-Efficient Fine-Tuning) es la librería oficial que implementa LoRA, QLoRA y otras técnicas. Es más lenta que Unsloth, pero tiene soporte para más modelos y más opciones de configuración.

Para evaluación, herramientas como LLM Judge permiten usar un modelo más grande para puntuar las respuestas del modelo fine-tuneado. Métricas tradicionales como accuracy o F1-score funcionan para tareas de clasificación; para generación de texto, la evaluación humana o asistida por LLM sigue siendo el gold standard.

Privacidad y cumplimiento normativo

Una ventaja decisiva del fine-tuning local: tus datos nunca salen de tu infraestructura. Con APIs en la nube, cada prompt —potencialmente sensible— viaja a servidores de terceros. Para sectores regulados como fintech, salud o legal, esta diferencia es determinante.

El EU AI Act, con deadline de 2 de agosto de 2026, plantea una pregunta sin respuesta clara: ¿un modelo fine-tuneado es un «nuevo» sistema de IA? Si modificas sustancialmente el comportamiento del modelo, puede clasificarse como nuevo sistema y requerir compliance obligatorio. Si el fine-tuning es menor —adaptación de tono o formato—, probablemente no.

Recomendación práctica: documenta el proceso de fine-tuning, los datos usados, y las evaluaciones realizadas. Si tu modelo toma decisiones en sanidad, finanzas o contratación, asume que necesitas compliance. Las multas pueden llegar a 35 millones de euros o 7 por ciento de facturación global.

Errores comunes al hacer fine-tuning

1. Fine-tunear cuando deberías usar RAG o prompting: el fine-tuning no añade conocimiento nuevo, solo adapta comportamiento. Si necesitas que el modelo sepa información actualizada, usa RAG. Si solo estás experimentando, mejora el prompt primero.

2. Dataset pequeño o ruidoso: menos de 200 ejemplos de baja calidad producen degradación en lugar de mejora. Limpia manualmente los ejemplos, elimina duplicados y verifica formato consistente antes de entrenar.

3. No evaluar contra test set: siempre reserva un 10 por ciento de datos para evaluación. Si el modelo fine-tuneado no mejora al menos 5-10 por ciento frente al modelo base en tu test set, el fine-tuning no valió la pena.

4. Overfitting agresivo: entrenar demasiadas épocas o con learning rate muy alto hace que el modelo memorice los ejemplos en lugar de aprender patrones generales. Empieza con 1-3 épocas y learning rate de 2e-4.

5. Ignorar el coste de inferencia: un modelo fine-tuneado necesita hosting. Si usas una GPU de 24 GB solo para inferencia, el coste mensual (200-400 euros en cloud) puede superar a una API para volúmenes bajos. Calcula el punto de equilibrio antes de comprometerte.

6. No documentar el proceso: para cumplimiento normativo y reproducibilidad, guarda registro de: versión exacta del modelo base, commit del código de entrenamiento, hyperparámetros usados, dataset completo (o hash si es sensible), y métricas de evaluación.

Caso práctico: combinación RAG + fine-tuning

El Instituto de Ingeniería del Conocimiento de la Universidad Autónoma de Madrid documentó un caso real de chatbot para soporte técnico académico:

  • Sin fine-tuning: Chatbot RAG con GPT-3.5 obtuvo 3,59 sobre 5 en calidad de respuesta. Las respuestas eran correctas pero genéricas en tono y formato.
  • Con fine-tuning: mismo setup RAG, pero con modelo Mistral 7B fine-tuneado en 800 ejemplos de respuestas ideales del servicio de soporte. Mejora medible en calidad (4,31 sobre 5) y control total de formato: estructura consistente, longitud apropiada, tono institucional.
  • Conclusión: RAG aporta conocimiento actualizado; fine-tuning aporta comportamiento consistente. La combinación supera a ambos enfoques por separado.

Resumen práctico

  • El fine-tuning adapta el comportamiento del modelo, no añade conocimiento nuevo. Para conocimiento actualizado, usa RAG.
  • LoRA y QLoRA democratizaron el fine-tuning: reducen requisitos de VRAM 10-100 veces, permitiendo entrenar en GPUs de consumo.
  • Mistral 7B y Llama 3 8B son los modelos más fiables para empezar en 2026. Prueba 2-3 modelos antes de comprometerte.
  • Necesitas 200-500 ejemplos de calidad para cambios de estilo, 1.000-3.000 para adaptación de dominio. Calidad importa más que cantidad.
  • Unsloth es 2x más rápido y usa 70 por ciento menos VRAM que HuggingFace estándar, sin pérdida de precisión.
  • Con 12 GB de VRAM puedes fine-tunear modelos 7B; con 24 GB, modelos 13B. Mac con 32 GB RAM usa MLX.
  • Tus datos nunca salen de tu servidor con fine-tuning local. Ventaja crítica para sectores regulados.
  • EU AI Act (agosto 2026) puede requerir compliance si el fine-tuning modifica sustancialmente el comportamiento. Documenta todo.
  • Errores comunes: fine-tunear cuando bastaba RAG, dataset ruidoso, no evaluar, overfitting, ignorar costes de inferencia.
  • Combinación óptima: RAG + fine-tuning. RAG para conocimiento, fine-tuning para comportamiento consistente.

Referencias

Berythium

Modelos: gpt-5 + dall-e 2