Cuándo Hacer Fine-Tuning (Y Cuándo No)
Los Tres Enfoques para Personalizar LLMs
Cuando necesitas que un LLM se comporte de manera diferente a su comportamiento por defecto, tienes tres opciones fundamentales: ingeniería de prompts, generación aumentada por recuperación (RAG) y fine-tuning. Cada una tiene fortalezas distintas, y elegir la equivocada desperdicia tiempo, dinero y esfuerzo. Esta lección te da un marco de decisión claro para que nunca te comprometas con fine-tuning cuando un system prompt bien elaborado habría resuelto el problema — y viceversa.
Ingeniería de Prompts
La ingeniería de prompts es el enfoque más ligero. Escribes system prompts detallados, proporcionas ejemplos few-shot y estructuras tus instrucciones para que el modelo se comporte como deseas. No requiere entrenamiento, ni GPUs, ni dataset.
Ideal para: Tareas de propósito general, prototipado rápido, tareas donde los requisitos cambian frecuentemente, equipos pequeños sin infraestructura de ML.
Limitaciones: La ventana de contexto tiene un tamaño finito. El comportamiento complejo requiere prompts largos que consumen tu presupuesto de tokens. El modelo puede no seguir consistentemente reglas de formato intrincadas. Pagas por los tokens del prompt en cada solicitud.
Generación Aumentada por Recuperación (RAG)
RAG aumenta el conocimiento del modelo recuperando documentos relevantes en el momento de la consulta e incluyéndolos en el contexto. El modelo en sí permanece sin cambios — le estás alimentando conocimiento externo dinámicamente.
Ideal para: Tareas intensivas en conocimiento (soporte al cliente sobre documentación, investigación legal, bases de conocimiento internas), escenarios donde la información cambia frecuentemente, casos donde necesitas citas y atribución de fuentes.
Limitaciones: La calidad de la recuperación es un cuello de botella — si los documentos correctos no se recuperan, la respuesta sufre. No cambia el estilo, tono o patrones de razonamiento del modelo. Agrega latencia por el paso de recuperación. Complejo de mantener a escala (estrategia de fragmentación, selección de modelo de embeddings, actualizaciones del índice).
Fine-Tuning
El fine-tuning modifica los pesos del modelo para que inherentemente se comporte de manera diferente. El comportamiento está incorporado en el modelo en lugar de inyectarse a través del prompt o contexto.
Ideal para: Requisitos consistentes de estilo o tono, vocabulario y jerga específica del dominio, formatos de salida específicos (JSON estructurado, informes médicos, cláusulas legales), aplicaciones sensibles a la latencia donde los prompts largos son demasiado lentos, reducción de costos cuando actualmente usas system prompts largos en cada solicitud.
Limitaciones: Requiere un dataset de calidad (típicamente 200+ ejemplos mínimo). Necesita cómputo GPU para entrenamiento. El modelo puede sobreajustarse o perder capacidades generales. Las actualizaciones requieren reentrenamiento.
Señales de que Necesitas Fine-Tuning
No todos los proyectos se benefician del fine-tuning. Aquí están las señales concretas que te dicen que es momento:
-
Estilo o voz consistente. Tu aplicación necesita responder siempre en un tono específico — un asistente médico que use lenguaje clínico, un bot orientado al cliente que coincida con la voz de tu marca, una herramienta legal que escriba en lenguaje formal de contratos. La ingeniería de prompts puede aproximar esto, pero el fine-tuning lo hace confiable.
-
Jerga específica del dominio. Tu campo tiene terminología especializada que el modelo base maneja torpemente. Modelos financieros, texto biomédico, procesos de manufactura — el fine-tuning enseña al modelo a usar estos términos naturalmente en lugar de tratarlos como vocabulario inusual.
-
Formato de salida específico. Necesitas salidas estructuradas que sigan esquemas exactos — estructuras JSON particulares, plantillas XML, formatos tabulares o diseños de reportes. El fine-tuning hace que el cumplimiento del formato sea casi automático en lugar de requerir instrucciones elaboradas en el prompt.
-
Requisitos de latencia. Si tu solución actual usa un system prompt de 2,000 tokens para obtener un comportamiento aceptable, ese prompt agrega latencia y costo a cada solicitud. Incorporar esas instrucciones en el modelo mediante fine-tuning elimina esa sobrecarga.
-
Costo a escala. Cuando haces miles de llamadas API por día con prompts largos, hacer fine-tuning de un modelo más pequeño para igualar la calidad de un modelo más grande con prompting elaborado puede reducir dramáticamente los costos.
-
Razonamiento específico de tarea. El modelo necesita seguir un patrón de razonamiento particular — una cadena de pensamiento específica para diagnóstico médico, un framework particular para revisión de código, una metodología definida para evaluación de riesgos.
Señales de que NO Deberías Hacer Fine-Tuning
Igualmente importante es saber cuándo evitar el fine-tuning:
-
Dataset pequeño o de baja calidad. Si tienes menos de 100 ejemplos de alta calidad, el fine-tuning probablemente se sobreajustará o producirá una mejora insignificante. Comienza con ingeniería de prompts y recopila más datos con el tiempo.
-
Requisitos que cambian frecuentemente. Si el comportamiento que necesitas cambia cada semana, reentrenar constantemente es impráctico. Usa prompts o RAG en su lugar.
-
Tareas de conocimiento general. Si necesitas que el modelo sepa sobre eventos actuales, documentación reciente o un corpus grande de información, RAG es la herramienta correcta. El fine-tuning no inyecta conocimiento factual de manera confiable — cambia comportamiento, no conocimiento.
-
Sin criterios de evaluación claros. Si no puedes definir cómo se ve una "buena salida" para tu tarea, no puedes construir un dataset y no puedes medir si el fine-tuning ayudó. Define tus métricas de éxito primero.
-
Restricciones de presupuesto sin acceso a GPU. Aunque QLoRA ha hecho el fine-tuning accesible en hardware de consumo, aún necesitas al menos una GPU de 16GB (o equivalente en la nube). Si eso no está disponible, enfócate en ingeniería de prompts.
Diagrama de Decisión
Usa esta secuencia de preguntas para determinar tu enfoque:
1. Puede el prompting few-shot resolver la tarea adecuadamente?
SI -> Usa ingenieria de prompts. Detente aqui.
NO -> Continua.
2. Es el problema principal la falta de conocimiento/informacion?
SI -> Implementa RAG. Detente aqui.
NO -> Continua.
3. Es el problema principal comportamiento, estilo, formato o razonamiento?
SI -> Continua a la pregunta 4.
NO -> Revisa tu definicion del problema.
4. Tienes 200+ ejemplos de alta calidad del comportamiento deseado?
SI -> Haz fine-tuning. Procede con el resto de este curso.
NO -> Recopila mas datos. Usa ingenieria de prompts mientras tanto.
Análisis de Costo/Beneficio
Aquí hay una comparación realista para una aplicación en producción manejando 10,000 solicitudes por día:
| Enfoque | Costo Inicial | Costo por Solicitud | Mantenimiento | Consistencia de Calidad | |---------|--------------|--------------------|--------------|-----------------------| | Ingeniería de prompts (GPT-4o) | $0 | Alto (prompts largos) | Bajo | Medio | | RAG + modelo más pequeño | Medio (infra) | Medio | Alto (actualizaciones) | Medio-Alto | | Modelo fine-tuned más pequeño | Medio (entrenamiento) | Bajo (prompts cortos) | Medio (reentrenar) | Alto |
El punto óptimo para el fine-tuning es cuando tienes requisitos estables, una tarea bien definida y suficientes datos para entrenar. Los ahorros continuos de usar prompts más cortos con un modelo fine-tuned a menudo pagan la inversión de entrenamiento en semanas.
Combinando Enfoques
Estos tres enfoques no son mutuamente excluyentes. De hecho, los sistemas de producción más poderosos los combinan:
-
Fine-tuning + RAG: Fine-tuning para estilo y formato, RAG para conocimiento. Un asistente médico con fine-tuning en estilo de escritura clínica que recupera de la literatura médica más reciente.
-
Fine-tuning + ingeniería de prompts: Fine-tuning para comportamiento base, prompts para personalización por solicitud. Un modelo de servicio al cliente con fine-tuning en el tono de tu empresa que recibe contexto del cliente a través del prompt.
-
Los tres: Modelo con fine-tuning, RAG para conocimiento y system prompts cuidadosos para manejo de casos extremos.
Consejo Práctico
Antes de comprometerte con el fine-tuning, ejecuta este experimento: Toma tus 20 mejores ejemplos de comportamiento deseado y úsalos como ejemplos few-shot en un prompt. Prueba contra 50 ejemplos reservados. Si el enfoque few-shot alcanza el 90%+ de tu objetivo de calidad, la ingeniería de prompts puede ser suficiente. Si se queda corto, tienes evidencia sólida de que el fine-tuning agregará valor — y ya has comenzado a construir tu dataset de entrenamiento.
En la próxima lección, recorreremos el panorama de técnicas de fine-tuning para que puedas elegir el método correcto para tus restricciones específicas.