Qué es y cómo funciona
El fine-tuning (ajuste fino) consiste en continuar el entrenamiento de un modelo ya existente con un conjunto de ejemplos propios, de modo que cambie su comportamiento. Cada ejemplo suele ser un par de entrada y salida deseada: la pregunta típica y la respuesta con el formato, el tono o el criterio que esperas. Al terminar obtienes una versión del modelo adaptada a tu tarea.
Sirve sobre todo para enseñar un comportamiento: mantener un estilo de redacción, producir siempre una estructura concreta, clasificar según criterios propios o resolver bien una tarea muy específica con un modelo más pequeño. Es mucho menos eficaz para que el modelo memorice datos que cambian, porque lo aprendido queda fijado en el modelo y actualizarlo exige repetir el proceso.
Depende además de lo que ofrezca cada proveedor: algunos modelos permiten ajuste fino por API, otros no, y con los de pesos abiertos puedes hacerlo tú en tu propia infraestructura. Existen técnicas más ligeras que entrenan solo una pequeña parte del modelo y abaratan el proceso.
Por qué importa
Es una inversión que conviene justificar. Necesitas ejemplos de calidad, y prepararlos suele costar más tiempo que el propio entrenamiento. Después hay que evaluar si el modelo ajustado mejora de verdad frente a una buena instrucción o a un RAG, y repetir el proceso cada vez que cambie el modelo base o el criterio que quieres enseñar.
Cuando encaja, puede dar resultados más consistentes y permitir usar un modelo más pequeño, con menos coste y latencia por petición. Cuando no encaja, es una vía cara y rígida. Por eso lo razonable es agotar antes las opciones más baratas: mejorar el prompt, añadir ejemplos en la instrucción y, si falta información, incorporar RAG.
Un ejemplo
Un equipo de soporte tiene miles de tickets ya resueltos y quiere que cada nuevo ticket se clasifique en categorías internas, con un formato de salida fijo. Un modelo genérico acierta con frecuencia, pero se desvía en los casos ambiguos. Tras revisar y depurar un conjunto de tickets etiquetados por personas, se ajusta un modelo pequeño con ellos y se compara con el modelo genérico sobre casos que no se usaron en el entrenamiento, antes de decidir si merece la pena.
Errores y confusiones frecuentes
- Usarlo para que el modelo «sepa» documentación que cambia. Para eso es mejor RAG: con fine-tuning los datos quedan desactualizados y no puedes citar la fuente de cada respuesta.
- Entrenar con ejemplos inconsistentes, con errores o con datos personales. El modelo aprende lo que le das, defectos incluidos, y los datos personales incorporados al entrenamiento son difíciles de retirar después.
- No medir. Sin un conjunto de pruebas separado de los datos de entrenamiento no puedes saber si el modelo ajustado es mejor o solo parece mejor en los ejemplos que ya vio.
