Un modelo mental útil
El entrenamiento es una corrección controlada de errores.
Imagina un modelo que tiene controles ajustables en su interior. Entra un ejemplo y el modelo produce una salida. Una regla de puntuación indica qué tan buena o mala fue esa salida. El entrenamiento determina en qué dirección girar los controles, los ajusta una pequeña cantidad y vuelve a intentarlo.
Esos «controles» son parámetros del modelo. La regla de puntuación se llama objetivo. Cuando un valor menor es mejor, su puntuación suele llamarse pérdida.
Esta descripción es más precisa que decir que el modelo «absorbe» sus datos. Los datos proporcionan ejemplos. El objetivo proporciona una dirección para mejorar. El algoritmo de entrenamiento cambia el modelo.
training examples
|
v
model makes outputs
|
v
objective measures loss or reward
|
v
calculate each parameter's contribution
|
v
update parameters
|
+---------- repeat ----------+
held-out validation data checks whether the result transfersCómo funciona el entrenamiento de IA
El método exacto depende del modelo y del objetivo, pero el entrenamiento de redes neuronales suele seguir este ciclo:
- Prepara ejemplos y un objetivo.Los datos de entrenamiento pueden emparejar entradas con etiquetas, ocultar parte de una entrada para que el modelo la prediga o incluir retroalimentación sobre las salidas preferidas.
- Elige un modelo inicial.El entrenamiento puede comenzar con parámetros recién inicializados o con un modelo que ya ha sido entrenado.
- Procesa un lote en el modelo.Un lote es un grupo pequeño de ejemplos procesados conjuntamente. Este paso hacia adelante se parece a la inferencia: el modelo actual convierte las entradas en salidas.
- Puntúa las salidas.Una función de pérdida puede medir la distancia respecto de las respuestas objetivo. Otro objetivo puede asignar una recompensa mayor al comportamiento preferido.
- Asigna mérito o responsabilidad.En una red neuronal, la retropropagación calcula un gradiente para cada parámetro. Un gradiente indica cómo se esperaría que un pequeño cambio en ese parámetro modificara la pérdida.
- Actualiza los parámetros.Un optimizador usa esos gradientes para elegir los cambios concretos. La tasa de aprendizaje controla el tamaño de una actualización típica.
- Repite y comprueba.El entrenamiento continúa con más lotes. Los datos de validación separados comprueban si la mejora se extiende más allá de los ejemplos que producen las actualizaciones.
Una época es un recorrido por todo el conjunto de datos de entrenamiento. El entrenamiento puede usar una parte de una época o muchas épocas. Una época es una unidad de progreso, no una garantía de que haya ocurrido un aprendizaje útil.
El ciclo describe el significado técnico estricto de entrenamiento. En la práctica, las personas también usan entrenamiento para referirse al flujo de trabajo más amplio que lo rodea: recopilar y filtrar datos, seleccionar un objetivo, ejecutar experimentos, evaluar puntos de control y decidir cuándo detenerse.
La retroalimentación no siempre tiene el mismo aspecto
La frase «comparar la predicción con la respuesta correcta» es un punto de partida útil, pero resulta demasiado limitada como definición.
- En el aprendizaje supervisado, los ejemplos incluyen etiquetas objetivo, como la categoría asignada a una imagen.
- En el aprendizaje autosupervisado, los datos proporcionan sus propios objetivos. Un modelo de lenguaje puede aprender prediciendo una parte oculta o siguiente del texto.
- En el aprendizaje por refuerzo, los resultados reciben recompensas y el entrenamiento aumenta la probabilidad de las acciones que conducen a una recompensa mayor.
Estos métodos difieren en el origen de la señal de entrenamiento. Comparten la misma idea central: usar la retroalimentación para modificar los parámetros del modelo en dirección a un objetivo.
Un ejemplo de entrenamiento de un solo paso
Considera un modelo con un parámetro, w. Predice:
output = w × inputEl modelo comienza con w = 0.5. Su ejemplo de entrenamiento tiene una entrada de 2 y una salida objetivo de 4.
La primera predicción es:
0.5 × 2 = 1Usa el error cuadrático como pérdida:
(prediction - target)²
(1 - 4)² = 9Para este ejemplo, el gradiente de la pérdida respecto de w es -12. El signo negativo significa que aumentar w debería reducir la pérdida. Con una tasa de aprendizaje de 0.1, el descenso de gradiente realiza esta actualización:
new w = old w - learning rate × gradient
new w = 0.5 - 0.1 × (-12)
new w = 1.7Ahora la predicción es 1.7 × 2 = 3.4, y el error cuadrático es 0.36. Una actualización hizo que este ejemplo se ajustara mejor.
Los modelos reales pueden tener muchos parámetros, y el entrenamiento suele combinar señales de un lote. El optimizador debe encontrar cambios que funcionen en ejemplos variados. Mejorar en un lote no es suficiente. El modelo también debe funcionar bien con datos reservados.
Por qué importa el entrenamiento
El entrenamiento determina qué comportamiento está disponible cuando el modelo se utiliza posteriormente.
La arquitectura establece los tipos de cálculos que el modelo puede realizar. El entrenamiento selecciona valores concretos de los parámetros dentro de esa arquitectura. Esos valores determinan a qué patrones responde el modelo y qué salidas tiende a producir.
El objetivo importa porque el modelo se optimiza para la señal que recibe, no para todas las cualidades que podrían importar a una persona. Un modelo de lenguaje entrenado para predecir texto puede resultar útil en muchas tareas lingüísticas, pero la pérdida de predicción no garantiza directamente veracidad, seguridad ni obediencia a las instrucciones. El entrenamiento posterior puede centrarse en algunos de esos comportamientos mediante demostraciones o retroalimentación de preferencias.
Los datos importan por la misma razón. Un modelo solo puede recibir señales de entrenamiento de los ejemplos y la retroalimentación disponibles. Las carencias, los errores, la duplicación y los sesgos de ese material pueden afectar el resultado entrenado.
Conceptos erróneos comunes
El entrenamiento almacena una copia de cada ejemplo
El entrenamiento cambia los parámetros. Normalmente no crea dentro del modelo una base de datos consultable, fila por fila, del conjunto de datos de entrenamiento.
Aun así, un modelo puede memorizar algunos ejemplos, especialmente cuando los datos se repiten o el modelo se entrena de forma demasiado ajustada a ellos. Pero la memorización y la generalización útil son resultados distintos. La evaluación con datos realmente separados ayuda a distinguirlos.
Una menor pérdida de entrenamiento significa que el modelo es bueno
Una pérdida menor significa que el modelo se ajusta mejor a su objetivo de entrenamiento en los datos medidos. No demuestra que el modelo funcione en casos nuevos ni que el objetivo capture la meta real.
Si la pérdida de entrenamiento disminuye mientras empeora el rendimiento de validación, el modelo puede estar sobreajustándose: volviéndose más especializado en sus ejemplos de entrenamiento a costa de los nuevos.
Más entrenamiento siempre mejora un modelo
Las actualizaciones adicionales pueden ayudar, hacer poco, desestabilizar el entrenamiento o aumentar el sobreajuste. El resultado depende de los datos, el objetivo, la configuración del optimizador, la capacidad del modelo y la decisión sobre cuándo detenerse.
El modelo aprende de ti mientras conversas con él
Durante la inferencia de IA ordinaria, el modelo implementado usa parámetros fijos para responder a una entrada. La información de la conversación actual puede influir en su siguiente salida sin cambiar esos parámetros.
Un proveedor puede usar posteriormente las interacciones recopiladas en un proceso de entrenamiento separado, según el producto y su política de datos. Eso no es lo mismo que que el modelo se actualice durante la conversación.
Todos los modelos se entrenan desde cero
El entrenamiento puede comenzar con un modelo existente. El preentrenamiento desarrolla capacidades generales a partir de un conjunto de datos grande y general. El ajuste fino continúa el entrenamiento para una tarea o dominio más específico. El posentrenamiento es una etiqueta más amplia para las etapas posteriores destinadas a dar forma al comportamiento, que pueden incluir el ajuste fino y métodos basados en preferencias.
Los límites entre estas etiquetas no están completamente estandarizados. La prueba fiable es comprobar si el proceso actualiza los parámetros del modelo. Proporcionar ejemplos en una instrucción puede cambiar una salida sin entrenar el modelo.
Cómo encaja el entrenamiento en un sistema de IA
El resultado de una ejecución de entrenamiento suele ser un punto de control guardado que contiene los pesos aprendidos y otro estado. Los desarrolladores evalúan los puntos de control candidatos y seleccionan uno para continuar el entrenamiento o implementarlo.
La implementación inicia una fase operativa distinta. En la inferencia, las entradas pasan por el modelo entrenado para producir predicciones, clasificaciones o contenido generado. Un paso hacia adelante aparece en ambas fases. El entrenamiento añade retroalimentación, cálculo de gradientes y actualizaciones de parámetros.
Qué leer a continuación
Lee ¿Qué es la inferencia en IA? para ver qué cambia cuando se detiene el ciclo de actualización de parámetros y se utiliza un modelo entrenado. Después, consulta Entrenamiento frente a inferencia para comparar directamente las dos etapas del ciclo de vida.