Un modelo mental útil

Piensa en una red neuronal como una pila de filtros ajustables.

Cada filtro recibe números de la capa anterior. Da a cada número una cantidad diferente de influencia, suma un desplazamiento y transforma el resultado. Una capa envía sus números transformados a la siguiente. Después de varias transformaciones de este tipo, la capa de salida produce una predicción, una puntuación o un valor generado.

El diagrama habitual parece una red porque los valores fluyen entre unidades:

input values          hidden layer             output

x₁ ───────────────┐   h₁ ───────────────┐
                  ├──>                  ├──> score
x₂ ───────────────┘   h₂ ───────────────┘

        weighted sums      weighted sum
        + activation

Una unidad suele llamarse neurona artificial. El nombre es histórico. En términos prácticos, una neurona es una pequeña función numérica. Su parecido con una neurona biológica es aproximado.

Esta imagen sencilla muestra una red de propagación hacia delante totalmente conectada, en la que la información se mueve de la entrada a la salida y cada unidad se conecta con todas las unidades de la capa siguiente. No todas las redes neuronales usan exactamente esta conexión. Algunas reutilizan el mismo filtro pequeño en una imagen, mantienen un estado a través de una secuencia o permiten que partes de la entrada interactúen mediante atención. Siguen siendo redes neuronales porque construyen un cálculo entrenable a partir de operaciones conectadas.

Cómo funciona una red neuronal

Para una neurona típica, el cálculo es:

output = activation(w₁x₁ + w₂x₂ + ... + wₙxₙ + b)

Los valores x son las entradas. Cada w es un peso que controla cuánto afecta una entrada a esta neurona. El sesgo b desplaza el resultado. A continuación, la función de activación transforma ese resultado antes de que continúe por la red.

Una función de activación habitual es la unidad lineal rectificada, o ReLU:

ReLU(x) = max(0, x)

ReLU devuelve cero para una entrada negativa y deja sin cambios una entrada positiva. Otras funciones de activación transforman los valores de otras maneras.

La activación no es un añadido meramente decorativo. Supón que cada capa realizara únicamente multiplicaciones y sumas. Dos capas de este tipo siempre podrían reescribirse como un solo paso de multiplicación y suma. Añadir más capas no permitiría a la red representar una relación no lineal. Las activaciones no lineales entre capas evitan esa reducción y permiten que la red construya formas más variadas a partir de piezas simples.

Cuando la red recibe una entrada, realiza una propagación hacia delante:

  1. La entrada se representa como números.
  2. Cada capa calcula nuevos números a partir de la capa anterior.
  3. La capa de salida produce el resultado de la red.

Durante el entrenamiento, el resultado se compara con el resultado deseado mediante una función de pérdida, que mide el error. La retropropagación calcula de manera eficiente cómo cambiaría esa pérdida ante un pequeño cambio en cada peso o sesgo. Después, un optimizador ajusta esos valores y el proceso se repite con muchos ejemplos.

«Aprender» significa cambiar estos números ajustables. El desarrollador elige la arquitectura general y el proceso de entrenamiento; el algoritmo de entrenamiento encuentra los valores de los parámetros.

Una propagación hacia delante hecha a mano

Considera una red de ejemplo que recibe dos señales normalizadas de una transacción con tarjeta:

  • x₁ = 0.8 para indicar cuán inusual es el importe
  • x₂ = 0.3 para indicar cuán desconocido es el dispositivo

Estos valores son ilustrativos, no corresponden a un modelo real de fraude. La red tiene dos unidades ocultas con activaciones ReLU.

La primera unidad oculta calcula:

h₁ = ReLU(1.0 × 0.8 − 1.0 × 0.3 − 0.2)
   = ReLU(0.3)
   = 0.3

La segunda calcula:

h₂ = ReLU(−0.5 × 0.8 + 0.5 × 0.3 + 0.1)
   = ReLU(−0.15)
   = 0

La unidad de salida combina los valores ocultos:

score = 1.5 × h₁ + 0.5 × h₂ − 0.4
      = 1.5 × 0.3 + 0.5 × 0 − 0.4
      = 0.05

Esa es una propagación hacia delante completa. Un clasificador real podría aplicar otra función para convertir su puntuación sin procesar en una probabilidad o comparar la puntuación con un umbral de decisión.

Ningún programador tuvo que escribir la regla específica representada por estos pesos. El entrenamiento los ajustaría a partir de los datos. Cambiar incluso un solo peso podría modificar qué unidades ocultas están activas y con qué intensidad afectan al resultado.

Es tentador llamar a h₁ «riesgo del importe» y a h₂ «riesgo del dispositivo». El cálculo no justifica esos nombres. Las unidades ocultas suelen participar en patrones que solo tienen sentido en combinación, y sus significados pueden no ser claramente interpretables por una persona.

Por qué son importantes las redes neuronales

Las redes neuronales pueden aprender representaciones intermedias útiles en lugar de depender únicamente de características que una persona especifica de antemano. En un sistema de imágenes, los primeros cálculos podrían responder a patrones visuales locales, mientras que los posteriores los combinan. En un sistema de lenguaje, muchas capas transforman las representaciones del texto según el contexto. El comportamiento exacto se aprende en toda la red, en lugar de asignarse a una neurona con nombre específico cada vez.

La forma flexible de su función hace que las redes neuronales sean útiles para imágenes, lenguaje, audio, predicción, control y generación. Esto no significa que sean automáticamente la mejor opción para todos los problemas. Un modelo más sencillo puede ser más barato, más fácil de inspeccionar y mejor cuando los datos son limitados o la relación es directa.

Los resultados matemáticos muestran que ciertas redes neuronales pueden aproximar amplias clases de funciones cuando cuentan con suficientes unidades ocultas. Esto es una afirmación sobre lo que una red puede representar. No garantiza que un conjunto de datos y una ejecución de entrenamiento concretos encuentren una buena función, eviten memorizar los ejemplos o se comporten de manera fiable con entradas desconocidas.

Conceptos erróneos comunes

Las redes neuronales funcionan como cerebros

La terminología se inspiró en la biología, pero las neuronas artificiales omiten casi toda la estructura y el comportamiento de las neuronas biológicas. «Operación numérica ponderada» es un modelo mental más fiable que «célula cerebral digital».

Cada neurona decide si se activa

Algunos modelos iniciales usaban umbrales, y ReLU establece en cero los valores negativos. Sin embargo, las unidades modernas generalmente producen activaciones numéricas, no decisiones simples de sí o no.

Más capas siempre hacen que una red sea mejor

Una profundidad adicional cambia lo que una red puede representar y la eficiencia con la que puede representar algunos patrones. También puede hacer que el modelo sea más difícil o costoso de entrenar. El rendimiento depende de la arquitectura, los datos, el objetivo, la optimización y la evaluación, no solo del número de capas.

Las capas ocultas hacen que un modelo sea automáticamente no lineal

Una pila de capas lineales sigue siendo lineal. La activación no lineal entre las capas es lo que evita que la pila se reduzca a una sola transformación lineal.

La red descubre reglas comprensibles

Descubre valores de parámetros que reducen su objetivo de entrenamiento. Esos valores pueden respaldar un comportamiento útil sin corresponder a una regla breve que una persona pueda leer. La interpretación requiere pruebas independientes.

Las redes neuronales y el aprendizaje profundo significan lo mismo

El aprendizaje profundo suele referirse al aprendizaje automático con redes neuronales que contienen varias capas de procesamiento. No existe un límite universal de número de capas para definir «profundo», y las redes neuronales también incluyen modelos poco profundos.

Cómo encajan las redes neuronales en la IA

Las redes neuronales son una familia dentro del aprendizaje automático. Una arquitectura de red neuronal especifica cómo se organizan los cálculos. El entrenamiento produce los pesos aprendidos del modelo, que forman parte de los parámetros del modelo. Ejecutar la red entrenada con una entrada nueva es inferencia.

Muchos sistemas descritos como un modelo de IA usan redes neuronales, pero los términos no son intercambiables. «Modelo de IA» es más amplio. Un transformador, por ejemplo, es una arquitectura de red neuronal construida a partir de atención, operaciones de propagación hacia delante, normalización y conexiones que dirigen la información alrededor de las capas.

La idea fundamental sigue siendo la misma en estos diseños: organizar cálculos diferenciables en una estructura útil y después aprender los valores ajustables a partir de los datos.

Qué leer a continuación

Lee ¿Qué son los pesos del modelo? para distinguir las intensidades de conexión aprendidas por la red de su arquitectura. Lee ¿Qué son los parámetros del modelo? para conocer el conjunto más amplio de valores ajustables y luego usa Parámetros del modelo frente a pesos del modelo para comparar directamente los términos. Para ver cómo las redes neuronales generan lenguaje, continúa con ¿Qué es un LLM?.