Qué son los parámetros del modelo
Parámetros del modelo son valores que pertenecen al modelo y se aprenden a partir de los datos. Son los valores que el entrenamiento ajusta y que la inferencia utiliza.
Para un modelo lineal simple,
[
y = wx + b
]
tanto (w) como (b) son parámetros. El modelo los aprende, en lugar de recibirlos como entradas nuevas con cada predicción.
Las redes neuronales almacenan los parámetros en tensores, que son matrices multidimensionales de números. Un solo tensor puede contener muchos parámetros escalares. Cuando se describe un modelo como un modelo con cierto número de parámetros, ese número suele referirse a los valores escalares de todos sus tensores de parámetros, no al número de tensores.
Qué son los pesos del modelo
Los pesos del modelo tienen dos significados habituales.
En el sentido matemático limitado, un peso multiplica una entrada o un valor intermedio. En (y = wx + b), (w) es el peso y (b) es el sesgo. Ambos son parámetros, pero solo uno es un peso.
En el sentido más amplio del software, «pesos» significa el estado numérico almacenado que hace que un modelo entrenado se comporte como lo hace. Un «archivo de pesos» puede contener matrices de pesos, sesgos y, en ocasiones, otros tensores persistentes. La etiqueta describe el conjunto, no la función matemática de cada número que contiene.
La distinción
La regla más fiable es:
Un peso suele ser un tipo de parámetro, pero «pesos del modelo» suele ser una abreviatura del estado aprendido completo de un modelo.
| Context | “Parameters” usually means | “Weights” usually means |
|---|---|---|
| A layer equation | All learned values, including weights and biases | Values multiplied by inputs or activations |
| A parameter count | The number of learned scalar values across parameter tensors | Often used loosely as a synonym for the same count |
| A framework API | Registered model values that may be trainable or frozen | A framework-specific collection that may include biases and non-trainable state |
| A model download or checkpoint | Learned values, if the term is used at all | The saved tensors needed to reproduce the trained model’s behavior |
La tabla describe convenciones, no un estándar universal. Cuando la precisión sea importante, consulta la fórmula cercana, la definición de la API o la especificación del archivo.
Un ejemplo práctico
Supón que una capa densa acepta tres valores de entrada y produce dos valores de salida. Calcula:
[
\mathbf{y} = \mathbf{x}\mathbf{W} + \mathbf{b}
]
La matriz de pesos (\mathbf{W}) tiene forma (3 \times 2), por lo que contiene seis pesos escalares. El vector de sesgos (\mathbf{b}) tiene dos sesgos escalares.
Por tanto, la capa tiene:
- 6 pesos escalares
- 2 sesgos escalares
- 8 parámetros escalares en total
Si una biblioteca guarda los «pesos» de esta capa, la colección guardada normalmente incluirá tanto (\mathbf{W}) como (\mathbf{b}). La matemática no ha cambiado. Solo ha cambiado el alcance de la palabra «pesos».
Cuándo importa la formulación
La distinción limitada importa al leer una ecuación, implementar una capa o comprobar un recuento de parámetros. Si alguien cuenta únicamente las entradas de las matrices de pesos, puede subestimar el tamaño del modelo al omitir los sesgos y otros tensores de parámetros aprendidos.
El significado amplio importa al descargar, cargar, congelar o compartir un modelo. Un framework puede llamar peso a cada variable persistente de una capa. Un checkpoint también puede incluir búferes utilizados durante la inferencia, aunque el entrenamiento no los haya optimizado como parámetros.
El congelamiento añade otra fuente de confusión. Un parámetro congelado ya no se actualiza durante esa ejecución del entrenamiento, pero sigue formando parte del modelo y afectando a su salida. Por tanto, «parámetros entrenables» y «todos los parámetros» pueden producir recuentos distintos para el mismo modelo.
El recuento de parámetros y el tamaño del checkpoint también son mediciones diferentes. El tamaño del archivo depende de cómo se codifica cada valor, de si los tensores están cuantizados o compartidos y de si el checkpoint contiene estado adicional. No se puede deducir uno de forma fiable a partir del otro sin conocer los detalles del formato.
Qué suele confundirse
«Los pesos» siempre excluyen los sesgos
Eso es cierto en una fórmula que nombra por separado los términos (W) y (b). A menudo es falso en el lenguaje de frameworks y checkpoints, donde «pesos» puede designar la colección que contiene ambos.
«Parámetros» significa configuraciones de entrenamiento
Los parámetros del modelo son valores aprendidos dentro del modelo. Las configuraciones elegidas para el proceso de entrenamiento, como la tasa de aprendizaje, son hiperparámetros. Que tengan nombres similares no los convierte en el mismo tipo de valor.
Más parámetros significa un modelo mejor
El recuento de parámetros indica cuántos valores escalares aprendidos contiene un modelo. No indica lo útil que es la arquitectura, la calidad de los datos de entrenamiento ni el rendimiento del modelo en tu tarea.
Qué leer a continuación
Lee ¿Qué son los parámetros del modelo? para saber cómo se cuentan y utilizan los valores aprendidos en un modelo. Lee ¿Qué son los pesos del modelo? para saber cómo los pesos determinan la salida de una capa y cómo se utiliza el término en los archivos de modelos.