O que são parâmetros do modelo
Parâmetros do modelo são valores que pertencem ao modelo e são aprendidos a partir dos dados. São os valores ajustados durante o treinamento e usados na inferência.
Para um modelo linear simples,
[
y = wx + b
]
tanto (w) quanto (b) são parâmetros. O modelo os aprende, em vez de recebê-los como novas entradas a cada previsão.
As redes neurais armazenam parâmetros em tensores, que são matrizes multidimensionais de números. Um único tensor pode conter muitos parâmetros escalares. Quando se diz que um modelo tem determinada quantidade de parâmetros, essa quantidade geralmente se refere aos valores escalares presentes em seus tensores de parâmetros, não ao número de tensores.
O que são pesos do modelo
Pesos do modelo têm dois significados comuns.
No sentido matemático restrito, um peso multiplica uma entrada ou um valor intermediário. Em (y = wx + b), (w) é o peso e (b) é o viés. Ambos são parâmetros, mas apenas um é um peso.
No sentido mais amplo, usado em software, “pesos” significa o estado numérico armazenado que faz um modelo treinado se comportar como se comporta. Um “arquivo de pesos” pode conter matrizes de pesos, vieses e, às vezes, outros tensores persistentes. O rótulo descreve o conjunto, não o papel matemático de cada número nele.
A distinção
A regra mais confiável é:
Um peso geralmente é um tipo de parâmetro, mas “pesos do modelo” costuma ser uma abreviação para o estado completo aprendido de um modelo.
| Context | “Parameters” usually means | “Weights” usually means |
|---|---|---|
| A layer equation | All learned values, including weights and biases | Values multiplied by inputs or activations |
| A parameter count | The number of learned scalar values across parameter tensors | Often used loosely as a synonym for the same count |
| A framework API | Registered model values that may be trainable or frozen | A framework-specific collection that may include biases and non-trainable state |
| A model download or checkpoint | Learned values, if the term is used at all | The saved tensors needed to reproduce the trained model’s behavior |
A tabela descreve convenções, não um padrão universal. Quando a precisão for importante, consulte a fórmula próxima, a definição da API ou a especificação do arquivo.
Um exemplo prático
Suponha que uma camada densa aceite três valores de entrada e produza dois valores de saída. Ela calcula:
[
\mathbf{y} = \mathbf{x}\mathbf{W} + \mathbf{b}
]
A matriz de pesos (\mathbf{W}) tem forma (3 \times 2), portanto contém seis pesos escalares. O vetor de vieses (\mathbf{b}) tem dois vieses escalares.
A camada, portanto, tem:
- 6 pesos escalares
- 2 vieses escalares
- 8 parâmetros escalares no total
Se uma biblioteca salvar os “pesos” dessa camada, a coleção salva normalmente incluirá tanto (\mathbf{W}) quanto (\mathbf{b}). Nada mudou na matemática. Apenas o escopo da palavra “pesos” mudou.
Quando a formulação é importante
A distinção restrita é importante ao ler uma equação, implementar uma camada ou verificar uma contagem de parâmetros. Se alguém contar apenas as entradas das matrizes de pesos, poderá subestimar o modelo ao omitir vieses e outros tensores de parâmetros aprendidos.
O significado amplo é importante ao baixar, carregar, congelar ou compartilhar um modelo. Um framework pode chamar toda variável persistente de uma camada de peso. Um checkpoint também pode incluir buffers usados durante a inferência, embora o treinamento não os tenha otimizado como parâmetros.
O congelamento acrescenta outra fonte de confusão. Um parâmetro congelado não é mais atualizado durante aquela execução do treinamento, mas continua fazendo parte do modelo e ainda afeta sua saída. Portanto, “parâmetros treináveis” e “todos os parâmetros” podem produzir contagens diferentes para o mesmo modelo.
A contagem de parâmetros e o tamanho do checkpoint também são medidas diferentes. O tamanho do arquivo depende de como cada valor é codificado, de os tensores serem quantizados ou compartilhados e de o checkpoint conter estado adicional. Não é possível determinar uma medida de forma confiável a partir da outra sem detalhes do formato.
O que as pessoas confundem
“Pesos” sempre exclui vieses
Isso é verdade em uma fórmula que nomeia termos separados (W) e (b). Muitas vezes é falso na linguagem de frameworks e checkpoints, em que “pesos” pode designar a coleção que contém ambos.
“Parâmetros” significa configurações de treinamento
Os parâmetros do modelo são valores aprendidos dentro do modelo. As configurações escolhidas para o processo de treinamento, como a taxa de aprendizado, são hiperparâmetros. Nomes semelhantes não fazem deles o mesmo tipo de valor.
Mais parâmetros significa um modelo melhor
A contagem de parâmetros informa quantos valores escalares aprendidos um modelo contém. Ela não informa quão útil é a arquitetura, quão bons eram os dados de treinamento ou quão bem o modelo tem desempenho na sua tarefa.
Por onde continuar
Leia O que são parâmetros do modelo? para saber como os valores aprendidos são contados e usados em um modelo. Leia O que são pesos do modelo? para saber como os pesos moldam a saída de uma camada e como o termo é usado em arquivos de modelo.