Aprender
Inferência e disponibilização
Inferência e disponibilização
6- ComparaçãoLatência vs. TTFT vs. Tokens por Segundo vs. Throughput↗Latência é o tempo que uma solicitação de inferência leva, TTFT é o tempo que uma solicitação transmitida leva para começar a responder, tokens por segundo é uma taxa que pode descrever um único fluxo ou um sistema inteiro, e throughput é o total de trabalho que um sistema conclui ao longo do tempo. A distinção mais importante é o escopo: latência e TTFT medem o tempo de uma solicitação, enquanto throughput contabiliza o trabalho realizado durante uma janela de medição.
- ConceitoO que são tokens por segundo?↗Tokens por segundo (TPS ou tok/s) mede quantos tokens um sistema de IA produz em um segundo. O número pode descrever a velocidade de saída de uma única resposta ou o throughput combinado de um sistema de serving inteiro, portanto o rótulo, por si só, é incompleto.
- ConceitoO que é inferência em IA?↗Inferência em IA é o processo de executar um modelo treinado com uma entrada para produzir uma saída, sem atualizar o que o modelo aprendeu. É a fase de uso de um modelo: uma foto entra e um rótulo sai, ou um prompt entra e um texto gerado sai.
- ConceitoO que é latência de inferência?↗Latência de inferência é o tempo decorrido entre o recebimento de uma entrada por um sistema de IA e a produção de uma saída especificada. Um valor de latência só é significativo quando se sabe onde o cronômetro começa, onde termina e que tipo de saída é considerada completa.
- ConceitoO que é o tempo até o primeiro token?↗O tempo até o primeiro token, ou TTFT, é o tempo decorrido entre o início de uma solicitação a um modelo de linguagem e o recebimento do primeiro token da resposta. Ele mede a espera inicial, não a velocidade com que o restante da resposta chega.
- ConceitoO que é throughput de inferência?↗Throughput de inferência é a quantidade de trabalho do modelo que um sistema de inferência conclui por unidade de tempo, considerando todas as solicitações que está atendendo. Ele pode ser medido em solicitações concluídas, inferências, amostras ou tokens por segundo.