학습
추론과 서빙
추론과 서빙
6- 개념AI 추론이란 무엇인가요?↗AI 추론은 학습된 모델을 입력에 실행하여 모델이 학습한 내용을 업데이트하지 않고 출력을 생성하는 과정입니다. 모델을 사용하는 단계로, 사진을 입력하면 레이블이 출력되거나 프롬프트를 입력하면 생성된 텍스트가 출력됩니다.
- 비교지연 시간 vs. TTFT vs. 초당 토큰 수 vs. 처리량↗지연 시간은 하나의 추론 요청에 걸리는 시간이고, TTFT는 스트리밍 요청이 응답을 시작하기까지 걸리는 시간이며, 초당 토큰 수는 하나의 스트림 또는 전체 시스템을 설명할 수 있는 비율입니다. 처리량은 시스템이 시간에 따라 완료하는 총 작업량입니다. 가장 중요한 차이는 범위입니다. 지연 시간과 TTFT는 하나의 요청을 측정하는 반면, 처리량은 측정 구간 동안의 작업량을 집계합니다.
- 개념첫 토큰까지의 시간이란?↗첫 토큰까지의 시간(Time to First Token), 즉 TTFT는 언어 모델 요청을 시작한 시점부터 응답의 첫 토큰을 받는 시점까지의 경과 시간입니다. 응답의 나머지 부분이 얼마나 빠르게 도착하는지가 아니라 초기 대기 시간을 측정합니다.
- 개념초당 토큰 수란 무엇인가요?↗초당 토큰 수(TPS 또는 tok/s)는 AI 시스템이 1초에 생성하는 토큰 수를 측정합니다. 이 수치는 하나의 응답 출력 속도 또는 전체 서빙 시스템의 결합 처리량을 나타낼 수 있으므로, 레이블만으로는 의미가 완전하지 않습니다.
- 개념추론 지연 시간이란 무엇인가요?↗추론 지연 시간은 AI 시스템이 입력을 받은 시점부터 지정된 출력을 생성하는 시점까지의 경과 시간입니다. 지연 시간 수치는 타이머가 어디서 시작하고 어디서 멈추는지, 그리고 어떤 출력 상태를 완료로 간주하는지를 알아야 의미가 있습니다.
- 개념추론 처리량이란 무엇인가요?↗추론 처리량은 추론 시스템이 처리 중인 모든 요청에 대해 단위 시간당 완료하는 모델 작업의 양입니다. 초당 완료 요청 수, 추론 수, 샘플 수 또는 토큰 수로 측정할 수 있습니다.