Skip to content

Ollama의 API 응답에는 성능과 모델 사용량 측정에 사용할 수 있는 메트릭이 포함되어 있습니다:

  • total_duration: 응답 생성에 소요된 시간
  • load_duration: 모델 로드에 소요된 시간
  • prompt_eval_count: 처리된 입력 토큰 수
  • prompt_eval_duration: 프롬프트 평가에 소요된 시간
  • eval_count: 처리된 출력 토큰 수
  • eval_duration: 출력 토큰 생성에 소요된 시간

모든 시간 측정값은 나노초 단위로 측정됩니다.

예제 응답

사용량 메트릭을 반환하는 엔드포인트의 경우 응답 본문에 사용량 필드가 포함됩니다. 예를 들어 /api/generate에 대한 비스트리밍 호출은 다음과 같은 응답을 반환할 수 있습니다:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

스트리밍 응답을 반환하는 엔드포인트의 경우 사용량 필드는 donetrue인 마지막 청크의 일부로 포함됩니다.