Skip to content

Ответы API Ollama содержат метрики, которые можно использовать для измерения производительности и использования модели:

  • total_duration: Время, затраченное на генерацию ответа
  • load_duration: Время, затраченное на загрузку модели
  • prompt_eval_count: Количество обработанных входных токенов
  • prompt_eval_duration: Время, затраченное на оценку промпта
  • eval_count: Количество обработанных выходных токенов
  • eval_duration: Время, затраченное на генерацию выходных токенов

Все значения времени измеряются в наносекундах.

Пример ответа

Для эндпоинтов, возвращающих метрики использования, в теле ответа будут присутствовать соответствующие поля. Например, нестриминговый запрос к /api/generate может вернуть следующий ответ:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Для эндпоинтов, возвращающих стриминговые ответы, поля использования включаются в качестве части последнего чанка, где done имеет значение true.