Ответы API Ollama содержат метрики, которые можно использовать для измерения производительности и использования модели:
total_duration: Время, затраченное на генерацию ответаload_duration: Время, затраченное на загрузку моделиprompt_eval_count: Количество обработанных входных токеновprompt_eval_duration: Время, затраченное на оценку промптаeval_count: Количество обработанных выходных токеновeval_duration: Время, затраченное на генерацию выходных токенов
Все значения времени измеряются в наносекундах.
Пример ответа
Для эндпоинтов, возвращающих метрики использования, в теле ответа будут присутствовать соответствующие поля. Например, нестриминговый запрос к /api/generate может вернуть следующий ответ:
json
{
"model": "gemma4",
"created_at": "2025-10-17T23:14:07.414671Z",
"response": "Hello! How can I help you today?",
"done": true,
"done_reason": "stop",
"total_duration": 174560334,
"load_duration": 101397084,
"prompt_eval_count": 11,
"prompt_eval_duration": 13074791,
"eval_count": 18,
"eval_duration": 52479709
}Для эндпоинтов, возвращающих стриминговые ответы, поля использования включаются в качестве части последнего чанка, где done имеет значение true.