Відповіді API Ollama містять метрики, які можна використовувати для вимірювання продуктивності та використання моделі:
total_duration: Час, необхідний для генерації відповідіload_duration: Час, необхідний для завантаження моделіprompt_eval_count: Кількість оброблених вхідних токенівprompt_eval_duration: Час, необхідний для оцінювання prompteval_count: Кількість оброблених вихідних токенівeval_duration: Час, необхідний для генерації вихідних токенів
Усі значення часу вимірюються в наносекундах.
Приклад відповіді
Для ендпоінтів, які повертають метрики використання, тіло відповіді міститиме поля з цими метриками. Наприклад, нестрімовий виклик до /api/generate може повертати наступну відповідь:
json
{
"model": "gemma4",
"created_at": "2025-10-17T23:14:07.414671Z",
"response": "Hello! How can I help you today?",
"done": true,
"done_reason": "stop",
"total_duration": 174560334,
"load_duration": 101397084,
"prompt_eval_count": 11,
"prompt_eval_duration": 13074791,
"eval_count": 18,
"eval_duration": 52479709
}Для ендпоінтів, які повертають стрімові відповіді, поля з метриками використання додаються до останнього фрагмента, де done має значення true.