Skip to content

Відповіді API Ollama містять метрики, які можна використовувати для вимірювання продуктивності та використання моделі:

  • total_duration: Час, необхідний для генерації відповіді
  • load_duration: Час, необхідний для завантаження моделі
  • prompt_eval_count: Кількість оброблених вхідних токенів
  • prompt_eval_duration: Час, необхідний для оцінювання prompt
  • eval_count: Кількість оброблених вихідних токенів
  • eval_duration: Час, необхідний для генерації вихідних токенів

Усі значення часу вимірюються в наносекундах.

Приклад відповіді

Для ендпоінтів, які повертають метрики використання, тіло відповіді міститиме поля з цими метриками. Наприклад, нестрімовий виклик до /api/generate може повертати наступну відповідь:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Для ендпоінтів, які повертають стрімові відповіді, поля з метриками використання додаються до останнього фрагмента, де done має значення true.