Skip to content

Odpowiedzi API Ollama zawierają metryki, które można wykorzystać do pomiaru wydajności i zużycia modelu:

  • total_duration: Jak długo trwało generowanie odpowiedzi
  • load_duration: Jak długo trwało ładowanie modelu
  • prompt_eval_count: Ile tokenów wejściowych zostało przetworzonych
  • prompt_eval_duration: Jak długo trwało ocenianie promptu
  • eval_count: Ile tokenów wyjściowych zostało przetworzonych
  • eval_duration: Jak długo trwało generowanie tokenów wyjściowych

Wszystkie wartości czasowe są podawane w nanosekundach.

Przykładowa odpowiedź

Dla punktów końcowych, które zwracają metryki zużycia, treść odpowiedzi będzie zawierać pola dotyczące zużycia. Na przykład, wywołanie bez przesyłania strumieniowego do /api/generate może zwrócić następującą odpowiedź:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Dla punktów końcowych, które zwracają strumieniowe odpowiedzi, pola dotyczące zużycia są dołączane jako część ostatniego fragmentu, gdzie wartość done wynosi true.