Odpowiedzi API Ollama zawierają metryki, które można wykorzystać do pomiaru wydajności i zużycia modelu:
total_duration: Jak długo trwało generowanie odpowiedziload_duration: Jak długo trwało ładowanie modeluprompt_eval_count: Ile tokenów wejściowych zostało przetworzonychprompt_eval_duration: Jak długo trwało ocenianie promptueval_count: Ile tokenów wyjściowych zostało przetworzonycheval_duration: Jak długo trwało generowanie tokenów wyjściowych
Wszystkie wartości czasowe są podawane w nanosekundach.
Przykładowa odpowiedź
Dla punktów końcowych, które zwracają metryki zużycia, treść odpowiedzi będzie zawierać pola dotyczące zużycia. Na przykład, wywołanie bez przesyłania strumieniowego do /api/generate może zwrócić następującą odpowiedź:
json
{
"model": "gemma4",
"created_at": "2025-10-17T23:14:07.414671Z",
"response": "Hello! How can I help you today?",
"done": true,
"done_reason": "stop",
"total_duration": 174560334,
"load_duration": 101397084,
"prompt_eval_count": 11,
"prompt_eval_duration": 13074791,
"eval_count": 18,
"eval_duration": 52479709
}Dla punktów końcowych, które zwracają strumieniowe odpowiedzi, pola dotyczące zużycia są dołączane jako część ostatniego fragmentu, gdzie wartość done wynosi true.