Die API-Antworten von Ollama enthalten Metriken, die zur Messung der Leistung und der Modellnutzung verwendet werden können:
total_duration: Wie lange die Generierung der Antwort gedauert hatload_duration: Wie lange das Laden des Modells gedauert hatprompt_eval_count: Wie viele Eingabetoken verarbeitet wurdenprompt_eval_duration: Wie lange die Auswertung des Prompts gedauert hateval_count: Wie viele Ausgabetoken verarbeitet wurdeneval_duration: Wie lange die Generierung der Ausgabetoken gedauert hat
Alle Zeitwerte werden in Nanosekunden gemessen.
Beispielantwort
Für Endpunkte, die Nutzungsmetriken zurückgeben, enthält der Antwortrumpf die Nutzungsfelder. Beispielsweise kann ein nicht-streamender Aufruf an /api/generate die folgende Antwort zurückgeben:
json
{
"model": "gemma4",
"created_at": "2025-10-17T23:14:07.414671Z",
"response": "Hello! How can I help you today?",
"done": true,
"done_reason": "stop",
"total_duration": 174560334,
"load_duration": 101397084,
"prompt_eval_count": 11,
"prompt_eval_duration": 13074791,
"eval_count": 18,
"eval_duration": 52479709
}Für Endpunkte, die Streaming-Antworten zurückgeben, sind die Nutzungsfelder Teil des letzten Chunks, wobei done auf true gesetzt ist.