Skip to content

Die API-Antworten von Ollama enthalten Metriken, die zur Messung der Leistung und der Modellnutzung verwendet werden können:

  • total_duration: Wie lange die Generierung der Antwort gedauert hat
  • load_duration: Wie lange das Laden des Modells gedauert hat
  • prompt_eval_count: Wie viele Eingabetoken verarbeitet wurden
  • prompt_eval_duration: Wie lange die Auswertung des Prompts gedauert hat
  • eval_count: Wie viele Ausgabetoken verarbeitet wurden
  • eval_duration: Wie lange die Generierung der Ausgabetoken gedauert hat

Alle Zeitwerte werden in Nanosekunden gemessen.

Beispielantwort

Für Endpunkte, die Nutzungsmetriken zurückgeben, enthält der Antwortrumpf die Nutzungsfelder. Beispielsweise kann ein nicht-streamender Aufruf an /api/generate die folgende Antwort zurückgeben:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Für Endpunkte, die Streaming-Antworten zurückgeben, sind die Nutzungsfelder Teil des letzten Chunks, wobei done auf true gesetzt ist.