Skip to content

Le risposte dell'API di Ollama includono metriche che possono essere utilizzate per misurare le prestazioni e l'utilizzo del modello:

  • total_duration: Quanto tempo ha impiegato la generazione della risposta
  • load_duration: Quanto tempo ha impiegato il caricamento del modello
  • prompt_eval_count: Quanti token di input sono stati elaborati
  • prompt_eval_duration: Quanto tempo ha impiegato la valutazione del prompt
  • eval_count: Quanti token di output sono stati elaborati
  • eval_duration: Quanto tempo ha impiegato la generazione dei token di output

Tutti i valori temporali sono misurati in nanosecondi.

Esempio di risposta

Per gli endpoint che restituiscono metriche di utilizzo, il corpo della risposta includerà i campi di utilizzo. Ad esempio, una chiamata non in streaming a /api/generate può restituire la seguente risposta:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Per gli endpoint che restituiscono risposte in streaming, i campi di utilizzo sono inclusi come parte dell'ultimo chunk, dove done è true.