Skip to content

Respons API Ollama mencakup metrik yang dapat digunakan untuk mengukur kinerja dan penggunaan model:

  • total_duration: Berapa lama waktu yang dibutuhkan untuk menghasilkan respons
  • load_duration: Berapa lama waktu yang dibutuhkan untuk memuat model
  • prompt_eval_count: Berapa banyak token masukan yang diproses
  • prompt_eval_duration: Berapa lama waktu yang dibutuhkan untuk mengevaluasi prompt
  • eval_count: Berapa banyak token keluaran yang diproses
  • eval_duration: Berapa lama waktu yang dibutuhkan untuk menghasilkan token keluaran

Semua nilai waktu diukur dalam nanodetik.

Contoh respons ​

Untuk endpoint yang mengembalikan metrik penggunaan, isi respons akan mencakup kolom penggunaan. Sebagai contoh, panggian non-streaming ke /api/generate dapat mengembalikan respons berikut:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Untuk endpoint yang mengembalikan respons streaming, kolom penggunaan disertakan sebagai bagian dari chunk terakhir, di mana done bernilai true.