Skip to content

Respons API Ollama mencakup metrik yang dapat digunakan untuk mengukur kinerja dan penggunaan model:

  • total_duration: Berapa lama waktu yang dibutuhkan untuk menghasilkan respons
  • load_duration: Berapa lama waktu yang dibutuhkan untuk memuat model
  • prompt_eval_count: Berapa banyak token masukan yang diproses
  • prompt_eval_duration: Berapa lama waktu yang dibutuhkan untuk mengevaluasi prompt
  • eval_count: Berapa banyak token keluaran yang diproses
  • eval_duration: Berapa lama waktu yang dibutuhkan untuk menghasilkan token keluaran

Semua nilai waktu diukur dalam nanodetik.

Contoh respons

Untuk endpoint yang mengembalikan metrik penggunaan, isi respons akan mencakup kolom penggunaan. Sebagai contoh, panggian non-streaming ke /api/generate dapat mengembalikan respons berikut:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Untuk endpoint yang mengembalikan respons streaming, kolom penggunaan disertakan sebagai bagian dari chunk terakhir, di mana done bernilai true.