Respons API Ollama mencakup metrik yang dapat digunakan untuk mengukur kinerja dan penggunaan model:
total_duration: Berapa lama waktu yang dibutuhkan untuk menghasilkan responsload_duration: Berapa lama waktu yang dibutuhkan untuk memuat modelprompt_eval_count: Berapa banyak token masukan yang diprosesprompt_eval_duration: Berapa lama waktu yang dibutuhkan untuk mengevaluasi prompteval_count: Berapa banyak token keluaran yang diproseseval_duration: Berapa lama waktu yang dibutuhkan untuk menghasilkan token keluaran
Semua nilai waktu diukur dalam nanodetik.
Contoh respons
Untuk endpoint yang mengembalikan metrik penggunaan, isi respons akan mencakup kolom penggunaan. Sebagai contoh, panggian non-streaming ke /api/generate dapat mengembalikan respons berikut:
json
{
"model": "gemma4",
"created_at": "2025-10-17T23:14:07.414671Z",
"response": "Hello! How can I help you today?",
"done": true,
"done_reason": "stop",
"total_duration": 174560334,
"load_duration": 101397084,
"prompt_eval_count": 11,
"prompt_eval_duration": 13074791,
"eval_count": 18,
"eval_duration": 52479709
}Untuk endpoint yang mengembalikan respons streaming, kolom penggunaan disertakan sebagai bagian dari chunk terakhir, di mana done bernilai true.