Ollama'nın API yanıtları, performans ve model kullanımını ölçmek için kullanılabilecek metrikler içerir:
total_duration: Yanıtın oluşturulması için geçen süreload_duration: Modelin yüklenmesi için geçen süreprompt_eval_count: İşlenen girdi token sayısıprompt_eval_duration: İstemcinin değerlendirilmesi için geçen süreeval_count: İşlenen çıktı token sayısıeval_duration: Çıktı token'larının oluşturulması için geçen süre
Tüm zamanlama değerleri nanosaniye cinsinden ölçülür.
Örnek yanıt
Kullanım metrikleri döndüren uç noktalar için, yanıt gövdesi kullanım alanlarını içerecektir. Örneğin, /api/generate için yapılan akış dışı bir çağrı aşağıdaki yanıtı döndürebilir:
json
{
"model": "gemma4",
"created_at": "2025-10-17T23:14:07.414671Z",
"response": "Hello! How can I help you today?",
"done": true,
"done_reason": "stop",
"total_duration": 174560334,
"load_duration": 101397084,
"prompt_eval_count": 11,
"prompt_eval_duration": 13074791,
"eval_count": 18,
"eval_duration": 52479709
}Akışlı yanıtlar döndüren uç noktalar için, kullanım alanları done değeri true olduğunda son parça olarak eklenir.