Skip to content

Ollama'nın API yanıtları, performans ve model kullanımını ölçmek için kullanılabilecek metrikler içerir:

  • total_duration: Yanıtın oluşturulması için geçen süre
  • load_duration: Modelin yüklenmesi için geçen süre
  • prompt_eval_count: İşlenen girdi token sayısı
  • prompt_eval_duration: İstemcinin değerlendirilmesi için geçen süre
  • eval_count: İşlenen çıktı token sayısı
  • eval_duration: Çıktı token'larının oluşturulması için geçen süre

Tüm zamanlama değerleri nanosaniye cinsinden ölçülür.

Örnek yanıt

Kullanım metrikleri döndüren uç noktalar için, yanıt gövdesi kullanım alanlarını içerecektir. Örneğin, /api/generate için yapılan akış dışı bir çağrı aşağıdaki yanıtı döndürebilir:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Akışlı yanıtlar döndüren uç noktalar için, kullanım alanları done değeri true olduğunda son parça olarak eklenir.