Skip to content

Ollama के API प्रतिक्रियाओं में ऐसे मेट्रिक्स शामिल होते हैं जिनका उपयोग प्रदर्शन और मॉडल उपयोग को मापने के लिए किया जा सकता है:

  • total_duration: प्रतिक्रिया को जनरेट करने में कितना समय लगा
  • load_duration: मॉडल को लोड करने में कितना समय लगा
  • prompt_eval_count: कितने इनपुट टोकन प्रोसेस किए गए
  • prompt_eval_duration: प्रॉम्प्ट का मूल्यांकन करने में कितना समय लगा
  • eval_count: कितने आउटपुट टोकन प्रोसेस किए गए
  • eval_duration: आउटपुट टोकन को जनरेट करने में कितना समय लगा

सभी समय मान नैनोसेकंड में मापे जाते हैं।

उदाहरण प्रतिक्रिया

उपयोग मेट्रिक्स लौटाने वाले एंडपॉइंट्स के लिए, प्रतिक्रिया बॉडी में उपयोग संबंधी फील्ड शामिल होती है। उदाहरण के लिए, /api/generate पर एक गैर-स्ट्रीमिंग कॉल करने पर निम्नलिखित प्रतिक्रिया लौटाई जा सकती है:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

उन एंडपॉइंट्स के लिए जो स्ट्रीमिंग प्रतिक्रियाएं लौटाते हैं, उपयोग फील्ड अंतिम चंक का हिस्सा होते हैं, जहां done का मान true होता है।