Skip to content

Ollama के API प्रतिक्रियाओं में ऐसे मेट्रिक्स शामिल होते हैं जिनका उपयोग प्रदर्शन और मॉडल उपयोग को मापने के लिए किया जा सकता है:

  • total_duration: प्रतिक्रिया को जनरेट करने में कितना समय लगा
  • load_duration: मॉडल को लोड करने में कितना समय लगा
  • prompt_eval_count: कितने इनपुट टोकन प्रोसेस किए गए
  • prompt_eval_duration: प्रॉम्प्ट का मूल्यांकन करने में कितना समय लगा
  • eval_count: कितने आउटपुट टोकन प्रोसेस किए गए
  • eval_duration: आउटपुट टोकन को जनरेट करने में कितना समय लगा

सभी समय मान नैनोसेकंड में मापे जाते हैं।

उदाहरण प्रतिक्रिया ​

उपयोग मेट्रिक्स लौटाने वाले एंडपॉइंट्स के लिए, प्रतिक्रिया बॉडी में उपयोग संबंधी फील्ड शामिल होती है। उदाहरण के लिए, /api/generate पर एक गैर-स्ट्रीमिंग कॉल करने पर निम्नलिखित प्रतिक्रिया लौटाई जा सकती है:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

उन एंडपॉइंट्स के लिए जो स्ट्रीमिंग प्रतिक्रियाएं लौटाते हैं, उपयोग फील्ड अंतिम चंक का हिस्सा होते हैं, जहां done का मान true होता है।