Ollama के API प्रतिक्रियाओं में ऐसे मेट्रिक्स शामिल होते हैं जिनका उपयोग प्रदर्शन और मॉडल उपयोग को मापने के लिए किया जा सकता है:
total_duration: प्रतिक्रिया को जनरेट करने में कितना समय लगाload_duration: मॉडल को लोड करने में कितना समय लगाprompt_eval_count: कितने इनपुट टोकन प्रोसेस किए गएprompt_eval_duration: प्रॉम्प्ट का मूल्यांकन करने में कितना समय लगाeval_count: कितने आउटपुट टोकन प्रोसेस किए गएeval_duration: आउटपुट टोकन को जनरेट करने में कितना समय लगा
सभी समय मान नैनोसेकंड में मापे जाते हैं।
उदाहरण प्रतिक्रिया
उपयोग मेट्रिक्स लौटाने वाले एंडपॉइंट्स के लिए, प्रतिक्रिया बॉडी में उपयोग संबंधी फील्ड शामिल होती है। उदाहरण के लिए, /api/generate पर एक गैर-स्ट्रीमिंग कॉल करने पर निम्नलिखित प्रतिक्रिया लौटाई जा सकती है:
json
{
"model": "gemma4",
"created_at": "2025-10-17T23:14:07.414671Z",
"response": "Hello! How can I help you today?",
"done": true,
"done_reason": "stop",
"total_duration": 174560334,
"load_duration": 101397084,
"prompt_eval_count": 11,
"prompt_eval_duration": 13074791,
"eval_count": 18,
"eval_duration": 52479709
}उन एंडपॉइंट्स के लिए जो स्ट्रीमिंग प्रतिक्रियाएं लौटाते हैं, उपयोग फील्ड अंतिम चंक का हिस्सा होते हैं, जहां done का मान true होता है।