Skip to content

การตอบกลับของ API ของ Ollama มีเมตริกที่สามารถใช้เพื่อวัดประสิทธิภาพและการใช้งานโมเดล:

  • total_duration: ระยะเวลาที่ใช้ในการสร้างการตอบกลับ
  • load_duration: ระยะเวลาที่ใช้ในการโหลดโมเดล
  • prompt_eval_count: จำนวนโทเค็นอินพุตที่ประมวลผล
  • prompt_eval_duration: ระยะเวลาที่ใช้ในการประเมินพรอมต์
  • eval_count: จำนวนโทเค็นเอาต์พุตที่ประมวลผล
  • eval_duration: ระยะเวลาที่ใช้ในการสร้างโทเค็นเอาต์พุต

ค่าทั้งหมดที่เกี่ยวกับเวลาจะวัดเป็นนาโนวินาที

ตัวอย่างการตอบกลับ

สำหรับเอนด์พอยต์ที่ส่งคืนเมตริกการใช้งาน ร่างการตอบกลับจะมีฟิลด์การใช้งานอยู่ด้วย ตัวอย่างเช่น การเรียก /api/generate แบบไม่สตรีมอาจส่งคืนการตอบกลับดังต่อไปนี้:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

สำหรับเอนด์พอยต์ที่ส่งคืน การตอบกลับแบบสตรีม ฟิลด์การใช้งานจะรวมอยู่กับชังก์สุดท้าย ซึ่งมีค่า done เป็น true