Skip to content

Phản hồi từ API của Ollama bao gồm các chỉ số có thể được sử dụng để đo lường hiệu suất và mức sử dụng mô hình:

  • total_duration: Thời gian cần thiết để tạo ra phản hồi
  • load_duration: Thời gian cần thiết để tải mô hình
  • prompt_eval_count: Số lượng token đầu vào đã được xử lý
  • prompt_eval_duration: Thời gian cần thiết để đánh giá prompt
  • eval_count: Số lượng token đầu ra đã được xử lý
  • eval_duration: Thời gian cần thiết để tạo ra các token đầu ra

Tất cả các giá trị thời gian đều được đo bằng nano giây.

Ví dụ phản hồi

Đối với các endpoint trả về chỉ số sử dụng, nội dung phản hồi sẽ bao gồm các trường chỉ số sử dụng. Ví dụ, một lệnh gọi không streaming đến /api/generate có thể trả về phản hồi sau:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Đối với các endpoint trả về phản hồi streaming, các trường chỉ số sử dụng được đưa vào phần cuối của chunk, nơi done có giá trị là true.