Skip to content

Mô hình đám mây

Các mô hình đám mây của Ollama là một loại mô hình mới trong Ollama có thể chạy mà không cần GPU mạnh. Thay vào đó, các mô hình đám mây sẽ được tự động chuyển sang dịch vụ đám mây của Ollama, đồng thời cung cấp các khả năng tương tự như các mô hình chạy cục bộ, giúp bạn có thể tiếp tục sử dụng các công cụ cục bộ của mình khi chạy các mô hình lớn hơn không thể chạy được trên máy tính cá nhân.

Các mô hình được hỗ trợ

Để xem danh sách các mô hình được hỗ trợ, hãy truy cập thư viện mô hình của Ollama.

Chạy các mô hình đám mây

Các mô hình đám mây của Ollama yêu cầu bạn có tài khoản trên ollama.com. Để đăng nhập hoặc tạo tài khoản, hãy chạy lệnh:

ollama signin

CLI

Để chạy một mô hình đám mây, hãy mở terminal và chạy lệnh:

ollama run gpt-oss:120b-cloud

Python

Trước tiên, hãy tải một mô hình đám mây để có thể truy cập được:

ollama pull gpt-oss:120b-cloud

Tiếp theo, hãy cài đặt thư viện Python của Ollama:

pip install ollama

Tiếp theo, hãy tạo và chạy một đoạn mã Python đơn giản:

python

from ollama import Client

client = Client()

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b-cloud', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript

Trước tiên, hãy tải một mô hình đám mây để có thể truy cập được:

ollama pull gpt-oss:120b-cloud

Tiếp theo, hãy cài đặt thư viện JavaScript của Ollama:

npm i ollama

Sau đó, sử dụng thư viện này để chạy mô hình đám mây:

typescript


const ollama = new Ollama();

const response = await ollama.chat({
  model: "gpt-oss:120b-cloud",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL

Trước tiên, hãy tải một mô hình đám mây để có thể truy cập được:

ollama pull gpt-oss:120b-cloud

Chạy lệnh cURL sau để thực hiện yêu cầu thông qua API của Ollama:

curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:120b-cloud",
  "messages": [{
    "role": "user",
    "content": "Why is the sky blue?"
  }],
  "stream": false
}'

Truy cập API đám mây

Các mô hình đám mây cũng có thể được truy cập trực tiếp thông qua API của ollama.com. Ở chế độ này, ollama.com đóng vai trò là máy chủ Ollama từ xa.

Xác thực

Để truy cập trực tiếp API của ollama.com, trước tiên hãy tạo một khóa API.

Sau đó, đặt biến môi trường OLLAMA_API_KEY thành khóa API của bạn.

export OLLAMA_API_KEY=your_api_key

Liệt kê các mô hình

Đối với các mô hình có sẵn trực tiếp thông qua API của Ollama, bạn có thể liệt kê chúng bằng lệnh:

curl https://ollama.com/api/tags

Tạo phản hồi

Python

Trước tiên, hãy cài đặt thư viện Python của Ollama

pip install ollama

Sau đó, gửi yêu cầu

python

from ollama import Client

client = Client(
    host="https://ollama.com",
    headers={'Authorization': 'Bearer ' + os.environ.get('OLLAMA_API_KEY')}
)

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript

Trước tiên, hãy cài đặt thư viện JavaScript của Ollama:

npm i ollama

Tiếp theo, gửi yêu cầu đến mô hình:

typescript


const ollama = new Ollama({
  host: "https://ollama.com",
  headers: {
    Authorization: "Bearer " + process.env.OLLAMA_API_KEY,
  },
});

const response = await ollama.chat({
  model: "gpt-oss:120b",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL

Tạo phản hồi thông qua API chat của Ollama:

curl https://ollama.com/api/chat \
  -H "Authorization: Bearer $OLLAMA_API_KEY" \
  -d '{
    "model": "gpt-oss:120b",
    "messages": [{
      "role": "user",
      "content": "Why is the sky blue?"
    }],
    "stream": false
  }'

Chỉ chạy cục bộ

Ollama có thể chạy ở chế độ chỉ cục bộ bằng cách tắt các tính năng đám mây của Ollama.

Ngừng hỗ trợ

Ollama sẽ thỉnh thoảng ngừng hỗ trợ và loại bỏ các mô hình đám mây cũ khi các mô hình nguồn mở mới và tốt hơn được phát hành. Các công cụ và ứng dụng phụ thuộc vào các mô hình Đám mây của Ollama có thể cần được cập nhật để tiếp tục hoạt động. Người dùng bị ảnh hưởng sẽ được thông báo trước khi mô hình bị ngừng hỗ trợ và loại bỏ. Các thông báo ngừng hỗ trợ sẽ được gửi qua email và đăng trên trang web của Ollama.

Việc ngừng hỗ trợ các mô hình Đám mây của Ollama không ảnh hưởng đến các mô hình chạy cục bộ.

Các mô hình sắp ngừng hỗ trợ

Ngày ngừng hỗ trợMô hìnhMô hình thay thế được đề xuất
July 15, 2026deepseek-v3.1:671bdeepseek-v4-flash
July 15, 2026deepseek-v3.2deepseek-v4-flash
July 15, 2026devstral-2:123bmistral-large-3:675b
July 15, 2026devstral-small-2:24b
July 15, 2026ministral-3:14b
July 15, 2026ministral-3:3b
July 15, 2026ministral-3:8b
July 15, 2026gemini-3-flash-previewminimax-m3
July 15, 2026gemma3:12bgemma4:31b
July 15, 2026gemma3:27bgemma4:31b
July 15, 2026gemma3:4bgemma4:31b
July 15, 2026glm-4.7glm-5.2
July 15, 2026glm-5glm-5.2
July 15, 2026minimax-m2.1minimax-m3
July 15, 2026qwen3-coder-nextqwen3.5:397b
July 15, 2026qwen3-coder:480bqwen3.5:397b

Các mô hình đã ngừng hỗ trợ

Ngày 30 tháng 6 năm 2026
| Mô hình | Mô hình thay thế được đề xuất |
| --- | --- |
| `rnj-1:8b` | |
Ngày 16 tháng 6 năm 2026
| Mô hình | Mô hình thay thế được đề xuất |
| --- | --- |
| `kimi-k2-thinking` | `kimi-k2.6` |
| `kimi-k2:1t` | `kimi-k2.6` |
| `minimax-m2`  | `minimax-m3` |
| `glm-4.6` | `glm-5.1` |
| `qwen3-next:80b` | `qwen3.5` |
| `qwen3-vl:235b` | `qwen3.5` |
| `qwen3-vl:235b-instruct` | `qwen3.5` |
| `cogito-2.1:671b` | `deepseek-v4-flash` |