Skip to content

Cloudmodellen

Ollama's cloudmodellen zijn een nieuw type model in Ollama die kunnen draaien zonder een krachtige GPU. In plaats daarvan worden cloudmodellen automatisch verplaatst naar de cloudservice van Ollama, terwijl ze dezelfde mogelijkheden bieden als lokale modellen. Dit maakt het mogelijk om je lokale tools te blijven gebruiken terwijl je grotere modellen draait die niet op een persoonlijke computer passen.

Ondersteunde modellen

Voor een lijst met ondersteunde modellen, zie de modellenbibliotheek van Ollama.

Cloudmodellen uitvoeren

Voor cloudmodellen van Ollama heb je een account op ollama.com nodig. Om je aan te melden of een account aan te maken, voer je het volgende uit:

ollama signin

CLI

Om een cloudmodel uit te voeren, open je de terminal en voer je het volgende uit:

ollama run gpt-oss:120b-cloud

Python

Pull eerst een cloudmodel zodat er toegang toe is:

ollama pull gpt-oss:120b-cloud

Installeer vervolgens de Python-bibliotheek van Ollama:

pip install ollama

Maak en voer vervolgens een eenvoudig Python-script uit:

python
from ollama import Client

client = Client()

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b-cloud', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript

Pull eerst een cloudmodel zodat er toegang toe is:

ollama pull gpt-oss:120b-cloud

Installeer vervolgens de JavaScript-bibliotheek van Ollama:

npm i ollama

Gebruik de bibliotheek vervolgens om een cloudmodel uit te voeren:

typescript


const ollama = new Ollama();

const response = await ollama.chat({
  model: "gpt-oss:120b-cloud",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL

Pull eerst een cloudmodel zodat er toegang toe is:

ollama pull gpt-oss:120b-cloud

Voer de volgende cURL-opdracht uit om het commando via de API van Ollama uit te voeren:

curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:120b-cloud",
  "messages": [{
    "role": "user",
    "content": "Why is the sky blue?"
  }],
  "stream": false
}'

Toegang tot Cloud-API

Cloudmodellen kunnen ook direct via de API van ollama.com worden benaderd. In deze modus fungeert ollama.com als een externe Ollama-host.

Authenticatie

Voor directe toegang tot de API van ollama.com maak je eerst een API-sleutel aan.

Stel vervolgens de omgevingsvariabele OLLAMA_API_KEY in op je API-sleutel.

export OLLAMA_API_KEY=your_api_key

Modellen weergeven

Voor modellen die direct via de API van Ollama beschikbaar zijn, kun je modellen weergeven via:

curl https://ollama.com/api/tags

Een antwoord genereren

Python

Installeer eerst de Python-bibliotheek van Ollama

pip install ollama

Maak vervolgens een aanvraag

python

from ollama import Client

client = Client(
    host="https://ollama.com",
    headers={'Authorization': 'Bearer ' + os.environ.get('OLLAMA_API_KEY')}
)

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript

Installeer eerst de JavaScript-bibliotheek van Ollama:

npm i ollama

Maak vervolgens een aanvraag aan het model:

typescript


const ollama = new Ollama({
  host: "https://ollama.com",
  headers: {
    Authorization: "Bearer " + process.env.OLLAMA_API_KEY,
  },
});

const response = await ollama.chat({
  model: "gpt-oss:120b",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL

Genereer een antwoord via de chat-API van Ollama:

curl https://ollama.com/api/chat \
  -H "Authorization: Bearer $OLLAMA_API_KEY" \
  -d '{
    "model": "gpt-oss:120b",
    "messages": [{
      "role": "user",
      "content": "Why is the sky blue?"
    }],
    "stream": false
  }'

Alleen lokaal

Ollama kan in alleen-lokale modus draaien door de cloudfuncties van Ollama uit te schakelen.

Intrekking van modellen

Ollama zal af en toe oudere cloudmodellen deprecëren en intrekken wanneer er nieuwere en betere open-source modellen worden uitgebracht. Tools en applicaties die afhankelijk zijn van cloudmodellen van Ollama moeten mogelijk worden bijgewerkt om te blijven werken. Getroffen gebruikers worden voorafgaand aan de deprecatie en intrekking van modellen op de hoogte gesteld. Deprecaties worden gecommuniceerd via e-mail en op de website van Ollama.

De intrekking van cloudmodellen van Ollama heeft geen invloed op lokale modellen.

Aankomende intrekkingen

IntrekdatumModelAanbevolen alternatief
15 juli 2026deepseek-v3.1:671bdeepseek-v4-flash
15 juli 2026deepseek-v3.2deepseek-v4-flash
15 juli 2026devstral-2:123bmistral-large-3:675b
15 juli 2026devstral-small-2:24b
15 juli 2026ministral-3:14b
15 juli 2026ministral-3:3b
15 juli 2026ministral-3:8b
15 juli 2026gemini-3-flash-previewminimax-m3
15 juli 2026gemma3:12bgemma4:31b
15 juli 2026gemma3:27bgemma4:31b
15 juli 2026gemma3:4bgemma4:31b
15 juli 2026glm-4.7glm-5.2
15 juli 2026glm-5glm-5.2
15 juli 2026minimax-m2.1minimax-m3
15 juli 2026qwen3-coder-nextqwen3.5:397b
15 juli 2026qwen3-coder:480bqwen3.5:397b

Eerdere intrekkingen

30 juni 2026
| Model | Aanbevolen alternatief |
| --- | --- |
| `rnj-1:8b` | |
16 juni 2026
| Model | Aanbevolen alternatief |
| --- | --- |
| `kimi-k2-thinking` | `kimi-k2.6` |
| `kimi-k2:1t` | `kimi-k2.6` |
| `minimax-m2`  | `minimax-m3` |
| `glm-4.6` | `glm-5.1` |
| `qwen3-next:80b` | `qwen3.5` |
| `qwen3-vl:235b` | `qwen3.5` |
| `qwen3-vl:235b-instruct` | `qwen3.5` |
| `cogito-2.1:671b` | `deepseek-v4-flash` |