Skip to content

Cloudmodellen ​

Ollama's cloudmodellen zijn een nieuw type model in Ollama die kunnen draaien zonder een krachtige GPU. In plaats daarvan worden cloudmodellen automatisch verplaatst naar de cloudservice van Ollama, terwijl ze dezelfde mogelijkheden bieden als lokale modellen. Dit maakt het mogelijk om je lokale tools te blijven gebruiken terwijl je grotere modellen draait die niet op een persoonlijke computer passen.

Ondersteunde modellen ​

Voor een lijst met ondersteunde modellen, zie de modellenbibliotheek van Ollama.

Cloudmodellen uitvoeren ​

Voor cloudmodellen van Ollama heb je een account op ollama.com nodig. Om je aan te melden of een account aan te maken, voer je het volgende uit:

ollama signin

CLI ​

Om een cloudmodel uit te voeren, open je de terminal en voer je het volgende uit:

ollama run gpt-oss:120b-cloud

Python ​

Pull eerst een cloudmodel zodat er toegang toe is:

ollama pull gpt-oss:120b-cloud

Installeer vervolgens de Python-bibliotheek van Ollama:

pip install ollama

Maak en voer vervolgens een eenvoudig Python-script uit:

python
from ollama import Client

client = Client()

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b-cloud', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript ​

Pull eerst een cloudmodel zodat er toegang toe is:

ollama pull gpt-oss:120b-cloud

Installeer vervolgens de JavaScript-bibliotheek van Ollama:

npm i ollama

Gebruik de bibliotheek vervolgens om een cloudmodel uit te voeren:

typescript


const ollama = new Ollama();

const response = await ollama.chat({
  model: "gpt-oss:120b-cloud",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL ​

Pull eerst een cloudmodel zodat er toegang toe is:

ollama pull gpt-oss:120b-cloud

Voer de volgende cURL-opdracht uit om het commando via de API van Ollama uit te voeren:

curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:120b-cloud",
  "messages": [{
    "role": "user",
    "content": "Why is the sky blue?"
  }],
  "stream": false
}'

Toegang tot Cloud-API ​

Cloudmodellen kunnen ook direct via de API van ollama.com worden benaderd. In deze modus fungeert ollama.com als een externe Ollama-host.

Authenticatie ​

Voor directe toegang tot de API van ollama.com maak je eerst een API-sleutel aan.

Stel vervolgens de omgevingsvariabele OLLAMA_API_KEY in op je API-sleutel.

export OLLAMA_API_KEY=your_api_key

Modellen weergeven ​

Voor modellen die direct via de API van Ollama beschikbaar zijn, kun je modellen weergeven via:

curl https://ollama.com/api/tags

Een antwoord genereren ​

Python ​

Installeer eerst de Python-bibliotheek van Ollama

pip install ollama

Maak vervolgens een aanvraag

python

from ollama import Client

client = Client(
    host="https://ollama.com",
    headers={'Authorization': 'Bearer ' + os.environ.get('OLLAMA_API_KEY')}
)

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript ​

Installeer eerst de JavaScript-bibliotheek van Ollama:

npm i ollama

Maak vervolgens een aanvraag aan het model:

typescript


const ollama = new Ollama({
  host: "https://ollama.com",
  headers: {
    Authorization: "Bearer " + process.env.OLLAMA_API_KEY,
  },
});

const response = await ollama.chat({
  model: "gpt-oss:120b",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL ​

Genereer een antwoord via de chat-API van Ollama:

curl https://ollama.com/api/chat \
  -H "Authorization: Bearer $OLLAMA_API_KEY" \
  -d '{
    "model": "gpt-oss:120b",
    "messages": [{
      "role": "user",
      "content": "Why is the sky blue?"
    }],
    "stream": false
  }'

Alleen lokaal ​

Ollama kan in alleen-lokale modus draaien door de cloudfuncties van Ollama uit te schakelen.

Intrekking van modellen ​

Ollama zal af en toe oudere cloudmodellen deprecëren en intrekken wanneer er nieuwere en betere open-source modellen worden uitgebracht. Tools en applicaties die afhankelijk zijn van cloudmodellen van Ollama moeten mogelijk worden bijgewerkt om te blijven werken. Getroffen gebruikers worden voorafgaand aan de deprecatie en intrekking van modellen op de hoogte gesteld. Deprecaties worden gecommuniceerd via e-mail en op de website van Ollama.

De intrekking van cloudmodellen van Ollama heeft geen invloed op lokale modellen.

Aankomende intrekkingen ​

IntrekdatumModelAanbevolen alternatief
15 juli 2026deepseek-v3.1:671bdeepseek-v4-flash
15 juli 2026deepseek-v3.2deepseek-v4-flash
15 juli 2026devstral-2:123bmistral-large-3:675b
15 juli 2026devstral-small-2:24b
15 juli 2026ministral-3:14b
15 juli 2026ministral-3:3b
15 juli 2026ministral-3:8b
15 juli 2026gemini-3-flash-previewminimax-m3
15 juli 2026gemma3:12bgemma4:31b
15 juli 2026gemma3:27bgemma4:31b
15 juli 2026gemma3:4bgemma4:31b
15 juli 2026glm-4.7glm-5.2
15 juli 2026glm-5glm-5.2
15 juli 2026minimax-m2.1minimax-m3
15 juli 2026qwen3-coder-nextqwen3.5:397b
15 juli 2026qwen3-coder:480bqwen3.5:397b

Eerdere intrekkingen ​

30 juni 2026
| Model | Aanbevolen alternatief |
| --- | --- |
| `rnj-1:8b` | |
16 juni 2026
| Model | Aanbevolen alternatief |
| --- | --- |
| `kimi-k2-thinking` | `kimi-k2.6` |
| `kimi-k2:1t` | `kimi-k2.6` |
| `minimax-m2`  | `minimax-m3` |
| `glm-4.6` | `glm-5.1` |
| `qwen3-next:80b` | `qwen3.5` |
| `qwen3-vl:235b` | `qwen3.5` |
| `qwen3-vl:235b-instruct` | `qwen3.5` |
| `cogito-2.1:671b` | `deepseek-v4-flash` |