Skip to content

Cloud-Modelle

Ollamas Cloud-Modelle sind eine neue Art von Modellen in Ollama, die ohne leistungsstarke GPU ausgeführt werden können. Stattdessen werden Cloud-Modelle automatisch an Ollamas Cloud-Dienst ausgelagert, bieten dabei die gleichen Funktionen wie lokale Modelle und ermöglichen es dir, deine lokalen Tools weiterzuverwenden, während du größere Modelle ausführst, die auf einem Personal Computer nicht Platz finden würden.

Unterstützte Modelle

Eine Liste der unterstützten Modelle findest du in Ollamas Modellbibliothek.

Ausführen von Cloud-Modellen

Für Ollamas Cloud-Modelle wird ein Konto auf ollama.com benötigt. Um dich anzumelden oder ein Konto zu erstellen, führe folgenden Befehl aus:

ollama signin

CLI

Um ein Cloud-Modell auszuführen, öffne das Terminal und führe folgenden Befehl aus:

ollama run gpt-oss:120b-cloud

Python

Zuerst lade ein Cloud-Modell herunter, damit es verfügbar ist:

ollama pull gpt-oss:120b-cloud

Als Nächstes installiere Ollamas Python-Bibliothek:

pip install ollama

Erstelle und führe anschließend ein einfaches Python-Skript aus:

python
from ollama import Client

client = Client()

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b-cloud', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript

Zuerst lade ein Cloud-Modell herunter, damit es verfügbar ist:

ollama pull gpt-oss:120b-cloud

Als Nächstes installiere Ollamas JavaScript-Bibliothek:

npm i ollama

Verwende anschließend die Bibliothek, um ein Cloud-Modell auszuführen:

typescript


const ollama = new Ollama();

const response = await ollama.chat({
  model: "gpt-oss:120b-cloud",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL

Zuerst lade ein Cloud-Modell herunter, damit es verfügbar ist:

ollama pull gpt-oss:120b-cloud

Führe den folgenden cURL-Befehl aus, um den Befehl über Ollamas API auszuführen:

curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:120b-cloud",
  "messages": [{
    "role": "user",
    "content": "Why is the sky blue?"
  }],
  "stream": false
}'

Cloud-API-Zugriff

Cloud-Modelle können auch direkt über die API von ollama.com aufgerufen werden. In diesem Modus agiert ollama.com als entfernter Ollama-Host.

Authentifizierung

Für den direkten Zugriff auf die API von ollama.com musst du zuerst einen API-Schlüssel erstellen.

Setze anschließend die Umgebungsvariable OLLAMA_API_KEY auf deinen API-Schlüssel.

export OLLAMA_API_KEY=your_api_key

Auflisten von Modellen

Für Modelle, die direkt über Ollamas API verfügbar sind, kannst du die Liste wie folgt abrufen:

curl https://ollama.com/api/tags

Generieren einer Antwort

Python

Zuerst installiere Ollamas Python-Bibliothek

pip install ollama

Sende anschließend eine Anfrage

python

from ollama import Client

client = Client(
    host="https://ollama.com",
    headers={'Authorization': 'Bearer ' + os.environ.get('OLLAMA_API_KEY')}
)

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript

Zuerst installiere Ollamas JavaScript-Bibliothek:

npm i ollama

Sende anschließend eine Anfrage an das Modell:

typescript


const ollama = new Ollama({
  host: "https://ollama.com",
  headers: {
    Authorization: "Bearer " + process.env.OLLAMA_API_KEY,
  },
});

const response = await ollama.chat({
  model: "gpt-oss:120b",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL

Generiere eine Antwort über Ollamas Chat-API:

curl https://ollama.com/api/chat \
  -H "Authorization: Bearer $OLLAMA_API_KEY" \
  -d '{
    "model": "gpt-oss:120b",
    "messages": [{
      "role": "user",
      "content": "Why is the sky blue?"
    }],
    "stream": false
  }'

Nur lokal

Ollama kann im Nur-lokal-Modus ausgeführt werden, indem du die Cloud-Funktionen von Ollama deaktivierst.

Einstellung von Cloud-Modellen

Ollama wird ältere Cloud-Modelle gelegentlich als veraltet markieren und einstellen, sobald neuere und bessere Open-Source-Modelle veröffentlicht werden. Tools und Anwendungen, die auf Ollama Cloud-Modelle angewiesen sind, müssen möglicherweise aktualisiert werden, um weiterhin zu funktionieren. Betroffene Nutzer werden im Voraus über die Veraltung und Einstellung von Modellen benachrichtigt. Mitteilungen über Veraltungen werden per E-Mail und auf der Ollama-Website veröffentlicht. Die Einstellung von Ollama Cloud-Modellen hat keine Auswirkungen auf lokale Modelle.

Bevorstehende Einstellungen

EinstellungsdatumModellEmpfohlene Alternative
15. Juli 2026deepseek-v3.1:671bdeepseek-v4-flash
15. Juli 2026deepseek-v3.2deepseek-v4-flash
15. Juli 2026devstral-2:123bmistral-large-3:675b
15. Juli 2026devstral-small-2:24b
15. Juli 2026ministral-3:14b
15. Juli 2026ministral-3:3b
15. Juli 2026ministral-3:8b
15. Juli 2026gemini-3-flash-previewminimax-m3
15. Juli 2026gemma3:12bgemma4:31b
15. Juli 2026gemma3:27bgemma4:31b
15. Juli 2026gemma3:4bgemma4:31b
15. Juli 2026glm-4.7glm-5.2
15. Juli 2026glm-5glm-5.2
15. Juli 2026minimax-m2.1minimax-m3
15. Juli 2026qwen3-coder-nextqwen3.5:397b
15. Juli 2026qwen3-coder:480bqwen3.5:397b

Vergangene Einstellungen

30. Juni 2026
| Modell | Empfohlene Alternative |
| --- | --- | --- |
| `rnj-1:8b` | |
16. Juni 2026
| Modell | Empfohlene Alternative |
| --- | --- | --- |
| `kimi-k2-thinking` | `kimi-k2.6` |
| `kimi-k2:1t` | `kimi-k2.6` |
| `minimax-m2`  | `minimax-m3` |
| `glm-4.6` | `glm-5.1` |
| `qwen3-next:80b` | `qwen3.5` |
| `qwen3-vl:235b` | `qwen3.5` |
| `qwen3-vl:235b-instruct` | `qwen3.5` |
| `cogito-2.1:671b` | `deepseek-v4-flash` |