Cloud-Modelle
Ollamas Cloud-Modelle sind eine neue Art von Modellen in Ollama, die ohne leistungsstarke GPU ausgeführt werden können. Stattdessen werden Cloud-Modelle automatisch an Ollamas Cloud-Dienst ausgelagert, bieten dabei die gleichen Funktionen wie lokale Modelle und ermöglichen es dir, deine lokalen Tools weiterzuverwenden, während du größere Modelle ausführst, die auf einem Personal Computer nicht Platz finden würden.
Unterstützte Modelle
Eine Liste der unterstützten Modelle findest du in Ollamas Modellbibliothek.
Ausführen von Cloud-Modellen
Für Ollamas Cloud-Modelle wird ein Konto auf ollama.com benötigt. Um dich anzumelden oder ein Konto zu erstellen, führe folgenden Befehl aus:
ollama signinCLI
Um ein Cloud-Modell auszuführen, öffne das Terminal und führe folgenden Befehl aus:
ollama run gpt-oss:120b-cloudPython
Zuerst lade ein Cloud-Modell herunter, damit es verfügbar ist:
ollama pull gpt-oss:120b-cloudAls Nächstes installiere Ollamas Python-Bibliothek:
pip install ollamaErstelle und führe anschließend ein einfaches Python-Skript aus:
python
from ollama import Client
client = Client()
messages = [
{
'role': 'user',
'content': 'Why is the sky blue?',
},
]
for part in client.chat('gpt-oss:120b-cloud', messages=messages, stream=True):
print(part['message']['content'], end='', flush=True)JavaScript
Zuerst lade ein Cloud-Modell herunter, damit es verfügbar ist:
ollama pull gpt-oss:120b-cloudAls Nächstes installiere Ollamas JavaScript-Bibliothek:
npm i ollamaVerwende anschließend die Bibliothek, um ein Cloud-Modell auszuführen:
typescript
const ollama = new Ollama();
const response = await ollama.chat({
model: "gpt-oss:120b-cloud",
messages: [{ role: "user", content: "Explain quantum computing" }],
stream: true,
});
for await (const part of response) {
process.stdout.write(part.message.content);
}cURL
Zuerst lade ein Cloud-Modell herunter, damit es verfügbar ist:
ollama pull gpt-oss:120b-cloudFühre den folgenden cURL-Befehl aus, um den Befehl über Ollamas API auszuführen:
curl http://localhost:11434/api/chat -d '{
"model": "gpt-oss:120b-cloud",
"messages": [{
"role": "user",
"content": "Why is the sky blue?"
}],
"stream": false
}'Cloud-API-Zugriff
Cloud-Modelle können auch direkt über die API von ollama.com aufgerufen werden. In diesem Modus agiert ollama.com als entfernter Ollama-Host.
Authentifizierung
Für den direkten Zugriff auf die API von ollama.com musst du zuerst einen API-Schlüssel erstellen.
Setze anschließend die Umgebungsvariable OLLAMA_API_KEY auf deinen API-Schlüssel.
export OLLAMA_API_KEY=your_api_keyAuflisten von Modellen
Für Modelle, die direkt über Ollamas API verfügbar sind, kannst du die Liste wie folgt abrufen:
curl https://ollama.com/api/tagsGenerieren einer Antwort
Python
Zuerst installiere Ollamas Python-Bibliothek
pip install ollamaSende anschließend eine Anfrage
python
from ollama import Client
client = Client(
host="https://ollama.com",
headers={'Authorization': 'Bearer ' + os.environ.get('OLLAMA_API_KEY')}
)
messages = [
{
'role': 'user',
'content': 'Why is the sky blue?',
},
]
for part in client.chat('gpt-oss:120b', messages=messages, stream=True):
print(part['message']['content'], end='', flush=True)JavaScript
Zuerst installiere Ollamas JavaScript-Bibliothek:
npm i ollamaSende anschließend eine Anfrage an das Modell:
typescript
const ollama = new Ollama({
host: "https://ollama.com",
headers: {
Authorization: "Bearer " + process.env.OLLAMA_API_KEY,
},
});
const response = await ollama.chat({
model: "gpt-oss:120b",
messages: [{ role: "user", content: "Explain quantum computing" }],
stream: true,
});
for await (const part of response) {
process.stdout.write(part.message.content);
}cURL
Generiere eine Antwort über Ollamas Chat-API:
curl https://ollama.com/api/chat \
-H "Authorization: Bearer $OLLAMA_API_KEY" \
-d '{
"model": "gpt-oss:120b",
"messages": [{
"role": "user",
"content": "Why is the sky blue?"
}],
"stream": false
}'Nur lokal
Ollama kann im Nur-lokal-Modus ausgeführt werden, indem du die Cloud-Funktionen von Ollama deaktivierst.
Einstellung von Cloud-Modellen
Ollama wird ältere Cloud-Modelle gelegentlich als veraltet markieren und einstellen, sobald neuere und bessere Open-Source-Modelle veröffentlicht werden. Tools und Anwendungen, die auf Ollama Cloud-Modelle angewiesen sind, müssen möglicherweise aktualisiert werden, um weiterhin zu funktionieren. Betroffene Nutzer werden im Voraus über die Veraltung und Einstellung von Modellen benachrichtigt. Mitteilungen über Veraltungen werden per E-Mail und auf der Ollama-Website veröffentlicht. Die Einstellung von Ollama Cloud-Modellen hat keine Auswirkungen auf lokale Modelle.
Bevorstehende Einstellungen
| Einstellungsdatum | Modell | Empfohlene Alternative |
|---|---|---|
| 15. Juli 2026 | deepseek-v3.1:671b | deepseek-v4-flash |
| 15. Juli 2026 | deepseek-v3.2 | deepseek-v4-flash |
| 15. Juli 2026 | devstral-2:123b | mistral-large-3:675b |
| 15. Juli 2026 | devstral-small-2:24b | |
| 15. Juli 2026 | ministral-3:14b | |
| 15. Juli 2026 | ministral-3:3b | |
| 15. Juli 2026 | ministral-3:8b | |
| 15. Juli 2026 | gemini-3-flash-preview | minimax-m3 |
| 15. Juli 2026 | gemma3:12b | gemma4:31b |
| 15. Juli 2026 | gemma3:27b | gemma4:31b |
| 15. Juli 2026 | gemma3:4b | gemma4:31b |
| 15. Juli 2026 | glm-4.7 | glm-5.2 |
| 15. Juli 2026 | glm-5 | glm-5.2 |
| 15. Juli 2026 | minimax-m2.1 | minimax-m3 |
| 15. Juli 2026 | qwen3-coder-next | qwen3.5:397b |
| 15. Juli 2026 | qwen3-coder:480b | qwen3.5:397b |
Vergangene Einstellungen
30. Juni 2026
| Modell | Empfohlene Alternative |
| --- | --- | --- |
| `rnj-1:8b` | |
16. Juni 2026
| Modell | Empfohlene Alternative |
| --- | --- | --- |
| `kimi-k2-thinking` | `kimi-k2.6` |
| `kimi-k2:1t` | `kimi-k2.6` |
| `minimax-m2` | `minimax-m3` |
| `glm-4.6` | `glm-5.1` |
| `qwen3-next:80b` | `qwen3.5` |
| `qwen3-vl:235b` | `qwen3.5` |
| `qwen3-vl:235b-instruct` | `qwen3.5` |
| `cogito-2.1:671b` | `deepseek-v4-flash` |