Wie kann ich Ollama aktualisieren?
Ollama unter macOS und Windows lädt Updates automatisch herunter. Klicken Sie auf das Taskleisten- oder Menüleisten-Symbol und anschließend auf „Zum Aktualisieren neu starten“, um das Update anzuwenden. Updates können außerdem durch Herunterladen der neuesten Version manuell installiert werden.
Unter Linux führen Sie das Installationsskript erneut aus:
shell
curl -fsSL https://ollama.com/install.sh | shWie kann ich die Protokolle anzeigen?
Lesen Sie die Fehlerbehebung-Dokumentation, um weitere Informationen zur Verwendung von Protokollen zu erhalten.
Ist meine GPU mit Ollama kompatibel?
Bitte lesen Sie die GPU-Dokumentation.
Wie kann ich die Größe des Kontextfensters angeben?
Standardmäßig verwendet Ollama eine Kontextfenstergröße von 4096 Token.
Dies kann mit der Umgebungsvariable OLLAMA_CONTEXT_LENGTH überschrieben werden. Um das Standard-Kontextfenster beispielsweise auf 8K zu setzen, verwenden Sie:
shell
OLLAMA_CONTEXT_LENGTH=8192 ollama serveUm dies bei Verwendung von ollama run zu ändern, verwenden Sie /set parameter:
shell
/set parameter num_ctx 4096Bei Verwendung der API geben Sie den Parameter num_ctx an:
shell
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Why is the sky blue?",
"options": {
"num_ctx": 4096
}
}'Wie kann ich feststellen, ob mein Modell auf die GPU geladen wurde?
Verwenden Sie den Befehl ollama ps, um zu sehen, welche Modelle aktuell in den Speicher geladen sind.
shell
ollama psINFO
Ausgabe:
NAME ID SIZE PROCESSOR UNTIL
llama3:70b bcfb190ca3a7 42 GB 100% GPU 4 minutes from nowDie Spalte Processor zeigt an, in welchen Speicher das Modell geladen wurde:
100% GPUbedeutet, dass das Modell vollständig auf die GPU geladen wurde100% CPUbedeutet, dass das Modell vollständig in den Systemspeicher geladen wurde48%/52% CPU/GPUbedeutet, dass das Modell teilweise sowohl auf die GPU als auch in den Systemspeicher geladen wurde
Wie konfiguriere ich den Ollama-Server?
Der Ollama-Server kann über Umgebungsvariablen konfiguriert werden.
Umgebungsvariablen auf dem Mac festlegen
Wenn Ollama als macOS-Anwendung ausgeführt wird, sollten Umgebungsvariablen mit launchctl festgelegt werden:
- Rufen Sie für jede Umgebungsvariable
launchctl setenvauf.bashlaunchctl setenv OLLAMA_HOST "0.0.0.0:11434" - Starten Sie die Ollama-Anwendung neu.
Umgebungsvariablen auf Linux festlegen
Wenn Ollama als systemd-Dienst ausgeführt wird, sollten Umgebungsvariablen mit systemctl festgelegt werden:
- Bearbeiten Sie den systemd-Dienst, indem Sie
systemctl edit ollama.serviceaufrufen. Dadurch wird ein Editor geöffnet. - Fügen Sie für jede Umgebungsvariable eine Zeile
Environmentunter dem Abschnitt[Service]hinzu:ini[Service] Environment="OLLAMA_HOST=0.0.0.0:11434" - Speichern Sie die Änderungen und beenden Sie den Editor.
- Laden Sie
systemdneu und starten Sie Ollama neu:shellsystemctl daemon-reload systemctl restart ollama
Umgebungsvariablen auf Windows festlegen
Unter Windows erbt Ollama Ihre Benutzer- und Systemumgebungsvariablen.
- Beenden Sie Ollama zuerst, indem Sie in der Taskleiste darauf klicken.
- Öffnen Sie die Einstellungen (Windows 11) oder die Systemsteuerung (Windows 10) und suchen Sie nach Umgebungsvariablen.
- Klicken Sie auf Umgebungsvariablen für Ihr Konto bearbeiten.
- Bearbeiten oder erstellen Sie eine neue Variable für Ihr Benutzerkonto für
OLLAMA_HOST,OLLAMA_MODELSusw. - Klicken Sie auf OK/Übernehmen, um die Änderungen zu speichern.
- Starten Sie die Ollama-Anwendung über das Windows-Startmenü.
Wie verwende ich Ollama hinter einem Proxy?
Ollama lädt Modelle aus dem Internet herunter und benötigt möglicherweise einen Proxy-Server, um auf die Modelle zuzugreifen. Verwenden Sie HTTPS_PROXY, um ausgehende Anfragen über den Proxy umzuleiten. Stellen Sie sicher, dass das Proxy-Zertifikat als Systemzertifikat installiert ist. Lesen Sie den obigen Abschnitt, um zu erfahren, wie Sie Umgebungsvariablen auf Ihrer Plattform festlegen.
Hinweis
Vermeiden Sie die Festlegung von HTTP_PROXY. Ollama verwendet für das Herunterladen von Modellen kein HTTP, nur HTTPS. Die Festlegung von HTTP_PROXY kann Client-Verbindungen zum Server unterbrechen.
Wie verwende ich Ollama hinter einem Proxy in Docker?
Das Ollama-Docker-Container-Image kann so konfiguriert werden, dass es einen Proxy verwendet, indem beim Starten des Containers der Parameter -e HTTPS_PROXY=https://proxy.example.com übergeben wird.
Alternativ kann der Docker-Daemon so konfiguriert werden, dass er einen Proxy verwendet. Anleitungen hierzu finden Sie für Docker Desktop unter macOS, Windows und Linux sowie für den Docker-Daemon mit systemd.
Stellen Sie sicher, dass das Zertifikat bei Verwendung von HTTPS als Systemzertifikat installiert ist. Bei Verwendung eines selbstsignierten Zertifikats ist möglicherweise ein neues Docker-Image erforderlich.
dockerfile
FROM ollama/ollama
COPY my-ca.pem /usr/local/share/ca-certificates/my-ca.crt
RUN update-ca-certificatesErstellen und führen Sie dieses Image aus:
shell
docker build -t ollama-with-ca .
docker run -d -e HTTPS_PROXY=https://my.proxy.example.com -p 11434:11434 ollama-with-caSendet Ollama meine Prompts und Antworten an ollama.com?
Ollama wird lokal ausgeführt. Wir sehen Ihre Prompts oder Daten nicht, wenn Sie es lokal ausführen. Bei Verwendung von cloudgehosteten Modellen verarbeiten wir Ihre Prompts und Antworten, um den Dienst bereitzustellen, speichern oder protokollieren diese Inhalte jedoch nicht und verwenden sie niemals für Trainingszwecke. Wir sammeln grundlegende Kontoinformationen und begrenzte Nutzungsmetadaten, um den Dienst bereitzustellen, die keine Prompt- oder Antwortinhalte enthalten. Wir verkaufen Ihre Daten nicht. Sie können Ihr Konto jederzeit löschen.
Wie deaktiviere ich die Cloud-Funktionen von Ollama?
Ollama kann im rein lokalen Modus ausgeführt werden, indem die Cloud-Funktionen von Ollama deaktiviert werden. Wenn Sie die Cloud-Funktionen von Ollama deaktivieren, verlieren Sie die Möglichkeit, die Cloud-Modelle von Ollama und die Websuche zu verwenden.
Legen Sie disable_ollama_cloud in ~/.ollama/server.json fest:
json
{
"disable_ollama_cloud": true
}Sie können auch die Umgebungsvariable festlegen:
shell
OLLAMA_NO_CLOUD=1Starten Sie Ollama nach der Änderung der Konfiguration neu. Nach der Deaktivierung wird in den Protokollen von Ollama Ollama cloud disabled: true angezeigt.
Wie kann ich Ollama in meinem Netzwerk verfügbar machen?
Standardmäßig bindet Ollama an die Adresse 127.0.0.1 Port 11434. Ändern Sie die Bindungsadresse mit der Umgebungsvariable OLLAMA_HOST.
Lesen Sie den obigen Abschnitt, um zu erfahren, wie Sie Umgebungsvariablen auf Ihrer Plattform festlegen.
Wie kann ich Ollama mit einem Proxy-Server verwenden?
Ollama betreibt einen HTTP-Server und kann über einen Proxy-Server wie Nginx verfügbar gemacht werden. Konfigurieren Sie dazu den Proxy so, dass er Anfragen weiterleitet, und legen Sie optional erforderliche Header fest (wenn Ollama nicht im Netzwerk verfügbar gemacht wird). Beispiel für Nginx:
nginx
server {
listen 80;
server_name example.com; # Replace with your domain or IP
location / {
proxy_pass http://localhost:11434;
proxy_set_header Host localhost:11434;
}
}Wie kann ich Ollama mit ngrok verwenden?
Auf Ollama kann über verschiedene Tunneling-Apps zugegriffen werden. Beispielsweise mit Ngrok:
shell
ngrok http 11434 --host-header="localhost:11434"Wie kann ich Ollama mit Cloudflare Tunnel verwenden?
Um Ollama mit Cloudflare Tunnel zu verwenden, nutzen Sie die Flags --url und --http-host-header:
shell
cloudflared tunnel --url http://localhost:11434 --http-host-header="localhost:11434"Wie kann ich zusätzlichen Web-Ursprüngen den Zugriff auf Ollama erlauben?
Standardmäßig erlaubt Ollama Cross-Origin-Anfragen von 127.0.0.1 und 0.0.0.0. Zusätzliche Ursprünge können mit OLLAMA_ORIGINS konfiguriert werden.
Für Browser-Erweiterungen müssen Sie das Ursprungsmuster der Erweiterung explizit zulassen. Legen Sie OLLAMA_ORIGINS fest, sodass es chrome-extension://*, moz-extension://* und safari-web-extension://* enthält, wenn Sie allen Browser-Erweiterungen den Zugriff erlauben möchten, oder nach Bedarf bestimmte Erweiterungen:
# Allen Chrome-, Firefox- und Safari-Erweiterungen erlauben
OLLAMA_ORIGINS=chrome-extension://*,moz-extension://*,safari-web-extension://* ollama serveLesen Sie den obigen Abschnitt, um zu erfahren, wie Sie Umgebungsvariablen auf Ihrer Plattform festlegen.
Wo werden Modelle gespeichert?
- macOS:
~/.ollama/models - Linux:
/usr/share/ollama/.ollama/models - Windows:
C:\Users\%username%\.ollama\models
Wie lege ich einen anderen Speicherort fest?
Wenn ein anderes Verzeichnis verwendet werden soll, legen Sie die Umgebungsvariable OLLAMA_MODELS auf das gewünschte Verzeichnis fest.
Hinweis
Bei Verwendung des Standardinstallationsprogramms unter Linux benötigt der Benutzer ollama Lese- und Schreibzugriff auf das angegebene Verzeichnis. Um das Verzeichnis dem Benutzer ollama zuzuweisen, führen Sie sudo chown -R ollama:ollama <directory> aus.
Lesen Sie den obigen Abschnitt, um zu erfahren, wie Sie Umgebungsvariablen auf Ihrer Plattform festlegen.
Wie kann ich Ollama in Visual Studio Code verwenden?
Es gibt bereits eine große Sammlung von Plugins für VS Code sowie andere Editoren, die Ollama nutzen. Die Liste der Erweiterungen und Plugins finden Sie unten im Readme des Haupt-Repositorys.
Wie verwende ich Ollama mit GPU-Beschleunigung in Docker?
Der Ollama-Docker-Container kann unter Linux oder Windows (mit WSL2) mit GPU-Beschleunigung konfiguriert werden. Dazu wird das nvidia-container-toolkit benötigt. Weitere Details finden Sie unter ollama/ollama.
GPU-Beschleunigung ist für Docker Desktop unter macOS aufgrund fehlender GPU-Passthrough und -Emulation nicht verfügbar.
Warum ist die Netzwerkverbindung in WSL2 unter Windows 10 langsam?
Dies kann sowohl die Installation von Ollama als auch das Herunterladen von Modellen beeinträchtigen.
Öffnen Sie die Systemsteuerung > Netzwerk und Internet > Netzwerkstatus und -aufgaben anzeigen und klicken Sie links auf Adaptereinstellungen ändern. Suchen Sie den Adapter vEthernet (WSL), klicken Sie mit der rechten Maustaste darauf und wählen Sie Eigenschaften. Klicken Sie auf Konfigurieren und öffnen Sie die Registerkarte Erweitert. Durchsuchen Sie alle Eigenschaften, bis Sie Large Send Offload Version 2 (IPv4) und Large Send Offload Version 2 (IPv6) finden. Deaktivieren Sie beide dieser Eigenschaften.
Wie kann ich ein Modell in Ollama vorladen, um schnellere Antwortzeiten zu erhalten?
Wenn Sie die API verwenden, können Sie ein Modell vorladen, indem Sie eine leere Anfrage an den Ollama-Server senden. Dies funktioniert sowohl mit den API-Endpunkten /api/generate als auch /api/chat.
Um das Modell mistral über den Generate-Endpunkt vorzuladen, verwenden Sie:
shell
curl http://localhost:11434/api/generate -d '{"model": "mistral"}'Um den Chat-Completions-Endpunkt zu verwenden, nutzen Sie:
shell
curl http://localhost:11434/api/chat -d '{"model": "mistral"}'Um ein Modell über die CLI vorzuladen, verwenden Sie den Befehl:
shell
ollama run llama3.2 ""Wie halte ich ein Modell im Speicher geladen oder entlade es sofort?
Standardmäßig werden Modelle 5 Minuten lang im Speicher gehalten, bevor sie entladen werden. Dies ermöglicht schnellere Antwortzeiten, wenn Sie zahlreiche Anfragen an das LLM senden. Wenn Sie ein Modell sofort aus dem Speicher entladen möchten, verwenden Sie den Befehl ollama stop:
shell
ollama stop llama3.2Wenn Sie die API verwenden, nutzen Sie den Parameter keep_alive mit den Endpunkten /api/generate und /api/chat, um die Dauer festzulegen, die ein Modell im Speicher verbleibt. Der Parameter keep_alive kann auf folgende Werte gesetzt werden:
- einen Dauerstring (z. B. "10m" oder "24h")
- eine Anzahl von Sekunden (z. B. 3600)
- eine beliebige negative Zahl, die das Modell dauerhaft im Speicher hält (z. B. -1 oder "-1m")
- '0', wodurch das Modell sofort nach der Generierung einer Antwort entladen wird
Beispiel: Um ein Modell vorzuladen und es im Speicher zu halten, verwenden Sie:
shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'Um das Modell zu entladen und Speicher freizugeben, verwenden Sie:
shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": 0}'Alternativ können Sie die Dauer, die alle Modelle im Speicher geladen bleiben, ändern, indem Sie die Umgebungsvariable OLLAMA_KEEP_ALIVE beim Starten des Ollama-Servers festlegen. Die Variable OLLAMA_KEEP_ALIVE verwendet die gleichen Parametertypen wie der oben genannte Parameter keep_alive. Lesen Sie den Abschnitt zur Konfiguration des Ollama-Servers, um die Umgebungsvariable korrekt festzulegen.
Der API-Parameter keep_alive mit den Endpunkten /api/generate und /api/chat überschreibt die Einstellung OLLAMA_KEEP_ALIVE.
Wie verwalte ich die maximale Anzahl von Anfragen, die der Ollama-Server in die Warteschlange stellen kann?
Wenn zu viele Anfragen an den Server gesendet werden, antwortet er mit einem 503-Fehler, der angibt, dass der Server überlastet ist. Sie können die Anzahl der in die Warteschlange gestellten Anfragen anpassen, indem Sie OLLAMA_MAX_QUEUE festlegen.
Wie verarbeitet Ollama gleichzeitige Anfragen?
Ollama unterstützt zwei Ebenen der parallelen Verarbeitung. Wenn Ihr System über genügend verfügbaren Speicher (Systemspeicher bei CPU-Inferenz oder VRAM bei GPU-Inferenz) verfügt, können mehrere Modelle gleichzeitig geladen werden. Für ein bestimmtes Modell wird, wenn beim Laden des Modells genügend verfügbarer Speicher vorhanden ist, die parallele Anfragenverarbeitung aktiviert.
Wenn nicht genügend verfügbarer Speicher vorhanden ist, um eine neue Modellanfrage zu laden, während bereits ein oder mehrere Modelle geladen sind, werden alle neuen Anfragen in die Warteschlange gestellt, bis das neue Modell geladen werden kann. Wenn vorherige Modelle inaktiv werden, werden eines oder mehrere entladen, um Platz für das neue Modell zu schaffen. In der Warteschlange stehende Anfragen werden der Reihe nach verarbeitet. Bei Verwendung von GPU-Inferenz müssen neue Modelle vollständig in den VRAM passen, um parallele Modell-Ladungen zu ermöglichen.
Die parallele Anfragenverarbeitung für ein bestimmtes Modell führt dazu, dass sich die Kontextgröße um die Anzahl der parallelen Anfragen erhöht. Beispiel: Ein 2K-Kontext mit 4 parallelen Anfragen führt zu einem 8K-Kontext und zusätzlicher Speicherzuweisung.
Die folgenden Servereinstellungen können verwendet werden, um anzupassen, wie Ollama gleichzeitige Anfragen auf den meisten Plattformen verarbeitet:
OLLAMA_MAX_LOADED_MODELS– Die maximale Anzahl von Modellen, die gleichzeitig geladen werden können, vorausgesetzt sie passen in den verfügbaren Speicher. Die Standardeinstellung ist 3 * die Anzahl der GPUs oder 3 bei CPU-Inferenz.OLLAMA_NUM_PARALLEL– Die maximale Anzahl von parallelen Anfragen, die jedes Modell gleichzeitig verarbeitet, Standardwert 1. Der erforderliche RAM skaliert mitOLLAMA_NUM_PARALLEL*OLLAMA_CONTEXT_LENGTH.OLLAMA_MAX_QUEUE– Die maximale Anzahl von Anfragen, die Ollama bei Auslastung in die Warteschlange stellt, bevor weitere Anfragen abgelehnt werden. Der Standardwert ist 512.
Hinweis: Windows mit Radeon-GPUs hat derzeit aufgrund von Einschränkungen bei der Berichterstattung über verfügbaren VRAM in ROCm v5.7 ein Standardmaximum von 1 Modell. Sobald ROCm v6.2 verfügbar ist, folgt Windows Radeon den obigen Standardeinstellungen. Sie können parallele Modell-Ladungen auf Radeon unter Windows aktivieren, aber stellen Sie sicher, dass Sie nicht mehr Modelle laden, als in den VRAM Ihrer GPU passen.
Wie lädt Ollama Modelle auf mehrere GPUs?
Beim Laden eines neuen Modells vergleicht Ollama den erforderlichen VRAM für das Modell mit dem aktuell verfügbaren VRAM. Wenn das Modell vollständig auf eine einzelne GPU passt, lädt Ollama das Modell auf diese GPU. Dies bietet in der Regel die beste Leistung, da es die Menge an Daten reduziert, die während der Inferenz über den PCI-Bus übertragen werden muss. Wenn das Modell nicht vollständig auf eine einzelne GPU passt, wird es auf alle verfügbaren GPUs verteilt.
Wie kann ich Flash Attention aktivieren?
Flash Attention ist eine Funktion der meisten modernen Modelle, die den Speicherverbrauch bei wachsender Kontextgröße deutlich reduzieren kann. Ollama verwendet Flash Attention automatisch, wenn der ausgewählte Backend und die Geräte es unterstützen. Um Flash Attention zu erzwingen, setzen Sie beim Starten des Ollama-Servers die Umgebungsvariable OLLAMA_FLASH_ATTENTION=1. Um es zu deaktivieren, setzen Sie OLLAMA_FLASH_ATTENTION=0.
Wie kann ich den Quantisierungstyp für den K/V-Cache festlegen?
Der K/V-Kontext-Cache kann quantisiert werden, um den Speicherverbrauch bei aktiviertem Flash Attention deutlich zu reduzieren.
Um einen quantisierten K/V-Cache mit Ollama zu verwenden, können Sie die folgende Umgebungsvariable setzen:
OLLAMA_KV_CACHE_TYPE– Der Quantisierungstyp für den K/V-Cache. Standardwert istf16.
Hinweis
Dies ist derzeit eine globale Option – das bedeutet, alle Modelle werden mit dem angegebenen Quantisierungstyp ausgeführt.
Die derzeit verfügbaren K/V-Cache-Quantisierungstypen sind:
f16– Hohe Genauigkeit und Speicherverbrauch (Standard).q8_0– 8-Bit-Quantisierung, verbraucht etwa die Hälfte des Speichers vonf16bei einem sehr geringen Genauigkeitsverlust, dies hat in der Regel keine spürbare Auswirkung auf die Modellqualität (empfohlen, wenn nichtf16verwendet wird).q4_0– 4-Bit-Quantisierung, verbraucht etwa ein Viertel des Speichers vonf16bei einem kleinen bis mittleren Genauigkeitsverlust, der bei größeren Kontextgrößen stärker auffallen kann.
Wie stark die Cache-Quantisierung die Antwortqualität des Modells beeinflusst, hängt vom Modell und der Aufgabe ab. Modelle mit einer hohen GQA-Anzahl (z. B. Qwen2) können einen größeren Genauigkeitsverlust durch Quantisierung aufweisen als Modelle mit einer niedrigen GQA-Anzahl.
Möglicherweise müssen Sie mit verschiedenen Quantisierungstypen experimentieren, um das beste Gleichgewicht zwischen Speicherverbrauch und Qualität zu finden.
Wo finde ich meinen Ollama-öffentlichen Schlüssel?
Ihr Ollama-öffentlicher Schlüssel ist der öffentliche Teil des Schlüsselpaars, das es Ihrer lokalen Ollama-Instanz ermöglicht, mit ollama.com zu kommunizieren.
Sie benötigen ihn für:
- Modelle zu Ollama hochzuladen
- Private Modelle von Ollama auf Ihren Rechner herunterzuladen
- Modelle auszuführen, die in der Ollama Cloud gehostet sind
So fügen Sie den Schlüssel hinzu
Anmeldung über die Einstellungsseite in der Mac- und Windows-App
Anmeldung über die CLI
shell
ollama signin- Manuelles Kopieren und Einfügen des Schlüssels auf der Seite Ollama-Schlüssel: https://ollama.com/settings/keys
Wo der Ollama-öffentliche Schlüssel gespeichert ist
| OS | Pfad zu id_ed25519.pub |
|---|---|
| macOS | ~/.ollama/id_ed25519.pub |
| Linux | /usr/share/ollama/.ollama/id_ed25519.pub |
| Windows | C:\Users\<username>\.ollama\id_ed25519.pub |
Hinweis
Ersetzen Sie <username> durch Ihren tatsächlichen Windows-Benutzernamen.
Wie kann ich verhindern, dass Ollama beim Anmelden an meinem Rechner startet?
Ollama für Windows und macOS wird während der Installation als Anmeldeelement registriert. Sie können dies deaktivieren, wenn Sie nicht möchten, dass Ollama automatisch startet. Ollama behält diese Einstellung bei Upgrades bei, es sei denn, Sie deinstallieren die Anwendung.
Windows
- Öffnen Sie den
Task-Manager, wechseln Sie zur RegisterkarteStartprogramme, suchen Sie nachollamaund klicken Sie dann aufDeaktivieren
macOS
- Öffnen Sie
Einstellungenund suchen Sie nach „Anmeldeelemente“, suchen Sie den EintragOllamaunterIm Hintergrund zulassenund klicken Sie dann auf den Schieberegler, um ihn zu deaktivieren.