Skip to content

Die Kontextlänge ist die maximale Anzahl an Tokens, auf die das Modell im Speicher zugreifen kann.

Hinweis

Ollama verwendet standardmäßig die folgenden Kontextlängen, abhängig vom verfügbaren VRAM: - < 24 GiB VRAM: 4k Kontext - 24–48 GiB VRAM: 32k Kontext - ≥ 48 GiB VRAM: 256k Kontext

Aufgaben, die einen großen Kontext erfordern, wie Websuche, Agenten und Programmierwerkzeuge, sollten auf mindestens 64000 Tokens eingestellt werden.

Kontextlänge festlegen

Eine größere Kontextlänge erhöht den Speicherbedarf zum Ausführen eines Modells. Stellen Sie sicher, dass Sie genügend VRAM zur Verfügung haben, um die Kontextlänge zu erhöhen.

Cloud-Modelle werden standardmäßig auf ihre maximale Kontextlänge eingestellt.

App

Ändern Sie den Schieberegler in der Ollama-App unter den Einstellungen auf Ihre gewünschte Kontextlänge. Kontextlänge in der Ollama-App

CLI

Wenn die Bearbeitung der Kontextlänge für Ollama nicht möglich ist, kann die Kontextlänge auch beim Starten des Ollama-Servers aktualisiert werden.

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

Zugewiesene Kontextlänge und Modell-Auslagerung überprüfen

Für die beste Leistung verwenden Sie die maximale Kontextlänge für ein Modell und vermeiden Sie die Auslagerung des Modells auf die CPU. Überprüfen Sie die Aufteilung unter PROCESSOR mit dem Befehl ollama ps.

ollama ps
NAME             ID              SIZE      PROCESSOR    CONTEXT    UNTIL
gemma4:latest    c6eb396dbd59    9.6 GB    100% GPU     131072     2 minutes from now