Die Kontextlänge ist die maximale Anzahl an Tokens, auf die das Modell im Speicher zugreifen kann.
Hinweis
Ollama verwendet standardmäßig die folgenden Kontextlängen, abhängig vom verfügbaren VRAM: - < 24 GiB VRAM: 4k Kontext - 24–48 GiB VRAM: 32k Kontext - ≥ 48 GiB VRAM: 256k Kontext
Aufgaben, die einen großen Kontext erfordern, wie Websuche, Agenten und Programmierwerkzeuge, sollten auf mindestens 64000 Tokens eingestellt werden.
Kontextlänge festlegen
Eine größere Kontextlänge erhöht den Speicherbedarf zum Ausführen eines Modells. Stellen Sie sicher, dass Sie genügend VRAM zur Verfügung haben, um die Kontextlänge zu erhöhen.
Cloud-Modelle werden standardmäßig auf ihre maximale Kontextlänge eingestellt.
App
Ändern Sie den Schieberegler in der Ollama-App unter den Einstellungen auf Ihre gewünschte Kontextlänge. 
CLI
Wenn die Bearbeitung der Kontextlänge für Ollama nicht möglich ist, kann die Kontextlänge auch beim Starten des Ollama-Servers aktualisiert werden.
OLLAMA_CONTEXT_LENGTH=64000 ollama serveZugewiesene Kontextlänge und Modell-Auslagerung überprüfen
Für die beste Leistung verwenden Sie die maximale Kontextlänge für ein Modell und vermeiden Sie die Auslagerung des Modells auf die CPU. Überprüfen Sie die Aufteilung unter PROCESSOR mit dem Befehl ollama ps.
ollama psNAME ID SIZE PROCESSOR CONTEXT UNTIL
gemma4:latest c6eb396dbd59 9.6 GB 100% GPU 131072 2 minutes from now