Contextlengte is het maximum aantal tokens waar het model toegang toe heeft in het geheugen.
Opmerking
Ollama gebruikt standaard de volgende contextlengtes op basis van VRAM: - < 24 GiB VRAM: 4k contextlengte - 24-48 GiB VRAM: 32k contextlengte - >= 48 GiB VRAM: 256k contextlengte
Taken die een grote contextlengte vereisen, zoals webzoekopdrachten, agenten en codeertools, moeten minimaal op 64000 tokens worden ingesteld.
Contextlengte instellen
Een grotere contextlengte instellen vergroot de hoeveelheid geheugen die nodig is om een model uit te voeren. Zorg dat u voldoende VRAM beschikbaar heeft om de contextlengte te verhogen.
Cloudmodellen worden standaard ingesteld op hun maximale contextlengte.
App
Verplaats de schuifregelaar in de Ollama-app onder Instellingen naar de gewenste contextlengte. 
CLI
Als het niet mogelijk is om de contextlengte van Ollama te bewerken, kan de contextlengte ook worden bijgewerkt wanneer u Ollama bedient.
OLLAMA_CONTEXT_LENGTH=64000 ollama serveToegewezen contextlengte en model-offloading controleren
Voor de beste prestaties gebruikt u de maximale contextlengte voor een model en vermijdt u het model naar de CPU te offloaden. Controleer de verdeling onder PROCESSOR met ollama ps.
ollama psNAME ID SIZE PROCESSOR CONTEXT UNTIL
gemma4:latest c6eb396dbd59 9.6 GB 100% GPU 131072 2 minutes from now