Skip to content

Contextlengte is het maximum aantal tokens waar het model toegang toe heeft in het geheugen.

Opmerking

Ollama gebruikt standaard de volgende contextlengtes op basis van VRAM: - < 24 GiB VRAM: 4k contextlengte - 24-48 GiB VRAM: 32k contextlengte - >= 48 GiB VRAM: 256k contextlengte

Taken die een grote contextlengte vereisen, zoals webzoekopdrachten, agenten en codeertools, moeten minimaal op 64000 tokens worden ingesteld.

Contextlengte instellen ​

Een grotere contextlengte instellen vergroot de hoeveelheid geheugen die nodig is om een model uit te voeren. Zorg dat u voldoende VRAM beschikbaar heeft om de contextlengte te verhogen.

Cloudmodellen worden standaard ingesteld op hun maximale contextlengte.

App ​

Verplaats de schuifregelaar in de Ollama-app onder Instellingen naar de gewenste contextlengte. Contextlengte in de Ollama-app

CLI ​

Als het niet mogelijk is om de contextlengte van Ollama te bewerken, kan de contextlengte ook worden bijgewerkt wanneer u Ollama bedient.

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

Toegewezen contextlengte en model-offloading controleren ​

Voor de beste prestaties gebruikt u de maximale contextlengte voor een model en vermijdt u het model naar de CPU te offloaden. Controleer de verdeling onder PROCESSOR met ollama ps.

ollama ps
NAME             ID              SIZE      PROCESSOR    CONTEXT    UNTIL
gemma4:latest    c6eb396dbd59    9.6 GB    100% GPU     131072     2 minutes from now