Skip to content

Contextlengte is het maximum aantal tokens waar het model toegang toe heeft in het geheugen.

Opmerking

Ollama gebruikt standaard de volgende contextlengtes op basis van VRAM: - < 24 GiB VRAM: 4k contextlengte - 24-48 GiB VRAM: 32k contextlengte - >= 48 GiB VRAM: 256k contextlengte

Taken die een grote contextlengte vereisen, zoals webzoekopdrachten, agenten en codeertools, moeten minimaal op 64000 tokens worden ingesteld.

Contextlengte instellen

Een grotere contextlengte instellen vergroot de hoeveelheid geheugen die nodig is om een model uit te voeren. Zorg dat u voldoende VRAM beschikbaar heeft om de contextlengte te verhogen.

Cloudmodellen worden standaard ingesteld op hun maximale contextlengte.

App

Verplaats de schuifregelaar in de Ollama-app onder Instellingen naar de gewenste contextlengte. Contextlengte in de Ollama-app

CLI

Als het niet mogelijk is om de contextlengte van Ollama te bewerken, kan de contextlengte ook worden bijgewerkt wanneer u Ollama bedient.

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

Toegewezen contextlengte en model-offloading controleren

Voor de beste prestaties gebruikt u de maximale contextlengte voor een model en vermijdt u het model naar de CPU te offloaden. Controleer de verdeling onder PROCESSOR met ollama ps.

ollama ps
NAME             ID              SIZE      PROCESSOR    CONTEXT    UNTIL
gemma4:latest    c6eb396dbd59    9.6 GB    100% GPU     131072     2 minutes from now