Skip to content

O comprimento do contexto é o número máximo de tokens que o modelo pode acessar na memória.

Nota

O Ollama usa por padrão os seguintes comprimentos de contexto com base na VRAM: - < 24 GiB de VRAM: contexto de 4k - 24-48 GiB de VRAM: contexto de 32k - >= 48 GiB de VRAM: contexto de 256k

Tarefas que exigem um contexto grande, como busca na web, agentes e ferramentas de codificação, devem ser configuradas com pelo menos 64000 tokens.

Definindo o comprimento do contexto

Definir um comprimento de contexto maior aumentará a quantidade de memória necessária para executar um modelo. Certifique-se de ter VRAM suficiente disponível para aumentar o comprimento do contexto.

Modelos de nuvem são configurados com o comprimento de contexto máximo por padrão.

Aplicativo

Altere o controle deslizante nas configurações do aplicativo Ollama para o comprimento de contexto desejado. Comprimento do contexto no aplicativo Ollama

CLI

Se não for possível editar o comprimento de contexto do Ollama, ele também pode ser atualizado ao executar o serviço do Ollama.

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

Verificar o comprimento de contexto alocado e o descarregamento do modelo

Para obter o melhor desempenho, use o comprimento de contexto máximo para um modelo e evite descarregar o modelo para a CPU. Verifique a divisão em PROCESSOR usando ollama ps.

ollama ps
NAME             ID              SIZE      PROCESSOR    CONTEXT    UNTIL
gemma4:latest    c6eb396dbd59    9.6 GB    100% GPU     131072     2 minutes from now