O comprimento do contexto é o número máximo de tokens que o modelo pode acessar na memória.
Nota
O Ollama usa por padrão os seguintes comprimentos de contexto com base na VRAM: - < 24 GiB de VRAM: contexto de 4k - 24-48 GiB de VRAM: contexto de 32k - >= 48 GiB de VRAM: contexto de 256k
Tarefas que exigem um contexto grande, como busca na web, agentes e ferramentas de codificação, devem ser configuradas com pelo menos 64000 tokens.
Definindo o comprimento do contexto
Definir um comprimento de contexto maior aumentará a quantidade de memória necessária para executar um modelo. Certifique-se de ter VRAM suficiente disponível para aumentar o comprimento do contexto.
Modelos de nuvem são configurados com o comprimento de contexto máximo por padrão.
Aplicativo
Altere o controle deslizante nas configurações do aplicativo Ollama para o comprimento de contexto desejado. 
CLI
Se não for possível editar o comprimento de contexto do Ollama, ele também pode ser atualizado ao executar o serviço do Ollama.
OLLAMA_CONTEXT_LENGTH=64000 ollama serveVerificar o comprimento de contexto alocado e o descarregamento do modelo
Para obter o melhor desempenho, use o comprimento de contexto máximo para um modelo e evite descarregar o modelo para a CPU. Verifique a divisão em PROCESSOR usando ollama ps.
ollama psNAME ID SIZE PROCESSOR CONTEXT UNTIL
gemma4:latest c6eb396dbd59 9.6 GB 100% GPU 131072 2 minutes from now