上下文长度是模型在内存中可以访问的最大 Token 数量。
注意
Ollama 根据显存(VRAM)默认采用以下上下文长度: - < 24 GiB 显存:4k 上下文 - 24-48 GiB 显存:32k 上下文 - >= 48 GiB 显存:256k 上下文
需要大上下文的任务(如网页搜索、智能体和编码工具)应设置为至少 64000 个 Token。
设置上下文长度
设置更大的上下文长度将增加运行模型所需的内存量。请确保您有足够的显存(VRAM)来增加上下文长度。
云端模型默认设置为其最大上下文长度。
App
在 Ollama 应用的设置中,将滑块更改为您所需的上下文长度。 
CLI
如果无法直接修改 Ollama 的上下文长度,也可以在启动服务时更新上下文长度。
OLLAMA_CONTEXT_LENGTH=64000 ollama serve检查分配的上下文长度和模型卸载
为了获得最佳性能,请使用模型的最大上下文长度,并避免将模型卸载到 CPU。使用 ollama ps 命令验证 PROCESSOR 下的分配情况。
ollama psNAME ID SIZE PROCESSOR CONTEXT UNTIL
gemma4:latest c6eb396dbd59 9.6 GB 100% GPU 131072 2 minutes from now