Skip to content

上下文长度是模型在内存中可以访问的最大 Token 数量。

注意

Ollama 根据显存(VRAM)默认采用以下上下文长度: - < 24 GiB 显存:4k 上下文 - 24-48 GiB 显存:32k 上下文 - >= 48 GiB 显存:256k 上下文

需要大上下文的任务(如网页搜索、智能体和编码工具)应设置为至少 64000 个 Token。

设置上下文长度

设置更大的上下文长度将增加运行模型所需的内存量。请确保您有足够的显存(VRAM)来增加上下文长度。

云端模型默认设置为其最大上下文长度。

App

在 Ollama 应用的设置中,将滑块更改为您所需的上下文长度。 Context length in Ollama app

CLI

如果无法直接修改 Ollama 的上下文长度,也可以在启动服务时更新上下文长度。

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

检查分配的上下文长度和模型卸载

为了获得最佳性能,请使用模型的最大上下文长度,并避免将模型卸载到 CPU。使用 ollama ps 命令验证 PROCESSOR 下的分配情况。

ollama ps
NAME             ID              SIZE      PROCESSOR    CONTEXT    UNTIL
gemma4:latest    c6eb396dbd59    9.6 GB    100% GPU     131072     2 minutes from now