コンテキスト長とは、モデルがメモリ上でアクセスできるトークンの最大数です。
Note
OllamaはVRAMに応じて以下のコンテキスト長をデフォルトとしています: - < 24 GiBのVRAM:4kコンテキスト - 24-48 GiBのVRAM:32kコンテキスト - >= 48 GiBのVRAM:256kコンテキスト
ウェブ検索、エージェント、コーディングツールなど、大規模なコンテキストを必要とするタスクは、少なくとも64000トークンに設定する必要があります。
コンテキスト長の設定
コンテキスト長を大きくすると、モデルの実行に必要なメモリ量が増加します。コンテキスト長を増やす前に、十分なVRAMが利用可能であることを確認してください。
クラウドモデルはデフォルトで最大コンテキスト長に設定されています。
アプリ
Ollamaアプリの設定にあるスライダーを希望のコンテキスト長に変更してください。 
CLI
Ollamaのコンテキスト長を編集できない場合は、Ollamaを実行する際にコンテキスト長を更新することもできます。
OLLAMA_CONTEXT_LENGTH=64000 ollama serve割り当てられたコンテキスト長とモデルのオフロードの確認
最高のパフォーマンスを得るには、モデルの最大コンテキスト長を使用し、モデルをCPUにオフロードしないでください。ollama ps を使用して PROCESSOR の下の分割を確認してください。
ollama psNAME ID SIZE PROCESSOR CONTEXT UNTIL
gemma4:latest c6eb396dbd59 9.6 GB 100% GPU 131072 2 minutes from now