Skip to content

コンテキスト長とは、モデルがメモリ上でアクセスできるトークンの最大数です。

Note

OllamaはVRAMに応じて以下のコンテキスト長をデフォルトとしています: - < 24 GiBのVRAM:4kコンテキスト - 24-48 GiBのVRAM:32kコンテキスト - >= 48 GiBのVRAM:256kコンテキスト

ウェブ検索、エージェント、コーディングツールなど、大規模なコンテキストを必要とするタスクは、少なくとも64000トークンに設定する必要があります。

コンテキスト長の設定

コンテキスト長を大きくすると、モデルの実行に必要なメモリ量が増加します。コンテキスト長を増やす前に、十分なVRAMが利用可能であることを確認してください。

クラウドモデルはデフォルトで最大コンテキスト長に設定されています。

アプリ

Ollamaアプリの設定にあるスライダーを希望のコンテキスト長に変更してください。 Ollamaアプリでのコンテキスト長

CLI

Ollamaのコンテキスト長を編集できない場合は、Ollamaを実行する際にコンテキスト長を更新することもできます。

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

割り当てられたコンテキスト長とモデルのオフロードの確認

最高のパフォーマンスを得るには、モデルの最大コンテキスト長を使用し、モデルをCPUにオフロードしないでください。ollama ps を使用して PROCESSOR の下の分割を確認してください。

ollama ps
NAME             ID              SIZE      PROCESSOR    CONTEXT    UNTIL
gemma4:latest    c6eb396dbd59    9.6 GB    100% GPU     131072     2 minutes from now