Skip to content

Panjang konteks adalah jumlah maksimum token yang dapat diakses model di dalam memori.

Catatan

Ollama secara default menggunakan panjang konteks berikut berdasarkan VRAM: - < 24 GiB VRAM: 4k konteks - 24-48 GiB VRAM: 32k konteks - ≥ 48 GiB VRAM: 256k konteks

Tugas yang memerlukan konteks besar seperti pencarian web, agen, dan alat pemrograman harus diatur ke setidaknya 64000 token.

Mengatur panjang konteks

Mengatur panjang konteks yang lebih besar akan meningkatkan jumlah memori yang diperlukan untuk menjalankan model. Pastikan Anda memiliki cukup VRAM yang tersedia untuk meningkatkan panjang konteks.

Model cloud secara default diatur ke panjang konteks maksimum mereka.

Aplikasi

Ubah slider di aplikasi Ollama pada bagian pengaturan ke panjang konteks yang Anda inginkan. Panjang konteks di aplikasi Ollama

CLI

Jika pengeditan panjang konteks untuk Ollama tidak memungkinkan, panjang konteks juga dapat diperbarui saat menjalankan layanan Ollama.

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

Periksa panjang konteks yang dialokasikan dan pemindahan model

Untuk performa terbaik, gunakan panjang konteks maksimum untuk sebuah model, dan hindari memindahkan model ke CPU. Verifikasi pembagian di bawah PROCESSOR menggunakan ollama ps.

ollama ps
NAME             ID              SIZE      PROCESSOR    CONTEXT    UNTIL
gemma4:latest    c6eb396dbd59    9.6 GB    100% GPU     131072     2 minutes from now