Panjang konteks adalah jumlah maksimum token yang dapat diakses model di dalam memori.
Catatan
Ollama secara default menggunakan panjang konteks berikut berdasarkan VRAM: - < 24 GiB VRAM: 4k konteks - 24-48 GiB VRAM: 32k konteks - ≥ 48 GiB VRAM: 256k konteks
Tugas yang memerlukan konteks besar seperti pencarian web, agen, dan alat pemrograman harus diatur ke setidaknya 64000 token.
Mengatur panjang konteks
Mengatur panjang konteks yang lebih besar akan meningkatkan jumlah memori yang diperlukan untuk menjalankan model. Pastikan Anda memiliki cukup VRAM yang tersedia untuk meningkatkan panjang konteks.
Model cloud secara default diatur ke panjang konteks maksimum mereka.
Aplikasi
Ubah slider di aplikasi Ollama pada bagian pengaturan ke panjang konteks yang Anda inginkan. 
CLI
Jika pengeditan panjang konteks untuk Ollama tidak memungkinkan, panjang konteks juga dapat diperbarui saat menjalankan layanan Ollama.
OLLAMA_CONTEXT_LENGTH=64000 ollama servePeriksa panjang konteks yang dialokasikan dan pemindahan model
Untuk performa terbaik, gunakan panjang konteks maksimum untuk sebuah model, dan hindari memindahkan model ke CPU. Verifikasi pembagian di bawah PROCESSOR menggunakan ollama ps.
ollama psNAME ID SIZE PROCESSOR CONTEXT UNTIL
gemma4:latest c6eb396dbd59 9.6 GB 100% GPU 131072 2 minutes from now