Bagaimana cara saya memperbarui Ollama?
Ollama di macOS dan Windows akan mengunduh pembaruan secara otomatis. Klik item di bilah tugas atau bilah menu, lalu klik "Restart to update" untuk menerapkan pembaruan. Pembaruan juga dapat diinstal dengan mengunduh versi terbaru secara manual.
Di Linux, jalankan ulang skrip instalasi:
shell
curl -fsSL https://ollama.com/install.sh | shBagaimana cara saya melihat log?
Tinjau dokumentasi Pemecahan Masalah untuk informasi lebih lanjut tentang penggunaan log.
Apakah GPU saya kompatibel dengan Ollama?
Silakan lihat dokumentasi GPU.
Bagaimana cara saya menentukan ukuran jendela konteks?
Secara default, Ollama menggunakan ukuran jendela konteks sebesar 4096 token.
Ini dapat diganti dengan variabel lingkungan OLLAMA_CONTEXT_LENGTH. Misalnya, untuk mengatur jendela konteks default menjadi 8K, gunakan:
shell
OLLAMA_CONTEXT_LENGTH=8192 ollama serveUntuk mengubah ini saat menggunakan ollama run, gunakan /set parameter:
shell
/set parameter num_ctx 4096Saat menggunakan API, tentukan parameter num_ctx:
shell
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Why is the sky blue?",
"options": {
"num_ctx": 4096
}
}'Bagaimana cara saya mengetahui apakah model saya dimuat ke GPU?
Gunakan perintah ollama ps untuk melihat model-model apa saja yang saat ini dimuat ke dalam memori.
shell
ollama psINFO
Output:
NAME ID SIZE PROCESSOR UNTIL
llama3:70b bcfb190ca3a7 42 GB 100% GPU 4 minutes from nowKolom Processor akan menunjukkan memori mana yang dimuat modelnya:
100% GPUberarti model dimuat sepenuhnya ke dalam GPU100% CPUberarti model dimuat sepenuhnya ke dalam memori sistem48%/52% CPU/GPUberarti model dimuat sebagian ke GPU dan sebagian ke memori sistem
Bagaimana cara saya mengonfigurasi server Ollama?
Server Ollama dapat dikonfigurasi dengan variabel lingkungan.
Menetapkan variabel lingkungan di Mac
Jika Ollama dijalankan sebagai aplikasi macOS, variabel lingkungan harus ditetapkan menggunakan launchctl:
Untuk setiap variabel lingkungan, panggil
launchctl setenv.bashlaunchctl setenv OLLAMA_HOST "0.0.0.0:11434"Mulai ulang aplikasi Ollama.
Menetapkan variabel lingkungan di Linux
Jika Ollama dijalankan sebagai layanan systemd, variabel lingkungan harus ditetapkan menggunakan systemctl:
Edit layanan systemd dengan memanggil
systemctl edit ollama.service. Ini akan membuka editor.Untuk setiap variabel lingkungan, tambahkan baris
Environmentdi bawah bagian[Service]:ini[Service] Environment="OLLAMA_HOST=0.0.0.0:11434"Simpan dan keluar.
Muat ulang
systemddan mulai ulang Ollama:shellsystemctl daemon-reload systemctl restart ollama
Menetapkan variabel lingkungan di Windows
Di Windows, Ollama mewarisi variabel lingkungan pengguna dan sistem Anda.
Pertama, keluar dari Ollama dengan mengkliknya di taskbar.
Buka Pengaturan (Windows 11) atau Panel Kontrol (Windows 10) dan cari variabel lingkungan.
Klik pada Edit variabel lingkungan untuk akun Anda.
Edit atau buat variabel baru untuk akun pengguna Anda untuk
OLLAMA_HOST,OLLAMA_MODELS, dll.Klik OK/Terapkan untuk menyimpan.
Buka aplikasi Ollama dari menu Start Windows.
Bagaimana cara saya menggunakan Ollama di belakang proxy?
Ollama menarik model-model dari Internet dan mungkin memerlukan server proxy untuk mengakses model-model tersebut. Gunakan HTTPS_PROXY untuk mengalihkan permintaan keluar melalui proxy. Pastikan sertifikat proxy terinstal sebagai sertifikat sistem. Lihat bagian di atas untuk cara menggunakan variabel lingkungan di platform Anda.
Note
Hindari menetapkan HTTP_PROXY. Ollama tidak menggunakan HTTP untuk pengambilan model, hanya HTTPS. Menetapkan HTTP_PROXY dapat mengganggu koneksi klien ke server.
Bagaimana cara saya menggunakan Ollama di belakang proxy di Docker?
Gambar kontainer Docker Ollama dapat dikonfigurasi untuk menggunakan proxy dengan meneruskan -e HTTPS_PROXY=https://proxy.example.com saat memulai kontainer.
Sebagai alternatif, daemon Docker dapat dikonfigurasi untuk menggunakan proxy. Instruksi tersedia untuk Docker Desktop di macOS, Windows, dan Linux, serta Docker daemon dengan systemd.
Pastikan sertifikat terinstal sebagai sertifikat sistem saat menggunakan HTTPS. Ini mungkin memerlukan gambar Docker baru saat menggunakan sertifikat yang ditandatangani sendiri.
dockerfile
FROM ollama/ollama
COPY my-ca.pem /usr/local/share/ca-certificates/my-ca.crt
RUN update-ca-certificatesBangun dan jalankan gambar ini:
shell
docker build -t ollama-with-ca .
docker run -d -e HTTPS_PROXY=https://my.proxy.example.com -p 11434:11434 ollama-with-caApakah Ollama mengirimkan prompt dan jawaban saya kembali ke ollama.com?
Ollama berjalan secara lokal. Kami tidak melihat prompt atau data Anda saat Anda menjalankannya secara lokal. Saat menggunakan model yang dihosting cloud, kami memproses prompt dan respons Anda untuk memberikan layanan tetapi tidak menyimpan atau mencatat konten tersebut dan tidak pernah melatih model dengan konten tersebut. Kami mengumpulkan informasi akun dasar dan metadata penggunaan terbatas untuk memberikan layanan yang tidak termasuk konten prompt atau respons. Kami tidak menjual data Anda. Anda dapat menghapus akun Anda kapan saja.
Bagaimana cara saya menonaktifkan fitur cloud Ollama?
Ollama dapat berjalan dalam mode hanya lokal dengan menonaktifkan fitur cloud Ollama. Dengan mematikan fitur cloud Ollama, Anda akan kehilangan kemampuan untuk menggunakan model cloud dan pencarian web Ollama.
Tetapkan disable_ollama_cloud di ~/.ollama/server.json:
json
{
"disable_ollama_cloud": true
}Anda juga dapat menetapkan variabel lingkungan:
shell
OLLAMA_NO_CLOUD=1Mulai ulang Ollama setelah mengubah konfigurasi. Setelah dinonaktifkan, log Ollama akan menampilkan Ollama cloud disabled: true.
Bagaimana cara saya mengekspos Ollama di jaringan saya?
Ollama mengikat 127.0.0.1 port 11434 secara default. Ubah alamat bind dengan variabel lingkungan OLLAMA_HOST.
Lihat bagian di atas untuk cara menetapkan variabel lingkungan di platform Anda.
Bagaimana cara saya menggunakan Ollama dengan server proxy?
Ollama menjalankan server HTTP dan dapat diekspos menggunakan server proxy seperti Nginx. Untuk melakukannya, konfigurasikan proxy untuk meneruskan permintaan dan secara opsional tetapkan header yang diperlukan (jika tidak mengekspos Ollama di jaringan). Misalnya, dengan Nginx:
nginx
server {
listen 80;
server_name example.com; # Ganti dengan domain atau IP Anda
location / {
proxy_pass http://localhost:11434;
proxy_set_header Host localhost:11434;
}
}Bagaimana cara saya menggunakan Ollama dengan ngrok?
Ollama dapat diakses menggunakan berbagai aplikasi tunneling. Misalnya dengan Ngrok:
shell
ngrok http 11434 --host-header="localhost:11434"Bagaimana cara saya menggunakan Ollama dengan Cloudflare Tunnel?
Untuk menggunakan Ollama dengan Cloudflare Tunnel, gunakan flag --url dan --http-host-header:
shell
cloudflared tunnel --url http://localhost:11434 --http-host-header="localhost:11434"Bagaimana cara saya mengizinkan asal web tambahan untuk mengakses Ollama?
Ollama mengizinkan permintaan lintas asal dari 127.0.0.1 dan 0.0.0.0 secara default. Asal tambahan dapat dikonfigurasi dengan OLLAMA_ORIGINS.
Untuk ekstensi browser, Anda perlu secara eksplisit mengizinkan pola asal ekstensi. Tetapkan OLLAMA_ORIGINS untuk menyertakan chrome-extension://*, moz-extension://*, dan safari-web-extension://* jika Anda ingin mengizinkan semua ekstensi browser mengakses, atau ekstensi tertentu sesuai kebutuhan:
# Izinkan semua ekstensi Chrome, Firefox, dan Safari
OLLAMA_ORIGINS=chrome-extension://*,moz-extension://*,safari-web-extension://* ollama serveLihat bagian di atas untuk cara menetapkan variabel lingkungan di platform Anda.
Di mana model-model disimpan?
- macOS:
~/.ollama/models - Linux:
/usr/share/ollama/.ollama/models - Windows:
C:\Users\%username%\.ollama\models
Bagaimana cara saya mengaturnya ke lokasi yang berbeda?
Jika direktori yang berbeda perlu digunakan, tetapkan variabel lingkungan OLLAMA_MODELS ke direktori yang dipilih.
Note
Di Linux menggunakan installer standar, pengguna ollama memerlukan akses baca dan tulis ke direktori yang ditentukan. Untuk menetapkan direktori ke pengguna ollama jalankan sudo chown -R ollama:ollama <directory>.
Lihat bagian di atas untuk cara menetapkan variabel lingkungan di platform Anda.
Bagaimana cara saya menggunakan Ollama di Visual Studio Code?
Sudah ada koleksi besar plugin yang tersedia untuk VS Code serta editor lain yang memanfaatkan Ollama. Lihat daftar ekstensi & plugin di bagian bawah readme repositori utama.
Bagaimana cara saya menggunakan Ollama dengan akselerasi GPU di Docker?
Kontainer Docker Ollama dapat dikonfigurasi dengan akselerasi GPU di Linux atau Windows (dengan WSL2). Ini memerlukan nvidia-container-toolkit. Lihat ollama/ollama untuk detail lebih lanjut.
Akselerasi GPU tidak tersedia untuk Docker Desktop di macOS karena kurangnya passthrough GPU dan emulasi.
Mengapa jaringan lambat di WSL2 pada Windows 10?
Ini dapat mempengaruhi baik penginstalan Ollama maupun pengunduhan model.
Buka Control Panel > Networking and Internet > View network status and tasks dan klik Change adapter settings di panel kiri. Temukan adaptor vEthernet (WSL), klik kanan dan pilih Properties. Klik Configure dan buka tab Advanced. Cari melalui setiap properti hingga Anda menemukan Large Send Offload Version 2 (IPv4) dan Large Send Offload Version 2 (IPv6). Nonaktifkan kedua properti ini.
Bagaimana cara saya memuat sebelumnya model ke Ollama untuk mendapatkan waktu respons yang lebih cepat?
Jika Anda menggunakan API, Anda dapat memuat sebelumnya model dengan mengirimkan permintaan kosong ke server Ollama. Ini berfungsi dengan kedua endpoint API /api/generate dan /api/chat.
Untuk memuat sebelumnya model mistral menggunakan endpoint generate, gunakan:
shell
curl http://localhost:11434/api/generate -d '{"model": "mistral"}'Untuk menggunakan endpoint chat completions, gunakan:
shell
curl http://localhost:11434/api/chat -d '{"model": "mistral"}'Untuk memuat sebelumnya model menggunakan CLI, gunakan perintah:
shell
ollama run llama3.2 ""Bagaimana cara saya menjaga model tetap dimuat di memori atau membuatnya segera dibongkar?
Secara default, model-model disimpan di memori selama 5 menit sebelum dibongkar. Ini memungkinkan waktu respons yang lebih cepat jika Anda membuat banyak permintaan ke LLM. Jika Anda ingin segera membongkar model dari memori, gunakan perintah ollama stop:
shell
ollama stop llama3.2Jika Anda menggunakan API, gunakan parameter keep_alive dengan endpoint /api/generate dan /api/chat untuk mengatur jumlah waktu model tetap berada di memori. Parameter keep_alive dapat ditetapkan ke:
- string durasi (seperti "10m" atau "24h")
- angka dalam detik (seperti 3600)
- angka negatif apa pun yang akan menjaga model tetap dimuat di memori (misalnya -1 atau "-1m")
- '0' yang akan membongkar model segera setelah menghasilkan respons
Misalnya, untuk memuat sebelumnya model dan membiarkannya tetap di memori, gunakan:
shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'Untuk membongkar model dan membebaskan memori, gunakan:
shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": 0}'Sebagai alternatif, Anda dapat mengubah jumlah waktu semua model dimuat ke dalam memori dengan menetapkan variabel lingkungan OLLAMA_KEEP_ALIVE saat memulai server Ollama. Variabel OLLAMA_KEEP_ALIVE menggunakan jenis parameter yang sama dengan jenis parameter keep_alive yang disebutkan di atas. Lihat bagian yang menjelaskan cara mengonfigurasi server Ollama untuk menetapkan variabel lingkungan dengan benar.
Parameter API keep_alive dengan endpoint /api/generate dan /api/chat akan mengganti pengaturan OLLAMA_KEEP_ALIVE.
Bagaimana cara saya mengelola jumlah maksimum permintaan yang dapat diantrekan server Ollama?
Jika terlalu banyak permintaan dikirim ke server, server akan merespons dengan kesalahan 503 yang menunjukkan server kelebihan beban. Anda dapat menyesuaikan berapa banyak permintaan yang dapat diantrekan dengan menetapkan OLLAMA_MAX_QUEUE.
Bagaimana Ollama menangani permintaan bersamaan?
Ollama mendukung dua tingkat pemrosesan bersamaan. Jika sistem Anda memiliki memori yang cukup tersedia (memori sistem saat menggunakan inferensi CPU, atau VRAM untuk inferensi GPU) maka beberapa model dapat dimuat secara bersamaan. Untuk model tertentu, jika ada memori yang cukup tersedia saat model dimuat, model tersebut dikonfigurasi untuk memungkinkan pemrosesan permintaan paralel.
Jika memori yang tersedia tidak cukup untuk memuat permintaan model baru sementara satu atau lebih model sudah dimuat, semua permintaan baru akan diantrekan hingga model baru dapat dimuat. Saat model-model sebelumnya menjadi menganggur, satu atau lebih akan dibongkar untuk membuat ruang untuk model baru. Permintaan yang diantrekan akan diproses sesuai urutan. Saat menggunakan inferensi GPU, model-model baru harus dapat sepenuhnya muat di VRAM untuk memungkinkan pemuatan model bersamaan.
Pemrosesan permintaan paralel untuk model tertentu menghasilkan peningkatan ukuran konteks dengan jumlah permintaan paralel. Misalnya, konteks 2K dengan 4 permintaan paralel akan menghasilkan konteks 8K dan alokasi memori tambahan.
Pengaturan server berikut dapat digunakan untuk menyesuaikan cara Ollama menangani permintaan bersamaan di sebagian besar platform:
OLLAMA_MAX_LOADED_MODELS- Jumlah maksimum model yang dapat dimuat secara bersamaan asalkan muat di memori yang tersedia. Defaultnya adalah 3 * jumlah GPU atau 3 untuk inferensi CPU.OLLAMA_NUM_PARALLEL- Jumlah maksimum permintaan paralel yang setiap model akan proses secara bersamaan, default 1. RAM yang diperlukan akan berkala denganOLLAMA_NUM_PARALLEL*OLLAMA_CONTEXT_LENGTH.OLLAMA_MAX_QUEUE- Jumlah maksimum permintaan yang akan diantrekan Ollama saat sibuk sebelum menolak permintaan tambahan. Defaultnya adalah 512
Catatan: Windows dengan GPU Radeon saat ini default ke 1 model maksimum karena keterbatasan dalam pelaporan VRAM yang tersedia di ROCm v5.7. Setelah ROCm v6.2 tersedia, Windows Radeon akan mengikuti default di atas. Anda dapat mengaktifkan pemuatan model bersamaan di Radeon di Windows, tetapi pastikan Anda tidak memuat lebih banyak model daripada yang muat di VRAM GPU Anda.
Bagaimana Ollama memuat model pada beberapa GPU?
Saat memuat model baru, Ollama mengevaluasi VRAM yang diperlukan untuk model tersebut terhadap VRAM yang saat ini tersedia. Jika model akan sepenuhnya muat di GPU mana pun, Ollama akan memuat model di GPU tersebut. Ini biasanya memberikan kinerja terbaik karena mengurangi jumlah data yang ditransfer di sepanjang bus PCI selama inferensi. Jika model tidak muat sepenuhnya di satu GPU, maka model akan disebar di semua GPU yang tersedia.
Bagaimana cara mengaktifkan Flash Attention?
Flash Attention adalah fitur pada sebagian besar model modern yang dapat secara signifikan mengurangi penggunaan memori seiring bertambahnya ukuran konteks. Ollama menggunakan Flash Attention secara otomatis ketika backend dan perangkat yang dipilih mendukungnya. Untuk memaksa mengaktifkan Flash Attention, atur OLLAMA_FLASH_ATTENTION=1 saat memulai server Ollama. Untuk menonaktifkannya, atur OLLAMA_FLASH_ATTENTION=0.
Bagaimana cara mengatur jenis kuantisasi untuk cache K/V?
Cache konteks K/V dapat dikuantisasi untuk secara signifikan mengurangi penggunaan memori ketika Flash Attention diaktifkan.
Untuk menggunakan cache K/V yang dikuantisasi dengan Ollama, Anda dapat mengatur variabel lingkungan berikut:
OLLAMA_KV_CACHE_TYPE- Jenis kuantisasi untuk cache K/V. Nilai default adalahf16.
Catatan
Saat ini ini adalah opsi global - artinya semua model akan berjalan dengan jenis kuantisasi yang ditentukan.
Jenis kuantisasi cache K/V yang saat ini tersedia adalah:
f16- presisi tinggi dan penggunaan memori tinggi (default).q8_0- kuantisasi 8-bit, menggunakan sekitar 1/2 memori darif16dengan kehilangan presisi yang sangat kecil, biasanya ini tidak memiliki dampak yang terlihat pada kualitas model (disarankan jika tidak menggunakan f16).q4_0- kuantisasi 4-bit, menggunakan sekitar 1/4 memori darif16dengan kehilangan presisi kecil-menengah yang mungkin lebih terlihat pada ukuran konteks yang lebih tinggi.
Seberapa besar kuantisasi cache mempengaruhi kualitas respons model akan tergantung pada model dan tugasnya. Model yang memiliki jumlah GQA tinggi (misalnya Qwen2) mungkin melihat dampak yang lebih besar pada presisi dari kuantisasi dibandingkan model dengan jumlah GQA rendah.
Anda mungkin perlu melakukan eksperimen dengan jenis kuantisasi yang berbeda untuk menemukan keseimbangan terbaik antara penggunaan memori dan kualitas.
Di mana saya dapat menemukan Kunci Publik Ollama saya?
Kunci Publik Ollama Anda adalah bagian publik dari pasangan kunci yang memungkinkan instance Ollama lokal Anda berkomunikasi dengan ollama.com.
Anda akan membutuhkannya untuk:
- Mendorong model ke Ollama
- Menarik model pribadi dari Ollama ke mesin Anda
- Menjalankan model yang dihosting di Ollama Cloud
Cara Menambahkan Kunci
Masuk melalui halaman Pengaturan di Aplikasi Mac dan Windows
Masuk melalui CLI
shell
ollama signin- Salin dan tempel secara manual kunci di halaman Kunci Ollama: https://ollama.com/settings/keys
Di mana Kunci Publik Ollama berada
| Sistem Operasi | Jalur ke id_ed25519.pub |
|---|---|
| macOS | ~/.ollama/id_ed25519.pub |
| Linux | /usr/share/ollama/.ollama/id_ed25519.pub |
| Windows | C:\Users\<username>\.ollama\id_ed25519.pub |
Catatan
Ganti <username> dengan nama pengguna Windows Anda yang sebenarnya.
Bagaimana cara menghentikan Ollama dari memulai saat saya masuk ke komputer saya?
Ollama untuk Windows dan macOS terdaftar sebagai item login selama instalasi. Anda dapat menonaktifkannya jika Anda lebih suka Ollama tidak dimulai secara otomatis. Ollama akan mempertahankan pengaturan ini across peningkatan, kecuali Anda menghapus aplikasi.
Windows
- Di
Task Manager, buka tabStartup apps, cariollamalalu klikDisable
MacOS
- Buka
Settingsdan cari "Login Items", temukan entriOllamadi bawahAllow in the Background, lalu klik slider untuk menonaktifkan.