ฉันจะอัปเกรด Ollama ได้อย่างไร?
Ollama บน macOS และ Windows จะดาวน์โหลดอัปเดตโดยอัตโนมัติ คลิกที่ไอคอนบนแถบงานหรือแถบเมนู จากนั้นคลิก "Restart to update" เพื่อใช้งานอัปเดต นอกจากนี้ คุณยังสามารถติดตั้งอัปเดตได้ด้วยการดาวน์โหลดเวอร์ชันล่าสุด ด้วยตนเอง.
บน Linux ให้รันสคริปต์ติดตั้งอีกครั้ง:
shell
curl -fsSL https://ollama.com/install.sh | shฉันจะดูบันทึกระบบได้อย่างไร?
กรุณาดูเอกสาร การแก้ไขปัญหา เพื่อเรียนรู้เพิ่มเติมเกี่ยวกับการใช้งานบันทึกระบบ
การ์ด GPU ของฉันเข้ากันได้กับ Ollama หรือไม่?
กรุณาดูเอกสาร เกี่ยวกับ GPU
ฉันจะกำหนดขนาดหน้าต่างบริบทได้อย่างไร?
โดยค่าเริ่มต้น Ollama จะใช้ขนาดหน้าต่างบริบท 4096 โทเค็น
สามารถแทนค่านี้ได้ด้วยตัวแปรสภาพแวดล้อม OLLAMA_CONTEXT_LENGTH ตัวอย่างเช่น หากต้องการตั้งค่าหน้าต่างบริบทเริ่มต้นเป็น 8K ให้ใช้:
shell
OLLAMA_CONTEXT_LENGTH=8192 ollama serveหากต้องการเปลี่ยนค่านี้เมื่อใช้งาน ollama run ให้ใช้คำสั่ง /set parameter:
shell
/set parameter num_ctx 4096เมื่อใช้งาน API ให้ระบุพารามิเตอร์ num_ctx:
shell
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Why is the sky blue?",
"options": {
"num_ctx": 4096
}
}'ฉันจะรู้ได้อย่างไรว่ามอเดลของฉันถูกโหลดเข้า GPU แล้ว?
ใช้คำสั่ง ollama ps เพื่อดูว่ามอเดลใดกำลังโหลดอยู่ในหน่วยความจำอยู่ในปัจจุบัน
shell
ollama psINFO
เอาต์พุต:
NAME ID SIZE PROCESSOR UNTIL
llama3:70b bcfb190ca3a7 42 GB 100% GPU 4 minutes from nowคอลัมน์ Processor จะแสดงว่ามอเดลถูกโหลดเข้าในหน่วยความจำประเภทใด:
100% GPUหมายถึง มอเดลถูกโหลดเข้า GPU ทั้งหมด100% CPUหมายถึง มอเดลถูกโหลดเข้าในหน่วยความจำของระบบทั้งหมด48%/52% CPU/GPUหมายถึง มอเดลถูกโหลดแยกส่วนทั้งบน GPU และหน่วยความจำของระบบ
ฉันจะกำหนดค่าเซิร์ฟเวอร์ Ollama ได้อย่างไร?
สามารถกำหนดค่าเซิร์ฟเวอร์ Ollama ด้วยตัวแปรสภาพแวดล้อมได้
การตั้งค่าตัวแปรสภาพแวดล้อมบน Mac
หาก Ollama ทำงานเป็นแอปพลิเคชัน macOS ควรตั้งค่าตัวแปรสภาพแวดล้อมด้วย launchctl:
สำหรับแต่ละตัวแปรสภาพแวดล้อม ให้เรียกใช้
launchctl setenvbashlaunchctl setenv OLLAMA_HOST "0.0.0.0:11434"รีสตาร์ทแอปพลิเคชัน Ollama
การตั้งค่าตัวแปรสภาพแวดล้อมบน Linux
หาก Ollama ทำงานเป็นบริการ systemd ควรตั้งค่าตัวแปรสภาพแวดล้อมด้วย systemctl:
แก้ไขบริการ systemd โดยเรียกใช้
systemctl edit ollama.serviceคำสั่งนี้จะเปิดตัวแก้ไขข้อความขึ้นมาสำหรับแต่ละตัวแปรสภาพแวดล้อม ให้เพิ่มบรรทัด
Environmentภายใต้ส่วน[Service]:ini[Service] Environment="OLLAMA_HOST=0.0.0.0:11434"บันทึกและออกจากตัวแก้ไข
รีโหลด
systemdและรีสตาร์ท Ollama:shellsystemctl daemon-reload systemctl restart ollama
การตั้งค่าตัวแปรสภาพแวดล้อมบน Windows
บน Windows Ollama จะสืบทอดตัวแปรสภาพแวดล้อมของผู้ใช้และระบบของคุณ
ก่อนอื่นให้ออกจาก Ollama โดยคลิกที่ไอคอนในแถบงาน
เปิดแอปพลิเคชัน Settings (สำหรับ Windows 11) หรือ Control Panel (สำหรับ Windows 10) แล้วค้นหาสำหรับ ตัวแปรสภาพแวดล้อม
คลิกที่ แก้ไขตัวแปรสภาพแวดล้อมสำหรับบัญชีของคุณ
แก้ไขหรือสร้างตัวแปรใหม่สำหรับบัญชีผู้ใช้ของคุณสำหรับ
OLLAMA_HOST,OLLAMA_MODELSและอื่นๆคลิก OK/Apply เพื่อบันทึก
เปิดแอปพลิเคชัน Ollama จากเมนู Start ของ Windows
ฉันจะใช้งาน Ollama อยู่หลังพร็อกซีเซิร์ฟเวอร์ได้อย่างไร?
Ollama ดึงมอเดลจากอินเทอร์เน็ตและอาจต้องการพร็อกซีเซิร์ฟเวอร์เพื่อเข้าถึงมอเดลเหล่านี้ ใช้ HTTPS_PROXY เพื่อเปลี่ยนเส้นทางคำขอขาออกผ่านพร็อกซี ตรวจสอบให้แน่ใจว่าสertificate ของพร็อกซีถูกติดตั้งเป็น certificate ของระบบแล้ว กรุณาดูส่วนด้านบนเพื่อเรียนรู้วิธีตั้งค่าตัวแปรสภาพแวดล้อมบนแพลตฟอร์มของคุณ
ข้อควรระวัง
หลีกเลี่ยงการตั้งค่า HTTP_PROXY Ollama ไม่ใช้ HTTP สำหรับการดึงมอเดล แต่ใช้ HTTPS เท่านั้น การตั้งค่า HTTP_PROXY อาจทำให้การเชื่อมต่อระหว่างไคลเอนต์กับเซิร์ฟเวอร์ขัดข้อง
ฉันจะใช้งาน Ollama อยู่หลังพร็อกซีใน Docker ได้อย่างไร?
สามารถกำหนดค่าให้รูปภาพคอนเทนเนอร์ Docker ของ Ollama ใช้พร็อกซีได้โดยส่งพารามิเตอร์ -e HTTPS_PROXY=https://proxy.example.com เมื่อเริ่มทำงานคอนเทนเนอร์
อีกวิธีหนึ่งคือกำหนดค่าให้เดมอน Docker ใช้พร็อกซี มีคำแนะนำสำหรับ Docker Desktop สำหรับ macOS, Windows, และ Linux รวมถึง เดมอน Docker ที่ใช้กับ systemd
ตรวจสอบให้แน่ใจว่าสertificate ติดตั้งเป็น certificate ของระบบเมื่อใช้งาน HTTPS สิ่งนี้อาจต้องการรูปภาพ Docker ใหม่เมื่อใช้ certificate ที่ลงนามด้วยตนเอง
dockerfile
FROM ollama/ollama
COPY my-ca.pem /usr/local/share/ca-certificates/my-ca.crt
RUN update-ca-certificatesBuild และรันรูปภาพนี้:
shell
docker build -t ollama-with-ca .
docker run -d -e HTTPS_PROXY=https://my.proxy.example.com -p 11434:11434 ollama-with-caOllama ส่ง prompt และคำตอบของฉันกลับไปยัง ollama.com หรือไม่?
Ollama ทำงานในเครื่องเราไม่เห็น prompt หรือข้อมูลของคุณเมื่อคุณใช้งานในเครื่อง เมื่อใช้งานมอเดลที่โฮสต์บนคลาวด์ เราจะประมวลผล prompt และคำตอบของคุณเพื่อให้บริการ แต่ไม่เก็บรักษาหรือบันทึกเนื้อหาดังกล่าวและไม่เคยใช้ในการฝึกโมเดล เรารวบรวมข้อมูลบัญชีพื้นฐานและข้อมูลการใช้งานจำกัดเพื่อให้บริการโดยไม่รวมถึงเนื้อหา prompt หรือคำตอบ เราขายข้อมูลของคุณไม่ได้ คุณสามารถลบบัญชีของคุณได้ทุกเมื่อ
ฉันจะปิดใช้งานฟีเจอร์คลาวด์ของ Ollama ได้อย่างไร?
Ollama สามารถทำงานในโหมดเฉพาะในเครื่องได้โดยปิดใช้งานฟีเจอร์คลาวด์ของ Ollama เมื่อปิดใช้งานฟีเจอร์คลาวด์ของ Ollama คุณจะไม่สามารถใช้งานมอเดลคลาวด์และฟีเจอร์ค้นหาเว็บของ Ollama ได้
ตั้งค่า disable_ollama_cloud ในไฟล์ ~/.ollama/server.json:
json
{
"disable_ollama_cloud": true
}คุณยังสามารถตั้งค่าตัวแปรสภาพแวดล้อมได้:
shell
OLLAMA_NO_CLOUD=1รีสตาร์ท Ollama หลังจากเปลี่ยนการกำหนดค่า เมื่อปิดใช้งานแล้ว บันทึกระบบของ Ollama จะแสดงข้อความ Ollama cloud disabled: true
ฉันจะเปิดให้ Ollama เข้าถึงได้ในเครือข่ายของฉันได้อย่างไร?
โดยค่าเริ่มต้น Ollama จะ binds ที่ 127.0.0.1 พอร์ต 11434 เปลี่ยนที่อยู่ bind ด้วยตัวแปรสภาพแวดล้อม OLLAMA_HOST
กรุณาดูส่วน ด้านบน เพื่อเรียนรู้วิธีตั้งค่าตัวแปรสภาพแวดล้อมบนแพลตฟอร์มของคุณ
ฉันจะใช้งาน Ollama พร้อมพร็อกซีเซิร์ฟเวอร์ได้อย่างไร?
Ollama รันเซิร์ฟเวอร์ HTTP และสามารถเปิดให้เข้าถึงได้โดยใช้พร็อกซีเซิร์ฟเวอร์อย่าง Nginx เพื่อทำเช่นนี้ ให้กำหนดค่าให้พร็อกซีส่งต่อคำขอและตั้งค่า header ที่ต้องการ (หากไม่เปิดให้ Ollama เข้าถึงในเครือข่าย) ตัวอย่างเช่น ด้วย Nginx:
nginx
server {
listen 80;
server_name example.com; # Replace with your domain or IP
location / {
proxy_pass http://localhost:11434;
proxy_set_header Host localhost:11434;
}
}ฉันจะใช้งาน Ollama พร้อม ngrok ได้อย่างไร?
สามารถเข้าถึง Ollama ได้โดยใช้แอปพลิเคชัน tunneling ต่างๆ ตัวอย่างเช่น ด้วย Ngrok:
shell
ngrok http 11434 --host-header="localhost:11434"ฉันจะใช้งาน Ollama พร้อม Cloudflare Tunnel ได้อย่างไร?
เพื่อใช้งาน Ollama พร้อม Cloudflare Tunnel ให้ใช้ฟลัก --url และ --http-host-header:
shell
cloudflared tunnel --url http://localhost:11434 --http-host-header="localhost:11434"ฉันจะอนุญาตให้ต้นทางเว็บอื่นเข้าถึง Ollama ได้อย่างไร?
โดยค่าเริ่มต้น Ollama อนุญาตคำขอข้ามต้นทางจาก 127.0.0.1 และ 0.0.0.0 สามารถกำหนดต้นทางเพิ่มเติมได้ด้วย OLLAMA_ORIGINS
สำหรับส่วนขยายของเบราว์เซอร์ คุณจะต้องอนุญาตรูปแบบต้นทางของส่วนขยายอย่างชัดเจน ตั้งค่า OLLAMA_ORIGINS ให้รวม chrome-extension://*, moz-extension://*, และ safari-web-extension://* หากคุณต้องการอนุญาตให้ส่วนขยายเบราว์เซอร์ทั้งหมดเข้าถึง หรือกำหนดส่วนขยายเฉพาะตามต้องการ:
# Allow all Chrome, Firefox, and Safari extensions
OLLAMA_ORIGINS=chrome-extension://*,moz-extension://*,safari-web-extension://* ollama serveกรุณาดูส่วน ด้านบน เพื่อเรียนรู้วิธีตั้งค่าตัวแปรสภาพแวดล้อมบนแพลตฟอร์มของคุณ
มอเดลถูกเก็บไว้ที่ใด?
- macOS:
~/.ollama/models - Linux:
/usr/share/ollama/.ollama/models - Windows:
C:\Users\%username%\.ollama\models
ฉันจะเปลี่ยนตำแหน่งที่เก็บมอเดลได้อย่างไร?
หากต้องการใช้ไดเรกทอรีอื่น ตั้งค่าตัวแปรสภาพแวดล้อม OLLAMA_MODELS เป็นไดเรกทอรีที่เลือก
ข้อควรระวัง
บน Linux ที่ใช้ตัวติดตั้งมาตรฐาน ผู้ใช้ ollama จะต้องมีสิทธิ์อ่านและเขียนในไดเรกทอรีที่กำหนด เพื่อกำหนดสิทธิ์ไดเรกทอรีให้กับผู้ใช้ ollama ให้รันคำสั่ง sudo chown -R ollama:ollama <directory>
กรุณาดูส่วน ด้านบน เพื่อเรียนรู้วิธีตั้งค่าตัวแปรสภาพแวดล้อมบนแพลตฟอร์มของคุณ
ฉันจะใช้งาน Ollama ใน Visual Studio Code ได้อย่างไร?
มีปลั๊กอินสำหรับ VS Code และโปรแกรมแก้ไขข้อความอื่นๆ ที่ใช้ Ollama อยู่แล้วจำนวนมาก กรุณาดูรายการ ส่วนขยายและปลั๊กอิน ที่ด้านล่างของไฟล์ readme ของ repositori หลัก
ฉันจะใช้งาน Ollama พร้อมการเร่ง GPU ใน Docker ได้อย่างไร?
สามารถกำหนดค่าให้คอนเทนเนอร์ Docker ของ Ollama ใช้การเร่ง GPU ได้บน Linux หรือ Windows (พร้อม WSL2) สิ่งนี้ต้องการ nvidia-container-toolkit กรุณาดูรายละเอียดเพิ่มเติมที่ ollama/ollama
การเร่ง GPU ไม่พร้อมใช้งานสำหรับ Docker Desktop บน macOS เนื่องจากไม่มีฟีเจอร์ GPU passthrough และการจำลอง GPU
ทำไมการเชื่อมต่อเครือข่ายใน WSL2 บน Windows 10 ช้า?
ปัญหานี้อาจส่งผลต่อทั้งการติดตั้ง Ollama และการดาวน์โหลดมอเดล
เปิด Control Panel > Networking and Internet > View network status and tasks แล้วคลิกที่ Change adapter settings ในแผงด้านซ้าย ค้นหาอะแดปเตอร์ vEthernet (WSL) คลิกขวาและเลือก Properties คลิกที่ Configure แล้วเปิดแท็บ Advanced ค้นหาทั้งหมดในคุณสมบัติจนกว่าคุณจะพบ Large Send Offload Version 2 (IPv4) และ Large Send Offload Version 2 (IPv6) ปิดใช้งาน คุณสมบัติทั้งสองนี้
ฉันจะโหลดมอเดลล่วงหน้าเข้า Ollama เพื่อให้ได้เวลาตอบสนองที่เร็วขึ้นได้อย่างไร?
หากคุณใช้งาน API คุณสามารถโหลดมอเดลล่วงหน้าได้โดยส่งคำขอว่างไปยังเซิร์ฟเวอร์ Ollama วิธีนี้ทำงานกับทั้งจุดสิ้นสุด API /api/generate และ /api/chat
เพื่อโหลดมอเดล mistral ล่วงหน้าโดยใช้จุดสิ้นสุด generate ให้ใช้:
shell
curl http://localhost:11434/api/generate -d '{"model": "mistral"}'เพื่อใช้งานจุดสิ้นสุด chat completions ให้ใช้:
shell
curl http://localhost:11434/api/chat -d '{"model": "mistral"}'เพื่อโหลดมอเดลล่วงหน้าโดยใช้ CLI ให้ใช้คำสั่ง:
shell
ollama run llama3.2 ""ฉันจะทำให้มอเดลอยู่ในหน่วยความจำตลอดหรือโหลดออกได้ทันทีได้อย่างไร?
โดยค่าเริ่มต้น มอเดลจะถูกเก็บไว้ในหน่วยความจำเป็นเวลา 5 นาทีก่อนจะถูกโหลดออก สิ่งนี้ช่วยให้ได้เวลาตอบสนองที่เร็วขึ้นหากคุณส่งคำขอจำนวนมากไปยัง LLM หากคุณต้องการโหลดมอเดลออกจากหน่วยความจำทันที ให้ใช้คำสั่ง ollama stop:
shell
ollama stop llama3.2หากคุณใช้งาน API ให้ใช้พารามิเตอร์ keep_alive พร้อมจุดสิ้นสุด /api/generate และ /api/chat เพื่อตั้งค่าเวลาที่มอเดลจะอยู่ในหน่วยความจำ พารามิเตอร์ keep_alive สามารถตั้งค่าเป็น:
- สตริงระยะเวลา (เช่น "10m" หรือ "24h")
- ตัวเลขเป็นวินาที (เช่น 3600)
- ตัวเลขลบใดๆ ซึ่งจะทำให้มอเดลอยู่ในหน่วยความจำตลอด (เช่น -1 หรือ "-1m")
- '0' ซึ่งจะโหลดมอเดลออกทันทีหลังจากสร้างคำตอบเสร็จ
ตัวอย่างเช่น เพื่อโหลดมอเดลล่วงหน้าและ让它อยู่ในหน่วยความจำ ให้ใช้:
shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'เพื่อโหลดมอเดลออกและปล่อยหน่วยความจำ ให้ใช้:
shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": 0}'อีกวิธีหนึ่ง คุณสามารถเปลี่ยนเวลาที่มอเดลทั้งหมดถูกโหลดอยู่ในหน่วยความจำได้โดยตั้งค่าตัวแปรสภาพแวดล้อม OLLAMA_KEEP_ALIVE เมื่อเริ่มทำงานเซิร์ฟเวอร์ Ollama ตัวแปร OLLAMA_KEEP_ALIVE ใช้ประเภทพารามิเตอร์เดียวกันกับพารามิเตอร์ keep_alive ที่กล่าวถึงด้านบน กรุณาดูส่วนที่อธิบาย วิธีกำหนดค่าเซิร์ฟเวอร์ Ollama เพื่อตั้งค่าตัวแปรสภาพแวดล้อมอย่างถูกต้อง
พารามิเตอร์ API keep_alive พร้อมจุดสิ้นสุด /api/generate และ /api/chat จะแทนที่การตั้งค่า OLLAMA_KEEP_ALIVE
ฉันจะจัดการจำนวนคำขอสูงสุดที่เซิร์ฟเวอร์ Ollama สามารถจัดคิวได้อย่างไร?
หากส่งคำขอจำนวนมากเกินไปไปยังเซิร์ฟเวอร์ มันจะตอบกลับด้วยข้อผิดพลาด 503 ระบุว่าซิร์ฟเวอร์โหลดเกินความสามารถ คุณสามารถปรับจำนวนคำขอที่สามารถจัดคิวได้โดยตั้งค่า OLLAMA_MAX_QUEUE
Ollama จัดการคำขอพร้อมกันได้อย่างไร?
Ollama รองรับสองระดับของการประมวลผลพร้อมกัน หากระบบของคุณมีหน่วยความจำเพียงพอ (หน่วยความจำของระบบเมื่อใช้งานการอนุมานบน CPU หรือ VRAM สำหรับการอนุมานบน GPU) ก็จะโหลดมอเดลหลายตัวได้พร้อมกัน สำหรับมอเดลที่กำหนด หากมีหน่วยความจำเพียงพอเมื่อโหลดมอเดล มอเดลจะถูกกำหนดค่าเพื่ออนุญาตการประมวลผลคำขอแบบขนาน
หากหน่วยความจำไม่เพียงพอสำหรับการโหลดมอเดลใหม่ในขณะที่มีมอเดลอย่างน้อยหนึ่งตัวถูกโหลดอยู่ คำขอใหม่ทั้งหมดจะถูกจัดคิวจนกว่ามอเดลใหม่จะถูกโหลดได้ เมื่อมอเดลเดิมไม่ใช้งาน อันดับหนึ่งหรือมากกว่าจะถูกโหลดออกเพื่อสร้างพื้นที่สำหรับมอเดลใหม่ คำขอที่จัดคิวไว้จะถูกประมวลผลตามลำดับ เมื่อใช้งานการอนุมานบน GPU มอเดลใหม่ต้องพอดีกับ VRAM ทั้งหมดเพื่อให้สามารถโหลดมอเดลพร้อมกันได้
การประมวลผลคำขอแบบขนานสำหรับมอเดลที่กำหนดจะทำให้ขนาดบริบทเพิ่มขึ้นตามจำนวนคำขอแบบขนาน ตัวอย่างเช่น บริบท 2K พร้อมคำขอแบบขนาน 4 รายการจะให้บริบท 8K และการจัดสรรหน่วยความจำเพิ่มเติม
การตั้งค่าเซิร์ฟเวอร์ต่อไปนี้สามารถใช้เพื่อปรับวิธีการจัดการคำขอพร้อมกันของ Ollama ในส่วนใหญ่ของแพลตฟอร์ม:
OLLAMA_MAX_LOADED_MODELS- จำนวนมอเดลสูงสุดที่สามารถโหลดพร้อมกันได้ หากมีขนาดพอดีกับหน่วยความจำที่มีอยู่ ค่าเริ่มต้นคือ 3 คูณจำนวน GPU หรือ 3 สำหรับการอนุมานบน CPUOLLAMA_NUM_PARALLEL- จำนวนคำขอแบบขนานสูงสุดที่แต่ละมอเดลจะประมวลผลพร้อมกัน ค่าเริ่มต้นคือ 1 หน่วยความจำ RAM ที่ต้องการจะเพิ่มตามOLLAMA_NUM_PARALLELคูณOLLAMA_CONTEXT_LENGTHOLLAMA_MAX_QUEUE- จำนวนคำขอสูงสุดที่ Ollama จะจัดคิวเมื่อทำงานอยู่ก่อนที่จะปฏิเสธคำขอเพิ่มเติม ค่าเริ่มต้นคือ 512
ข้อควรทราบ: บน Windows ที่ใช้ GPU Radeon ปัจจุบันมีค่าเริ่มต้นสูงสุด 1 มอเดล เนื่องจากข้อจำกัดในการรายงาน VRAM ที่มีอยู่ใน ROCm v5.7 เมื่อ ROCm v6.2 พร้อมใช้งานแล้ว Windows Radeon จะใช้ค่าเริ่มต้นตามด้านบน คุณสามารถเปิดใช้งานการโหลดมอเดลพร้อมกันบน Radeon บน Windows ได้ แต่ตรวจสอบให้แน่ใจว่าคุณไม่โหลดมอเดลมากเกินกว่าที่จะพอดีกับ VRAM ของ GPU
Ollama โหลดมอเดลบน GPU หลายตัวได้อย่างไร?
เมื่อโหลดมอเดลใหม่ Ollama จะประเมิน VRAM ที่ต้องการสำหรับมอเดลเทียบกับ VRAMที่มีอยู่ในปัจจุบัน หากมอเดลพอดีกับ GPU ตัวใดตัวหนึ่งทั้งหมด Ollama จะโหลดมอเดลบน GPU นั้น โดยปกติแล้ววิธีนี้ให้ประสิทธิภาพที่ดีที่สุดเพราะลดปริมาณข้อมูลที่ส่งผ่าน bus PCI ระหว่างการอนุมาน หากมอเดลไม่พอดีกับ GPU ตัวใดตัวหนึ่งทั้งหมด มอเดลจะถูกกระจายไปบน GPU ทั้งหมดที่มีอยู่
ฉันจะเปิดใช้งาน Flash Attention ได้อย่างไร?
Flash Attention เป็นฟีเจอร์ที่มีในโมเดลสมัยใหม่ส่วนใหญ่ ซึ่งสามารถลดการใช้หน่วยความจำอย่างมากเมื่อขนาดบริบทเพิ่มขึ้น Ollama จะใช้ Flash Attention โดยอัตโนมัติเมื่อแบ็กเอนด์และอุปกรณ์ที่เลือกรองรับ หากต้องการบังคับให้เปิดใช้งาน Flash Attention ให้ตั้งค่า OLLAMA_FLASH_ATTENTION=1 เมื่อเริ่มเซิร์ฟเวอร์ Ollama หากต้องการปิดใช้งาน ให้ตั้งค่า OLLAMA_FLASH_ATTENTION=0
ฉันจะตั้งค่าประเภทการควอนไทซ์สำหรับแคช K/V ได้อย่างไร?
แคชบริบท K/V สามารถถูกควอนไทซ์เพื่อลดการใช้หน่วยความจำอย่างมากเมื่อเปิดใช้งาน Flash Attention ได้
หากต้องการใช้แคช K/V ที่ถูกควอนไทซ์กับ Ollama คุณสามารถตั้งค่าตัวแปรสิ่งแวดล้อมต่อไปนี้:
OLLAMA_KV_CACHE_TYPE- ประเภทการควอนไทซ์สำหรับแคช K/V ค่าเริ่มต้นคือf16
ข้อสังเกต
ตัวเลือกนี้เป็นระดับทั่วโลกในปัจจุบัน - หมายความว่าทั้งหมดโมเดลจะรันด้วยประเภทการควอนไทซ์ที่ระบุ
ประเภทการควอนไทซ์สำหรับแคช K/V ที่มีอยู่ในปัจจุบันมีดังนี้:
f16- ความแม่นยำสูงและการใช้หน่วยความจำสูง (ค่าเริ่มต้น)q8_0- การควอนไทซ์ 8 บิต ใช้หน่วยความจำประมาณครึ่งหนึ่งของf16โดยมีการสูญเสียความแม่นยำน้อยมาก ซึ่งโดยปกติแล้วไม่มีผลต่อคุณภาพของโมเดลอย่างเห็นได้ (แนะนำหากไม่ได้ใช้f16)q4_0- การควอนไทซ์ 4 บิต ใช้หน่วยความจำประมาณหนึ่งในสี่ของf16โดยมีการสูญเสียความแม่นยำระดับน้อยถึงปานกลาง ซึ่งอาจเห็นได้ชัดเจนขึ้นเมื่อขนาดบริบทเพิ่มสูงขึ้น
ระดับการส่งผลต่อคุณภาพการตอบสนองของโมเดลจากการควอนไทซ์แคชจะขึ้นอยู่กับโมเดลและงานที่ใช้งาน โมเดลที่มีค่า GQA สูง (เช่น Qwen2) อาจมีความแม่นยำลดลงมากกว่าโมเดลที่มีค่า GQA ต่ำจากการควอนไทซ์
คุณอาจจำเป็นต้องลองใช้ประเภทการควอนไทซ์ต่างๆ เพื่อหาสมดุลที่ดีที่สุดระหว่างการใช้หน่วยความจำและคุณภาพ
ฉันจะค้นหาคีย์สาธารณะของ Ollama ของฉันได้ที่ไหน?
คีย์สาธารณะของ Ollama ของคุณเป็นส่วนสาธารณะของคู่กุญแจที่ทำให้อินสแตนซ์ Ollama บนเครื่องของคุณสามารถสื่อสารกับ ollama.com ได้
คุณจะต้องใช้คีย์นี้เพื่อ:
- อัปโหลดโมเดลไปยัง Ollama
- ดาวน์โหลดโมเดลส่วนตัวจาก Ollama ไปยังเครื่องของคุณ
- รันโมเดลที่โฮสต์ใน Ollama Cloud
วิธีเพิ่มคีย์
ลงชื่อเข้าใช้ผ่านหน้า Settings ใน แอป Mac และ Windows
ลงชื่อเข้าใช้ผ่าน CLI
shell
ollama signin- คัดลอกและวางคีย์ด้วยตนเอง ที่หน้า Ollama Keys: https://ollama.com/settings/keys
ตำแหน่งที่จัดเก็บคีย์สาธารณะของ Ollama
| ระบบปฏิบัติการ | เส้นทางไปยัง id_ed25519.pub |
|---|---|
| macOS | ~/.ollama/id_ed25519.pub |
| Linux | /usr/share/ollama/.ollama/id_ed25519.pub |
| Windows | C:\Users\<username>\.ollama\id_ed25519.pub |
ข้อสังเกต
เปลี่ยน <username> เป็นชื่อผู้ใช้ Windows จริงของคุณ
ฉันจะป้องกัน Ollama ไม่ให้เริ่มต้นอัตโนมัติเมื่อเข้าสู่ระบบคอมพิวเตอร์ได้อย่างไร?
Ollama สำหรับ Windows และ macOS จะลงทะเบียนเป็นรายการการเข้าสู่ระบบในระหว่างการติดตั้ง คุณสามารถปิดใช้งานการตั้งค่านี้หากไม่ต้องการให้ Ollama เริ่มต้นอัตโนมัติ Ollama จะคงการตั้งค่านี้ไว้ในระหว่างการอัปเกรดเวอร์ชัน เว้นแต่คุณจะถอนการติดตั้งแอปพลิเคชัน
Windows
- ใน
Task Managerให้ไปที่แท็บStartup appsค้นหาคำว่าollamaจากนั้นคลิกDisable
MacOS
- เปิด
Settingsและค้นหาคำว่า "Login Items" ค้นหารายการOllamaภายใต้Allow in the Backgroundจากนั้นคลิกแถบเลื่อนเพื่อปิดใช้งาน