Skip to content

สารบัญ

การนำเข้าอะแดปเตอร์ที่ปรับแต่งแล้วจากน้ำหนัก Safetensors

ก่อนอื่น สร้างไฟล์ Modelfile โดยใช้คำสั่ง FROM ชี้ไปที่โมเดลพื้นฐานที่คุณใช้ในการปรับแต่ง และคำสั่ง ADAPTER ชี้ไปที่ไดเรกทอรีที่เก็บอะแดปเตอร์ Safetensors ของคุณ:

dockerfile
FROM <base model name>
ADAPTER /path/to/safetensors/adapter/directory

ตรวจสอบให้แน่ใจว่าคุณใช้โมเดลพื้นฐานเดียวกันในคำสั่ง FROM ที่คุณใช้ในการสร้างอะแดปเตอร์ มิฉะนั้นคุณจะได้ผลลัพธ์ที่ไม่สม่ำเสมอ เฟรมเวิร์กส่วนใหญ่ใช้วิธีการควอนตัสที่แตกต่างกัน ดังนั้นจึงแนะนำให้ใช้อะแดปเตอร์ที่ไม่ได้ควอนตัส (คือ non-QLoRA) หากอะแดปเตอร์ของคุณอยู่ในไดเรกทอรีเดียวกับ Modelfile ให้ใช้ ADAPTER . เพื่อระบุเส้นทางของอะแดปเตอร์

ตอนนี้รันคำสั่ง ollama create จากไดเรกทอรีที่คุณสร้าง Modelfile ไว้:

shell
ollama create my-model

สุดท้าย ทดสอบโมเดล:

shell
ollama run my-model

Ollama รองรับการนำเข้าอะแดปเตอร์ที่อ้างอิงจากสถาปัตยกรรมโมเดลหลายรูปแบบ ได้แก่:

  • Llama (รวมถึง Llama 2, Llama 3, Llama 3.1 และ Llama 3.2);
  • Mistral (รวมถึง Mistral 1, Mistral 2 และ Mixtral); และ
  • Gemma (รวมถึง Gemma 1 และ Gemma 2)

คุณสามารถสร้างอะแดปเตอร์โดยใช้เฟรมเวิร์กหรือเครื่องมือปรับแต่งที่สามารถส่งออกอะแดปเตอร์ในรูปแบบ Safetensors ได้ เช่น:

การนำเข้ารูปแบบโมเดลจากน้ำหนัก Safetensors

ก่อนอื่น สร้างไฟล์ Modelfile โดยใช้คำสั่ง FROM ชี้ไปที่ไดเรกทอรีที่เก็บน้ำหนัก Safetensors ของคุณ:

dockerfile
FROM /path/to/safetensors/directory

หากคุณสร้าง Modelfile ในไดเรกทอรีเดียวกับน้ำหนัก สามารถใช้คำสั่ง FROM . ได้

ตอนนี้รันคำสั่ง ollama create จากไดเรกทอรีที่คุณสร้าง Modelfile ไว้:

shell
ollama create my-model

สุดท้าย ทดสอบโมเดล:

shell
ollama run my-model

Ollama รองรับการนำเข้ารูปแบบโมเดลสำหรับสถาปัตยกรรมหลายรูปแบบ ได้แก่:

  • Llama (รวมถึง Llama 2, Llama 3, Llama 3.1 และ Llama 3.2);
  • Mistral (รวมถึง Mistral 1, Mistral 2 และ Mixtral);
  • Gemma (รวมถึง Gemma 1 และ Gemma 2); และ
  • Phi3

รวมถึงการนำเข้ารูปแบบโมเดลพื้นฐาน และโมเดลที่ปรับแต่งแล้วที่ถูก ผสาน กับโมเดลพื้นฐานด้วย

การนำเข้ารูปแบบโมเดลหรืออะแดปเตอร์ที่ใช้ GGUF

หากคุณมีรูปแบบโมเดลหรืออะแดปเตอร์ที่ใช้ GGUF คุณสามารถนำเข้าสู่ Ollama ได้ คุณสามารถได้รับรูปแบบโมเดลหรืออะแดปเตอร์ GGUF ผ่านการ:

  • คอนเวิร์ตรูปแบบโมเดล Safetensors โดยใช้สคริปต์ convert_hf_to_gguf.py จาก Llama.cpp;
  • คอนเวิร์ตอะแดปเตอร์ Safetensors โดยใช้สคริปต์ convert_lora_to_gguf.py จาก Llama.cpp; หรือ
  • ดาวน์โหลดรูปแบบโมเดลหรืออะแดปเตอร์จากแหล่งต่างๆ เช่น HuggingFace

เพื่อนำเข้ารูปแบบโมเดล GGUF สร้างไฟล์ Modelfile ที่มีเนื้อหาดังนี้:

dockerfile
FROM /path/to/file.gguf

สำหรับอะแดปเตอร์ GGUF สร้างไฟล์ Modelfile ดังนี้:

dockerfile
FROM <model name>
ADAPTER /path/to/file.gguf

เมื่อนำเข้าอะแดปเตอร์ GGUF จำเป็นต้องใช้โมเดลพื้นฐานเดียวกันกับโมเดลพื้นฐานที่ใช้สร้างอะแดปเตอร์นี้ คุณสามารถใช้:

  • รูปแบบโมเดลจาก Ollama
  • ไฟล์ GGUF
  • รูปแบบโมเดลที่ใช้ Safetensors

หลังจากที่คุณสร้างไฟล์ Modelfile แล้ว ใช้คำสั่ง ollama create เพื่อสร้างรูปแบบโมเดล

shell
ollama create my-model

การควอนตัสรูปแบบโมเดล

การควอนตัสรูปแบบโมเดลช่วยให้คุณรันโมเดลได้เร็วขึ้นและใช้หน่วยความจำน้อยลง แต่มีความแม่นยำลดลง ซึ่งช่วยให้คุณรันโมเดลบนฮาร์ดแวร์ที่มีสเปคต่ำกว่าได้

Ollama สามารถควอนตัสรูปแบบโมเดลที่ใช้ FP16 และ FP32 เป็นระดับควอนตัสต่างๆ ได้โดยใช้ฟлаг -q/--quantize ร่วมกับคำสั่ง ollama create

ก่อนอื่น สร้างไฟล์ Modelfile โดยใช้รูปแบบโมเดล FP16 หรือ FP32 ที่คุณต้องการควอนตัส

dockerfile
FROM /path/to/my/gemma/f16/model

จากนั้นใช้คำสั่ง ollama create เพื่อสร้างรูปแบบโมเดลที่ควอนตัสแล้ว

shell
$ ollama create --quantize q4_K_M mymodel
transferring model data
quantizing F16 model to Q4_K_M
creating new layer sha256:735e246cc1abfd06e9cdcf95504d6789a6cd1ad7577108a70d9902fef503c1bd
creating new layer sha256:0853f0ad24e5865173bbf9ffcc7b0f5d56b66fd690ab1009867e45e7d2c4db0f
writing manifest
success

ระดับควอนตัสที่รองรับ

  • q8_0

ควอนตัสแบบ K-means

  • q4_K_S
  • q4_K_M

การแชร์รูปแบบโมเดลของคุณบน ollama.com

คุณสามารถแชร์รูปแบบโมเดลที่คุณสร้างได้โดย push ไปยัง ollama.com เพื่อให้ผู้ใช้อื่นสามารถลองใช้งานได้

ก่อนอื่น ใช้เบราว์เซอร์ของคุณไปที่หน้า Ollama Sign-Up หากคุณมีบัญชีอยู่แล้ว สามารถข้ามขั้นตอนนี้ได้

สมัครสมาชิก

ฟิลด์ Username จะถูกใช้เป็นส่วนหนึ่งของชื่อรูปแบบโมเดลของคุณ (เช่น jmorganca/mymodel) ดังนั้นตรวจสอบให้แน่ใจว่าคุณพอใจกับชื่อผู้ใช้ที่คุณเลือกไว้

หลังจากที่คุณสร้างบัญชีและเข้าสู่ระบบแล้ว ไปที่หน้า Ollama Keys Settings

กุญแจ Ollama

ทำตามคำแนะนำบนหน้าเพื่อหาตำแหน่งของกุญแจสาธารณะ Ollama ของคุณ

คลิกที่ปุ่ม Add Ollama Public Key แล้วคัดลอกและวางเนื้อหาของกุญแจสาธารณะ Ollama ของคุณลงในฟิลด์ข้อความ

เพื่อ push รูปแบบโมเดลไปยัง ollama.com ก่อนอื่นตรวจสอบให้แน่ใจว่าชื่อโมเดลถูกต้องพร้อมกับชื่อผู้ใช้ของคุณ คุณอาจต้องใช้คำสั่ง ollama cp เพื่อคัดลอกรูปแบบโมเดลเพื่อตั้งชื่อที่ถูกต้อง เมื่อคุณพอใจกับชื่อรูปแบบโมเดลแล้ว ใช้คำสั่ง ollama push เพื่อ push ไปยัง ollama.com

shell
ollama cp mymodel myuser/mymodel
ollama push myuser/mymodel

หลังจากที่รูปแบบโมเดลของคุณถูก push แล้ว ผู้ใช้อื่นสามารถดึงและรันได้โดยใช้คำสั่ง:

shell
ollama run myuser/mymodel