Daftar Isi
- Mengimpor Adapter Safetensors
- Mengimpor Model Safetensors
- Mengimpor File GGUF
- Membagikan Model di ollama.com
Mengimpor adapter yang telah di-fine-tune dari bobot Safetensors
Pertama, buatlah Modelfile dengan perintah FROM yang menunjuk ke model dasar yang Anda gunakan untuk fine-tuning, serta perintah ADAPTER yang menunjuk ke direktori yang berisi adapter Safetensors Anda:
dockerfile
FROM <base model name>
ADAPTER /path/to/safetensors/adapter/directoryPastikan Anda menggunakan model dasar yang sama pada perintah FROM dengan model yang Anda gunakan untuk membuat adapter, jika tidak Anda akan mendapatkan hasil yang tidak konsisten. Sebagian besar framework menggunakan metode kuantisasi yang berbeda, jadi sebaiknya gunakan adapter yang tidak terkuantisasi (yaitu non-QLoRA). Jika adapter Anda berada di direktori yang sama dengan Modelfile Anda, gunakan ADAPTER . untuk menentukan path adapter.
Sekarang jalankan perintah ollama create dari direktori tempat Modelfile dibuat:
shell
ollama create my-modelTerakhir, uji model tersebut:
shell
ollama run my-modelOllama mendukung pengimporan adapter berdasarkan beberapa arsitektur model yang berbeda, di antaranya:
- Llama (termasuk Llama 2, Llama 3, Llama 3.1, dan Llama 3.2);
- Mistral (termasuk Mistral 1, Mistral 2, dan Mixtral); dan
- Gemma (termasuk Gemma 1 dan Gemma 2)
Anda dapat membuat adapter menggunakan framework atau alat fine-tuning yang dapat menghasilkan adapter dalam format Safetensors, seperti:
- Hugging Face framework penyesuaian halus
- Unsloth
- MLX
Mengimpor model dari bobot Safetensors
Pertama, buatlah Modelfile dengan perintah FROM yang menunjuk ke direktori yang berisi bobot Safetensors Anda:
dockerfile
FROM /path/to/safetensors/directoryJika Anda membuat Modelfile di direktori yang sama dengan bobot, Anda dapat menggunakan perintah FROM ..
Sekarang jalankan perintah ollama create dari direktori tempat Anda membuat Modelfile:
shell
ollama create my-modelTerakhir, uji model tersebut:
shell
ollama run my-modelOllama mendukung pengimporan model untuk beberapa arsitektur yang berbeda, di antaranya:
- Llama (termasuk Llama 2, Llama 3, Llama 3.1, dan Llama 3.2);
- Mistral (termasuk Mistral 1, Mistral 2, dan Mixtral);
- Gemma (termasuk Gemma 1 dan Gemma 2); dan
- Phi3
Hal ini termasuk pengimporan model dasar (foundation model) serta model-model yang telah di-fine-tune yang telah digabung dengan model dasar.
Mengimpor model atau adapter berbasis GGUF
Jika Anda memiliki model atau adapter berbasis GGUF, Anda dapat mengimpornya ke Ollama. Anda dapat memperoleh model atau adapter GGUF dengan:
- mengonversi model Safetensors menggunakan
convert_hf_to_gguf.pydari Llama.cpp; - mengonversi adapter Safetensors menggunakan
convert_lora_to_gguf.pydari Llama.cpp; atau - mengunduh model atau adapter dari sumber seperti HuggingFace
Untuk mengimpor model GGUF, buatlah Modelfile yang berisi:
dockerfile
FROM /path/to/file.ggufUntuk adapter GGUF, buatlah Modelfile dengan:
dockerfile
FROM <model name>
ADAPTER /path/to/file.ggufSaat mengimpor adapter GGUF, penting untuk menggunakan model dasar yang sama dengan model dasar yang digunakan untuk membuat adapter. Anda dapat menggunakan:
- model dari Ollama
- file GGUF
- model berbasis Safetensors
Setelah Anda membuat Modelfile, gunakan perintah ollama create untuk membangun model.
shell
ollama create my-modelMengkuantisasi Model
Mengkuantisasi model memungkinkan Anda menjalankan model dengan lebih cepat dan konsumsi memori yang lebih rendah, namun dengan akurasi yang berkurang. Ini memungkinkan Anda menjalankan model pada perangkat keras yang lebih rendah spesifikasinya.
Ollama dapat mengkuantisasi model berbasis FP16 dan FP32 ke tingkat kuantisasi yang berbeda menggunakan flag -q/--quantize pada perintah ollama create.
Pertama, buatlah Modelfile dengan model berbasis FP16 atau FP32 yang ingin Anda kuantiskan.
dockerfile
FROM /path/to/my/gemma/f16/modelGunakan ollama create untuk membuat model yang telah dikuantisasi.
shell
$ ollama create --quantize q4_K_M mymodel
transferring model data
quantizing F16 model to Q4_K_M
creating new layer sha256:735e246cc1abfd06e9cdcf95504d6789a6cd1ad7577108a70d9902fef503c1bd
creating new layer sha256:0853f0ad24e5865173bbf9ffcc7b0f5d56b66fd690ab1009867e45e7d2c4db0f
writing manifest
successKuantisasi yang Didukung
q8_0
Kuantisasi K-means
q4_K_Sq4_K_M
Membagikan Model Anda di ollama.com
Anda dapat membagikan model apa pun yang telah Anda buat dengan mendorong (push) model tersebut ke ollama.com agar pengguna lain dapat mencobanya.
Pertama, buka halaman Pendaftaran Ollama menggunakan browser Anda. Jika Anda sudah memiliki akun, Anda dapat melewati langkah ini.

Bidang Username akan digunakan sebagai bagian dari nama model Anda (misalnya jmorganca/mymodel), jadi pastikan Anda puas dengan nama pengguna yang telah Anda pilih.
Setelah Anda membuat akun dan masuk, buka halaman Pengaturan Kunci Ollama.
Ikuti petunjuk di halaman tersebut untuk mengetahui lokasi Kunci Publik Ollama Anda.

Klik tombol Tambahkan Kunci Publik Ollama, lalu salin dan tempelkan isi Kunci Publik Ollama Anda ke kolom teks.
Untuk mendorong (push) model ke ollama.com, pertama pastikan model tersebut diberi nama yang benar sesuai nama pengguna Anda. Anda mungkin perlu menggunakan perintah ollama cp untuk menyalin model Anda agar mendapatkan nama yang benar. Setelah Anda puas dengan nama model Anda, gunakan perintah ollama push untuk mendorongkannya ke ollama.com.
shell
ollama cp mymodel myuser/mymodel
ollama push myuser/mymodelSetelah model Anda didorong, pengguna lain dapat menarik (pull) model tersebut dan menjalankannya menggunakan perintah:
shell
ollama run myuser/mymodel