Mục Lục
- Nhập bộ điều chỉnh (adapter) Safetensors
- Nhập mô hình Safetensors
- Nhập tệp GGUF
- Chia sẻ mô hình trên ollama.com
Nhập bộ điều chỉnh (adapter) đã tinh chỉnh từ trọng số Safetensors
Đầu tiên, tạo một Modelfile với lệnh FROM trỏ đến mô hình cơ sở bạn đã sử dụng để tinh chỉnh, và lệnh ADAPTER trỏ đến thư mục chứa bộ điều chỉnh Safetensors của bạn:
dockerfile
FROM <base model name>
ADAPTER /path/to/safetensors/adapter/directoryĐảm bảo rằng bạn sử dụng cùng một mô hình cơ sở trong lệnh FROM như mô hình bạn đã dùng để tạo bộ điều chỉnh, nếu không bạn sẽ nhận được kết quả không ổn định. Hầu hết các framework sử dụng các phương pháp lượng tử hóa khác nhau, vì vậy tốt nhất là sử dụng các bộ điều chỉnh không được lượng tử hóa (tức là không phải QLoRA). Nếu bộ điều chỉnh của bạn nằm trong cùng thư mục với tệp Modelfile, hãy sử dụng ADAPTER . để chỉ định đường dẫn đến bộ điều chỉnh.
Bây giờ, chạy lệnh ollama create từ thư mục nơi bạn đã tạo tệp Modelfile:
shell
ollama create my-modelCuối cùng, kiểm tra mô hình:
shell
ollama run my-modelOllama hỗ trợ nhập các bộ điều chỉnh dựa trên nhiều kiến trúc mô hình khác nhau, bao gồm:
- Llama (bao gồm Llama 2, Llama 3, Llama 3.1 và Llama 3.2);
- Mistral (bao gồm Mistral 1, Mistral 2 và Mixtral); và
- Gemma (bao gồm Gemma 1 và Gemma 2)
Bạn có thể tạo bộ điều chỉnh bằng cách sử dụng framework hoặc công cụ tinh chỉnh có thể xuất bộ điều chỉnh ở định dạng Safetensors, ví dụ như:
- Hugging Face framework tinh chỉnh
- Unsloth
- MLX
Nhập mô hình từ trọng số Safetensors
Đầu tiên, tạo một Modelfile với lệnh FROM trỏ đến thư mục chứa trọng số Safetensors của bạn:
dockerfile
FROM /path/to/safetensors/directoryNếu bạn tạo tệp Modelfile trong cùng thư mục với trọng số, bạn có thể sử dụng lệnh FROM ..
Bây giờ, chạy lệnh ollama create từ thư mục nơi bạn đã tạo tệp Modelfile:
shell
ollama create my-modelCuối cùng, kiểm tra mô hình:
shell
ollama run my-modelOllama hỗ trợ nhập mô hình cho nhiều kiến trúc khác nhau, bao gồm:
- Llama (bao gồm Llama 2, Llama 3, Llama 3.1 và Llama 3.2);
- Mistral (bao gồm Mistral 1, Mistral 2 và Mixtral);
- Gemma (bao gồm Gemma 1 và Gemma 2); và
- Phi3
Điều này bao gồm cả việc nhập các mô hình nền cũng như bất kỳ mô hình đã được tinh chỉnh nào đã được hợp nhất với mô hình nền.
Nhập mô hình hoặc bộ điều chỉnh (adapter) dựa trên GGUF
Nếu bạn có mô hình hoặc bộ điều chỉnh dựa trên GGUF, bạn có thể nhập chúng vào Ollama. Bạn có thể lấy mô hình hoặc bộ điều chỉnh GGUF bằng cách:
- Chuyển đổi mô hình Safetensors bằng tệp
convert_hf_to_gguf.pytừ Llama.cpp; - Chuyển đổi bộ điều chỉnh Safetensors bằng tệp
convert_lora_to_gguf.pytừ Llama.cpp; hoặc - Tải xuống mô hình hoặc bộ điều chỉnh từ các nguồn như HuggingFace
Để nhập mô hình GGUF, tạo một tệp Modelfile có nội dung sau:
dockerfile
FROM /path/to/file.ggufĐối với bộ điều chỉnh GGUF, tạo tệp Modelfile với nội dung:
dockerfile
FROM <model name>
ADAPTER /path/to/file.ggufKhi nhập bộ điều chỉnh GGUF, điều quan trọng là sử dụng cùng mô hình cơ sở như mô hình cơ sở được dùng để tạo bộ điều chỉnh. Bạn có thể sử dụng:
- Mô hình từ Ollama
- Tệp GGUF
- Mô hình dựa trên Safetensors
Sau khi bạn đã tạo tệp Modelfile, sử dụng lệnh ollama create để xây dựng mô hình.
shell
ollama create my-modelLượng Tử Hóa Mô Hình
Lượng tử hóa mô hình cho phép bạn chạy mô hình nhanh hơn và tiêu tốn ít bộ nhớ hơn nhưng với độ chính xác giảm. Điều này cho phép bạn chạy mô hình trên phần cứng có cấu hình thấp hơn.
Ollama có thể lượng tử hóa các mô hình dựa trên FP16 và FP32 sang các mức lượng tử hóa khác nhau bằng cách sử dụng cờ -q/--quantize với lệnh ollama create.
Đầu tiên, tạo một tệp Modelfile với mô hình dựa trên FP16 hoặc FP32 mà bạn muốn lượng tử hóa.
dockerfile
FROM /path/to/my/gemma/f16/modelSau đó, sử dụng lệnh ollama create để tạo mô hình đã lượng tử hóa.
shell
$ ollama create --quantize q4_K_M mymodel
transferring model data
quantizing F16 model to Q4_K_M
creating new layer sha256:735e246cc1abfd06e9cdcf95504d6789a6cd1ad7577108a70d9902fef503c1bd
creating new layer sha256:0853f0ad24e5865173bbf9ffcc7b0f5d56b66fd690ab1009867e45e7d2c4db0f
writing manifest
successCác Mức Lượng Tử Hóa Được Hỗ Trợ
q8_0
Lượng Tử Hóa K-means
q4_K_Sq4_K_M
Chia sẻ mô hình của bạn trên ollama.com
Bạn có thể chia sẻ bất kỳ mô hình nào bạn đã tạo bằng cách đẩy chúng lên ollama.com để những người dùng khác có thể dùng thử.
Đầu tiên, sử dụng trình duyệt của bạn để truy cập trang Đăng Ký Ollama. Nếu bạn đã có tài khoản, bạn có thể bỏ qua bước này.

Trường Username sẽ được sử dụng như một phần của tên mô hình của bạn (ví dụ: jmorganca/mymodel), vì vậy hãy đảm bảo bạn hài lòng với tên người dùng mà bạn đã chọn.
Sau khi bạn đã tạo tài khoản và đăng nhập, truy cập trang Cài Đặt Khóa Ollama.
Làm theo hướng dẫn trên trang để xác định vị trí của Khóa Công Khai Ollama của bạn.

Nhấp vào nút Add Ollama Public Key, sau đó sao chép và dán nội dung của Khóa Công Khai Ollama của bạn vào trường văn bản.
Để đẩy mô hình lên ollama.com, trước tiên hãy đảm bảo rằng tên mô hình được đặt đúng với tên người dùng của bạn. Bạn có thể phải sử dụng lệnh ollama cp để sao chép mô hình của bạn và đặt tên chính xác cho nó. Khi bạn hài lòng với tên mô hình, sử dụng lệnh ollama push để đẩy nó lên ollama.com.
shell
ollama cp mymodel myuser/mymodel
ollama push myuser/mymodelSau khi mô hình của bạn đã được đẩy lên, những người dùng khác có thể kéo về và chạy mô hình bằng lệnh:
shell
ollama run myuser/mymodel