Table of Contents
Safetensors 가중치에서 미세 조정된 어댑터 가져오기
먼저, 미세 조정에 사용한 기본 모델을 가리키는 FROM 명령어와, Safetensors 어댑터가 있는 디렉토리를 가리키는 ADAPTER 명령어를 포함한 Modelfile을 생성하세요:
dockerfile
FROM <base model name>
ADAPTER /path/to/safetensors/adapter/directory어댑터 생성에 사용한 것과 동일한 기본 모델을 FROM 명령어에 사용해야 하며, 그렇지 않으면 불안정한 결과가 발생할 수 있습니다. 대부분의 프레임워크는 서로 다른 양자화 방법을 사용하므로, 양자화되지 않은(즉, non-QLoRA) 어댑터를 사용하는 것이 가장 좋습니다. 어댑터가 Modelfile과 같은 디렉토리에 있는 경우, ADAPTER .를 사용하여 어댑터 경로를 지정할 수 있습니다.
이제 Modelfile이 생성된 디렉토리에서 ollama create 명령어를 실행하세요:
shell
ollama create my-model마지막으로 모델을 테스트하세요:
shell
ollama run my-modelOllama는 여러 다른 모델 아키텍처 기반의 어댑터 가져오기를 지원합니다:
- Llama(Llama 2, Llama 3, Llama 3.1, Llama 3.2 포함)
- Mistral(Mistral 1, Mistral 2, Mixtral 포함)
- Gemma(Gemma 1, Gemma 2 포함)
다음은 Safetensors 형식의 어댑터를 출력할 수 있는 미세 조정 프레임워크나 도구를 사용하여 어댑터를 생성할 수 있습니다:
- Hugging Face 미세 조정 프레임워크
- Unsloth
- MLX
Safetensors 가중치에서 모델 가져오기
먼저, Safetensors 가중치가 저장된 디렉토리를 가리키는 FROM 명령어를 포함한 Modelfile을 생성하세요:
dockerfile
FROM /path/to/safetensors/directory가중치와 같은 디렉토리에 Modelfile을 생성하는 경우, FROM . 명령어를 사용할 수 있습니다.
이제 Modelfile을 생성한 디렉토리에서 ollama create 명령어를 실행하세요:
shell
ollama create my-model마지막으로 모델을 테스트하세요:
shell
ollama run my-modelOllama는 여러 다른 아키텍처의 모델 가져오기를 지원합니다:
- Llama(Llama 2, Llama 3, Llama 3.1, Llama 3.2 포함)
- Mistral(Mistral 1, Mistral 2, Mixtral 포함)
- Gemma(Gemma 1, Gemma 2 포함)
- Phi3
이에는 기본 모델뿐만 아니라 기본 모델과 퓨전(fused) 된 미세 조정 모델의 가져오기도 포함됩니다.
GGUF 기반 모델 또는 어댑터 가져오기
GGUF 기반 모델이나 어댑터를 Ollama로 가져올 수 있습니다. GGUF 모델이나 어댑터는 다음 방법으로 얻을 수 있습니다:
- Llama.cpp의
convert_hf_to_gguf.py를 사용하여 Safetensors 모델을 변환하거나 - Llama.cpp의
convert_lora_to_gguf.py를 사용하여 Safetensors 어댑터를 변환하거나 - HuggingFace 등에서 모델이나 어댑터를 다운로드하는 방법이 있습니다.
GGUF 모델을 가져오려면 다음 내용을 포함한 Modelfile을 생성하세요:
dockerfile
FROM /path/to/file.ggufGGUF 어댑터의 경우, 다음 내용으로 Modelfile을 생성하세요:
dockerfile
FROM <model name>
ADAPTER /path/to/file.ggufGGUF 어댑터를 가져올 때는, 어댑터 생성에 사용된 것과 동일한 기본 모델을 사용하는 것이 중요합니다. 다음을 사용할 수 있습니다:
- Ollama의 모델
- GGUF 파일
- Safetensors 기반 모델
Modelfile 생성이 완료되면, ollama create 명령어를 사용하여 모델을 빌드하세요.
shell
ollama create my-model모델 양자화
모델 양자화를 사용하면 모델을 더 빠르게 실행하고 메모리 사용량을 줄일 수 있지만, 정확도가 낮아지는 대가가 있습니다. 이를 통해 사양이 낮은 하드웨어에서도 모델을 실행할 수 있습니다.
Ollama는 ollama create 명령어와 함께 -q/--quantize 플래그를 사용하여 FP16 및 FP32 기반 모델을 다양한 양자화 수준으로 변환할 수 있습니다.
먼저, 양자화하려는 FP16 또는 FP32 기반 모델을 지정한 Modelfile을 생성하세요.
dockerfile
FROM /path/to/my/gemma/f16/model그 다음 ollama create를 사용하여 양자화된 모델을 생성하세요.
shell
$ ollama create --quantize q4_K_M mymodel
transferring model data
quantizing F16 model to Q4_K_M
creating new layer sha256:735e246cc1abfd06e9cdcf95504d6789a6cd1ad7577108a70d9902fef503c1bd
creating new layer sha256:0853f0ad24e5865173bbf9ffcc7b0f5d56b66fd690ab1009867e45e7d2c4db0f
writing manifest
success지원되는 양자화
q8_0
K-평균 양자화
q4_K_Sq4_K_M
ollama.com에 모델 공유하기
생성한 모든 모델을 ollama.com에 푸시하여 다른 사용자가 사용해볼 수 있도록 공유할 수 있습니다.
먼저 브라우저를 사용하여 Ollama 가입 페이지로 이동하세요. 이미 계정이 있는 경우 이 단계를 건너뛸 수 있습니다.

모델 이름에 Username 필드 값이 사용되므로(예: jmorganca/mymodel), 선택한 사용자 이름이 마음에 드는지 확인하세요.
계정을 생성하고 로그인한 후, Ollama 키 설정 페이지로 이동하세요.
페이지의 안내에 따라 Ollama 공개 키의 위치를 확인하세요.

Add Ollama Public Key 버튼을 클릭한 후, Ollama 공개 키의 내용을 복사하여 텍스트 필드에 붙여넣으세요.
ollama.com에 모델을 푸시하려면, 먼저 모델 이름에 사용자 이름이 올바르게 포함되어 있는지 확인하세요. 모델에 올바른 이름을 지정하려면 ollama cp 명령어를 사용하여 모델을 복사해야 할 수 있습니다. 모델 이름이 마음에 들면, ollama push 명령어를 사용하여 ollama.com에 푸시하세요.
shell
ollama cp mymodel myuser/mymodel
ollama push myuser/mymodel모델 푸시가 완료되면, 다른 사용자는 다음 명령어를 사용하여 모델을 가져와 실행할 수 있습니다:
shell
ollama run myuser/mymodel