Skip to content

Ollama를 어떻게 업그레이드할 수 있나요?

macOS와 Windows에서 실행되는 Ollama는 자동으로 업데이트를 다운로드합니다. 작업 표시줄 또는 메뉴 막대의 항목을 클릭한 다음 "Restart to update"를 클릭해 업데이트를 적용하세요. 최신 버전을 수동으로 다운로드해 업데이트를 설치할 수도 있습니다.

Linux의 경우 설치 스크립트를 다시 실행하세요:

shell
curl -fsSL https://ollama.com/install.sh | sh

로그를 어떻게 확인할 수 있나요?

로그 사용에 대한 자세한 내용은 문제 해결 문서를 참조하세요.

내 GPU가 Ollama와 호환되나요?

GPU 문서를 참조하세요.

컨텍스트 창 크기를 어떻게 지정할 수 있나요?

기본적으로 Ollama는 4096 토큰의 컨텍스트 창 크기를 사용합니다.

이 값은 OLLAMA_CONTEXT_LENGTH 환경 변수로 재정의할 수 있습니다. 예를 들어 기본 컨텍스트 창을 8K로 설정하려면 다음을 사용하세요:

shell
OLLAMA_CONTEXT_LENGTH=8192 ollama serve

ollama run을 사용할 때 이 값을 변경하려면 /set parameter를 사용하세요:

shell
/set parameter num_ctx 4096

API를 사용할 때는 num_ctx 매개변수를 지정하세요:

shell
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Why is the sky blue?",
  "options": {
    "num_ctx": 4096
  }
}'

모델이 GPU에 로드되었는지 어떻게 확인할 수 있나요?

현재 메모리에 로드된 모델을 확인하려면 ollama ps 명령어를 사용하세요.

shell
ollama ps

INFO

출력:

NAME        ID            SIZE    PROCESSOR   UNTIL
llama3:70b  bcfb190ca3a7  42 GB   100% GPU    4 minutes from now

Processor 열은 모델이 로드된 메모리를 표시합니다:

  • 100% GPU: 모델이 GPU에 전체적으로 로드되었음을 의미합니다.
  • 100% CPU: 모델이 시스템 메모리에 전체적으로 로드되었음을 의미합니다.
  • 48%/52% CPU/GPU: 모델이 GPU와 시스템 메모리에 부분적으로 로드되었음을 의미합니다.

Ollama 서버를 어떻게 구성하나요?

Ollama 서버는 환경 변수로 구성할 수 있습니다.

Mac에서 환경 변수 설정하기

Ollama가 macOS 애플리케이션으로 실행되는 경우 환경 변수는 launchctl을 사용하여 설정해야 합니다:

  1. 각 환경 변수에 대해 launchctl setenv를 호출하세요.

    bash
    launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
  2. Ollama 애플리케이션을 재시작하세요.

Linux에서 환경 변수 설정하기

Ollama가 systemd 서비스로 실행되는 경우 환경 변수는 systemctl을 사용하여 설정해야 합니다:

  1. systemctl edit ollama.service를 호출하여 systemd 서비스를 편집하세요. 이 명령은 편집기를 엽니다.

  2. 각 환경 변수에 대해 [Service] 섹션 아래에 Environment 줄을 추가하세요:

    ini
    [Service]
    Environment="OLLAMA_HOST=0.0.0.0:11434"
  3. 저장 후 종료하세요.

  4. systemd를 다시 불러오고 Ollama를 재시작하세요:

    shell
    systemctl daemon-reload
    systemctl restart ollama

Windows에서 환경 변수 설정하기

Windows에서 Ollama는 사용자 및 시스템 환경 변수를 상속합니다.

  1. 먼저 작업 표시줄에서 Ollama를 클릭하여 종료하세요.

  2. 설정(Windows 11) 또는 제어판(Windows 10) 앱을 시작하고 환경 변수를 검색하세요.

  3. 내 계정의 환경 변수 편집을 클릭하세요.

  4. 사용자 계정에 대한 OLLAMA_HOST, OLLAMA_MODELS 등의 변수를 편집하거나 새로 생성하세요.

  5. 저장하려면 확인/적용을 클릭하세요.

  6. Windows 시작 메뉴에서 Ollama 애플리케이션을 시작하세요.

프록시 뒤에서 Ollama를 어떻게 사용하나요?

Ollama는 인터넷에서 모델을 가져오며 모델에 접근하려면 프록시 서버가 필요할 수 있습니다. HTTPS_PROXY를 사용하여 아웃바운드 요청을 프록시를 통해 리디렉션하세요. 프록시 인증서가 시스템 인증서로 설치되어 있는지 확인하세요. 플랫폼별 환경 변수 사용 방법은 위 섹션을 참조하세요.

참고

HTTP_PROXY 설정은 피하세요. Ollama는 모델 가져오기에 HTTP를 사용하지 않고 HTTPS만 사용합니다. HTTP_PROXY를 설정하면 클라이언트의 서버 연결이 중단될 수 있습니다.

Docker에서 프록시 뒤에서 Ollama 사용하기

Ollama Docker 컨테이너 이미지는 컨테이너를 시작할 때 -e HTTPS_PROXY=https://proxy.example.com를 전달하여 프록시를 사용하도록 구성할 수 있습니다.

또는 Docker 데몬을 프록시를 사용하도록 구성할 수도 있습니다. Docker Desktop에 대한 지침은 macOS, Windows, Linux 및 systemd를 사용하는 Docker 데몬에서 확인할 수 있습니다.

HTTPS를 사용할 때 인증서가 시스템 인증서로 설치되어 있는지 확인하세요. 자체 서명 인증서를 사용하는 경우 새 Docker 이미지가 필요할 수 있습니다.

dockerfile
FROM ollama/ollama
COPY my-ca.pem /usr/local/share/ca-certificates/my-ca.crt
RUN update-ca-certificates

이 이미지를 빌드하고 실행하세요:

shell
docker build -t ollama-with-ca .
docker run -d -e HTTPS_PROXY=https://my.proxy.example.com -p 11434:11434 ollama-with-ca

Ollama가 내 프롬프트와 답변을 ollama.com으로 다시 전송하나요?

Ollama는 로컬에서 실행됩니다. 로컬에서 실행할 때 사용자의 프롬프트나 데이터를 확인하지 않습니다. 클라우드 호스팅 모델을 사용할 때 서비스를 제공하기 위해 프롬프트와 응답을 처리하지만 해당 콘텐츠는 저장하거나 로깅하지 않으며 절대 학습에 사용하지 않습니다. 서비스 제공에 필요한 기본 계정 정보와 제한된 사용 메타데이터를 수집하지만 프롬프트나 응답 콘텐츠는 포함되지 않습니다. 사용자의 데이터를 판매하지 않으며 언제든지 계정을 삭제할 수 있습니다.

Ollama의 클라우드 기능을 어떻게 비활성화하나요?

Ollama의 클라우드 기능을 비활성화하여 로컬 전용 모드로 실행할 수 있습니다. 클라우드 기능을 끄면 Ollama의 클라우드 모델과 웹 검색 기능을 사용할 수 없게 됩니다.

~/.ollama/server.json에서 disable_ollama_cloud를 설정하세요:

json
{
  "disable_ollama_cloud": true
}

환경 변수를 설정할 수도 있습니다:

shell
OLLAMA_NO_CLOUD=1

구성 변경 후 Ollama를 재시작하세요. 비활성화되면 Ollama 로그에 Ollama cloud disabled: true가 표시됩니다.

네트워크에서 Ollama를 어떻게 노출할 수 있나요?

기본적으로 Ollama는 127.0.0.1 포트 11434에 바인딩됩니다. OLLAMA_HOST 환경 변수로 바인딩 주소를 변경할 수 있습니다.

플랫폼별 환경 변수 설정 방법은 위 섹션을 참조하세요.

프록시 서버와 함께 Ollama를 어떻게 사용할 수 있나요?

Ollama는 HTTP 서버를 실행하며 Nginx와 같은 프록시 서버를 사용하여 노출할 수 있습니다. 이렇게 하려면 프록시가 요청을 전달하도록 구성하고 필요에 따라 필요한 헤더를 설정하세요(Ollama를 네트워크에 노출하지 않는 경우). 예를 들어 Nginx의 경우:

nginx
server {
    listen 80;
    server_name example.com;  # Replace with your domain or IP
    location / {
        proxy_pass http://localhost:11434;
        proxy_set_header Host localhost:11434;
    }
}

ngrok과 함께 Ollama를 어떻게 사용할 수 있나요?

터널링 앱을 사용하여 Ollama에 접근할 수 있습니다. 예를 들어 Ngrok의 경우:

shell
ngrok http 11434 --host-header="localhost:11434"

Cloudflare Tunnel과 함께 Ollama를 어떻게 사용할 수 있나요?

Cloudflare Tunnel과 함께 Ollama를 사용하려면 --url--http-host-header 플래그를 사용하세요:

shell
cloudflared tunnel --url http://localhost:11434 --http-host-header="localhost:11434"

추가 웹 출처가 Ollama에 접근할 수 있도록 허용하려면 어떻게 하나요?

기본적으로 Ollama는 127.0.0.10.0.0.0에서의 교차 출처 요청을 허용합니다. 추가 출처는 OLLAMA_ORIGINS로 구성할 수 있습니다.

브라우저 확장 프로그램의 경우 확장 프로그램의 출처 패턴을 명시적으로 허용해야 합니다. 모든 브라우저 확장 프로그램의 접근을 허용하려면 OLLAMA_ORIGINSchrome-extension://*, moz-extension://*, safari-web-extension://*를 포함하도록 설정하거나, 필요한 경우 특정 확장 프로그램만 허용할 수 있습니다:

# Allow all Chrome, Firefox, and Safari extensions
OLLAMA_ORIGINS=chrome-extension://*,moz-extension://*,safari-web-extension://* ollama serve

플랫폼별 환경 변수 설정 방법은 위 섹션을 참조하세요.

모델은 어디에 저장되나요?

  • macOS: ~/.ollama/models
  • Linux: /usr/share/ollama/.ollama/models
  • Windows: C:\Users\%username%\.ollama\models

모델 저장 위치를 변경하려면 어떻게 하나요?

다른 디렉토리를 사용해야 하는 경우 환경 변수 OLLAMA_MODELS를 선택한 디렉토리로 설정하세요.

참고

표준 설치 프로그램을 사용하는 Linux의 경우 ollama 사용자가 지정된 디렉토리에 대한 읽기 및 쓰기 권한이 필요합니다. 디렉토리를 ollama 사용자에게 할당하려면 sudo chown -R ollama:ollama <directory>를 실행하세요.

플랫폼별 환경 변수 설정 방법은 위 섹션을 참조하세요.

Visual Studio Code에서 Ollama를 어떻게 사용할 수 있나요?

Ollama를 활용하는 VS Code 및 기타 편집기용 플러그인이 이미 많이 있습니다. 기본 리포지토리 readme 하단의 확장 프로그램 및 플러그인 목록을 확인하세요.

Docker에서 GPU 가속과 함께 Ollama를 어떻게 사용할 수 있나요?

Ollama Docker 컨테이너는 Linux 또는 Windows(WSL2 사용)에서 GPU 가속으로 구성할 수 있습니다. 이 작업에는 nvidia-container-toolkit이 필요합니다. 자세한 내용은 ollama/ollama를 참조하세요.

macOS의 Docker Desktop은 GPU 패스스루 및 에뮬레이션 부재로 인해 GPU 가속을 사용할 수 없습니다.

Windows 10의 WSL2에서 네트워킹이 느린 이유는 무엇인가요?

이 문제는 Ollama 설치 및 모델 다운로드 모두에 영향을 줄 수 있습니다.

제어판 > 네트워크 및 인터넷 > 네트워크 상태 및 작업 보기를 열고 왼쪽 패널에서 어댑터 설정 변경을 클릭하세요. vEthernet (WSL) 어댑터를 찾아 마우스 오른쪽 버튼으로 클릭한 후 속성을 선택하세요. 구성을 클릭한 후 고급 탭을 열으세요. 각 속성을 검색하여 Large Send Offload Version 2 (IPv4)Large Send Offload Version 2 (IPv6)를 찾습니다. 이 두 속성을 모두 비활성화하세요.

더 빠른 응답 시간을 얻기 위해 Ollama에 모델을 미리 로드하려면 어떻게 하나요?

API를 사용하는 경우 Ollama 서버에 빈 요청을 보내어 모델을 미리 로드할 수 있습니다. 이 방법은 /api/generate/api/chat API 엔드포인트 모두에서 작동합니다.

generate 엔드포인트를 사용하여 mistral 모델을 미리 로드하려면 다음을 사용하세요:

shell
curl http://localhost:11434/api/generate -d '{"model": "mistral"}'

chat completions 엔드포인트를 사용하려면 다음을 사용하세요:

shell
curl http://localhost:11434/api/chat -d '{"model": "mistral"}'

CLI를 사용하여 모델을 미리 로드하려면 다음 명령을 사용하세요:

shell
ollama run llama3.2 ""

모델을 메모리에 유지하거나 즉시 언로드하려면 어떻게 하나요?

기본적으로 모델은 언로드되기 전에 5분 동안 메모리에 유지됩니다. 이를 통해 LLM에 수많은 요청을 보낼 때 더 빠른 응답 시간을 얻을 수 있습니다. 모델을 즉시 메모리에서 언로드하려면 ollama stop 명령을 사용하세요:

shell
ollama stop llama3.2

API를 사용하는 경우 /api/generate/api/chat 엔드포인트에서 keep_alive 매개변수를 사용하여 모델이 메모리에 유지되는 시간을 설정할 수 있습니다. keep_alive 매개변수는 다음 값으로 설정할 수 있습니다:

  • 기간 문자열(예: "10m", "24h")
  • 초 단위 숫자(예: 3600)
  • 모델을 메모리에 유지하는 임의의 음수(예: -1, "-1m")
  • 응답 생성 후 모델을 즉시 언로드하는 '0'

예를 들어 모델을 미리 로드하고 메모리에 유지하려면 다음을 사용하세요:

shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'

모델을 언로드하고 메모리를 확보하려면 다음을 사용하세요:

shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": 0}'

또는 Ollama 서버를 시작할 때 OLLAMA_KEEP_ALIVE 환경 변수를 설정하여 모든 모델이 메모리에 로드되는 시간을 변경할 수 있습니다. OLLAMA_KEEP_ALIVE 변수는 위에서 언급한 keep_alive 매개변수와 같은 매개변수 유형을 사용합니다. 환경 변수를 올바르게 설정하는 방법은 Ollama 서버 구성 방법 섹션을 참조하세요.

/api/generate/api/chat API 엔드포인트의 keep_alive API 매개변수는 OLLAMA_KEEP_ALIVE 설정보다 우선합니다.

Ollama 서버가 큐에 대기할 수 있는 최대 요청 수를 관리하려면 어떻게 하나요?

서버에 너무 많은 요청이 전송되면 서버가 과부하 상태임을 나타내는 503 오류가 반환됩니다. OLLAMA_MAX_QUEUE를 설정하여 큐에 대기할 수 있는 요청 수를 조정할 수 있습니다.

Ollama는 동시 요청을 어떻게 처리하나요?

Ollama는 두 가지 수준의 동시 처리를 지원합니다. 시스템에 충분한 사용 가능 메모리(CPU 추론 시 시스템 메모리, GPU 추론 시 VRAM)가 있는 경우 여러 모델을 동시에 로드할 수 있습니다. 특정 모델의 경우 로드 시 충분한 사용 가능 메모리가 있으면 병렬 요청 처리가 허용되도록 구성됩니다.

하나 이상의 모델이 이미 로드된 상태에서 새 모델 요청을 로드할 충분한 사용 가능 메모리가 없는 경우 새 모델을 로드할 수 있을 때까지 모든 새 요청이 큐에 대기합니다. 이전 모델이 유휴 상태가 되면 하나 이상의 모델이 언로드되어 새 모델을 위한 공간이 확보됩니다. 큐에 대기한 요청은 순서대로 처리됩니다. GPU 추론을 사용할 때 새 모델이 완전히 VRAM에 맞아야 동시 모델 로드가 가능합니다.

특정 모델에 대한 병렬 요청 처리는 병렬 요청 수만큼 컨텍스트 크기가 증가하는 결과를 가져옵니다. 예를 들어 2K 컨텍스트에 4개의 병렬 요청이 있으면 8K 컨텍스트와 추가 메모리 할당이 발생합니다.

다음 서버 설정을 사용하여 대부분의 플랫폼에서 Ollama가 동시 요청을 처리하는 방식을 조정할 수 있습니다:

  • OLLAMA_MAX_LOADED_MODELS: 사용 가능한 메모리에 맞는 경우 동시에 로드할 수 있는 최대 모델 수입니다. 기본값은 GPU 수의 3배 또는 CPU 추론의 경우 3입니다.
  • OLLAMA_NUM_PARALLEL: 각 모델이 동시에 처리할 최대 병렬 요청 수로 기본값은 1입니다. 필요한 RAM은 OLLAMA_NUM_PARALLEL * OLLAMA_CONTEXT_LENGTH만큼 증가합니다.
  • OLLAMA_MAX_QUEUE: Ollama가 바쁠 때 추가 요청을 거부하기 전에 큐에 대기할 최대 요청 수로 기본값은 512입니다.

참고: ROCm v5.7의 사용 가능 VRAM 보고 제한으로 인해 Radeon GPU가 있는 Windows는 현재 최대 모델 수가 1로 기본 설정되어 있습니다. ROCm v6.2가 출시되면 Windows Radeon은 위의 기본값을 따릅니다. Windows에서 Radeon의 동시 모델 로드를 활성화할 수 있지만 GPU VRAM에 맞는 것보다 더 많은 모델을 로드하지 않도록 하세요.

Ollama는 여러 GPU에서 모델을 어떻게 로드하나요?

새 모델을 로드할 때 Ollama는 모델에 필요한 VRAM과 현재 사용 가능한 VRAM을 비교합니다. 모델이 단일 GPU에 완전히 맞는 경우 Ollama는 해당 GPU에 모델을 로드합니다. 이 경우 추론 중에 PCI 버스를 통해 전송되는 데이터 양이 줄어들어 일반적으로 최상의 성능을 제공합니다. 모델이 단일 GPU에 완전히 맞지 않는 경우 사용 가능한 모든 GPU에 분산되어 로드됩니다.

Flash Attention을 어떻게 활성화할 수 있나요?

Flash Attention은 대부분의 최신 모델의 기능으로, 컨텍스트 크기가 커질수록 메모리 사용량을 크게 줄일 수 있습니다. Ollama는 선택한 백엔드와 디바이스가 지원하는 경우 자동으로 Flash Attention을 사용합니다. 강제로 Flash Attention을 활성화하려면 Ollama 서버를 시작할 때 OLLAMA_FLASH_ATTENTION=1을 설정하세요. 비활성화하려면 OLLAMA_FLASH_ATTENTION=0을 설정하세요.

K/V 캐시의 양자화 유형을 어떻게 설정할 수 있나요?

K/V 컨텍스트 캐시를 양자화하면 Flash Attention이 활성화되었을 때 메모리 사용량을 크게 줄일 수 있습니다.

Ollama에서 양자화된 K/V 캐시를 사용하려면 다음 환경 변수를 설정할 수 있습니다:

  • OLLAMA_KV_CACHE_TYPE - K/V 캐시의 양자화 유형입니다. 기본값은 f16입니다.

Note

현재 이 옵션은 전역 옵션으로, 지정된 양자화 유형으로 모든 모델이 실행됩니다.

현재 사용 가능한 K/V 캐시 양자화 유형은 다음과 같습니다:

  • f16 - 고정밀, 높은 메모리 사용량(기본값).
  • q8_0 - 8비트 양자화로, f16보다 약 절반의 메모리를 사용하며 정밀도 손실이 매우 작아 일반적으로 모델 품질에 눈에 띄는 영향을 미치지 않습니다(f16을 사용하지 않는 경우 권장).
  • q4_0 - 4비트 양자화로, f16보다 약 1/4의 메모리를 사용하며 정밀도 손실이 소~중간 수준으로, 높은 컨텍스트 크기에서 더 눈에 띌 수 있습니다.

캐시 양자화가 모델의 응답 품질에 미치는 영향은 모델과 작업에 따라 다릅니다. GQA 수가 높은 모델(예: Qwen2)은 GQA 수가 낮은 모델보다 양자화로 인한 정밀도 영향이 더 클 수 있습니다.

메모리 사용량과 품질 사이의 최적 균형을 찾으려면 다양한 양자화 유형을 실험해보셔야 할 수 있습니다.

내 Ollama 공개 키는 어디에서 찾을 수 있나요?

Ollama 공개 키는 로컬 Ollama 인스턴스가 ollama.com과 통신할 수 있게 해주는 키 쌍의 공개 부분입니다.

다음 작업에 필요합니다:

  • Ollama에 모델 푸시
  • 기기에 Ollama 개인 모델 풀링
  • Ollama Cloud에서 호스팅되는 모델 실행

키 추가 방법

  • Mac 및 Windows 앱의 설정 페이지에서 로그인

  • CLI로 로그인

shell
ollama signin

Ollama 공개 키의 저장 위치

OSid_ed25519.pub 경로
macOS~/.ollama/id_ed25519.pub
Linux/usr/share/ollama/.ollama/id_ed25519.pub
WindowsC:\Users\<username>\.ollama\id_ed25519.pub

Note

<username>을 실제 Windows 사용자 이름으로 바꾸세요.

컴퓨터에 로그인할 때 Ollama가 자동으로 시작되지 않게 하려면 어떻게 해야 하나요?

Windows 및 MacOS용 Ollama는 설치 시 로그인 항목으로 등록됩니다. 자동으로 시작하는 것을 원하지 않으면 이 설정을 비활성화할 수 있습니다. 앱을 제거하지 않는 한 업그레이드 후에도 이 설정이 유지됩니다.

Windows

  • 작업 관리자시작 앱 탭으로 이동해 ollama를 검색한 다음 사용 안 함을 클릭하세요

MacOS

  • 설정을 열고 "로그인 항목"을 검색한 다음, 백그라운드에서 허용 아래의 Ollama 항목을 찾아 슬라이더를 비활성화하세요