윈도우에서 로컬 AI 실행하기, 설치부터 최적화까지 7단계 가이드

윈도우에서 로컬 AI 실행하기를 위한 하드웨어 요건, Ollama와 LM Studio 설치, 양자화 모델 선택, GPU 가속 설정과 오류 해결 방법을 순서대로 정리했습니다.

윈도우에서 로컬 AI 실행하기는 인터넷 연결이나 월 구독료 없이 내 PC의 자원만으로 언어 모델을 직접 구동하는 방법입니다. 가장 빠른 출발점은 Ollama를 설치한 뒤 명령 프롬프트에 ollama run llama3.1:8b 한 줄을 입력하는 것입니다. 이 한 줄이면 모델 파일이 자동으로 내려받아지고 곧바로 대화창이 열립니다. 별도의 파이썬 환경 구성이나 복잡한 라이브러리 설치 과정을 거치지 않아도 됩니다.

로컬 실행을 선택하는 이유는 명확합니다. 사내 문서나 개인 자료를 외부 서버로 전송하지 않으므로 보안 부담이 사라지고, 토큰 단위 요금이 발생하지 않아 사용량에 제한이 없습니다. 비행기 안이나 인터넷이 불안정한 환경에서도 동일하게 작동합니다. 아래에서는 하드웨어 요건 점검부터 모델 선택, GPU 가속 설정, 다른 프로그램과의 연동, 오류 대응까지 실제 순서대로 정리했습니다.

윈도우에서 로컬 AI 실행하기 전 확인할 하드웨어 요건

윈도우에서 로컬 AI 실행하기 전 확인할 하드웨어 요건

3줄 요약 · 바로 해결하기

  • Ollama를 설치하고 ollama run llama3.1:8b 한 줄이면 첫 모델이 바로 실행됩니다.
  • VRAM이 부족하면 Q4 계열 양자화 모델로 낮추는 것이 속도 개선에 가장 효과가 큽니다.
  • 화면으로 다루고 싶으면 LM Studio, 업무에 붙이려면 로컬 API 호출 방식을 쓰세요.

최종 점검 2026.8.9 · 이 글의 절차는 발행 시점 기준으로 정리했습니다.

가장 먼저 점검할 항목은 메모리입니다. 언어 모델은 실행 시 모델 파일 전체를 메모리에 올려두고 연산하므로, 파일 크기보다 조금 더 넉넉한 여유 공간이 필요합니다. 그래픽카드가 있다면 전용 메모리인 VRAM에 올리는 편이 압도적으로 빠르고, VRAM이 부족하면 시스템 RAM과 나누어 쓰거나 전부 CPU로 처리하게 됩니다. CPU만으로도 동작은 하지만 응답 속도가 몇 배 느려집니다.

내 PC의 실제 사양은 작업 관리자 성능 탭에서 확인할 수 있습니다. GPU 항목을 클릭하면 전용 GPU 메모리 수치가 표시되고, 메모리 항목에서는 설치된 총 RAM과 남은 슬롯 수를 볼 수 있습니다. 저장 공간도 중요합니다. 모델 하나가 4GB에서 40GB까지 차지하므로 여러 모델을 비교해 보려면 SSD 여유 공간을 최소 50GB 이상 확보해 두는 편이 안전합니다.

모델 규모모델 파일 크기(4비트 기준)권장 VRAM권장 시스템 RAM체감 용도
3B 이하약 2GB4GB8GB요약, 번역, 간단한 분류
7B~8B약 4~5GB8GB16GB일상 업무 대부분, 문서 초안
13B~14B약 8~9GB12GB16GB긴 문맥 정리, 코드 리뷰
30B~34B약 20GB24GB32GB복잡한 추론, 전문 문서
70B 이상약 40GB 이상48GB 이상64GB연구용, 다중 GPU 환경

표의 수치는 4비트 양자화 모델을 기준으로 한 현실적인 최소선입니다. 문맥 길이를 길게 설정하거나 여러 대화를 동시에 처리하면 요구량이 더 늘어납니다. 처음이라면 7B~8B 구간에서 시작해 만족도를 확인한 뒤 상위 모델로 올라가는 방식이 시간과 디스크를 아끼는 길입니다.

Ollama 설치로 첫 모델을 5분 안에 띄우기

Ollama 설치로 첫 모델을 5분 안에 띄우기

Ollama는 윈도우용 설치 파일을 제공하는 로컬 모델 실행 도구입니다. 공식 사이트에서 설치 파일을 받아 실행하면 별도 설정 없이 백그라운드 서비스로 등록되고, 작업 표시줄 우측 알림 영역에 아이콘이 나타납니다. 설치가 끝나면 시작 메뉴에서 명령 프롬프트나 PowerShell을 열어 명령어를 입력하는 방식으로 사용합니다.

가장 먼저 ollama –version을 입력해 설치 여부를 확인합니다. 버전 번호가 출력되면 정상입니다. 이어서 ollama pull 명령으로 모델을 내려받고 ollama run 명령으로 대화를 시작합니다. 모델 이름 뒤에 콜론을 붙여 태그를 지정하면 파라미터 규모나 양자화 방식을 골라 받을 수 있습니다. 대화 중 종료하려면 슬래시와 함께 bye를 입력합니다.

  • ollama list : 내려받은 모델 목록과 각 용량 확인
  • ollama pull 모델명 : 모델만 미리 내려받기
  • ollama run 모델명 : 대화형 세션 시작
  • ollama ps : 현재 메모리에 올라간 모델과 점유량 확인
  • ollama rm 모델명 : 디스크 정리를 위한 모델 삭제

모델 파일은 기본적으로 사용자 폴더 하위의 .ollama 디렉터리에 저장됩니다. C 드라이브 용량이 부족하다면 OLLAMA_MODELS 환경 변수를 다른 드라이브 경로로 지정한 뒤 서비스를 재시작하면 저장 위치를 옮길 수 있습니다. 환경 변수는 시스템 속성의 고급 탭에서 환경 변수 버튼을 눌러 추가하면 됩니다.

LM Studio로 그래픽 화면에서 모델 다루기

명령줄 입력이 부담스럽다면 LM Studio 같은 GUI 도구가 대안입니다. 프로그램 안에 모델 검색창이 내장되어 있어 이름을 입력하면 공개 저장소의 파일 목록이 바로 뜨고, 내 PC 사양으로 실행 가능한 파일에는 별도 표시가 붙습니다. 사양을 초과하는 파일에는 경고가 표시되므로 무리한 모델을 내려받아 시간을 낭비하는 일을 줄일 수 있습니다.

채팅 화면 우측에는 조절 가능한 항목이 나열됩니다. 온도 값을 낮추면 답변이 일관되고 사실 위주로, 높이면 표현이 다양해집니다. 문맥 길이는 한 번에 기억할 수 있는 글자 수를 결정하는데, 값을 키우면 긴 문서를 다룰 수 있지만 메모리 사용량이 함께 늘어납니다. GPU 오프로드 슬라이더로 몇 개 층을 그래픽카드에 올릴지 직접 정할 수 있어 사양이 애매한 PC에서 특히 유용합니다.

문서를 올려 질문하는 기능도 기본 제공됩니다. PDF나 텍스트 파일을 창에 끌어다 놓으면 내용이 분할되어 검색 대상으로 등록되고, 질문에 관련된 부분만 골라 답변에 반영합니다. 계약서 검토나 보고서 요약처럼 외부 서비스에 올리기 꺼려지는 자료를 다룰 때 로컬 방식의 장점이 가장 크게 드러나는 지점입니다.

양자화와 모델 선택 기준 제대로 이해하기

모델 이름 뒤에 붙은 Q4_K_M, Q5_K_S, Q8_0 같은 표기는 양자화 방식을 뜻합니다. 원래 16비트로 저장된 가중치를 4비트나 5비트로 압축해 용량과 메모리 사용량을 줄인 결과물입니다. 숫자가 낮을수록 파일이 작고 빠르지만 답변 품질이 조금씩 떨어지고, 숫자가 높을수록 원본에 가깝지만 무거워집니다.

실무 기준으로는 Q4_K_M이 가장 균형이 좋다고 평가됩니다. 용량 대비 품질 손실이 크지 않아 대부분의 문서 작업과 질의응답에서 체감 차이를 느끼기 어렵습니다. VRAM이 넉넉하다면 Q5나 Q6 계열로 올려 미세한 표현력 차이를 확인해 볼 수 있고, 4GB급 노트북이라면 Q4 이하의 소형 모델부터 시작하는 편이 현실적입니다.

파라미터 규모와 양자화 중 무엇을 먼저 포기해야 하는지 고민된다면, 같은 메모리 예산에서는 더 큰 모델을 강하게 압축하는 쪽이 대체로 유리합니다. 예를 들어 8GB VRAM 환경이라면 3B 모델을 8비트로 쓰는 것보다 8B 모델을 4비트로 쓰는 편이 답변 품질이 좋은 경우가 많습니다. 다만 코드 생성처럼 정확도가 중요한 작업에서는 압축률이 낮은 파일이 오류를 덜 만드는 경향이 있어 용도별로 두 가지를 준비해 두는 방법도 좋습니다.

GPU 가속 설정과 응답 속도 최적화 요령

엔비디아 그래픽카드를 쓴다면 최신 게임 레디 드라이버 또는 스튜디오 드라이버를 설치하는 것만으로 대부분의 가속 설정이 끝납니다. Ollama와 LM Studio 모두 CUDA 지원 여부를 자동으로 감지해 층을 GPU에 올립니다. 실제로 가속이 작동하는지 확인하려면 모델에 질문을 던진 직후 작업 관리자 성능 탭의 GPU 그래프가 치솟는지 살펴보면 됩니다. CPU만 100%로 튀고 GPU가 조용하다면 가속이 적용되지 않은 상태입니다.

AMD 라데온 사용자는 ROCm 지원 여부가 모델과 도구에 따라 갈리므로, DirectML 기반 실행 옵션을 제공하는 도구를 고르는 편이 안전합니다. 마이크로소프트가 정리한 윈도우 AI 개발 환경 공식 문서를 참고하면 하드웨어별로 어떤 실행 경로를 선택해야 하는지 판단하기 쉬워집니다. 내장 그래픽만 있는 사무용 PC라면 처음부터 3B 이하 소형 모델로 범위를 좁히는 것이 시간을 아끼는 방법입니다.

속도가 기대보다 느릴 때 손볼 지점은 세 곳입니다. 첫째, 문맥 길이를 필요 이상으로 크게 잡지 않습니다. 32K로 설정해 두면 짧은 질문에도 메모리가 크게 점유됩니다. 둘째, 브라우저 탭과 백그라운드 앱을 정리해 VRAM 여유를 확보합니다. 셋째, 윈도우 전원 옵션을 고성능 또는 최고의 성능으로 변경합니다. 노트북에서 절전 모드가 걸려 있으면 GPU 클럭이 제한되어 체감 속도가 절반 가까이 떨어질 수 있습니다.

로컬 AI를 API로 연결해 실제 업무에 붙이기

Ollama는 설치와 동시에 로컬 서버를 띄웁니다. 기본 주소는 localhost의 11434 포트이며, OpenAI 호환 형식의 요청도 받아들입니다. 덕분에 기존에 만들어 둔 스크립트나 확장 프로그램에서 접속 주소만 바꿔 주면 외부 API 대신 내 PC의 모델을 쓰도록 전환할 수 있습니다. 요금 걱정 없이 반복 실행이 가능하다는 점에서 자동화와 궁합이 좋습니다.

브라우저에서 쓰기 편한 화면이 필요하다면 Open WebUI처럼 로컬 서버에 연결되는 웹 인터페이스를 함께 설치하는 방법이 있습니다. 대화 기록 저장, 프롬프트 템플릿 관리, 여러 모델 전환 같은 기능을 갖추고 있어 실제 업무 도구에 가깝게 쓸 수 있습니다. 문서 폴더를 지정해 검색 기반 답변을 구성하는 것도 가능합니다.

주의할 점은 서버 노출 범위입니다. 편의를 위해 외부 접속을 허용해 두면 같은 네트워크의 다른 기기에서 내 모델과 대화 기록에 접근할 수 있습니다. 기본값인 로컬 전용 상태를 유지하고, 다른 기기에서 써야 한다면 방화벽 규칙과 인증을 반드시 함께 설정해야 합니다.

자주 발생하는 오류와 해결 순서

모델을 내려받는 도중 연결이 끊기거나 진행률이 멈추는 현상이 가장 흔합니다. 이 경우 명령을 다시 실행하면 중단된 지점부터 이어받는 경우가 많고, 계속 실패한다면 회사망이나 공용 와이파이의 트래픽 제한을 의심해 봐야 합니다. 백신 프로그램의 실시간 검사가 대용량 파일 쓰기를 막는 사례도 있어 다운로드 폴더를 예외로 등록하면 해결되는 경우가 있습니다.

실행 중 갑자기 종료되거나 응답이 중간에 끊기면 메모리 부족이 원인일 확률이 높습니다. 더 작은 모델이나 압축률이 높은 파일로 바꾸고, 문맥 길이를 절반으로 줄여 다시 시도합니다. 명령을 입력했는데 아무 반응이 없다면 백그라운드 서비스가 내려간 상태일 수 있으니 작업 관리자에서 관련 프로세스를 확인하고 프로그램을 재시작합니다.

포트 충돌도 종종 발생합니다. 다른 프로그램이 이미 11434 포트를 쓰고 있으면 서버가 시작되지 않으므로, 환경 변수로 포트를 변경하거나 충돌 프로그램을 종료해야 합니다. 답변 품질이 이상하게 낮다면 모델이 잘못 내려받아졌을 가능성이 있어 삭제 후 다시 받는 편이 빠릅니다.

윈도우에서 로컬 AI 실행하기의 핵심은 내 하드웨어에 맞는 모델을 고르고, 가속이 실제로 작동하는지 눈으로 확인하는 두 가지입니다. 이 두 단계만 정확히 잡아 두면 이후에는 모델을 바꿔 끼우며 용도별 최적 조합을 찾아가는 과정이 됩니다. 처음에는 8B급 4비트 모델로 시작해 일주일 정도 실제 업무에 써 본 뒤 상향 또는 하향을 결정하는 방식을 권합니다.

윈도우 로컬 AI 실행 자주 묻는 질문

로컬 AI를 돌리려면 그래픽카드가 꼭 필요한가요?

필수는 아닙니다. CPU만으로도 7B~8B급 모델은 실행되지만 응답이 눈에 띄게 느립니다. VRAM 8GB 이상 그래픽카드가 있으면 체감 속도가 크게 달라지며, VRAM이 부족하면 Q4 계열 양자화 모델을 선택해 메모리 사용량을 줄이는 방법이 현실적입니다.

Ollama와 LM Studio 중 무엇을 먼저 써야 하나요?

명령어가 익숙하다면 Ollama가 가볍고 API 연동도 쉽습니다. 터미널이 부담스럽다면 모델 검색과 다운로드, 대화까지 화면에서 처리하는 LM Studio가 편합니다. 두 도구를 함께 설치해도 충돌하지 않으므로 비교해 보고 선택해도 됩니다.

모델이 다운로드되지 않거나 실행 중 멈추면 어떻게 하나요?

먼저 디스크 여유 공간과 방화벽 차단 여부를 확인하세요. 모델 파일은 수 GB 단위라 저장 공간이 부족하면 조용히 실패합니다. 실행 중 멈춘다면 메모리 부족일 가능성이 높으므로 더 작은 파라미터의 모델이나 낮은 양자화 버전으로 바꿔 다시 시도해 보시기 바랍니다.

함께 읽으면 좋은 글

로컬 모델을 돌리기 전에 PC 자원 상태를 먼저 정리하면 체감 속도가 크게 달라집니다. 윈도우 작업 관리자 활용법으로 리소스를 점검하는 방법을 함께 적용해 보시고, 브라우저 기반 도구를 병행할 계획이라면 연결 오류 대응 가이드도 참고하면 도움이 됩니다.

Leek의 블로그 홈으로

다른 속도 최적화와 문제 해결 가이드도 홈에서 모아 보실 수 있습니다.

Leek
Leek

웹·브라우저 문제 해결과 속도 최적화를 직접 확인해 기록하는 1인 블로그 운영자입니다. 브라우저·서버·CDN 캐시, 크롬·엣지·웨일 설정, 워드프레스 운영과 캐시 플러그인, 윈도우 성능 관리, 구글 계정·Gmail·구글 포토 오류까지 제가 실제로 겪고 해결한 과정을 클릭 경로와 확인 날짜로 남깁니다. 개념만 옮겨 적기보다, 어떤 순서로 눌렀고 무엇이 달라졌는지를 쓰는 데 초점을 둡니다.

기사 : 46

댓글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다