로컬 LLM 개인 PC에서 돌리는 방법과 조건
로컬 LLM은 모델을 내 PC에 내려받아 인터넷 없이 돌리는 방식이다. 데이터가 밖으로 나가지 않는다는 것이 가장 큰 이유고, 대신 속도와 성능은 클라우드 모델보다 낮다. 실행 여부를 가르는 것은 CPU가 아니라 메모리 용량이다.
목차

왜 로컬로 돌리나?
이유는 세 가지다. 성능이 목적이면 클라우드가 낫고, 아래 이유가 없으면 굳이 로컬로 갈 필요가 없다.
- 데이터가 나가지 않는다 — 사내 자료나 개인정보를 다룰 때
- 호출 비용이 없다 — 반복 작업을 많이 돌릴 때
- 인터넷 없이 된다 — 폐쇄망이나 이동 중
첫 번째가 대부분의 실제 동기다. 사내 규정상 외부 서비스에 자료를 넣을 수 없는 경우 선택지가 로컬뿐이다. 확인할 항목은 사내 AI 도입 규정 체크리스트 7가지 총정리에 정리했다.
어떤 사양이 필요한가?
메모리가 관건이다. 모델 크기가 메모리에 올라가야 실행되기 때문에, 용량이 부족하면 아예 안 돌거나 극단적으로 느려진다.
| 모델 크기 | 필요 메모리(대략) | 체감 |
|---|---|---|
| 3B 이하 | 4~8GB | 가볍지만 품질 제한 |
| 7~8B | 8~16GB | 일반 용도 하한선 |
| 13B 내외 | 16~32GB | 여유 있는 편 |
| 30B 이상 | 32GB+ | 고사양 필요 |

GPU가 있으면 훨씬 빠르지만 필수는 아니다. 통합 메모리를 쓰는 최신 노트북에서는 CPU만으로도 작은 모델이 돌아간다.
양자화가 무엇인가?
모델의 정밀도를 낮춰 용량을 줄이는 기법이다. 같은 모델이라도 양자화 수준에 따라 필요 메모리가 크게 달라진다.
파일명에 붙은 표기가 그 수준을 나타낸다. 숫자가 낮을수록 가볍고 품질 손실이 커진다.
실무 기준은 단순하다. 내 메모리에 올라가는 것 중 가장 큰 것을 고른다. 메모리를 넘기면 속도가 급격히 떨어져 쓸 수 없다.
메모리를 넘기면 시스템이 디스크를 임시 메모리처럼 쓰는데, 이때 속도가 수십 배 느려진다. 한 문장 답하는 데 몇 분이 걸리면 실용성이 사라진다.
여유도 남겨야 한다. 운영체제와 다른 프로그램이 쓰는 메모리가 있으므로, 전체 용량을 다 쓸 수 있다고 계산하면 안 된다. 절반 정도를 모델 몫으로 잡는 편이 안전하다.
어떻게 시작하나?
실행 도구를 설치하고 모델을 내려받는 순서다. 명령줄 없이 쓸 수 있는 도구도 있다.
- 실행 도구 설치 — 데스크톱 앱 형태와 명령줄 형태가 있다
- 모델 선택 — 용도와 메모리에 맞춰
- 내려받기 — 수 GB 단위라 시간이 걸린다
- 테스트 — 응답 속도를 먼저 확인
- 필요하면 더 작은 모델로 교체
5번을 예상해두는 편이 낫다. 처음 고른 모델이 느리면 한 단계 작은 것으로 내려오면 된다.

무엇을 기대하면 안 되나?
클라우드 최신 모델과 같은 품질을 기대하면 실망한다. 특히 긴 문맥과 복잡한 추론에서 차이가 크다.
- 긴 문서 처리 — 문맥 길이 제한이 더 빡빡하다
- 복잡한 추론 — 다단계 판단에서 오류가 늘어난다
- 최신 정보 — 학습 시점 이후는 모른다
그래서 용도를 나누는 방식이 현실적이다. 민감한 자료 요약과 분류는 로컬로, 복잡한 판단은 클라우드로 보낸다. 작업별로 모델을 나누는 기준은 AI API 비용 줄이는 5가지 방법과 토큰 계산에 정리했다.
결과 검증은 로컬이라고 면제되지 않는다. 오히려 오류가 늘어나므로 AI 답변 검증하는 4가지 방법과 확인 순서 정리가 더 중요해진다.
모델과 도구 정보는 Hugging Face에서 확인한다.
자주 묻는 질문
GPU가 없으면 못 쓰나?
쓸 수 있다. 속도가 느릴 뿐이다. 작은 모델은 CPU만으로도 실용적인 속도가 나온다.
인터넷이 필요한가?
모델을 내려받을 때만 필요하다. 이후에는 오프라인으로 동작한다.
데이터가 정말 안 나가나?
로컬에서 실행되는 동안은 나가지 않는다. 다만 도구가 별도로 통계를 보내는지는 설정에서 확인해야 한다.
어느 정도 모델부터 쓸 만한가?
용도에 달렸다. 요약과 분류는 작은 모델로도 되고, 문서 작성이나 코드는 클수록 차이가 난다.
정리
- 로컬 LLM을 쓰는 이유는 데이터가 나가지 않는 것이 첫째다
- 실행을 가르는 것은 CPU가 아니라 메모리 용량
- 양자화 수준에 따라 필요 메모리가 크게 달라진다
- 내 메모리에 올라가는 것 중 가장 큰 모델을 고른다
- 긴 문맥과 복잡한 추론은 여전히 클라우드가 낫다
다음 행동은 내 PC의 메모리 용량을 확인하는 것이다. 그 숫자가 고를 수 있는 모델을 정한다.
글쓴이 션잇 · IT 전문가. 업무 자동화와 AI 도구를 다룬다
댓글