
이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.
Ollama를 처음 설치할 때는 솔직히 RAM부터 봤다.
개발용 PC나 노트북을 고를 때도 늘 그랬다.
16GB면 부족한가?
32GB면 충분한가?
IntelliJ 켜고, 브라우저 띄우고, Docker까지 쓰다 보면 RAM이 중요했으니까 로컬 AI도 비슷할 거라고 생각했다.
그런데 직접 Ollama를 돌려보고 나서는 보는 순서가 조금 바뀌었다.
실행되는 것과 쓸 만한 것은 달랐다
Security Lens를 만들면서 Ollama에 Gemma 계열 모델을 붙여봤다.
당시 내 환경에서는 GPU와 CUDA 쪽이 생각대로 붙지 않았고 결국 CPU로 모델을 돌려보기도 했다.
실행은 됐다.
문제는 여기서부터였다.
‘실행된다’와 ‘개발하면서 계속 쓸 만하다’는 전혀 다른 이야기였다.
응답 하나를 기다리면서부터 자연스럽게 내 컴퓨터 사양을 다시 보게 됐다.
그리고 그때 처음 제대로 보기 시작한 숫자가 VRAM이었다.
내 Ollama가 GPU를 쓰고 있는지 확인하는 방법
나처럼
설치는 됐는데 왜 이렇게 느리지?
싶다면 먼저 이것부터 확인해볼 수 있다.
터미널에서 아래 명령어를 실행하면 된다.
ollama ps
현재 메모리에 올라가 있는 모델과 PROCESSOR 항목을 확인할 수 있다.
예를 들어,
- 100% GPU → 모델 전체가 GPU 메모리에 올라간 상태
- 100% CPU → 모델 전체가 시스템 메모리에 올라간 상태
- CPU/GPU가 함께 표시 → 모델이 GPU와 시스템 메모리에 나뉘어 올라간 상태
Ollama 공식 문서에서도 현재 모델이 어느 메모리에 올라가 있는지 확인할 때 ollama ps를 사용하도록 안내한다.
내가 처음 로컬 LLM을 만졌을 때는 이런 부분을 모르고 단순히
실행됐으니 제대로 된 거겠지.
라고 생각했다.
그런데 속도가 이상하다면 RAM이나 모델 크기만 보기 전에 지금 모델이 실제로 GPU에 올라가 있는지부터 확인하는 편이 빠르다.
Ollama 서버 자체가 실행되지 않는 문제라면
Ollama 11434 포트 충돌 해결 — ollama serve가 실행되지 않았던 이유
모델 용량부터 생각보다 차이가 컸다
현재 Ollama의 Gemma 3 모델을 보면 크기에 따라 파일 용량부터 꽤 차이가 난다.
- Gemma 3 4B: 약 3.3GB
- Gemma 3 12B: 약 8.1GB
- Gemma 3 27B: 약 17GB
Ollama 공식 라이브러리에 표시되는 현재 모델 크기다.
여기서 한 가지 주의할 게 있다.
3.3GB 모델이라고 VRAM 3.3GB만 있으면 완벽하게 돌아간다는 뜻은 아니다.
실제 실행에서는 모델 자체 외에도 컨텍스트와 KV cache 등 추가 메모리가 필요하다.
그래서 모델 파일 크기만 보고 GPU를 고르면 애매해진다.
특히 8.1GB인 12B 모델을 보고
VRAM 8GB면 되겠네?
라고 단순하게 계산하기에는 여유가 없다.
모델 전체가 GPU 메모리에 올라가지 못하면 GPU와 시스템 메모리에 나뉘어 올라갈 수 있다.
이 경우 모델 전체가 GPU에 올라갔을 때와는 체감 성능 차이가 생길 수 있다.
그러면 RAM 16GB면 안 되는 걸까?
안 되는 건 아니다.
여기서도 내가 처음 조금 헷갈렸다.
RAM과 VRAM은 역할이 다르다.
RAM은
- IntelliJ
- Docker
- 브라우저
- Spring Boot
- 운영체제
- GPU에 모두 올라가지 못한 모델 데이터
같은 것들이 함께 사용한다.
반면 VRAM은 GPU가 AI 모델을 처리할 때 직접 사용하는 메모리다.
그래서 Ollama를 돌릴 거라고 해서 단순히
RAM 32GB니까 AI도 잘 돌아가겠지.
라고 보기는 어렵다.
내가 지금 다시 노트북을 산다면 대략 이렇게 볼 것 같다.
| Ollama 입문·작은 모델 테스트 | 16GB | 8GB | 가능 |
| 개발 + Docker + Ollama | 32GB | 8GB 이상 | 현실적인 시작점 |
| 로컬 LLM을 제법 자주 사용 | 32GB 이상 | 12GB 이상 | 선택지가 넓어짐 |
| 로컬 AI가 주 작업 | 64GB 고려 | 16GB 이상 | 본격적인 영역 |
이건 Ollama에서 공식적으로 발표한 최소 사양표가 아니다.
내가 IntelliJ, Docker, Spring Boot 같은 개발 환경과 로컬 LLM을 같이 사용한다는 기준에서 보는 사양이다.
그런데 RTX 5050과 5070을 보다가 이상한 걸 발견했다
새 노트북을 알아보면서 RTX 5050과 RTX 5070을 비교하기 시작했다.
처음에는 당연히 이렇게 생각했다.
5070이면 5050보다 AI 돌리기 훨씬 좋겠지?
GPU 자체의 연산 성능은 당연히 RTX 5070 쪽이 높다.
그런데 Ollama 기준으로 사양을 보다 보니 재미있는 부분이 하나 있었다.
노트북용 RTX 50 시리즈를 VRAM 기준으로 보면 대략 이렇게 나뉜다.
| RTX 5050 | 8GB GDDR7 |
| RTX 5060 | 8GB GDDR7 |
| RTX 5070 | 8GB GDDR7 |
| RTX 5070 Ti | 12GB GDDR7 |
| RTX 5080 | 16GB GDDR7 |
| RTX 5090 | 24GB GDDR7 |
여기서 조금 의외였다.
RTX 5050에서 RTX 5070까지 GPU 자체의 연산 성능은 올라가지만 노트북 GPU 기준 VRAM 용량은 셋 모두 8GB다.
반대로 RTX 5070 Ti부터 12GB로 올라간다.
그래서 로컬 LLM 때문에 GPU를 고르는 거라면 단순히
5050 < 5060 < 5070
처럼 숫자만 보고 판단하기보다는 VRAM 용량과 GPU 성능을 따로 볼 필요가 있었다.
그러면 RTX 5050은 의미가 없을까?
그건 또 아니다.
오히려 내가 돌렸던 Gemma 3 4B 같은 비교적 작은 모델을 사용하면서 개발도 같이 하는 정도라면 8GB VRAM으로 시작하는 것도 현실적인 선택이라고 생각한다.
결국 중요한 건 내가 무엇을 하려는지다.
로컬 LLM을 한번 써보고 싶다
→ 8GB VRAM부터
작은 모델을 개발 프로젝트에 붙인다
→ 8GB VRAM + RAM 32GB를 우선 고려
조금 더 큰 모델을 GPU에 올리고 싶다
→ 12GB 이상 확인
로컬 AI 자체가 메인 작업이다
→ 16GB 이상도 고려
이렇게 보는 게 GPU 이름만 보는 것보다 내 상황에는 훨씬 이해하기 쉬웠다.
실제 노트북 가격도 같이 확인해봤다
여기까지 알아보고 나니 결국 현실적인 문제가 하나 남았다.
그래서 이 정도 사양의 노트북은 얼마일까?
아직 내가 직접 구매해서 사용한 제품들은 아니다. 지금 로컬 AI용 노트북을 알아보면서 실제 구매 후보의 가격과 사양을 비교하고 있는 제품들이다.
이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.
RTX 5050 · VRAM 8GB 노트북
작은 로컬 LLM과 개발환경을 같이 사용한다면 내가 먼저 보고 있는 시작 구간이다.
다만 이 제품은 기본 RAM이 16GB라, IntelliJ·Docker·Ollama를 같이 사용할 생각이라면 RAM 확장 가능 여부도 같이 확인하는 편이 좋다.
에이서 Nitro V 16 RTX 5050
RTX 5070 Ti · VRAM 12GB 노트북
8GB보다 더 여유 있는 VRAM이 필요하다면 RTX 5070보다 오히려 RTX 5070 Ti부터 확인할 이유가 생긴다.
노트북 GPU 기준 VRAM 자체가 12GB로 올라가기 때문이다.
물론 가격 차이가 크기 때문에 로컬 AI를 쓴다는 이유만으로 무조건 이 정도 사양이 필요하다고 생각하지는 않는다. 내가 어떤 크기의 모델을 얼마나 자주 돌릴지가 먼저다.
HP OMEN MAX 16 RTX 5070 Ti
그래서 지금 노트북을 볼 때는 순서가 바뀌었다
예전에는 대충 이런 순서였다.
CPU
↓
RAM
↓
SSD
↓
그래픽카드
지금 로컬 AI용 노트북을 볼 때는 조금 다르다.
어떤 모델을 돌릴 건지
↓
VRAM이 몇 GB인지
↓
RAM이 충분한지
↓
GPU 성능
↓
무게·화면·배터리
물론 게임이나 영상 편집까지 생각하면 이야기는 또 달라진다.
하지만 Ollama 하나만 놓고 본다면 이제 나는 RTX 5050인지 RTX 5070인지보다 VRAM이 몇 GB인지부터 확인한다.
직접 돌려보기 전에는 몰랐던 부분이다.
그리고 이걸 확인하면서 또 다른 궁금증이 생겼다.
그렇다면 VRAM이 똑같이 8GB인 RTX 5050과 RTX 5070은 Ollama 때문에 굳이 돈을 더 주고 5070을 살 필요가 있을까?
이건 따로 비교해봤다.
다음 글에서는 RTX 5050과 RTX 5070을 놓고 개발용 노트북에 실제로 어디까지 필요한지 정리해보려고 한다.
둘 다 VRAM은 8GB인데 가격 차이를 감수하고 RTX 5070으로 올라갈 이유가 있는지도 같이 봤다.
'개발 노트' 카테고리의 다른 글
| RTX 5050 vs 5070, 개발자 노트북에 어디까지 필요할까? Ollama로 로컬 AI 돌린다면 (0) | 2026.10.01 |
|---|---|
| Railway Spring Boot PORT 설정 — server.port=${PORT:8080}를 쓴 이유 (0) | 2026.09.30 |
| Java EXIF 읽기 — metadata-extractor로 GPS·촬영시간·기기정보 추출해봤다 (0) | 2026.09.28 |
| Docker localhost 연결 안 될 때 — 8081:8080 포트 매핑부터 확인했다 (0) | 2026.09.27 |
| Ollama 11434 포트 충돌 해결 — ollama serve가 실행되지 않았던 이유 (0) | 2026.09.25 |