로컬 AI에 관심이 생기면 RAM, VRAM, 매개변수와 양자화 같은 낯선 단어를 만나게 된다. 처음부터 고가의 그래픽카드가 필요한 것은 아니지만 메모리가 작으면 선택할 모델과 긴 문서 처리 능력이 제한된다.
먼저 볼 숫자는 RAM
모델은 실행할 때 메모리에 올라간다. LM Studio는 16GB 이상을 권장하며 8GB에서도 작은 모델과 짧은 문맥을 사용하면 작동할 수 있다고 안내한다.
- RAM 8GB: 1B~4B 작은 양자화 모델로 짧은 대화와 요약 체험
- RAM 16GB: 7B~8B급 Q4 모델로 일반적인 글쓰기·번역·요약
- RAM 32GB: 14B급 전후와 더 긴 문서 작업을 시도할 여유
- RAM 64GB 이상: 큰 모델과 이미지, 긴 문서 및 동시 작업
이는 보장표가 아니다. 모델 구조와 양자화, 문맥 길이와 동시에 실행한 앱에 따라 달라진다.
그래픽카드는 필수가 아니다
CPU와 RAM만으로도 실행할 수 있지만 답변 속도가 느릴 수 있다. 별도 GPU는 계산을 빠르게 한다. Windows에서는 VRAM 용량이 중요하며 LM Studio는 전용 VRAM 4GB 이상을 권장한다.
Apple Silicon 맥은 CPU와 GPU가 통합 메모리를 공유한다. 별도 VRAM을 계산하지 않는 대신 운영체제와 다른 앱도 같은 메모리를 나눠 쓴다. LM Studio는 M1 이후 맥을 지원하고 현재 Intel Mac은 지원하지 않는다.
7B와 Q4는 무슨 뜻일까
7B는 약 70억 개의 매개변수를 뜻한다. 숫자가 커지면 더 많은 메모리와 계산이 필요하다.
Q4는 모델을 작게 압축한 양자화 버전으로 크기와 품질의 타협점으로 많이 사용한다. 처음에는 앱이 권장하거나 내 컴퓨터에 맞는다고 표시하는 버전을 고르면 된다.
모델 하나가 수GB를 차지하므로 SSD 여유 공간도 확인해야 한다. 여러 모델을 비교하면 수십GB가 금방 쌓인다.
사양표만 보고 어렵다면 Jan의 모델 적합도 표시를 이용한다. 가장 작은 권장 모델 하나부터 받아 속도와 품질을 보고 한 단계씩 올리는 편이 빠르다.
관련 글
같은 맥락에서 이어서 읽기 좋은 글들입니다.