로컬 AI 성능 계산기 · LLM·이미지·비디오·음성·OCR VRAM·속도 (2026)
내 그래픽카드로 이 AI를 돌릴 수 있나? AI 종류(텍스트 LLM·이미지생성·비디오생성·음성합성/인식·OCR·동시 실행 스택)와 GPU 105종(소비자~데이터센터 B200·MI350)·모델 159종(DeepSeek V4·Kimi K2·GLM-5.2·Qwen3.5·MiMo·Nemotron)을 정하면 VRAM·적재 여부·속도·다중 GPU/연결방식까지 계산합니다. 커뮤니티 실측으로 검증.
AI 종류
플랫폼 (보드/완제품)
그래픽카드
GPU 장수 (VRAM 합산)
연결 방식 (인터커넥트)
LLM 모델
양자화 (가중치 정밀도)
KV 캐시 (컨텍스트 메모리)
컨텍스트 길이
32K
이 구성 분석 · 병목·가속·권장
모델 벤치마크 · 품질 점수 (선택 모델)
이 그래픽카드로 돌릴 수 있는 모델 · 큰 모델 우선 (적재 가능한 것부터)
이 GPU·모델의 커뮤니티 실측
| GPU | 모델 | 양자화·컨텍스트 | 실측 tok/s | 출처 |
|---|
로컬 LLM 성능 원리 — 이 계산기가 쓰는 지식
1. 속도는 연산이 아니라 메모리 대역폭이 결정
토큰 생성(decode)은 매 토큰마다 모델 가중치를 한 번씩 읽습니다. 그래서 tok/s ≈ 메모리 대역폭 ÷ 토큰당 읽는 가중치 크기 × 효율(η). 예: RTX 4090(1008GB/s)로 27B Q4(약 15.7GB) → ~50 tok/s. GPU 코어가 빨라도 대역폭이 낮으면 느립니다(llama.cpp 실측: 같은 CPU에서 메모리 채널만 2배 늘려도 속도 ~2.7배).2. 양자화 — 크기와 품질의 교환
가중치를 낮은 비트로 압축해 VRAM을 줄입니다.Q4_K_M(파라미터당 ~0.58GB)이 표준 균형점. QAT(양자화인식학습·Gemma 공식 int4·Kimi K2 네이티브 INT4·MiMo FP4)는 양자화 오차를 학습으로 보정해 같은 4비트에서 품질이 ≈Q6_K(BF16 대비 1% 미만)까지 올라갑니다. 핵심은 같은 4비트 PTQ 대비는 크기·속도가 같고 품질만 우위지만, Q6/Q8/FP16 같은 고정밀 대비는 메모리·속도 이득(int4라서) — 즉 "Q6급 품질을 int4 크기·속도로". 양자화 선택에서 QAT를 고르면 이 int4 메모리/속도가 반영됩니다(공식 QAT 체크포인트 보유 모델 한정).
3. VRAM = 가중치 + KV 캐시 + 오버헤드 · 긴 컨텍스트는 속도도 떨어뜨린다
KV 캐시는 컨텍스트 길이에 비례(레이어·KV헤드·head_dim×토큰수). 긴 컨텍스트는 KV가 VRAM을 크게 먹으므로 KV 양자화(Q8/Q4)로 절약. 또한 decode는 매 토큰 가중치 + 지금까지의 KV 전체를 읽으므로, 컨텍스트가 길어질수록 토큰당 읽는 양이 늘어 생성속도(tok/s)도 느려집니다(이 계산기는 컨텍스트 슬라이더에 따라 속도를 재계산). GQA 비율이 큰 모델·MLA(DeepSeek·Kimi K2·GLM-5.2, 토큰당 ~68KB로 동급 GQA의 1/10)·하이브리드(Qwen3.6·Nemotron-H의 Mamba, 일부 층만 KV)는 KV가 작아 긴 컨텍스트에서도 속도 저하가 적습니다 — 그래서 1M 컨텍스트도 가능.4. MoE — 크지만 빠르다
전문가 혼합(MoE)은 전체 가중치를 VRAM에 올리되 토큰당 일부 전문가(활성 파라미터)만 계산 → VRAM은 크게 쓰지만 속도는 활성 크기 기준(예: 235B-A22B는 22B급 속도).5. MTP — 투기적 디코딩 가속 (속도) vs QAT (품질)
MTP(멀티토큰예측·Qwen3.6/Gemma4/DeepSeek/GLM/Ling 등 내장)는 한 번에 여러 토큰을 예측·검증해 디코드 속도를 올립니다 — 이 계산기는 "MTP 가속" 체크 시 ×1.45(채택률에 따라 ~1.3~1.8x)를 적용합니다. 단, MTP를 켜면 드래프트 모듈(≈디코더 1개 층, 임베딩·헤드는 본체와 공유)이 VRAM에 함께 적재됩니다 — 작은 모델은 미미하지만 대형 MoE는 무시 못 합니다(예: DeepSeek-V3 Q4 약 +6.4GB, GLM-5.2 약 +5.6GB). 계산기는 이 모듈 VRAM을 더해 적재 여부·최대 컨텍스트를 판정합니다. 반면 QAT(양자화인식학습)는 속도·VRAM이 아니라 품질 기능 — 같은 Q4 크기에서 품질이 높아, 비QAT 모델이 Q6/Q8로 얻을 품질을 Q4로 얻습니다(그래서 QAT는 토큰 수가 바뀌지 않는 게 정상).6. VRAM을 넘으면? — 오프로드는 시스템 RAM 대역폭에 묶인다
모델이 VRAM보다 크면 일부 층을 CPU가 시스템 RAM에서 계산합니다. 이 부분 속도는 PCIe가 아니라 메인보드 RAM 대역폭이 좌우 — 데스크탑 듀얼채널 ~90 · 워크스테이션 옥타채널 ~300 · 서버 12채널 ~460GB/s. 그래서 같은 GPU라도 플랫폼에 따라 오프로드 속도가 3~5배 차이납니다(PCIe는 가중치를 스트리밍하지 않고 층 경계 활성값만 전달).7. 다중 GPU — 병렬 방식(텐서 vs 파이프라인)이 속도를 가른다
여러 장을 쓰면 VRAM이 합산돼 더 큰 모델이 올라갑니다. 속도는 병렬 방식에 달렸습니다. 파이프라인 병렬(레이어 분할)은 카드가 순차 동작이라 VRAM만 합산되고 속도는 거의 그대로(용량 확장용) — llama.cpp 기본. 텐서 병렬은 매 레이어를 쪼개 모든 카드가 동시에 계산해 속도가 오릅니다. 다만 매 레이어 all-reduce 통신이 필요해 인터커넥트 대역폭이 확장 효율을 좌우합니다: NVLink(SXM)·OAM(수백 GB/s~1.8TB/s)은 거의 장수에 비례(효율 NVLink ~90%·OAM ~85%), PCIe는 통신부하가 커 확장이 제한적(2장 ~1.2~1.5배 수준, 세대·레인이 높을수록↑). 이 계산기의 병렬 방식 드롭다운에서 직접 선택해 비교할 수 있습니다(자동=인터커넥트 기준). 데스크탑 보드는 CPU 레인 한계로 2장이 현실 상한(2장 시 x8/x8).근거: 커뮤니티 실측(r/LocalLLaMA·llama.cpp·HuggingFace) + 모델 아키텍처 config + 하드웨어 스펙 교차검증. 추정은 ±30%, 실측이 있으면 실측을 우선 표시합니다.
VRAM 계산은 가중치(파라미터×양자화 크기) + KV 캐시(레이어·KV헤드·head_dim×컨텍스트×KV정밀도) + 런타임 오버헤드로 산술 계산합니다 — 적재 가능 여부·최대 컨텍스트는 꽤 정확합니다. MTP=멀티토큰예측(내장 투기적디코딩 드래프트로 가속 — 켜면 드래프트 모듈 VRAM이 더해짐). QAT=양자화인식학습(int4 크기·속도로 Q6급 품질 — 양자화 선택에서 'QAT'를 고르면 고정밀 대비 메모리↓·속도↑ 반영). MoE=VRAM은 전체 크기, 속도는 활성 파라미터 기준(빠름).
생성속도(tok/s)는 메모리 대역폭÷모델크기 추정이며, 해당 조합의 커뮤니티 실측이 있으면 그 값을 우선 표시합니다(±30%, 백엔드·투기적디코딩 등에 따라 변동). 프롬프트 처리(prefill)는 별도로 더 빠릅니다.
플랫폼·연결방식·다중 GPU: 모델이 VRAM에 다 들어가면 GPU 메모리 대역폭이 속도를 좌우합니다. VRAM을 넘겨 일부를 시스템 RAM으로 내리면(오프로드) 그 부분은 메인보드 등급의 시스템 RAM 대역폭(데스크탑 듀얼채널 ~90 · 워크스테이션 ~300 · 서버 ~460 GB/s)으로 처리돼 급격히 느려집니다. GPU를 여러 장 쓰면 VRAM이 합산돼 큰 모델이 올라가는데, 속도는 연결방식이 가릅니다 — PCIe=용량만(레이어 분할), NVLink/OAM(데이터센터)=속도도 장수에 비례(텐서 병렬). 맥·DGX Spark 같은 완제품은 플랫폼에서 고르면 통합메모리로 계산됩니다.
실측은 Reddit r/LocalLLaMA·HuggingFace·GitHub·리뷰 등에서 모았습니다(출처 링크). 제보·수정 환영: support@405.kr · 무거운 로컬 AI 견적은 도입 문의.
생성속도(tok/s)는 메모리 대역폭÷모델크기 추정이며, 해당 조합의 커뮤니티 실측이 있으면 그 값을 우선 표시합니다(±30%, 백엔드·투기적디코딩 등에 따라 변동). 프롬프트 처리(prefill)는 별도로 더 빠릅니다.
플랫폼·연결방식·다중 GPU: 모델이 VRAM에 다 들어가면 GPU 메모리 대역폭이 속도를 좌우합니다. VRAM을 넘겨 일부를 시스템 RAM으로 내리면(오프로드) 그 부분은 메인보드 등급의 시스템 RAM 대역폭(데스크탑 듀얼채널 ~90 · 워크스테이션 ~300 · 서버 ~460 GB/s)으로 처리돼 급격히 느려집니다. GPU를 여러 장 쓰면 VRAM이 합산돼 큰 모델이 올라가는데, 속도는 연결방식이 가릅니다 — PCIe=용량만(레이어 분할), NVLink/OAM(데이터센터)=속도도 장수에 비례(텐서 병렬). 맥·DGX Spark 같은 완제품은 플랫폼에서 고르면 통합메모리로 계산됩니다.
실측은 Reddit r/LocalLLaMA·HuggingFace·GitHub·리뷰 등에서 모았습니다(출처 링크). 제보·수정 환영: support@405.kr · 무거운 로컬 AI 견적은 도입 문의.