칼럼

칼럼 › 모델이 두 배 크면 두 배 느린가

모델이 두 배 크면 두 배 느린가

2026.09.23 · 럭스노트 · 약 9분

모델이 크면 그만큼 느려지겠죠. 매장에서 흔히 듣는 말인데, 이 통념은 매개변수 수가 늘면 연산량이 비례해서 증가하므로 처리 시간이 길어진다는 계산에서 나온다. 하지만 크기가 속도를 그대로 정하지는 않는다. 이번 글은 그 이유를 짚고, 실제 수치에서 크기와 속도의 관계가 어떻게 달라지는지 보여 준다.

공개된 실측 자료를 모아 보면, 모델 크기가 두 배가 되었을 때 속도는 1.77배만 줄어든다. 여기서 1.77은 중앙값으로, 절반의 경우가 이보다 느리고 절반이 이보다 빠르다는 뜻이다. 만약 속도가 크기에 비례해서 떨어졌다면 2배가 되어야 한다. 1.77배라는 숫자는 단순한 연산량 증가만으로 설명되지 않는 여지가 있음을 보여 준다. 하드웨어 구조나 메모리 접근 방식, 그리고 모델 내부의 효율성까지 함께 작용하기 때문에, 단순히 파라미터 수만 보고 속도를 단정할 수 없다.

매장에서 손님이 「이 모델은 크기가 두 배니까 두 배 느리겠네」라고 하면, 그 말이 틀린 것은 아니지만 불완전하다. 실제로는 1.77배 정도만 느려지는 경우가 절반 이상이다. 이 차이는 구매 결정에 영향을 준다. 같은 하드웨어에서 더 큰 모델을 돌릴 때, 예상보다 체감 속도가 덜 떨어질 수 있다. 반대로, 작은 모델을 빠르게 돌리려다 보니 큰 모델의 장점을 놓치는 경우도 있다. 숫자 하나, 즉 1.77이라는 배수만 기억해도 「크기 = 속도」라는 직관적 계산에서 한 걸음 더 나아갈 수 있다.

크기가 두 배가 되어도 속도는 두 배로 느려지지 않는다

크기 배수의 중앙값은 2.22이고, 속도 배수의 중앙값은 1.77이다. 이 두 수를 나란히 놓으면, 모델 크기가 2.22배 커졌을 때 속도가 1.77배만 느려진다는 계산이 나온다. 2.22를 1.77로 나누면 약 1.25배가 된다. 즉, 크기가 커지는 속도가 속도 저하 속도를 앞지른다.

이 차이는 실사용에서 체감되는 시간의 격차를 줄여준다. 같은 작업을 처리할 때, 더 큰 모델이 더 느리긴 하지만, 그 느려지는 정도가 크기 증가만큼 크지 않다. 1.77배라는 숫자는, 2.22배라는 크기 증가에 비해 상대적으로 완만한 하락을 의미한다. 만약 속도가 크기에 비례해서 떨어졌다면, 2.22배 느려졌어야 한다. 하지만 실제로는 1.77배에 그쳤다.

이러한 비선형 관계는 하드웨어 성능과 소프트웨어 최적화의 복합적 결과다. 더 큰 모델은 더 많은 연산을 필요로 하지만, 병렬 처리 효율이나 메모리 접근 패턴의 변화가 전체 처리 시간을 상쇄한다. 1.25배라는 비율은, 크기 증가가 성능 저하를 1:1로 만들지 않는다는 것을 보여준다.

손님이 체감하는 속도는 절대적인 숫자보다 상대적인 변화에 더 민감하다. 2.22배 큰 모델이 1.77배 느리다면, 이는 1.25배의 효율 손실을 의미한다. 이 차이는 대기 시간의 증가폭을 제한한다.

모델 구조 분포 — 빽빽한 136개, 일부만 도는 136개
모델 구조 분포 — 빽빽한 136개, 일부만 도는 136개
크기 배수와 속도 배수의 중앙값
크기 배수와 속도 배수의 중앙값

크기가 큰데 더 빠른 자리가 있다

크기가 두 배가 되어도 속도는 두 배로 느려지지 않는다. 오히려 더 큰 모델이 더 빠르게 도는 경우가 41개나 된다. RTX 3090에서 14B 모델은 초당 47.0 토큰, 27B 모델은 61.0 토큰을 뽑아낸다. 같은 카드로 32B는 30.5, 35B는 32.7 토큰을 기록한다. RTX 4090에서는 8B 모델이 131.0, 30B 모델이 196.0 토큰을 낸다. 숫자만 보면 30B가 8B보다 65 토큰 더 빠르다. 196.0 ÷ 131.0 = 1.5배다. 모델이 세 배가 커졌는데 속도는 1.5배만 늘었다. 하지만 8B가 131.0 토큰을 낼 때 30B가 196.0 토큰을 낸다는 사실 자체가 중요하다. 더 큰 모델이 더 느리다는 통념을 깨는 수치다. 41개의 사례가 모두 이 방향을 가리킨다. 크기가 커지면 메모리 접근이 늘어나고 연산량이 증가한다. 하지만 하드웨어가 그 부하를 감당할 여력이 있으면 속도는 오히려 올라간다. RTX 4090의 경우 8B에서 30B로 넘어가며 메모리 대역폭이 더 효율적으로 쓰인 것으로 보인다. 131.0에서 196.0으로의 도약은 단순한 비례가 아니다. 30B 모델이 8B 모델보다 50% 더 빠르게 도는 것은, 모델 크기가 성능의 적수라기보다 하드웨어 활용도의 변수임을 보여준다. 41개의 짝이 크기와 속도 사이의 관계를 다시 정의한다.

전부 도는 것과 일부만 도는 것이 다르다

MoE 모델은 매개변수가 크지만 실제로 도는 것은 적다. 136개 모델의 자료를 보면 매개변수 대비 실제 동작 비율의 중앙값이 0.10이다. 가장 작은 값은 0.03까지 내려간다. 이는 전체 크기가 두 배가 되어도 실제로 계산에 쓰이는 양은 10% 수준에 그칠 수 있음을 뜻한다.

전부 도는 것과 일부만 도는 것은 하드웨어 부하의 성격이 다르다. 매개변수 수가 같아도 실제로 활성화되는 비중이 다르면 메모리 대역폭과 연산량에 미치는 영향이 달라진다. 0.10이라는 비율은 모델의 총 용량이 아니라 그 중 10%만이 현재 토큰 생성에 관여한다는 의미다.

이 차이는 성능 예측 시 기준점을 바꾼다. 총 매개변수 수만으로 속도를 단정할 수 없는 이유가 여기에 있다. 실제로 도는 매개변수의 양이 성능의 직접적 변수가 되기 때문이다. 0.03에서 0.10 사이의 차이는 하드웨어 자원의 활용도를 결정짓는 핵심 수치로 작용한다.

이 셈을 그대로 믿으면 안 되는 자리

공개된 실측 272건은 우리가 직접 잰 값이 아니라 외부 자료를 모은 것이다. 이 중 견줄 수 있는 짝은 153개뿐이며, 이 안에는 48가지의 다른 엔진이 섞여 있다. 같은 모델이라도 어떤 엔진으로 돌리느냐에 따라 속도가 달라지므로, 엔진이 다른 값끼리는 비교 자체가 성립하지 않는다.

비교 가능한 153개 짝은 서로 독립적이지 않다. 이들은 35개의 (카드, 양자화) 묶음에서 나왔고, 그중 RTX 4090과 Q4_K_M 조합 하나가 36개, 즉 전체의 24%를 차지한다. 한 조합이 전체의 4분의 1을 차지하는 구조에서는 나머지 값들이 그 조합의 영향을 받을 수밖에 없다.

양자화 방식과 문맥 길이가 성능에 영향을 미치므로, 모델 크기만으로 속도를 단정할 수 없다. 10%의 활성 매개변수 비율이 하드웨어 자원의 활용도를 결정짓는 핵심 수치로 작용하기 때문이다.

그래서 무엇을 물어야 하나

모델 구조가 같지 않으므로, 같은 크기의 모델끼리 비교해도 속도가 달라진다. 자료에 따르면 빽빽한 구조와 일부만 도는 구조가 각각 136개씩 집계되어 있으며, 이 중 크기가 큰 모델이 오히려 더 빠르게 동작하는 짝이 41개나 된다. 하드웨어 자원을 어떻게 쓰느냐가 결과에 직결되므로, 단순히 파라미터 수만 보고 판단하면 안 된다.

손님에게 물어야 할 것은 세 가지다. 먼저 사용할 모델의 구조가 빽빽한 형태인지, 아니면 일부만 활성화되는 형태인지 확인한다. 다음으로 같은 그래픽카드에서 크기가 다른 모델의 속도 차이를 실측으로 비교해야 한다. 마지막으로 양자화 방식과 문맥 길이 조건을 고정하고 그 안에서 성능을 재야 한다. 이 세 가지가 맞물려야 실제 체감 속도를 알 수 있다.

게시판에서 이 글의 댓글 보기 →

다른 칼럼