# LM Studio 모델 별 토큰 생성 속도
참고:
사용한 하드웨어 사양은 M5 Max 128GB RAM, 스펙 명세서 상의 (이상적인) 최대 메모리 대역폭은 **614 GB/s**이다.
==메모리 스왑은 일절 발생하지 않았다.==
모두 첫 턴의 초당 토큰생성속도를 관찰한 것이다. 실험 시 입력(프롬프트)은 전부 "_'트랜스포머 기반 언어모델의 공학적 아름다움'을 세세하게, 촘촘하게, 자세하게, 상세하게, 문단 별로 밀도있게 설명하라_ "였다.
**MoE(Mixture of Experts)** 모델은 총 파라미터 중에 일부 파라미터만 활성화하여 작동하는 것이고,
**Dense** 모델은 추론 시 모델이 보유한 모든 파라미터를 사용하여 작동한다.
예시를 들자면, GPT OSS 20B같은 경우 MoE 모델이며, 액티브 익스퍼트 레이어의 파라미터는 약 3.6B 이다. 20B 중 3.6B만을 활성 전문가 레이어로 사용한다는 뜻이다.
(2026.04.11 업데이트)
(2026.05.01 업데이트)
(2026.05.08 업데이트)
(2026.08.01 업데이트)
(2026.08.23 업데이트)
---
## MoE 모델
#### GPT OSS 20B(MoE, A3.6B) 4bit (MLX)
모델 사이즈: 12.1GB
토큰 생성 속도: 123.08tok/s
#### GPT OSS 20B(MoE, A3.6B) 8bit (MLX)
모델 사이즈: 22.3GB
토큰 생성 속도: 96.79tok/s
#### GPT OSS 120B(MoE, A5.1B) 4bit (GGUF)
모델 사이즈: 63.4GB
토큰 생성 속도: 68.09tok/s
#### Gemma 4 26B(MoE, A4B) 8bit (MLX)
모델 사이즈: 28.0GB
토큰 생성 속도: 87.91tok/s
#### Gemma 4 26B(MoE, A4B) 16bit (MLX)
모델 사이즈: 51.6GB
토큰 생성 속도: 56.96tok/s
#### Supergemma 4 Abliterated 26B(MoE, A4B) 16bit (MLX)
모델 사이즈: 51.6GB
토큰 생성 속도: 58.24tok/s
#### Nemotron 3 nano 30B(MoE, A3B) 8bit (MLX)
모델 사이즈: 31.3GB
토큰 생성 속도: 106.09tok/s
#### Nemotron 3 Super 120B(MoE, A12B) 4bit (GGUF)
모델 사이즈: 86.1GB
토큰 생성 속도: 32.69tok/s
#### Mixtral 8x7b(MoE, A12.9B) 8bit (MLX)
모델 사이즈: 49.6GB
토큰 생성 속도: 36.03tok/s
#### Qwen 3.6 35B(MoE, A3B) 16bit (MLX)
모델 사이즈: 70.2 GB
토큰 생성속도: 63.58tok/s
---
## Dense 모델
#### Gemma 3 27B(Dense) 4bit (MLX)
모델 사이즈: 16.9GB
토큰 생성 속도: 27.76tok/s
#### Gemma 4 31B(Dense) 8bit (MLX)
모델 사이즈: 33.8GB
토큰 생성 속도: 14.55tok/s
#### OLMo 3 32B Think(Dense) 8bit (MLX)
모델 사이즈: 34.3GB
토큰 생성 속도: 13.77tok/s
#### Phi 4 Reasoning Plus 14B(Dense) 8bit (MLX)
모델 사이즈: 15.6GB
토큰 생성 속도: 26.4tok/s
#### EXAONE 4.0.1 32B(Dense) 8bit (GGUF)
모델 사이즈: 34.0GB
토큰 생성 속도: 15.48tok/s
#### Qwen 2.5 VL 72B(Dense) 6bit (MLX)
모델 사이즈: 59.7GB
토큰 생성 속도: 7.40tok/s
#### Qwen 3.5 Claude 4.6 Distilled 27B(Dense) 6bit (MLX)
모델 사이즈: 21.9GB
토큰 생성 속도: 17.12tok/s
#### Qwen 3.6 27B(Dense) 8bit (MLX)
모델 사이즈: 34.7GB
토큰 생성 속도: 13.55tok/s
#### Qwen 3.6 27B(Dense) Claude 5 Distilled Uncensored MTP 8bit (GGUF)
모델 사이즈: 32.1GB
토큰 생성 속도: 15.94tok/s
#### Qwen 3.8 27B(Dense) 8bit (MLX)
모델 사이즈: 29.5GB
토큰 생성 속도: 11.42tok/s