# LM Studio 모델 별 토큰 생성 속도 참고: 사용한 하드웨어 사양은 M5 Max 128GB RAM, 스펙 명세서 상의 (이상적인) 최대 메모리 대역폭은 **614 GB/s**이다. ==메모리 스왑은 일절 발생하지 않았다.== 모두 첫 턴의 초당 토큰생성속도를 관찰한 것이다. 실험 시 입력(프롬프트)은 전부 "_'트랜스포머 기반 언어모델의 공학적 아름다움'을 세세하게, 촘촘하게, 자세하게, 상세하게, 문단 별로 밀도있게 설명하라_ "였다. **MoE(Mixture of Experts)** 모델은 총 파라미터 중에 일부 파라미터만 활성화하여 작동하는 것이고, **Dense** 모델은 추론 시 모델이 보유한 모든 파라미터를 사용하여 작동한다. 예시를 들자면, GPT OSS 20B같은 경우 MoE 모델이며, 액티브 익스퍼트 레이어의 파라미터는 약 3.6B 이다. 20B 중 3.6B만을 활성 전문가 레이어로 사용한다는 뜻이다. (2026.04.11 업데이트) (2026.05.01 업데이트) (2026.05.08 업데이트) (2026.08.01 업데이트) (2026.08.23 업데이트) --- ## MoE 모델 #### GPT OSS 20B(MoE, A3.6B) 4bit (MLX) 모델 사이즈: 12.1GB 토큰 생성 속도: 123.08tok/s #### GPT OSS 20B(MoE, A3.6B) 8bit (MLX) 모델 사이즈: 22.3GB 토큰 생성 속도: 96.79tok/s #### GPT OSS 120B(MoE, A5.1B) 4bit (GGUF) 모델 사이즈: 63.4GB 토큰 생성 속도: 68.09tok/s #### Gemma 4 26B(MoE, A4B) 8bit (MLX) 모델 사이즈: 28.0GB 토큰 생성 속도: 87.91tok/s #### Gemma 4 26B(MoE, A4B) 16bit (MLX) 모델 사이즈: 51.6GB 토큰 생성 속도: 56.96tok/s #### Supergemma 4 Abliterated 26B(MoE, A4B) 16bit (MLX) 모델 사이즈: 51.6GB 토큰 생성 속도: 58.24tok/s #### Nemotron 3 nano 30B(MoE, A3B) 8bit (MLX) 모델 사이즈: 31.3GB 토큰 생성 속도: 106.09tok/s #### Nemotron 3 Super 120B(MoE, A12B) 4bit (GGUF) 모델 사이즈: 86.1GB 토큰 생성 속도: 32.69tok/s #### Mixtral 8x7b(MoE, A12.9B) 8bit (MLX) 모델 사이즈: 49.6GB 토큰 생성 속도: 36.03tok/s #### Qwen 3.6 35B(MoE, A3B) 16bit (MLX) 모델 사이즈: 70.2 GB 토큰 생성속도: 63.58tok/s --- ## Dense 모델 #### Gemma 3 27B(Dense) 4bit (MLX) 모델 사이즈: 16.9GB 토큰 생성 속도: 27.76tok/s #### Gemma 4 31B(Dense) 8bit (MLX) 모델 사이즈: 33.8GB 토큰 생성 속도: 14.55tok/s #### OLMo 3 32B Think(Dense) 8bit (MLX) 모델 사이즈: 34.3GB 토큰 생성 속도: 13.77tok/s #### Phi 4 Reasoning Plus 14B(Dense) 8bit (MLX) 모델 사이즈: 15.6GB 토큰 생성 속도: 26.4tok/s #### EXAONE 4.0.1 32B(Dense) 8bit (GGUF) 모델 사이즈: 34.0GB 토큰 생성 속도: 15.48tok/s #### Qwen 2.5 VL 72B(Dense) 6bit (MLX) 모델 사이즈: 59.7GB 토큰 생성 속도: 7.40tok/s #### Qwen 3.5 Claude 4.6 Distilled 27B(Dense) 6bit (MLX) 모델 사이즈: 21.9GB 토큰 생성 속도: 17.12tok/s #### Qwen 3.6 27B(Dense) 8bit (MLX) 모델 사이즈: 34.7GB 토큰 생성 속도: 13.55tok/s #### Qwen 3.6 27B(Dense) Claude 5 Distilled Uncensored MTP 8bit (GGUF) 모델 사이즈: 32.1GB 토큰 생성 속도: 15.94tok/s #### Qwen 3.8 27B(Dense) 8bit (MLX) 모델 사이즈: 29.5GB 토큰 생성 속도: 11.42tok/s