1호05 / 05
270억 파라미터 모델이 맥북에서 돈다
알리바바 Qwen 연구팀이 Apache 2 라이선스로 낸 Qwen 3.8 27B를 Simon Willison이 로컬에서 돌려본 후기입니다. 270억 파라미터에 이미지 인식이 됩니다.
실제로 돌린 환경
- 17GB짜리 Q4_K_M GGUF 파일을 LM Studio로 실행
- 128GB M5 Max 맥북 프로, 그리고 NVIDIA DGX Spark
- 초당 15~30 토큰 (상용 API는 74~184 토큰)
- 최대 컨텍스트 262,144 토큰
- Multi-Token Prediction을 켜면 약 72% 빨라집니다
17GB면 메모리 32GB 장비에서도 여유가 있습니다. "고사양 워크스테이션이 필요한 급"이 아닙니다.
점수
별도 측정에서 Artificial Analysis 지수 52점을 받았습니다. 비교 대상이 흥미롭습니다.
| 모델 | 파라미터 | 점수 |
|---|---|---|
| Qwen 3.8 27B | 270억 | 52 |
| GPT-5.6 Luna (max) | 비공개 | 52 |
| GLM-5.2 (max) | 7,530억 | 53 |
| DeepSeek V4 Pro (max) | 1조 7천억 | 53 |
27B가 753B, 1.7T 모델에 1점 차이입니다. 물론 단일 지수가 실사용 품질을 다 담지는 않습니다.
단점: 과하게 생각한다
기본 추론 강도가 가장 높은 단계(xhigh)로 설정돼 있어 단순한 요청도 과하게 처리합니다. "원 하나를 SVG로 그려달라"는 요청에 몇 분에 걸쳐 그라디언트와 애니메이션이 붙은 결과물을 내놓는 식입니다. 추론 강도를 low로 낮추거나 끄는 것을 권합니다.
언제 쓸 만한가
칭찬받은 부분은 이미지 바운딩 박스 감지, 에이전트 작업용 코딩 능력, 도구 호출 안정성, 긴 컨텍스트입니다.
국내 환경에서 의미가 있는 지점은 분명합니다. 외부 API로 내보낼 수 없는 데이터를 다루는 작업이 그렇습니다. 사내 코드, 고객 정보, 계약서 같은 것들이요. 지금까지는 "로컬 모델은 품질이 아쉽다"가 기본 전제였는데, 그 전제를 다시 볼 근거가 생겼습니다.
필요한 장비값이 이번 주 메모리 가격 항목과 이어진다는 점은 감안해야 합니다. 128GB 기계 한 대 값이 작년과 다릅니다.
1호의 다른 글
요약으로 한 번에 보기 →- 01DuckDB 2.0, 서버 모드와 트리거를 넣는다
- 02DDR5 128GB가 3,399달러, 그리고 기다려도 안 내려가는 이유
- 03Cloudflare Workers에서 Spectre 공격이 실제로 재현됐다
- 04uBlock Origin을 계속 쓰려면 이제 Firefox뿐
- 05270억 파라미터 모델이 맥북에서 돈다지금 읽는 글
댓글
불러오는 중…