105 / 05

270억 파라미터 모델이 맥북에서 돈다

원문 Simon Willison

알리바바 Qwen 연구팀이 Apache 2 라이선스로 낸 Qwen 3.8 27B를 Simon Willison이 로컬에서 돌려본 후기입니다. 270억 파라미터에 이미지 인식이 됩니다.

실제로 돌린 환경

  • 17GB짜리 Q4_K_M GGUF 파일을 LM Studio로 실행
  • 128GB M5 Max 맥북 프로, 그리고 NVIDIA DGX Spark
  • 초당 15~30 토큰 (상용 API는 74~184 토큰)
  • 최대 컨텍스트 262,144 토큰
  • Multi-Token Prediction을 켜면 약 72% 빨라집니다

17GB면 메모리 32GB 장비에서도 여유가 있습니다. "고사양 워크스테이션이 필요한 급"이 아닙니다.

점수

별도 측정에서 Artificial Analysis 지수 52점을 받았습니다. 비교 대상이 흥미롭습니다.

모델 파라미터 점수
Qwen 3.8 27B 270억 52
GPT-5.6 Luna (max) 비공개 52
GLM-5.2 (max) 7,530억 53
DeepSeek V4 Pro (max) 1조 7천억 53

27B가 753B, 1.7T 모델에 1점 차이입니다. 물론 단일 지수가 실사용 품질을 다 담지는 않습니다.

단점: 과하게 생각한다

기본 추론 강도가 가장 높은 단계(xhigh)로 설정돼 있어 단순한 요청도 과하게 처리합니다. "원 하나를 SVG로 그려달라"는 요청에 몇 분에 걸쳐 그라디언트와 애니메이션이 붙은 결과물을 내놓는 식입니다. 추론 강도를 low로 낮추거나 끄는 것을 권합니다.

언제 쓸 만한가

칭찬받은 부분은 이미지 바운딩 박스 감지, 에이전트 작업용 코딩 능력, 도구 호출 안정성, 긴 컨텍스트입니다.

국내 환경에서 의미가 있는 지점은 분명합니다. 외부 API로 내보낼 수 없는 데이터를 다루는 작업이 그렇습니다. 사내 코드, 고객 정보, 계약서 같은 것들이요. 지금까지는 "로컬 모델은 품질이 아쉽다"가 기본 전제였는데, 그 전제를 다시 볼 근거가 생겼습니다.

필요한 장비값이 이번 주 메모리 가격 항목과 이어진다는 점은 감안해야 합니다. 128GB 기계 한 대 값이 작년과 다릅니다.

  1. 01DuckDB 2.0, 서버 모드와 트리거를 넣는다
  2. 02DDR5 128GB가 3,399달러, 그리고 기다려도 안 내려가는 이유
  3. 03Cloudflare Workers에서 Spectre 공격이 실제로 재현됐다
  4. 04uBlock Origin을 계속 쓰려면 이제 Firefox뿐
  5. 05270억 파라미터 모델이 맥북에서 돈다지금 읽는 글

댓글

불러오는 중…