Qwen 3.5-122B를 Mac Studio에서 daily driver로 사용 중 - 3개의 버그 수정, 은밀한 전환

빌드 Jul 12, 2026 at 11:178북마크에 추가

Qwen 3.5-122B를 Mac Studio에서 daily driver로 사용 중 - 3개의 버그 수정, 은밀한 전환
삽화 : Léa Fontaine

한 엔지니어가 자신의 블로그에 세 가지 패치를 적용해 MLX를 통해 Mac Studio에서 큰 규모의 Qwen 3.5 모델을 실용적인 일상 동반자로 변신시킨 과정을 소개합니다. 로컬 하드웨어가 패치 하나하나를 거쳐 실용적인 영역으로 나아가고 있습니다.

간단히 말해

한 엔지니어가 mrzk.io, 2026년 7월에서 MLX 스택을 개선해 맥 스튜디오에서 큰 Qwen 3.5 오픈 가중치 모델을 일상용으로 구동할 수 있도록 수정한 세 가지 버그를 문서화했습니다. 미약하지만 tangible한 신호: 로컬이 조금씩 따라잡고 있습니다.


배경

MLX는 애플의 M 시리즈 칩에서 메모리 통합을 활용하는 추론 프레임워크입니다. 맥 스튜디오(최대 512GB 통합 RAM, M3 Ultra)에서 Qwen 3.5(약 100~235B 파라미터) 모델을 양자화하여 구동하는 것은 이론적으로 가능합니다. 그러나 블로그에서는 실전에서 무엇이 문제인지 문서화합니다—정확한 테스트된 모델 변수는 게시글에서 확인해야 합니다.


내부 동작 — 패치의 성격

게시글에 따르면 세 가지 버그가 일상 사용을 막고 있었습니다:

  1. 장문 컨텍스트 버그 — 특정 토큰 수 이상에서 생성 품질이 저하됩니다.
  2. 양자화 버그 — 4비트 변환이 모델의 일부 레이어에서 잘못된 출력을 생성합니다.
  3. 샘플링 버그 — 토큰 선택의 엣지 케이스가 품질을 저하시킵니다.

정확한 세부 사항(패치된 레이어, 수정 메커니즘, 업스트림 PR)은 게시글에 있습니다—재현을 원한다면 읽어보세요.


분석

게시글이 말하는 것은 패치 그 이상으로, 애플 스택 + Qwen이 디버깅할 가치가 있는 수준에 도달했다는 것입니다. 이는 "데모에서 동작합니다"에서 "매일 사용합니다"로의 전환입니다. 하드웨어 비용은 여전히 크지만(수천 달러짜리 맥 스튜디오), 데이터가 기기 밖으로 나갈 수 없는 전문가에게는 현실적인 선택지가 됩니다.


시나리오

기본 시나리오 (55%) : 애플 + Qwen/DeepSeek/Llama 스택이 2027년 중반까지 데이터 민감도가 높은 3~5% 개발자들에게 credible한 선택지가 됩니다. 낙관적 시나리오 (25%) : Qwen 또는 유사한 모델이 일반 사용자용 기기에서 frontier-class 수준에 도달합니다. 비관적 시나리오 (20%) : 스택의 파편화(MLX, llama.cpp, vLLM, exllama)로 인해 각 모델이 자체 패치를 요구하며 전체 시스템이 불안정해집니다.


빌드 측면의 영향

  • 로컬이 명확한 사용 사례를 되찾음: 데이터 민감성 + 지연 + 한계 비용 0에 수렴.
  • 벤치마크에서 time-to-fix로 관심사가 이동—모델 릴리스에서 실사용 안정성까지의 버그 수.
  • 오픈 가중치 생태계가 기여 가능 영역을 넓힘: 모든 패치가 업스트림에 중요합니다.

위험 요소

MLX에 대한 의존성(애플이 API를 깨뜨릴 수 있음), 큰 모델에서 4비트 양자화 품질, 장기 부하 시 가중치 안정성.


결론

"클라우드 vs 로컬" 논쟁은 이념적이지 않습니다. 기술적이며 버그 하나하나로 결정됩니다. 이처럼 특별하지 않지만 매우 구체적인 게시글이야말로 다가오는 전환의 가장 좋은 지표입니다.

Resources

인공지능이 작성하고 사람의 편집 감독하에 검수한 기사입니다.

편집팀
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
이 기사가 도움이 되었나요?

3 명이 이 기사를 좋아합니다

좋아요
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
공유:
댓글 (8)

토론에 참여하려면 로그인하세요.

LecteurDuDimanche 13 Jul 2026 · 05:08

Est-ce que ces corrections pourraient aussi améliorer la gestion des langues ?

1
LitLover42 13 Jul 2026 · 07:32

Peut-être, mais pour les langues, il faudrait des ajustements plus précis que ces correctifs généraux.

sandrine.b 13 Jul 2026 · 05:01

C'est bien de rendre ces modèles plus fiables, mais est-ce que ça les rend aussi plus précis sur les cas rares ?

Dr. L. 13 Jul 2026 · 04:37

Ces patches pourraient aussi améliorer l'efficacité sur des machines moins puissantes ?

1
BookWorm47 12 Jul 2026 · 12:37

I wonder how these patches affect the model's ability to handle complex queries. Will it be more adept at understanding nuanced requests?

curio_usa 12 Jul 2026 · 07:39

Est-ce que ces corrections pourraient aider à faire tourner des modèles similaires sur d'autres appareils Apple Silicon ?

2
Emma_London 12 Jul 2026 · 07:01

Impressionnant ! Ça donne quoi sur d'autres machines ?

unLecteurCurieux 12 Jul 2026 · 06:58

Super de voir l'IA tourner en local ! Mais ça ne ralentit pas le modèle sur d'autres tâches ?

FoodieChicago 12 Jul 2026 · 06:50

Intéressant de voir l'avancée. Est-ce que ces correctifs améliorent aussi l'efficacité du modèle ou juste les bugs ?

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
토픽
탐색
정보