Qwen 3.5-122B가 Mac Studio에서 일상용으로 구동됩니다 - 3개의 버그 수정, 조용한 전환

건축 Jul 12, 2026 at 11:178북마크에 추가

Qwen 3.5-122B가 Mac Studio에서 일상용으로 구동됩니다 - 3개의 버그 수정, 조용한 전환
삽화 : Léa Fontaine

엔지니어가 자신의 블로그에 세 개의 패치를 적용해 MLX를 통해 맥 스튜디오에서 큰 규모의 Qwen 3.5 모델을 일상 companion으로 신뢰성 있게 사용할 수 있도록 변환한 과정을 소개합니다. 로컬 하드웨어가 패치 하나씩 실용적인 영역에서 진전을 보이고 있습니다.

간단히 말해

한 엔지니어가 (mrzk.io, 2026년 7월) MLX 스택에서 세 가지 버그를 수정해 Mac Studio에서 Qwen 3.5 오픈 가중치 대형 모델을 일상용으로 구동했다는 내용을 문서화했습니다. 약한 신호지만 tangible한 변화: 로컬이 조금씩 따라잡고 있습니다. 패치 하나씩.

배경

MLX는 M 시리즈 칩에서 유니파이드 메모리를 활용하는 Apple의 추론 프레임워크입니다. Qwen 3.5 모델(변종에 따라 약 100~235B 매개변수)을 잘 구성된 Mac Studio(최대 M3 Ultra 기준 512GB 유니파이드 RAM)에서 양자화하여 이론상 구동할 수 있습니다. 해당 블로그는 실무에서 걸리는 문제점을 문서화했습니다—정확한 테스트된 변종명은 글에서 확인하세요.

내부 구조 - 패치의 성격

블로그에 따르면 세 가지 버그가 일상 사용을 막고 있었습니다:

  1. 장문 맥락 버그 - 특정 토큰 수 이상에서 생성 품질이 저하됩니다.
  2. 양자화 버그 - 4비트 변환 시 일부 레이어에서 잘못된 출력이 발생합니다.
  3. 샘플링 버그 - 토큰 선택의 엣지 케이스가 품질을 떨어뜨립니다.

정확한 세부 사항(패치된 레이어, 수정 메커니즘, 업스트림 PR)은 블로그에서 확인하세요—재현을 원한다면 읽어보세요.

분석

블로그에서 말하는 것은 패치 그 이상입니다. Apple + Qwen 스택이 이제 디버깅할 가치가 있는 수준에 도달했다는 것입니다. « 데모는 동작한다 »에서 « 매일 사용한다 »로의 전환입니다. 하드웨어 비용은 여전히 크지만(이 용도로 구성된 Mac Studio는 수천 달러) 데이터가 기기 밖으로 나갈 수 없는 전문가에게는 도달 가능한 수준이 되었습니다.

시나리오

기본 시나리오 (55%): Apple + Qwen/DeepSeek/Llama 스택이 2027년 중반까지 데이터 민감도가 높은 개발자 3~5%에게 credible한 선택지가 됩니다. 낙관적 시나리오 (25%): Qwen 또는 동급 모델이 일반 소비자용 기기에서 frontier-class 수준에 도달합니다. 상황이 바뀝니다. 비관적 시나리오 (20%): 스택의 파편화(MLX, llama.cpp, vLLM, exllama)로 인해 모든 모델에 고유한 패치가 필요해집니다.

빌드 측면의 시사점

  • 로컬이 명확한 사용 사례를 되찾았습니다: 데이터 민감성 + 지연 + 한계 비용이 0에 가까워집니다.
  • 벤치마크에서 수정까지의 시간(모델 릴리스에서 실사용 안정성까지의 버그 수)으로 관심이 이동합니다.
  • 오픈 가중치 에코시스템은 기여 가능 영역을 넓힙니다: 모든 업스트림 패치가 중요합니다.

위험 요소

MLX에 대한 의존성(Apple이 API를 깨뜨릴 수 있음), 대형 모델에서 4비트 양자화 품질, 장기 부하 시 가중치 안정성.

결론

« 클라우드 vs 로컬 » 논쟁은 이념적이지 않습니다. 기술적이며 버그 하나씩 해결되며 진행됩니다. 이처럼 특별하지 않지만 매우 구체적인 블로그 글こそ가 전환의 가장 좋은 지표입니다.

Resources

인공지능이 작성하고 사람의 편집 감독하에 검수한 기사입니다.

편집팀
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
이 기사가 도움이 되었나요?

3 명이 이 기사를 좋아합니다

좋아요
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
공유:
댓글 (8)

토론에 참여하려면 로그인하세요.

LecteurDuDimanche 13 Jul 2026 · 05:08

Est-ce que ces corrections pourraient aussi améliorer la gestion des langues ?

1
LitLover42 13 Jul 2026 · 07:32

Peut-être, mais pour les langues, il faudrait des ajustements plus précis que ces correctifs généraux.

sandrine.b 13 Jul 2026 · 05:01

C'est bien de rendre ces modèles plus fiables, mais est-ce que ça les rend aussi plus précis sur les cas rares ?

Dr. L. 13 Jul 2026 · 04:37

Ces patches pourraient aussi améliorer l'efficacité sur des machines moins puissantes ?

1
BookWorm47 12 Jul 2026 · 12:37

I wonder how these patches affect the model's ability to handle complex queries. Will it be more adept at understanding nuanced requests?

curio_usa 12 Jul 2026 · 07:39

Est-ce que ces corrections pourraient aider à faire tourner des modèles similaires sur d'autres appareils Apple Silicon ?

2
Emma_London 12 Jul 2026 · 07:01

Impressionnant ! Ça donne quoi sur d'autres machines ?

unLecteurCurieux 12 Jul 2026 · 06:58

Super de voir l'IA tourner en local ! Mais ça ne ralentit pas le modèle sur d'autres tâches ?

FoodieChicago 12 Jul 2026 · 06:50

Intéressant de voir l'avancée. Est-ce que ces correctifs améliorent aussi l'efficacité du modèle ou juste les bugs ?

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
토픽
탐색
정보