건축 Jul 12, 2026 at 11:178북마크에 추가

엔지니어가 자신의 블로그에 세 개의 패치를 적용해 MLX를 통해 맥 스튜디오에서 큰 규모의 Qwen 3.5 모델을 일상 companion으로 신뢰성 있게 사용할 수 있도록 변환한 과정을 소개합니다. 로컬 하드웨어가 패치 하나씩 실용적인 영역에서 진전을 보이고 있습니다.
간단히 말해
한 엔지니어가 (mrzk.io, 2026년 7월) MLX 스택에서 세 가지 버그를 수정해 Mac Studio에서 Qwen 3.5 오픈 가중치 대형 모델을 일상용으로 구동했다는 내용을 문서화했습니다. 약한 신호지만 tangible한 변화: 로컬이 조금씩 따라잡고 있습니다. 패치 하나씩.
MLX는 M 시리즈 칩에서 유니파이드 메모리를 활용하는 Apple의 추론 프레임워크입니다. Qwen 3.5 모델(변종에 따라 약 100~235B 매개변수)을 잘 구성된 Mac Studio(최대 M3 Ultra 기준 512GB 유니파이드 RAM)에서 양자화하여 이론상 구동할 수 있습니다. 해당 블로그는 실무에서 걸리는 문제점을 문서화했습니다—정확한 테스트된 변종명은 글에서 확인하세요.
블로그에 따르면 세 가지 버그가 일상 사용을 막고 있었습니다:
정확한 세부 사항(패치된 레이어, 수정 메커니즘, 업스트림 PR)은 블로그에서 확인하세요—재현을 원한다면 읽어보세요.
블로그에서 말하는 것은 패치 그 이상입니다. Apple + Qwen 스택이 이제 디버깅할 가치가 있는 수준에 도달했다는 것입니다. « 데모는 동작한다 »에서 « 매일 사용한다 »로의 전환입니다. 하드웨어 비용은 여전히 크지만(이 용도로 구성된 Mac Studio는 수천 달러) 데이터가 기기 밖으로 나갈 수 없는 전문가에게는 도달 가능한 수준이 되었습니다.
기본 시나리오 (55%): Apple + Qwen/DeepSeek/Llama 스택이 2027년 중반까지 데이터 민감도가 높은 개발자 3~5%에게 credible한 선택지가 됩니다. 낙관적 시나리오 (25%): Qwen 또는 동급 모델이 일반 소비자용 기기에서 frontier-class 수준에 도달합니다. 상황이 바뀝니다. 비관적 시나리오 (20%): 스택의 파편화(MLX, llama.cpp, vLLM, exllama)로 인해 모든 모델에 고유한 패치가 필요해집니다.
MLX에 대한 의존성(Apple이 API를 깨뜨릴 수 있음), 대형 모델에서 4비트 양자화 품질, 장기 부하 시 가중치 안정성.
« 클라우드 vs 로컬 » 논쟁은 이념적이지 않습니다. 기술적이며 버그 하나씩 해결되며 진행됩니다. 이처럼 특별하지 않지만 매우 구체적인 블로그 글こそ가 전환의 가장 좋은 지표입니다.
인공지능이 작성하고 사람의 편집 감독하에 검수한 기사입니다.
Est-ce que ces corrections pourraient aussi améliorer la gestion des langues ?
Peut-être, mais pour les langues, il faudrait des ajustements plus précis que ces correctifs généraux.
C'est bien de rendre ces modèles plus fiables, mais est-ce que ça les rend aussi plus précis sur les cas rares ?
Ces patches pourraient aussi améliorer l'efficacité sur des machines moins puissantes ?
I wonder how these patches affect the model's ability to handle complex queries. Will it be more adept at understanding nuanced requests?
Est-ce que ces corrections pourraient aider à faire tourner des modèles similaires sur d'autres appareils Apple Silicon ?
Impressionnant ! Ça donne quoi sur d'autres machines ?
Super de voir l'IA tourner en local ! Mais ça ne ralentit pas le modèle sur d'autres tâches ?
Intéressant de voir l'avancée. Est-ce que ces correctifs améliorent aussi l'efficacité du modèle ou juste les bugs ?