Qwen 3.5-122B работает в daily driver на Mac Studio — исправлены 3 бага, тихий переход

Строительство Jul 12, 2026 at 11:178В закладки

Qwen 3.5-122B работает в daily driver на Mac Studio — исправлены 3 бага, тихий переход
Иллюстрация : Léa Fontaine

Инженер документирует на своём блоге три патча, которые превращают большую модель Qwen 3.5 (через MLX) в надёжного повседневного помощника на Mac Studio. Локальное оборудование продвигается на практике, патч за патчем.

Простыми словами. Инженер задокументировал (mrzk.io, июль 2026) три бага, которые он исправил в стеке MLX, чтобы запустить большую модель Qwen 3.5 с открытыми весами как ежедневный инструмент на Mac Studio. Слабый, но ощутимый сигнал: локальные решения догоняют, исправление за исправлением.

Контекст

MLX — это фреймворк Apple для инференса на чипах M-series; он использует unified memory. Теоретически возможно разместить модель Qwen 3.5 (от ~100 до 235 млрд параметров в зависимости от варианта) на хорошо настроенном Mac Studio (до 512 ГБ unified RAM на M3 Ultra) с помощью квантизации. В блоге задокументированы практические проблемы — точное название протестированного варианта нужно уточнить в посте.

Под капотом — природа патчей

Согласно посту, три бага блокировали ежедневное использование:

  1. Баг длинного контекста — генерация деградировала после определённого количества токенов.
  2. Баг квантизации — конвертация в 4-битный формат давала некорректные выходные данные на некоторых слоях модели.
  3. Баг семплинга — крайний случай в выборе токена влиял на качество.

Точные детали (запатченный слой, механизм фикса, апстримный PR) — в посте; стоит прочитать тем, кто хочет воспроизвести.

Анализ

Что важно в посте, помимо патчей, — это то, что стек Apple + Qwen достиг уровня, когда стоит заниматься отладкой. Это переход от «работает в демке» к «я использую это каждый день». Аппаратные затраты остаются значительными — Mac Studio для этой задачи стоит несколько тысяч долларов, — но становятся доступными для профессионала, чьи данные не могут покинуть его машину.

Сценарии

Базовый (55 %) : стек Apple + Qwen/DeepSeek/Llama становится жизнеспособным выбором для 3-5 % разработчиков с высокой чувствительностью к данным к середине 2027 года. Оптимистичный (25 %) : модель Qwen или аналогичная достигает уровня frontier-class на массовом железе; уравнение меняется. Пессимистичный (20 %) : фрагментация стека (MLX, llama.cpp, vLLM, exllama) ослабляет позиции; для каждой модели нужен свой патч.

Последствия для сборки

  • Локальные решения получают чёткий кейс использования: чувствительность к данным + задержка + предельные затраты, стремящиеся к нулю.
  • Внимание смещается с бенчмарков на time-to-fix — сколько багов между релизом модели и её надёжностью в реальной эксплуатации.
  • Экосистема open weights расширяет поверхность для вклада: каждый апстримный патч важен.

Риски

Зависимость от MLX (Apple может сломать API), качество 4-битной квантизации на больших моделях, стабильность весов под длительной нагрузкой.

Итог

Спор «облако vs локаль» не идеологический. Он технический и решается баг за багом. Посты такого типа — неброские, но очень конкретные — лучший индикатор грядущего сдвига.

Resources

Статья создана искусственным интеллектом и проверена под редакционным контролем человека.

Наша редакция
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Была ли статья полезной?

3 чел. оценили эту статью

Нравится
A
Aiko NakamuraSenior software engineer
🇬🇧 Senior engineer, large-scale platforms. Writes about building with AI.
Поделиться:
Комментарии (8)

Войдите, чтобы участвовать в обсуждении.

LecteurDuDimanche 13 Jul 2026 · 05:08

Est-ce que ces corrections pourraient aussi améliorer la gestion des langues ?

1
LitLover42 13 Jul 2026 · 07:32

Peut-être, mais pour les langues, il faudrait des ajustements plus précis que ces correctifs généraux.

sandrine.b 13 Jul 2026 · 05:01

C'est bien de rendre ces modèles plus fiables, mais est-ce que ça les rend aussi plus précis sur les cas rares ?

Dr. L. 13 Jul 2026 · 04:37

Ces patches pourraient aussi améliorer l'efficacité sur des machines moins puissantes ?

1
BookWorm47 12 Jul 2026 · 12:37

I wonder how these patches affect the model's ability to handle complex queries. Will it be more adept at understanding nuanced requests?

curio_usa 12 Jul 2026 · 07:39

Est-ce que ces corrections pourraient aider à faire tourner des modèles similaires sur d'autres appareils Apple Silicon ?

2
Emma_London 12 Jul 2026 · 07:01

Impressionnant ! Ça donne quoi sur d'autres machines ?

unLecteurCurieux 12 Jul 2026 · 06:58

Super de voir l'IA tourner en local ! Mais ça ne ralentit pas le modèle sur d'autres tâches ?

FoodieChicago 12 Jul 2026 · 06:50

Intéressant de voir l'avancée. Est-ce que ces correctifs améliorent aussi l'efficacité du modèle ou juste les bugs ?

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Темы
Обзор
Информация