Строительство Jul 12, 2026 at 11:178В закладки

Инженер документирует на своём блоге три патча, которые превращают большую модель Qwen 3.5 (через MLX) в надёжного повседневного помощника на Mac Studio. Локальное оборудование продвигается на практике, патч за патчем.
Простыми словами. Инженер задокументировал (mrzk.io, июль 2026) три бага, которые он исправил в стеке MLX, чтобы запустить большую модель Qwen 3.5 с открытыми весами как ежедневный инструмент на Mac Studio. Слабый, но ощутимый сигнал: локальные решения догоняют, исправление за исправлением.
MLX — это фреймворк Apple для инференса на чипах M-series; он использует unified memory. Теоретически возможно разместить модель Qwen 3.5 (от ~100 до 235 млрд параметров в зависимости от варианта) на хорошо настроенном Mac Studio (до 512 ГБ unified RAM на M3 Ultra) с помощью квантизации. В блоге задокументированы практические проблемы — точное название протестированного варианта нужно уточнить в посте.
Согласно посту, три бага блокировали ежедневное использование:
Точные детали (запатченный слой, механизм фикса, апстримный PR) — в посте; стоит прочитать тем, кто хочет воспроизвести.
Что важно в посте, помимо патчей, — это то, что стек Apple + Qwen достиг уровня, когда стоит заниматься отладкой. Это переход от «работает в демке» к «я использую это каждый день». Аппаратные затраты остаются значительными — Mac Studio для этой задачи стоит несколько тысяч долларов, — но становятся доступными для профессионала, чьи данные не могут покинуть его машину.
Базовый (55 %) : стек Apple + Qwen/DeepSeek/Llama становится жизнеспособным выбором для 3-5 % разработчиков с высокой чувствительностью к данным к середине 2027 года. Оптимистичный (25 %) : модель Qwen или аналогичная достигает уровня frontier-class на массовом железе; уравнение меняется. Пессимистичный (20 %) : фрагментация стека (MLX, llama.cpp, vLLM, exllama) ослабляет позиции; для каждой модели нужен свой патч.
Зависимость от MLX (Apple может сломать API), качество 4-битной квантизации на больших моделях, стабильность весов под длительной нагрузкой.
Спор «облако vs локаль» не идеологический. Он технический и решается баг за багом. Посты такого типа — неброские, но очень конкретные — лучший индикатор грядущего сдвига.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
Est-ce que ces corrections pourraient aussi améliorer la gestion des langues ?
Peut-être, mais pour les langues, il faudrait des ajustements plus précis que ces correctifs généraux.
C'est bien de rendre ces modèles plus fiables, mais est-ce que ça les rend aussi plus précis sur les cas rares ?
Ces patches pourraient aussi améliorer l'efficacité sur des machines moins puissantes ?
I wonder how these patches affect the model's ability to handle complex queries. Will it be more adept at understanding nuanced requests?
Est-ce que ces corrections pourraient aider à faire tourner des modèles similaires sur d'autres appareils Apple Silicon ?
Impressionnant ! Ça donne quoi sur d'autres machines ?
Super de voir l'IA tourner en local ! Mais ça ne ralentit pas le modèle sur d'autres tâches ?
Intéressant de voir l'avancée. Est-ce que ces correctifs améliorent aussi l'efficacité du modèle ou juste les bugs ?