Модели и инструменты 16 h ago9В закладки

Три архитектуры для сравнения: MoE 118B / 8B активных слоёв от Poolside, работающий на одной машине; мультимодальная модель 975B / 41B от Inkling, также выпущенная в версии 276B / 12B; и модель Kimi K3 с контекстом 1M и 2,8T / 104B параметров, чьё коммерческое соглашение может вытеснить американские компании.
Простыми словами. Три основных открытых модели, выпущенные одновременно: Laguna S2.1 (Poolside), Inkling (Thinking Machines) и Kimi K3 (Moonshot). Они не нацелены на одно и то же применение — простое развёртывание, база для мультимодального fine-tuning, максимальный frontier — и их лицензии делают их стратегически разными выборами для CTO.
Подборка #23 от Interconnects (Натан Ламберт, 2 августа 2026) охватывает неделю в мире open-source. Три релиза выделяются, каждая с уникальным архитектурным профилем и лицензионным соглашением, которое не менее важно, чем бенчмарки.
Сегментация по ограничениям развёртывания. Laguna для команды, которой нужно минимизировать инфраструктуру (единственная из троих, работающая на одной машине с документацией). Inkling 276B / 12B как лёгкая база для мультимодального R&D. K3 для максимального frontier — но пункт коммерческого соглашения может заблокировать американскую компанию с экспортными ограничениями.
Внешние бенчмарки; первые реализации K3 вне Китая; версия 276B / 12B Inkling на Hugging Face; реальная стоимость на токен.
Итог. На этой неделе open-source — это не одна модель, а три стратегических выбора, которые нужно сортировать по ограничениям развёртывания и условиям лицензии.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
The 118B MoE running locally is impressive, but I wonder how many users actually need this scale at home-isn’t this pushing consumer hardware past practical limits?
Still skeptical about running 2.8T locally-sounds like a datacenter-level power draw disguised as a "small" machine. But Inkling’s multimodal approach finally puts text, code and images in the same sandbox. Time to see how it handles ambiguity.
The 2.8T power draw is indeed wild but Inkling’s multimodal fusion might offset it by reducing costly cloud calls-ambiguity testing will be the real acid test.
Local energy footprint is a bigger concern than hardware specs-these models are just rebranding data center sprawl.
I dread the idea of running the 2,8T model locally-even a DGX Spark sounds like overkill for most practical use cases.
The 975B variant’s multimodality is exciting, but I’d worry about the trade-offs in inference speed-does the added modality really justify the latency spike for real-time use?
Why is the 2.8T model even marketed as local-runnable? Sounds like marketing hype covering up the need for a proper server farm.
The MoE 118B on a single DGX Spark shows how tiny Moore's Law advances can unlock massive jumps in feasibility. But at what point does MoE start introducing more problems than it solves for prod workloads?
Inkling's multimodal jump is impressive, but I wonder if the 276B/12B variant will be usable on consumer hardware or if that's reserved for enterprise only.
The 118B MoE on Spark is wild-wonder how much latency jumps when you scale to 10 users on one machine.
Kimi K3 : de la preview au live