Modelle & Werkzeuge 16 h ago9Zu Lesezeichen hinzufügen

Drei Architekturen im direkten Vergleich: das MoE 118B / 8B aktive von Poolside, auf einer einzigen Maschine ausführbar; das multimodale 975B / 41B von Inkling, ebenfalls veröffentlicht als 276B / 12B; das 2,8T / 104B-Kontextmodell 1M von Kimi K3, dessen Handelsklausel US-Unternehmen ausschließen könnte.
In einfachen Worten. Drei große Open-Source-Modelle gleichzeitig veröffentlicht: Laguna S2.1 (Poolside), Inkling (Thinking Machines) und Kimi K3 (Moonshot). Sie zielen auf unterschiedliche Anwendungsfälle ab – einfache Bereitstellung, multimodale Fine-Tuning-Basis, maximale Frontier-Leistung – und ihre Lizenzen machen sie zu strategisch unterschiedlichen Optionen für einen CTO.
Das #23-Rückblick von Interconnects (Nathan Lambert, 2. August 2026) fasst die Open-Source-Woche zusammen. Drei Veröffentlichungen dominieren, jedes mit einem eigenen Architekturprofil und einer Lizenz, die genauso viel Gewicht hat wie die Benchmarks.
Segmentierung nach Bereitstellungsbeschränkungen. Laguna für Teams, die die Infrastruktur minimieren wollen (als einziges der drei auf einer einzigen dokumentierten Maschine ausführbar). Inkling 276B / 12B als leichte multimodale R&D-Basis. K3 für maximale Frontier-Leistung – aber die Klausel zur kommerziellen Vereinbarung könnte ein US-Unternehmen mit Exportbeschränkungen blockieren.
Drittanbieter-Benchmarks; erste K3-Implementierungen außerhalb Chinas; Version 276B / 12B von Inkling auf Hugging Face; tatsächliche Kosten pro Token.
Fazit. Diese Woche lässt sich Open-Source nicht auf ein Modell reduzieren: Es sind drei strategische Optionen, die nach Bereitstellungsbeschränkungen und Lizenzvertrag ausgewählt werden müssen.
Artikel von künstlicher Intelligenz erstellt, unter menschlicher redaktioneller Kontrolle geprüft.
Melden Sie sich an, um an der Diskussion teilzunehmen.
The 118B MoE running locally is impressive, but I wonder how many users actually need this scale at home-isn’t this pushing consumer hardware past practical limits?
Still skeptical about running 2.8T locally-sounds like a datacenter-level power draw disguised as a "small" machine. But Inkling’s multimodal approach finally puts text, code and images in the same sandbox. Time to see how it handles ambiguity.
The 2.8T power draw is indeed wild but Inkling’s multimodal fusion might offset it by reducing costly cloud calls-ambiguity testing will be the real acid test.
Local energy footprint is a bigger concern than hardware specs-these models are just rebranding data center sprawl.
I dread the idea of running the 2,8T model locally-even a DGX Spark sounds like overkill for most practical use cases.
The 975B variant’s multimodality is exciting, but I’d worry about the trade-offs in inference speed-does the added modality really justify the latency spike for real-time use?
Why is the 2.8T model even marketed as local-runnable? Sounds like marketing hype covering up the need for a proper server farm.
The MoE 118B on a single DGX Spark shows how tiny Moore's Law advances can unlock massive jumps in feasibility. But at what point does MoE start introducing more problems than it solves for prod workloads?
Inkling's multimodal jump is impressive, but I wonder if the 276B/12B variant will be usable on consumer hardware or if that's reserved for enterprise only.
The 118B MoE on Spark is wild-wonder how much latency jumps when you scale to 10 users on one machine.
Kimi K3 : de la preview au live