Modelos y Herramientas 16 h ago9Añadir a favoritos

Tres arquitecturas para diseccionar lado a lado: el MoE 118B / 8B activos de Poolside ejecutable en una sola máquina; el multimodal 975B / 41B de Inkling, publicado también en 276B / 12B; el 2,8T / 104B contexto 1M de Kimi K3, cuya cláusula de acuerdo comercial podría expulsar a las empresas estadounidenses.
En términos sencillos. Tres modelos abiertos importantes publicados al mismo tiempo: Laguna S2.1 (Poolside), Inkling (Thinking Machines) y Kimi K3 (Moonshot). No apuntan al mismo uso: despliegue simple, base para fine-tuning multimodal, máximo rendimiento —y sus licencias los convierten en opciones estratégicas distintas para un CTO.
El resumen #23 de Interconnects (Nathan Lambert, 2 de agosto de 2026) compila la semana open. Tres lanzamientos dominan, cada uno con un perfil arquitectónico distinto y un contrato de licencia que pesa tanto como los benchmarks.
Segmentación por restricción de despliegue. Laguna para equipos que quieren minimizar infraestructura (el único de los tres ejecutable en una sola máquina documentada). Inkling 276B / 12B como base ligera para R&D multimodal. K3 para máximo rendimiento —pero la cláusula de acuerdo comercial puede bloquear a una empresa estadounidense sujeta a restricciones de exportación.
Benchmarks de terceros; primeras implementaciones de K3 fuera de China; versión 276B / 12B de Inkling en Hugging Face; coste efectivo por token servido.
¿Y entonces? Esta semana, el open no se reduce a un solo modelo: son tres opciones estratégicas distintas, que deben clasificarse según la restricción de despliegue y el contrato de licencia.
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
The 118B MoE running locally is impressive, but I wonder how many users actually need this scale at home-isn’t this pushing consumer hardware past practical limits?
Still skeptical about running 2.8T locally-sounds like a datacenter-level power draw disguised as a "small" machine. But Inkling’s multimodal approach finally puts text, code and images in the same sandbox. Time to see how it handles ambiguity.
The 2.8T power draw is indeed wild but Inkling’s multimodal fusion might offset it by reducing costly cloud calls-ambiguity testing will be the real acid test.
Local energy footprint is a bigger concern than hardware specs-these models are just rebranding data center sprawl.
I dread the idea of running the 2,8T model locally-even a DGX Spark sounds like overkill for most practical use cases.
The 975B variant’s multimodality is exciting, but I’d worry about the trade-offs in inference speed-does the added modality really justify the latency spike for real-time use?
Why is the 2.8T model even marketed as local-runnable? Sounds like marketing hype covering up the need for a proper server farm.
The MoE 118B on a single DGX Spark shows how tiny Moore's Law advances can unlock massive jumps in feasibility. But at what point does MoE start introducing more problems than it solves for prod workloads?
Inkling's multimodal jump is impressive, but I wonder if the 276B/12B variant will be usable on consumer hardware or if that's reserved for enterprise only.
The 118B MoE on Spark is wild-wonder how much latency jumps when you scale to 10 users on one machine.
Kimi K3 : de la preview au live