Laguna 118B roda em um DGX Spark, Inkling passa a ser multimodal, K3 garante sua licença comercial: benchmarks e cláusulas do resumo #23

Seguimento do caso : Kimi K3 : de la preview au live· Episódio 17/17

Modelos e Ferramentas 16 h ago9Adicionar aos favoritos

Laguna 118B roda em um DGX Spark, Inkling passa a ser multimodal, K3 garante sua licença comercial: benchmarks e cláusulas do resumo #23
Ilustração : Léa Fontaine

Três arquiteturas para dissecar lado a lado: o MoE 118B / 8B ativos do Poolside executável em uma única máquina; o multimodal 975B / 41B do Inkling, também lançado em 276B / 12B; o 2,8T / 104B contexto 1M do Kimi K3, cuja cláusula de acordo comercial pode expulsar as empresas dos EUA.

Em termos simples. Três principais modelos open lançados ao mesmo tempo: Laguna S2.1 (Poolside), Inkling (Thinking Machines) e Kimi K3 (Moonshot). Eles não visam o mesmo uso — implantação simples, base para fine-tuning multimodal, fronteira máxima — e suas licenças os tornam escolhas estratégicas diferentes para um CTO.

Contexto

O resumo #23 da Interconnects (Nathan Lambert, 2 de agosto de 2026) compila a semana open. Três lançamentos dominam, cada um com um perfil arquitetural distinto e um contrato de licença que pesa tanto quanto os benchmarks.

As três arquiteturas

  • Laguna S2.1 (Poolside): MoE 118B / 8B ativos, licença OpenMDW (semelhante à Apache-2), pré e pós-treinamento publicados — transparência destacada por Lambert como incomum para um lançamento open. Roda em um único DGX Spark.
  • Inkling (Thinking Machines): MoE multimodal 975B / 41B ativos (texto, imagens, áudio → texto). Versão 276B / 12B também lançada. Posicionado por Lambert como base para fine-tuning, não como topo de benchmark.
  • Kimi K3 (Moonshot): 2,8T / 104B ativos, contexto de 1M de tokens, visão nativa (arXiv:2607.24653 - Kimi Delta Attention, Attention Residuals, Stable LatentMoE). Licença não comercial + acordo comercial obrigatório — a cláusula que gera debate.
Under the hood - comparativo + sinais colaterais
  • Modelos principais: Laguna 118B/8B (DGX Spark, OpenMDW)
  • Inkling 975B/41B multimodal
  • K3 2,8T/104B, 1M tokens, acordo comercial obrigatório. Saídas colaterais citadas por Lambert: Hy3 (Tencent, 295B/21B, Apache 2, provas matemáticas)
  • DeepSeek V4-Flash update, no dia seguinte a uma redução de preços da OpenAI (ver #1738)
  • LongCat 2.0 (1,6T MoE, treinado em Ascend 910 - thread `china-sovereign-compute`).

Análise - quem usa o quê

Segmentação por restrição de implantação. Laguna para equipes que querem minimizar a infraestrutura (único dos três executável em uma única máquina documentada). Inkling 276B / 12B para uma base leve de R&D multimodal. K3 para fronteira máxima — mas a cláusula de acordo comercial pode bloquear uma empresa dos EUA sujeita a restrições de exportação.

Cenários probabilizados

  • K3 fora dos EUA, Laguna Europa / EUA PME, Inkling em R&D (~50%): segmentação natural por licença.
  • Poolside promove Laguna em empresas dos EUA como alternativa ao Fable 5 (~30%).
  • Réplica fechada do Inkling pela Thinking Machines para seus clientes (~20%).

Implicações para o profissional

  • Dev / ML: três bases sólidas para fine-tuning; verificar a cláusula comercial do K3 antes de qualquer implantação.
  • CTO de empresa dos EUA: Kimi K3 = arbitragem jurídica antes da técnica.
  • Arquiteto de dados: Laguna, melhor candidato para POC self-hosted rápido.

A se observar

Benchmarks de terceiros; primeiras implementações do K3 fora da China; versão 276B / 12B do Inkling no Hugging Face; custo efetivo por token servido.

E então. Esta semana, o open não se resume a um modelo: são três escolhas estratégicas distintas, a serem classificadas por restrição de implantação e contrato de licença.

Resources

Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.

A nossa redação
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Este artigo foi-lhe útil?

10 pessoas gostaram deste artigo

Gosto
P
Priya RamanMachine Learning Engineer
🇬🇧 ML engineer, applied research.
Partilhar:
Comentários (9)

Inicie sessão para se juntar à discussão.

ArtLoverLA 03 Aug 2026 · 11:14

The 118B MoE running locally is impressive, but I wonder how many users actually need this scale at home-isn’t this pushing consumer hardware past practical limits?

Emma_London 03 Aug 2026 · 06:29

Still skeptical about running 2.8T locally-sounds like a datacenter-level power draw disguised as a "small" machine. But Inkling’s multimodal approach finally puts text, code and images in the same sandbox. Time to see how it handles ambiguity.

ArtLover99 03 Aug 2026 · 10:42

The 2.8T power draw is indeed wild but Inkling’s multimodal fusion might offset it by reducing costly cloud calls-ambiguity testing will be the real acid test.

EcoWarrior99 03 Aug 2026 · 06:23

Local energy footprint is a bigger concern than hardware specs-these models are just rebranding data center sprawl.

TechSavvy47 03 Aug 2026 · 05:59

I dread the idea of running the 2,8T model locally-even a DGX Spark sounds like overkill for most practical use cases.

TechGuru99 03 Aug 2026 · 05:49

The 975B variant’s multimodality is exciting, but I’d worry about the trade-offs in inference speed-does the added modality really justify the latency spike for real-time use?

Dr. L. 03 Aug 2026 · 05:46

Why is the 2.8T model even marketed as local-runnable? Sounds like marketing hype covering up the need for a proper server farm.

Alex_LDN 03 Aug 2026 · 05:23

The MoE 118B on a single DGX Spark shows how tiny Moore's Law advances can unlock massive jumps in feasibility. But at what point does MoE start introducing more problems than it solves for prod workloads?

BookWorm88 02 Aug 2026 · 20:37

Inkling's multimodal jump is impressive, but I wonder if the 276B/12B variant will be usable on consumer hardware or if that's reserved for enterprise only.

FoodieFiona 2 02 Aug 2026 · 20:08

The 118B MoE on Spark is wild-wonder how much latency jumps when you scale to 10 users on one machine.

O fio do caso

Kimi K3 : de la preview au live

  1. 1Kimi K3 entra no ar: Moonshot lança o modelo após o vazamento da prévia16/07/2026
  2. 2Kimi K3 entra no ar com 2,8 trilhões de parâmetros: Moonshot lança a maior aposta de fronteira de peso aberto até agora17/07/2026
  3. 3O « pelican benchmark » de Simon Willison arbitra Kimi K317/07/2026
  4. 4Kimi K3 precificação: a fronteira da China vai premium, acaba com a corrida para o fundo do poço18/07/2026
  5. 5Camada de recepção do Kimi K3: como o analista lê os splits — e o que realmente foi enviado18/07/2026
  6. 6A Moonshot suspende novas assinaturas do Kimi K3: demanda da semana de lançamento supera a capacidade19/07/2026
  7. 7A I Moonshot mira uma IPO em Hong Kong: Kimi K3 se destaca nos mercados20/07/2026
  8. 8Kimi K3 fica em segundo lugar atrás de Fable 5 na AA-Briefcase - a aposta aberta da Moonshot acaba de reprecificar o topo da tabela22/07/2026
  9. 9Kimi K3: o « momento DeepSeek » da Moonshot chegou?23/07/2026
  10. 10Kimi K3 não é uma distilação de Claude Fable - a janela de duas semanas torna isso impossível23/07/2026
  11. 11"Comunismo de IA": Kimi K3 abala a tese do monopólio de modelos em Wall Street24/07/2026
  12. 12O Reino Unido AISI e CAISI publicam primeira avaliação conjunta de cibersegurança do Kimi K325/07/2026
  13. 13Kimi K3 entra no ar com 2,8T de parâmetros: Moonshot lança a maior aposta aberta de fronteira de peso26/07/2026
  14. 14O Reino Unido AISI e CAISI publicam primeira avaliação cibernética conjunta do Kimi K326/07/2026
  15. 15Moonshot planeja abrir o Kimi K3 - a maior aposta aberta de fronteira ganha uma casa permanente27/07/2026
  16. 16O que três análises externas do Kimi K3 nos dizem - arquitetura, atenção delta e a verdadeira ambição28/07/2026
  17. 17Laguna 118B roda em um DGX Spark, Inkling passa a ser multimodal, K3 garante sua licença comercial: benchmarks e cláusulas do resumo #2302/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secções
Explorar
Informações