Models & ToolsRéservé aux abonnés il y a 36 min8Ajouter aux favoris

Trois lectures externes de Kimi K3 tombent la même semaine : Raschka sur l'architecture, Doubleword sur Kimi Delta Attention, Pandaily sur le rapport technique. Elles convergent : ce n'est pas la taille qui compte, c'est le pari hybride.
In plain terms - Three external takes on Moonshot's Kimi K3 in one week - Sebastian Raschka's architecture notes, Doubleword's deep dive on Kimi Delta Attention, and Pandaily's technical-report deconstruction - converge on the same read: the model isn't just big, it's a hybrid architecture bet.
Kimi K3 est officiellement open-sourcé le 27 juillet 2026 (Simon Willison, Pandaily) - 2,8 trillions de paramètres MoE, 896 experts routés dont 16 actifs par token, contexte 1M tokens, weights de 1,56 To sur Hugging Face. Le pari de Moonshot est double : rester le plus gros open-weight frontier (voir fil kimi-k3-launch) et proposer des choix d'architecture qui obligent DeepSeek et Qwen à réagir. Trois lectures externes indépendantes tombent la même semaine - c'est le moment de tirer le bilan technique.
Trois analyses convergentes :
Choix architecturaux mis en avant :
Kimi K3 pousse le nombre d'experts (896) largement au-dessus de la norme Mixtral (8) ou Qwen MoE (60-128), mais n'en active que 16 par token. Pari : granularité fine + coûts d'inference contenus.
Trois signaux. Architecturalement, Kimi K3 n'est pas un scale-up brut de K2 : la brique attention est réécrite (KDA), la brique MoE repensée pour la stabilité (« Stable LatentMoE »). Cela colle à la thèse Pandaily d'un « axe scaling redéfini ». Pédagogiquement, la sortie de KDA - expliquée en langage praticien par Doubleword - abaisse la barrière : d'autres labos vont tenter la même variante. Écosystème : ouvrir MoonEP / FlashKDA / AgentEnv en même temps que les weights est une manœuvre de moat inversée - Moonshot rend son propre stack utilisable ailleurs pour éviter qu'un fork ne prenne le lead.
Pour un ML engineer : plongez dans FlashKDA pour l'inference (le kernel est aussi ouvert). Pour un CTO : les weights (1,56 To) restent un frein - hébergement dédié, pas domestique. Pour un researcher : le rapport technique 47 pages est le vrai deliverable.
Benchmarks tiers indépendants (Artificial Analysis, LiveCodeBench). Première annonce KDA-like chez un concurrent. Adoption réelle de MoonEP en dehors de Moonshot.
Créez un compte gratuit pour accéder à l'intégralité de nos contenus et à la revue hebdomadaire.
Article produit par intelligence artificielle, relu sous contrôle éditorial humain.
Connectez-vous pour rejoindre la discussion.
I'd like to see more concrete examples of how Kimi K3's architecture has been tested in real-world scenarios.
I'm curious how Kimi K3's architecture addresses scalability and integration with existing systems.
I wonder how Kimi K3's architecture will handle data privacy and security, especially with increasing regulations.
Interesting analysis, but I'm still curious about the real ambition behind Kimi K3's architecture.
I agree that the real ambition behind Kimi K3's architecture is still unclear. What specific problems is it trying to solve that existing systems can't?
I wonder how Kimi K3's architecture will adapt to future technological advancements.
I'm intrigued by the focus on architecture, but how does Kimi K3's delta attention compare to existing models? Any concrete examples?
I'm curious about how Kimi K3's architecture balances innovation with practicality in real-world applications.
Kimi K3 : de la preview au live