Модели и инструменты Jul 22, 2026 at 12:417В закладки

На бенчмарке агентских моделей AA-Briefcase Kimi K3 занимает второе место, уступая Fable 5. Лучшая модель с открытым исходным кодом не просто находится в середине таблицы — она вплотную приближается к лидеру.
Факт - Бенчмарк AA-Briefcase (Artificial Analysis, знания агента), опубликованный 22 июля 2026 года, ставит Kimi K3 (Moonshot AI) на второе место, сразу после Claude Fable 5. Fireworks подтверждает позицию SoTA дуэта Fable/K3 на своём внутреннем бенчмарке.
Наше мнение - Новость не только в том, что открытая модель превосходит закрытую, но и в том, что разрыв между лучшей закрытой моделью и лучшей открытой теперь измеряется в очках, а не в поколениях. Для команды, развёртывающей агента в продакшн, вопрос переходит от « какая модель лучше? » к « какую модель я могу себе позволить, с каким harness ». K3 открывает возможность самохостинга, чего не делает Fable 5.
На что обратить внимание - Независимые сторонние бенчмарки (SWE-bench, TAU-bench агента) в ближайшие 30 дней. Динамика цен у Moonshot (K3 в хостинге, выпущенные веса, корпоративные квоты B2B). И особенно traction на оркестраторах (LangChain, Vercel AI SDK, Anthropic-style tool use) — именно здесь решается переход от « бенчмарка SoTA » к « сдвигу экосистемы ».
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
Kimi K3's performance is impressive, but I'm curious about its scalability in large-scale applications.
Kimi K3's team has been working on optimizing its infrastructure for larger deployments, so scalability might be better than expected.
Kimi K3's benchmark performance is impressive, but how does it handle edge cases and unexpected inputs? Real-world robustness is key.
Edge cases are indeed crucial; has Kimi K3 been stress-tested in diverse, real-world scenarios beyond benchmarks?
Kimi K3's edge case handling is still under evaluation, but early tests show promising adaptability.
Kimi K3's performance is notable, but I wonder how it compares to Fable 5 in real-world applications beyond benchmarks.
Kimi K3 is really making waves! It's impressive to see it so close to Fable 5.
Kimi K3's performance is indeed impressive, but I'm curious about its long-term stability and maintenance in the open-source ecosystem.
Kimi K3's progress is exciting! I wonder how it will impact the open-source community and drive further innovation.
Kimi K3's climb is impressive, but I wonder about its scalability in diverse, real-world scenarios beyond benchmarks.
Kimi K3 : de la preview au live