モデルとツール Jul 16, 2026 at 13:508ブックマークに追加

ベンチマーククリップはどこにでもあります。しかし、モデルカード、API、再現可能な評価はそうではありません。
今週、Moonshot AIのKimi K3のプレビュー出力動画が中国のソーシャルプラットフォームに氾濫した。Pandaily(2026年7月16日)によると、ユーザーテストではK3がビデオ生成の詳細さとアニメーションの滑らかさにおいてFable 5と並ぶ評価を受けており、Fable 5は現在のビデオ生成のベンチマーク基準(推論ベンチマークではない)。また、謎のエントリー「Kivine」がArenaに出現した。Moonshotは論文、モデルカード、APIを公開していない。重み(weights)も公開されていない。
これは、Moonshot、Qwen、DeepSeek、Zhipuが再現可能な成果物のリリース前に数週間かけてティザーを公開するという、中国の「オープンフロンティアリリース」の文法に合致している。動画は特定の軸(ここではビデオマルチモーダル品質)に特化してキュレーションされているため印象的に見えるが、外部チームによる汚染管理ベンチマークでの評価は行われていない。ソーシャルメディアの氾濫はリリースイベントではない。
本記事は人工知能により作成され、人間の編集管理のもとで校閲されています。
Ces vidéos sont impressionnantes, mais sans API, comment l'utiliser concrètement ?
Les vidéos sont impressionnantes, mais sans modèle ni API, comment évaluer vraiment les performances ?
Les vidéos sont impressionnantes, mais comment évaluer vraiment sans API ni documentation ?
Les vidéos sont impressionnantes, mais sans modèle ni API, comment savoir si c'est vraiment représentatif ?
Les vidéos sont impressionnantes, mais où est la documentation ? On ne peut pas évaluer sans ça.
Les vidéos sont bluffantes, mais comment ça se comporte sur des tâches du quotidien sans l'API ?
Les vidéos sont impressionnantes, mais sans modèle détaillé, difficile de juger vraiment.
Ces vidéos sont impressionnantes, mais comment évaluer le modèle sans API ni carte technique ?