Kimi K3がエージェントベンチでFable 5を超えました
Moonshotのオープンウェイト巨体がSonnet 5価格帯でフロンティア級スコアを出し、7月27日に重みが公開されます。
Moonshot AIがKimi K3を公開しました。複数のエージェントベンチでFable 5とGPT-5.6 Solを上回り、価格はSonnet 5級です。オープンウェイトがこの層に座ったのは初めてに近いです。
六点で整理します。
ニッチな点数ではない
Program Bench 77.8、SWE Marathon 42.0、BrowseComp 91.2、SpreadsheetBench 2 34.8。公開数値ではFable 5を上回ります。FrontierSWEは81.2でFable 5(86.6)の次ですがGPT-5.6 Sol(71.3)は大きく上回ります。コーディングとブラウジングの両方が強いなら一芸モデルではありません。
フロンティア価格ではなくSonnet級
入力約$3、出力約$15。上位フロンティア比でおおよそ30%。以前のKimi比では3倍以上上がっているのでK2比の無料ランチではありません。それでも終日エージェントを回すならトークン代は人件費に近い。
アーキテクチャは小さな改善ではない
Kimi Delta Attentionはattention経路そのものを変え、1Mコンテキスト復号を最大6.3倍速くすると主張します。Attention Residualsは層間の情報流を補強し、計算2%未満の追加で学習効率約25%。MoEは896専門家のうち16だけ起動。2.8Tパラメータでも推論時は数パーセントしか使わない設計がAPI価格を支えます。
自分のカーネルを最適化する
15時間の無人反復でtwo-phaseカーネルとkernel fusionにより約2.5倍の高速化を報告。Fable 5も同課題で近い着地に達しましたが、反復あたりの改善はK3が速い。重要なのはこれが学習スタック本体に載っている点です。自己進化ループが動き始めている、という意味です。
7月27日に重み公開
2.8Tパラメータ。現行はKimi.comとAPI、27日以降はセルフホストが現実の選択肢になります。
DeepSeek-R1、GLM-5.2に続く三度目の衝撃になり得る
リーダーボードだけで切り替えは決めません。本番ハーネスが最終判定です。今週からKimi K3をハーネスに載せます。
ニュースレターに登録
最新のAIに関するインサイトをお届けします。