Tony Lee
Tony Lee
目錄
1 分鐘閱讀 2026

Kimi K3 在代理基準上超越了 Fable 5

Moonshot 開源權重巨模型以 Sonnet 5 價位打出前沿級代理分數,權重將於 7 月 27 日開放。

Moonshot AI 發布了 Kimi K3。在多個代理基準上超過 Fable 5 與 GPT-5.6 Sol,價格卻接近 Sonnet 5。開源權重模型坐到這一檔,我以前沒見過。

分六點看。

不是小眾分數

Program Bench 77.8、SWE Marathon 42.0、BrowseComp 91.2、SpreadsheetBench 2 為 34.8,公開數字上領先 Fable 5。FrontierSWE 81.2,低於 Fable 5 的 86.6,但明顯高於 GPT-5.6 Sol 的 71.3。編碼與瀏覽都強,就不是單點特化模型。

Sonnet 級價格,不是前沿級價格

輸入約 $3、輸出約 $15,大約是頂級前沿標價的 30%。相對早期 Kimi 漲價超過 3 倍,所以不是相對 K2 的免費午餐。但若整天跑 agent,token 費近似人力成本,這個價差很難忽略。

架構不是小改

Kimi Delta Attention 重做 attention 路徑,宣稱 1M 上下文解碼最高快 6.3 倍。Attention Residuals 強化層間資訊流,不到 2% 算力換約 25% 訓練效率。MoE 在 896 個專家中只啟動 16 個。相對 K2 宣稱 2.5 倍縮放效率。

自己優化 kernel

15 小時無人迭代,以 two-phase 演算法與 kernel fusion 報告約 2.5 倍加速。關鍵是這不是玩具題,而是訓練棧本體。self-evolving 環開始轉。

7 月 27 日開放權重

2.8T 參數。目前可用 Kimi.com 與 API;27 日後自託管成為真實選項。

可能是 DeepSeek-R1、GLM-5.2 之後的第三次衝擊

榜單不會單獨決定我是否切換。生產 harness 才是最終裁判。這週會把 Kimi K3 放進 harness 跑。

訂閱電子報

獲取最新 AI 洞見。