Tony Lee
Tony Lee
目錄
1 分鐘閱讀

Kimi K3 喺 agent 基準上超過咗 Fable 5

Moonshot 開源權重巨模型以 Sonnet 5 價位打出前沿級 agent 分數,權重會喺 7 月 27 日開放。

Moonshot AI 發布咗 Kimi K3。喺多個 agent 基準上超過 Fable 5 同 GPT-5.6 Sol,價錢卻接近 Sonnet 5。開源權重模型坐到呢一檔,我以前未見過。

分六點睇。

唔係小眾分數

Program Bench 77.8、SWE Marathon 42.0、BrowseComp 91.2、SpreadsheetBench 2 係 34.8,公開數字上領先 Fable 5。FrontierSWE 81.2,低過 Fable 5 嘅 86.6,但明顯高過 GPT-5.6 Sol 嘅 71.3。編碼同 browsing 都強,就唔係單點特化模型。

Sonnet 級價錢,唔係前沿級價錢

輸入大約 $3、輸出大約 $15,大概係頂級前沿標價 30%。相對早期 Kimi 加價超過 3 倍,所以唔係相對 K2 嘅免費午餐。但如果成日跑 agent,token 費近似人力成本,呢個價差好難忽略。

架構唔係小改

Kimi Delta Attention 重做 attention 路徑,宣稱 1M context 解碼最高快 6.3 倍。Attention Residuals 強化層間資訊流。MoE 喺 896 個專家入面淨係開 16 個。相對 K2 宣稱 2.5 倍 scaling 效率。

自己優化 kernel

15 小時無人迭代,以 two-phase 演算法同 kernel fusion 報告大約 2.5 倍加速。關鍵係呢個唔係玩具題,而係訓練 stack 本體。self-evolving 環開始轉。

7 月 27 日開放權重

2.8T 參數。而家可以用 Kimi.com 同 API;27 日之後 self-host 成為真實選項。

可能係 DeepSeek-R1、GLM-5.2 之後第三次衝擊

榜單唔會單獨決定我係咪切換。生產 harness 先係最終裁判。呢個禮拜會將 Kimi K3 放進 harness 跑。

訂閱通訊

獲取最新 AI 洞見。