Tony Lee
Tony Lee
目录
1 分钟阅读 2026

Kimi K3 在智能体基准上超过了 Fable 5

Moonshot 开源权重巨模型以 Sonnet 5 价位打出前沿级智能体分数,权重将于 7 月 27 日开放。

Moonshot AI 发布了 Kimi K3。在多个智能体基准上超过 Fable 5 与 GPT-5.6 Sol,价格却接近 Sonnet 5。开源权重模型坐到这一档,我以前没见过。

分六点看。

不是小众分数

Program Bench 77.8、SWE Marathon 42.0、BrowseComp 91.2、SpreadsheetBench 2 为 34.8,公开数字上领先 Fable 5。FrontierSWE 81.2,低于 Fable 5 的 86.6,但明显高于 GPT-5.6 Sol 的 71.3。编码与浏览都强,就不是单点特化模型。

Sonnet 级价格,不是前沿级价格

输入约 $3、输出约 $15,大约是顶级前沿标价的 30%。相对早期 Kimi 涨价超过 3 倍,所以不是相对 K2 的免费午餐。但若整天跑 agent,token 费近似人力成本,这个价差很难忽略。

架构不是小改

Kimi Delta Attention 重做 attention 路径,宣称 1M 上下文解码最高快 6.3 倍。Attention Residuals 强化层间信息流,不到 2% 算力换约 25% 训练效率。MoE 在 896 个专家中只激活 16 个:2.8T 参数推理时只开百分之几,才撑得住 API 价。相对 K2 宣称 2.5 倍缩放效率。

自己优化 kernel

在 15 小时无人迭代中,用 two-phase 算法与 kernel fusion 报告约 2.5 倍加速。Fable 5 在同任务上也能到接近终点,但每轮改进 K3 更快。关键是:这不是玩具题,而是训练栈本体。模型加速自己的训练路径,下一版更便宜,再反哺基础设施——self-evolving 环开始转。

7 月 27 日开放权重

2.8T 参数。目前可用 Kimi.com 与 platform.kimi.ai;27 日后自托管成为真实选项。

可能是 DeepSeek-R1、GLM-5.2 之后的第三次冲击

榜单不会单独决定我是否切换。生产 harness 才是最终裁判。这周会把 Kimi K3 放进 harness 跑。

订阅通讯

获取最新 AI 洞见。