Kimi K3 在智能体基准上超过了 Fable 5
Moonshot 开源权重巨模型以 Sonnet 5 价位打出前沿级智能体分数,权重将于 7 月 27 日开放。
Moonshot AI 发布了 Kimi K3。在多个智能体基准上超过 Fable 5 与 GPT-5.6 Sol,价格却接近 Sonnet 5。开源权重模型坐到这一档,我以前没见过。
分六点看。
不是小众分数
Program Bench 77.8、SWE Marathon 42.0、BrowseComp 91.2、SpreadsheetBench 2 为 34.8,公开数字上领先 Fable 5。FrontierSWE 81.2,低于 Fable 5 的 86.6,但明显高于 GPT-5.6 Sol 的 71.3。编码与浏览都强,就不是单点特化模型。
Sonnet 级价格,不是前沿级价格
输入约 $3、输出约 $15,大约是顶级前沿标价的 30%。相对早期 Kimi 涨价超过 3 倍,所以不是相对 K2 的免费午餐。但若整天跑 agent,token 费近似人力成本,这个价差很难忽略。
架构不是小改
Kimi Delta Attention 重做 attention 路径,宣称 1M 上下文解码最高快 6.3 倍。Attention Residuals 强化层间信息流,不到 2% 算力换约 25% 训练效率。MoE 在 896 个专家中只激活 16 个:2.8T 参数推理时只开百分之几,才撑得住 API 价。相对 K2 宣称 2.5 倍缩放效率。
自己优化 kernel
在 15 小时无人迭代中,用 two-phase 算法与 kernel fusion 报告约 2.5 倍加速。Fable 5 在同任务上也能到接近终点,但每轮改进 K3 更快。关键是:这不是玩具题,而是训练栈本体。模型加速自己的训练路径,下一版更便宜,再反哺基础设施——self-evolving 环开始转。
7 月 27 日开放权重
2.8T 参数。目前可用 Kimi.com 与 platform.kimi.ai;27 日后自托管成为真实选项。
可能是 DeepSeek-R1、GLM-5.2 之后的第三次冲击
榜单不会单独决定我是否切换。生产 harness 才是最终裁判。这周会把 Kimi K3 放进 harness 跑。
订阅通讯
获取最新 AI 洞见。