Kimi K3 vient de battre Fable 5 sur les benchmarks agents
Le géant open-weight de Moonshot affiche des scores frontier au prix Sonnet 5, avec des poids le 27 juillet.
Moonshot AI a publié Kimi K3. Sur plusieurs benchmarks agents, il dépasse Fable 5 et GPT-5.6 Sol, au prix d’un Sonnet 5. Je n’avais pas vu d’open-weight s’installer à ce niveau.
Six points.
Des scores qui ne sont pas de niche
Program Bench 77.8, SWE Marathon 42.0, BrowseComp 91.2, SpreadsheetBench 2 à 34.8 — devant Fable 5 sur les chiffres publiés. FrontierSWE 81.2, derrière Fable 5 (86.6) mais bien devant GPT-5.6 Sol (71.3). Coding et browsing solides : pas un spécialiste d’un seul domaine.
Prix Sonnet, pas prix frontier
Environ $3 en entrée, $15 en sortie, ~30% des listes frontier. Par rapport aux Kimi précédents le prix a plus que triplé. Même ainsi, si vous tournez des agents toute la journée, le token est de la masse salariale.
L’architecture n’est pas un petit bump
Delta Attention, Attention Residuals, MoE 16/896 experts sur 2.8T paramètres : le design explique le prix API et le gain d’efficacité de scaling annoncé (~2.5x vs K2).
Il optimise ses propres kernels
15 heures sans humain, ~2.5x sur un kernel d’entraînement réel. Fable 5 arrive à un résultat proche ; K3 s’améliore plus vite par itération. Le vrai sujet est la boucle self-evolving sur l’infra d’entraînement.
Poids le 27 juillet
2.8T paramètres. Aujourd’hui Kimi.com et l’API ; après le 27, l’auto-hébergement devient une option réelle.
Troisième choc après DeepSeek-R1 et GLM-5.2
Je ne bascule pas sur un leaderboard seul. Le harness de production tranche. Je mets Kimi K3 en harness cette semaine.
Rejoindre la newsletter
Recevez les dernières analyses sur l'IA.