Kimi K3 acabou de superar o Fable 5 em benchmarks de agentes
O gigante open-weight da Moonshot entrega scores de fronteira a preço Sonnet 5, com pesos em 27 de julho.
A Moonshot AI lançou o Kimi K3. Em vários benchmarks de agentes, supera Fable 5 e GPT-5.6 Sol, com preço de Sonnet 5. Eu não tinha visto open-weight nesse patamar.
Seis pontos.
Scores que não são de nicho
Program Bench 77.8, SWE Marathon 42.0, BrowseComp 91.2, SpreadsheetBench 2 em 34.8. FrontierSWE 81.2 vs 86.6 do Fable 5 e 71.3 do GPT-5.6 Sol. Coding e browsing fortes.
Preço Sonnet, não frontier
~$3 entrada, ~$15 saída, ~30% das listas frontier. Em relação aos Kimi anteriores o preço subiu mais de 3x. Ainda assim, se você roda agentes o dia inteiro, token é folha de pagamento.
A arquitetura não é um retoque
Delta Attention, Attention Residuals e MoE 16/896 em 2.8T parâmetros explicam o preço da API e o ~2.5x de eficiência de scaling vs K2.
Otimiza os próprios kernels
15 horas sem humano, ~2.5x em um kernel real de treino. O ponto de fundo é o loop self-evolving.
Pesos em 27 de julho
2.8T parâmetros. Hoje Kimi.com e API; depois do 27, self-host de verdade.
Terceiro choque depois de DeepSeek-R1 e GLM-5.2
Não troco de stack só por leaderboard. O harness de produção decide. Esta semana coloco Kimi K3 no harness.
Assine a newsletter
Receba insights sobre a IA mais recente.