Kimi K3 acaba de superar a Fable 5 en benchmarks de agentes
El gigante open-weight de Moonshot marca scores de frontera a precio Sonnet 5, con pesos el 27 de julio.
Moonshot AI publicó Kimi K3. En varios benchmarks de agentes supera a Fable 5 y GPT-5.6 Sol, con precio de Sonnet 5. No había visto open-weight en ese piso.
Seis puntos.
Puntuaciones que no son de nicho
Program Bench 77.8, SWE Marathon 42.0, BrowseComp 91.2, SpreadsheetBench 2 en 34.8. FrontierSWE 81.2 frente a 86.6 de Fable 5 y 71.3 de GPT-5.6 Sol. Coding y browsing fuertes: no es un especialista de un solo dominio.
Precio Sonnet, no frontier
~$3 entrada, ~$15 salida, ~30% de las listas frontier. Frente a Kimi previos el precio subió más de 3x. Aun así, si corres agentes todo el día, el token es nómina.
La arquitectura no es un retoque
Delta Attention, Attention Residuals y MoE 16/896 sobre 2.8T parámetros explican el precio de API y el ~2.5x de eficiencia de scaling vs K2.
Optimiza sus propios kernels
15 horas sin humano, ~2.5x en un kernel real de entrenamiento. El tema de fondo es el bucle self-evolving.
Pesos el 27 de julio
2.8T parámetros. Hoy Kimi.com y API; después del 27, self-host real.
Tercer golpe tras DeepSeek-R1 y GLM-5.2
No cambio de stack solo por leaderboard. El harness de producción decide. Esta semana meto Kimi K3 en harness.
Únete al boletín
Recibe insights sobre la IA más reciente.