Tony Lee
Tony Lee
Índice
1 min de lectura

Kimi K3 acaba de superar a Fable 5 en benchmarks de agentes

El gigante open-weight de Moonshot marca scores de frontera a precio Sonnet 5, con pesos el 27 de julio.

Moonshot AI publicó Kimi K3. En varios benchmarks de agentes supera a Fable 5 y GPT-5.6 Sol, con precio de Sonnet 5. No había visto open-weight en ese piso.

Seis puntos.

Puntajes que no son de nicho

Program Bench 77.8, SWE Marathon 42.0, BrowseComp 91.2, SpreadsheetBench 2 en 34.8. FrontierSWE 81.2 frente a 86.6 de Fable 5 y 71.3 de GPT-5.6 Sol. Coding y browsing fuertes.

Precio Sonnet, no frontier

~$3 entrada, ~$15 salida, ~30% de las listas frontier. Frente a Kimi previos el precio subió más de 3x. Si corrés agentes todo el día, el token es sueldo.

La arquitectura no es un retoque

Delta Attention, Attention Residuals y MoE 16/896 sobre 2.8T parámetros explican el precio de API y el ~2.5x de eficiencia de scaling vs K2.

Optimiza sus propios kernels

15 horas sin humano, ~2.5x en un kernel real de entrenamiento. El tema de fondo es el loop self-evolving.

Pesos el 27 de julio

2.8T parámetros. Hoy Kimi.com y API; después del 27, self-host real.

Tercer golpe tras DeepSeek-R1 y GLM-5.2

No cambio de stack solo por leaderboard. El harness de producción decide. Esta semana meto Kimi K3 en harness.

Unite al boletín

Recibí insights sobre la IA más reciente.