Kimi K3 ने एजेंट बेंचमार्क पर Fable 5 को पीछे छोड़ दिया
Moonshot का ओपन-वेट दिग्गज Sonnet 5 कीमत पर फ्रंटियर-स्तर स्कोर दे रहा है, वेट 27 जुलाई को।
Moonshot AI ने Kimi K3 जारी किया। कई एजेंट बेंचमार्क पर यह Fable 5 और GPT-5.6 Sol को पीछे छोड़ता है, कीमत Sonnet 5 जैसी। ओपन-वेट को इस स्तर पर मैंने पहले नहीं देखा।
छह बिंदु।
स्कोरniche नहीं हैं
Program Bench 77.8, SWE Marathon 42.0, BrowseComp 91.2, SpreadsheetBench 2 = 34.8। FrontierSWE 81.2 बनाम Fable 5 का 86.6 और GPT-5.6 Sol का 71.3। कोडिंग और ब्राउज़िंग दोनों मज़बूत।
Sonnet कीमत, frontier नहीं
~$3 इनपुट, ~$15 आउटपुट—frontier लिस्ट का ~30%। पुराने Kimi से कीमत 3x+ बढ़ी। फिर भी अगर दिन-भर एजेंट चलाते हैं तो टोकन लगभग पेरोल है।
आर्किटेक्चर छोटी टच-अप नहीं
Delta Attention, Attention Residuals, और 2.8T पर MoE 16/896 API कीमत और K2 के मुकाबले ~2.5x स्केलिंग दक्षता समझाते हैं।
अपने kernels खुद ऑप्टिमाइज़ करता है
15 घंटे बिना इंसान, रियल ट्रेनिंग kernel पर ~2.5x। असली बात self-evolving लूप है।
वेट 27 जुलाई
2.8T पैरामीटर। आज Kimi.com और API; 27 के बाद self-host असली विकल्प।
DeepSeek-R1 और GLM-5.2 के बाद तीसरा झटका हो सकता है
मैं सिर्फ लीडरबोर्ड से स्टैक नहीं बदलता। प्रोडक्शन harness फ़ैसला करता है। इस हफ़्ते Kimi K3 को harness में डाल रहा हूँ।
न्यूज़लेटर से जुड़ें
नवीनतम AI पर इनसाइट्स पाएँ।