Karpathy’s LLM Wiki Idea Just Got a Standard-Shaped Push
When knowledge for agents is formatted like a product surface, wikis stop being human-only documentation.
大型語言模型、提示工程和基準測試。
12 篇
When knowledge for agents is formatted like a product surface, wikis stop being human-only documentation.
有人對 LLM 用 Rust 重新實作的 SQLite 做了效能測試。看起來正確和真正正確之間的差距,竟然達到五個數量級。
我逆向工程了 Codex 與 Claude Code 處理 context 溢出的方式差異。Codex 透過伺服器端 AES 加密摘要與 session 交接模式保留關鍵資訊,再搭配 KV cache 優化大幅降低延遲與成本。每個設計決策都直接影響長時間開發 session 的品質與可靠性。
最新的基準測試數據顯示,AGENTS.md 和 CLAUDE.md 這類 context 檔案其實會讓 coding agent 的表現變差。有時候,懶,就是最好的工程決策。
LangChain 的 Terminal Bench 結果與 hashline 格式實驗揭示了什麼。同一個模型排名被逆轉,原因只有三個:提示詞、工具和中介軟體。
OpenAI 簽下 Cerebras 百億美元大單、Nvidia 收購 Groq、Google TPU 拿下 Anthropic 與 Meta 合約。當推論取代訓練成為主戰場,晶片產業的遊戲規則正在被徹底改寫。
當市場對 GPU 產能過剩拉警報時,OpenAI 卻透過官方管道宣告:我們需要更多算力。這場算力軍備競賽的真正瓶頸,其實藏在意想不到的地方。
Anthropic的Claude Opus 4.5不只是刷新了跑分。當競爭對手在多模態上分散資源時,全押文字、程式碼和代理的聚焦策略才是真正的贏家。
Poetiq 的遞迴元系統成為第一個在 ARC-AGI-2 超越 50% 的系統,這是專為測試真正通用智慧設計的基準測試。看六人團隊如何以一半成本超越 Google 的表現。