省Token的秘密:KV Cache快取經濟學揭密
> 導讀:同一個對話問十個問題,為什麼比開十個新對話便宜得多?答案是 KV Cache。掌握它,就能省下 80% 的 Token 成本。十輪對話、每輪輸入 100 個 Token:- 沒有 KV Cache:每輪都重新計算所有舊內容,總計 5,500 Token- 有 KV Cache:
前往 →> 導讀:同一個對話問十個問題,為什麼比開十個新對話便宜得多?答案是 KV Cache。掌握它,就能省下 80% 的 Token 成本。十輪對話、每輪輸入 100 個 Token:- 沒有 KV Cache:每輪都重新計算所有舊內容,總計 5,500 Token- 有 KV Cache:
前往 →> 導讀:多個 AI 智能體一起工作,不是隨便組合就有效。選對模式系統高效,選錯了再聰明的 Agent 也浪費資源。一個 Agent 生成,另一個驗證品質。過不了就打回重寫。適用:程式碼審查、事實查核、資料驗證。簡單清晰;但驗證者持續不滿意可能陷入迴圈。主 Agent 分解任務,派給多個專屬子 Agent 執行
前往 →> 導讀:改進 Harness 設計,同一模型的 TerminalBench 排名從第 30+ 名跳到第 5 名。沒換模型,沒增加參數。LLM 無法看螢幕、執行程式碼、記住昨天的對話。這不是模型的問題——是缺乏「身體」的問題。Harness 就是這個身體。@akshay_pachaar
前往 →> 導讀:AI 要說話更流暢,需要更大的記憶體?真相更有趣——瓶頸不在容量,而在資料流動速度。Nvidia、Google、Anthropic 各守一個系統層,方案彼此互補,不是競爭。每產生一個詞彙,模型都要從記憶體讀取大量狀態;讀取慢 = 整體被拖累。加更多容量解決不了——高速公路再寬,堵車時一樣動不了。
前往 →> 導讀:就像 AWS 讓每家公司都能輕鬆部署雲端運算,Anthropic Managed Agents 正在對 AI Agent 基礎設施做同樣的事——Sentry 從數月縮短到數週,Rakuten 一週內部署五個 Agent。Managed Agents 將 Agent 系統拆解為三個可獨立擴展的層次:
前往 →