跳到主要內容
Lab Grimoire
TW EN
請喝咖啡
LLM 原理

同一張 16GB 卡上,準確率冠軍和速度冠軍不是同一套部署

同一張 RTX 4060 Ti 16GB、同一份凍結 700 題上,Ridge、OrcaSAQ-2 與 Ternary Bonsai 2 的客觀答對率是 78.4%、77.6%、74.6%,牆鐘卻是 47.55、62.59、34.01 分鐘。這篇比較的是三套部署,不是同一份權重。

作者
CY
發表
更新
同一張 16GB 卡上,準確率冠軍和速度冠軍不是同一套部署

就像三台車擠在同一條車道:準確率 78.4% 的那套,不是最先跑完的那套。我們該怎麼在 16GB 上挑一套日常部署?

2026-09-28,同一台 Windows 工作站、同一張 NVIDIA RTX 4060 Ti 16GB,三套都能放進顯示記憶體的部署,輪流跑同一份凍結的 700 題。Ridge 答對 549 項,OrcaSAQ 答對 543 項,Ternary 答對 522 項。牆鐘反過來。Ternary 用 34.01 分鐘,Ridge 用 47.55 分鐘,OrcaSAQ 用 62.59 分鐘。準確率的排序和抵達時間的排序,不是同一條。

先把契約講清楚

手上只有一張 16GB 卡時,準確率冠軍和速度冠軍往往不是同一套部署。

這篇回答的是一個很窄的契約。七套公開基準各凍結 100 題,三臂看到的是同一份清單。裁判只抽選擇題字母,或數值題的最終答案。它不問句子好不好看,也不問工具有沒有接上。另一篇 2026-09-19 的筆記,問的是短題、長文針刺與工具迴圈都過了之後,日常別名能不能指到 Ternary。那是另一個問題。這篇不改寫那個結論,也不把這 700 題說成日常工作的全部。

三套 runtime 輪流用掉同一張卡,不能同時管著三個服務。16GB 裝得下其中一套的權重,不代表三套可以並排常駐。我們把三臂的題目雜湊對過,三邊相同。所以差出來的是部署,不是題目抽籤。

這次比的是三套部署

三套都能進 16GB,但量化格式、執行環境與打包方式都不一樣。

三套的共同上游是 Qwen3.8-27B。模型卡寫的授權是 Apache 2.0,上下文長度 262,144。[1] 這次沒有跑官方未量化檢查點。比的是三個已經能在 16GB 卡上服務的實例。

Ridge 這臂的服務名稱是 Qwen3.8_Ridge,走 Ollama。公開的 Empero Ridge 3.7 bpw 是這個名稱在登記上的對應檔:混合 GGUF,檔案約 11.73 GiB(12.59 GB),模型卡把 16GB 寫成務實的起點,那是他們的硬體建議,不是我們這張卡的 VRAM 實測。[2] 本輪沒有重算權重雜湊,所以不能宣稱位元組等同於那個檔。

OrcaSAQ 這臂是 OrcaSAQ-2-27B,EXL3,走 vLLM。模型卡寫約 12.3 GB、3.21 bpw,thinking 預設開著,建議溫度 1.0。卡片上的 SWE-bench Pro 70.0 是他們用 vLLM 報的代理測驗,不是這 700 題。[3]

Ternary 這臂的檔名是 Ternary-Bonsai-2-27B-PQ2_0-MTP-Q8_0.gguf,執行環境是 Prism 的 llama.cpp MTP。這個檔名與 ProCreations 的 MTP 檔 相同。對方寫明這是實驗性 MTP 頭,不是 Prism 官方釋出,檔案約 7.658 GB,而且 stock llama.cpp 不夠。[5] Prism 自己的 PQ2_0 是 7.21 GB、2.13 bit/weight 的三值打包,模型卡寫 stock llama.cpp 會拒載或產生垃圾,thinking 模式的建議溫度是 1.0,14 項 thinking 基準的平均是 84.78。[4] 那 84.78 是另一套題、另一套取樣。我們不把 74.6% 和 84.78 相減。本輪同樣沒有核對權重雜湊。

如同大衣塞進登機箱,口袋裡的鑰匙還得另外量。檔案變小,不自動等於這 700 題的答對率保持不變。三套的「小」也不是同一種小。Ridge 是對混合架構敏感張量做的混合量化,OrcaSAQ 是 EXL3,Ternary 是三值主權重再外加一顆 MTP 頭。這不是同一份權重的三種標籤。

方法只鎖客觀答案

溫度設 0、關閉 thinking、每題最多 512 token,裁判只抽最終答案。

協定是溫度 0、max_tokens 512、關閉 thinking、裁判名 objective-v1。每題單獨送,牆鐘是該次 HTTP 往返,含 prompt 處理與生成,700 題串行加總。不是 llama-bench 的 tg128,也不是並發吞吐。本次紀錄沒有寫下 context 配置。三臂各 700 列結果都在,摘要裡的請求錯誤數是 0。本文重算的是結果檔裡的 passed 標記,沒有逐題重寫裁判。

這個協定和廠商建議不一致,而且必須寫在成績前面。Prism 的成績是 thinking 模式、溫度 1.0。[4] OrcaSAQ 的卡片也把 thinking 當預設,溫度 1.0。[3] 我們關 thinking、用溫度 0,是為了讓三臂的抽答比較可對,不是為了復現他們的標題數字。你若把這份 74.6% 拿去和 84.78 比高低,比的是兩種測驗,不是兩套部署。

512 token 的上限會吃掉長答案。Ridge 有 32 題碰到上限,OrcaSAQ 有 26 題,Ternary 有 92 題。碰到上限的題,多數沒被判對。這個上限和準確率落差纏在一起,下面分項會拆開看。空預測很少:Ridge 4 題、OrcaSAQ 6 題、Ternary 8 題,全部未過。那是抽答失敗,不是傳輸錯誤。

七套的名字對得上公開基準:MMLU、MMLU-Pro、CMMLU、GSM8K、ARC-Challenge、HellaSwag、MathQA。[6][7][8][9][10][11][12] 我們用的是每套凍結的 100 題,不是完整官方測驗集。所以表上的百分比不能寫進那些論文的排行榜。

準確率差在 27 題

總分是 Ridge 549、OrcaSAQ 543、Ternary 522,三臂都沒有請求錯誤。

套題 Ridge OrcaSAQ Ternary
MMLU 80 83 77
MMLU-Pro 63 68 48
CMMLU 78 77 72
GSM8K 85 87 85
ARC-Challenge 96 94 92
HellaSwag 92 91 86
MathQA 55 43 62
合計 549 543 522

換算成百分比,是 78.4%、77.6%、74.6%。對 Ridge 而言,OrcaSAQ 少 6 題,約 0.86 個百分點。Ternary 少 27 項,約 3.86 個百分點。6 題的總分差,在每套只有 100 題時很薄。27 題比較厚,可是它不是七套平均各掉一點,而是集中在少數套題。

七套各 100 題的答對題數,Ridge、OrcaSAQ 與 Ternary

MMLU-Pro 是洞。Ternary 48,Ridge 63,OrcaSAQ 68。對 Ridge 少 15 題,對 OrcaSAQ 少 20 題。不過這 15 題不能整段算成「模型比較不會」。Ternary 在這 100 題裡有 37 題碰到 512 token 上限,其中 34 題未過。Ridge 在這套的完成 token 平均是 2,上限次數是 0。OrcaSAQ 平均 27.5 個完成 token,上限 5 題。長篇解釋把額度吃掉之後,字母還沒被抽到,裁判就會記失敗。本輪沒有把上限提高到 512 以上再跑一次,所以不能估計那 34 題若寫完會對幾題。能說的是:這套的準確率落差,和輸出長度、和 512 的天花板,纏在一起。

MathQA 反過來。Ternary 62,Ridge 55,OrcaSAQ 43。Ternary 比 Ridge 多 7 題,比 OrcaSAQ 多 19 題。Ternary 在這套有 41 題碰到上限,其中 34 題未過、7 題仍過。Ridge 也有 20 題碰到上限。兩邊都被天花板切過,Ternary 切得更兇,總分仍較高。OrcaSAQ 的 MathQA 平均只有 109 個完成 token,上限 16 題。它寫得比較短,錯得比較多。這個落差比較不像是被 512 切出來的。

其餘套題的差距小得多。GSM8K 是 85、87、85,Ternary 與 Ridge 打平,OrcaSAQ 多 2 題。ARC-Challenge 是 96、94、92,三臂都在 92 以上。HellaSwag 是 92、91、86,Ternary 少 6 題,不是崩掉。MMLU 是 80、83、77。CMMLU 是 78、77、72。若只看總分,會以為 Ternary 全面薄一層。分項不是這樣。

速度要看牆鐘,不要只看 tok/s

Ternary 跑完 700 題用 34.01 分鐘,Ridge 47.55 分鐘,OrcaSAQ 62.59 分鐘。

你為什麼不能只看 tok/s?

完成 token 除以牆鐘,Ternary 是 46.74 tok/s,Ridge 是 17.45,OrcaSAQ 是 10.85。看起來像 2.68倍 與 4.31倍。牆鐘只快到 1.40倍 與 1.84 倍:Ridge 的總時間是 Ternary 的 1.40 倍,OrcaSAQ 是 1.84 倍。Ternary 比 Ridge 少用 28.5% 的牆鐘,比 OrcaSAQ 少用 45.7%。好比只看時速表、不看抵達時間。tok/s 量的是吐字速率,牆鐘量的是這 700 題何時做完。

原因在字數。Ternary 一共寫了 95,395 個完成 token,平均 136.3。Ridge 是 49,792,平均 71.1。OrcaSAQ 是 40,742,平均 58.2。字數多,tok/s 的分子就大。多寫出來的字會在牆鐘上堆積,可是堆積的方式不是每題都一樣。短選擇題上,Ridge 和 OrcaSAQ 經常只吐 2 個 token,也就是一個字母。Ternary 在 MMLU 平均寫 49.3 個,在 MMLU-Pro 平均寫 220 個。同一道選擇題,一個交字母,一個交一段解釋。速率表會把後者說得飛快,抵達時間卻不一定。

七套的逐題牆鐘加總,單位是分鐘

套題 Ridge OrcaSAQ Ternary
MMLU 2.13 2.94 3.35
MMLU-Pro 1.43 8.35 7.54
CMMLU 3.27 1.07 1.87
GSM8K 21.58 32.66 7.32
ARC-Challenge 0.98 0.73 0.85
HellaSwag 1.27 1.28 1.20
MathQA 16.89 15.57 11.88
合計 47.55 62.59 34.01

合計是原始秒數加總後再換成分鐘。上表各列若先四捨五入再相加,OrcaSAQ 會差 0.01 分鐘,以合計欄為準。

總時間的優勢不是七套均勻發下來的。GSM8K 上,三臂的完成 token 平均是 255、261、219,長度接近。牆鐘卻是 21.58、32.66、7.32 分鐘。Ridge 的這套時間是 Ternary 的 2.95 倍。這裡的速度差,比較像解碼本身,不是因為 Ternary 少寫了字。MathQA 上,Ternary 平均寫 409 個 token,已經靠近 512 的天花板,牆鐘仍是 11.88 分鐘,短於 Ridge 的 16.89 與 OrcaSAQ 的 15.57,而且答對更多。短選擇題則不是這個故事。ARC-Challenge 與 HellaSwag 三臂都在 1.3 分鐘以內。CMMLU 最快的是 OrcaSAQ,1.07 分鐘。MMLU-Pro 最快的是 Ridge,1.43 分鐘。Ternary 在這套用了 7.54 分鐘,比 Ridge 慢,又比 Ridge 少對 15 題。

所以「Ternary 比較快」只在 700 題的加總上成立。它快在 GSM8K 和 MathQA 這兩段長題。它沒有在每一套選擇題上都比較快,也沒有在最難的選擇題上又快又準。

各套平均完成 token,短選擇題與長題不是同一種輸出

分項會改你的選擇

總分落後的那套,在 MathQA 反而領先,在 MMLU-Pro 則掉最多。

若你的工作比較像這份凍結清單裡的 GSM8K,Ternary 用約三分之一的牆鐘,答對題數與 Ridge 相同,只比 OrcaSAQ 少 2 題。若工作比較像 MathQA,Ternary 又快又多對,但有 41 題被 512 切到,其中 34 題未過。把上限留在 512,等於接受這批被切掉的失敗。若工作比較像 MMLU-Pro 這種選項更擠、又被要求只交字母的題,Ridge 用 1.43 分鐘對 63 題,OrcaSAQ 用 8.35 分鐘對 68 題,Ternary 用 7.54 分鐘對 48 題。這裡速度和準確率沒有一起站到 Ternary 那邊。

OrcaSAQ 的總分只比 Ridge 少 6 題,可是 MathQA 少 12 題,MMLU-Pro 多 5 題。它不是 Ridge 的慢速複製品。總分接近,分項會搬位置。

什麼時候該用哪一套

契約若是客觀抽答,選 Ridge;契約若是同題牆鐘,選 Ternary。

契約若是「這份凍結清單上的字母與數值抽答」,Ridge 的 549 題是這三臂裡的高點。OrcaSAQ 只少 6 題,除非 MathQA 佔你的工作很大一塊,否則總分幾乎黏在一起。契約若是「同一張 4060 Ti、同一份 700 題、同樣關掉 thinking,何時做完」,Ternary 的 34.01 分鐘是高點,代價是少 27 題,而且代價集中在 MMLU-Pro,又和 512 的天花板纏在一起。

不該用這份數字做的事也很具體。不要用它決定寫作品味。不要用它決定工具迴圈能不能接上。不要把三套 runtime 同時塞進 16GB,讓它們互相用掉顯示記憶體。不要把廠商的 thinking 模式平均分,減去這次溫度 0 的抽答率。不要把 100 題切片寫成完整 MMLU 或完整 GSM8K。也不要因為 tok/s 看起來是 2.68 倍,就以為每題都會快 2.68 倍。

這份數字不能外推到哪裡

它不是寫作品味、工具迴圈,也不是廠商 thinking 模式的官方榜。

研究範圍是一台 Windows 工作站、一張 RTX 4060 Ti 16GB、2026-09-28 這三輪分時服務。每套 100 題,不是完整基準,也沒有在這篇文章裡重做信賴區間。6 題的總分差很薄。27 題比較厚,可是其中 MMLU-Pro 的 15 題和輸出上限纏在一起,不能單獨寫成能力差。Ridge 與 Ternary 的權重檔,本輪都沒有重算雜湊。裁判沿用結果檔裡的 passed,沒有另寫一版抽取器來交叉驗證。context 長度沒有記在這次可以公開的協定欄位裡。溫度 0、關閉 thinking、512 token,是這次的部署契約,不是這三個模型卡的建議取樣。

然而,在這個契約裡面,排序是穩的:逐題重算與結果檔表頭一致,三臂題目雜湊一致,請求錯誤數是 0。準確率冠軍是 Ridge。速度冠軍是 Ternary。兩者不是同一套部署。

參考文獻

  1. https://huggingface.co/Qwen/Qwen3.8-27B
  2. https://huggingface.co/empero-ai/Qwen3.8-27B-Ridge-GGUF
  3. https://huggingface.co/orcarouter/OrcaSAQ-2-27B
  4. https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf
  5. https://huggingface.co/ProCreations/Ternary-Bonsai-2-27B-MTP
  6. https://arxiv.org/abs/2009.03300
  7. https://arxiv.org/abs/2406.01574
  8. https://arxiv.org/abs/2306.09212
  9. https://arxiv.org/abs/2110.14168
  10. https://arxiv.org/abs/1803.05457
  11. https://arxiv.org/abs/1905.07830
  12. https://arxiv.org/abs/1905.13319

常見問題

這份 700 題是否等於官方排行榜?

不是。每套是凍結的 100 題切片,三臂題目相同,但不是 MMLU、GSM8K 或其他基準的完整官方測驗集。溫度是 0,thinking 關掉,每題最多 512 token。廠商卡片上的 thinking 模式平均分,用的是另一套題和另一套取樣。兩邊不能相減。

速度比較快,是否就該當唯一日常模型?

不一定。Ternary 的 700 題牆鐘最短,代價是少 27 題,而且落差集中在 MMLU-Pro,又和 512 token 上限纏在一起。契約若是客觀抽答,Ridge 的 549 題較高。契約若是同一張卡、同一份題、何時做完,才是 Ternary。寫作品味和工具迴圈不在這份數字的研究範圍裡。

碰到 512 token 上限,是否還能把落差全算成模型比較笨?

不能。Ternary 在 MMLU-Pro 有 37 題碰到上限,其中 34 題未過。本輪沒有提高上限再跑一次,所以那 15 題的落差不能單獨寫成能力差。MathQA 則是另一件事:Ternary 也被切了 41 題,總分仍高於 Ridge 和 OrcaSAQ。限制要跟著套題一起讀,不能只讀總分。

覺得這篇有幫助?

追蹤以收到新的 AI × 生醫研究筆記:

或請我喝杯咖啡,讓新內容持續產出。

☕ 請我喝杯咖啡