這次 AI 模型評測的結論很直接:截至 2026 年 8 月 5 日,Tenten AI 實驗室累計使用超過 1 億 token 後,最值得採用的組合是 Claude Opus 5 處理日常高階工作、GPT-5.6 Sol 負責工具密集的驗證與整合、DeepSeek V4 Flash 0731 承擔大量低風險任務。 Claude Fable 5 仍是我們資料裡的能力榜首,但它適合在失敗代價極高時出場,不適合吃掉整個團隊的 token 預算。
這個答案可能不像排行榜那麼痛快。它更接近我們每天面對的工程現場:模型要讀懂舊程式、改完後跑測試、遇到錯誤願意回頭,最後還得讓人看得懂它做了什麼。單次 benchmark 贏兩分,未必比少一次返工更值錢。
先看 Tenten 的選擇
| 工作層級 | 首選模型 | 為什麼值得用 | 使用邊界 |
|---|---|---|---|
| 日常高階主力 | Claude Opus 5 | $5 input/$25 output,官方定位接近 Fable 5、價格只有一半 | 大量簡單任務仍太貴 |
| 驗證與最終整合 | GPT-5.6 Sol | 1.05M context、128K 最大輸出,原生支援 hosted shell、apply patch、MCP 與 computer use | output 為 $30;超長 prompt 另有加價 |
| 大量低風險執行 | DeepSeek V4 Flash 0731 | $0.14 input/$0.28 output,1M context,官方公布 Terminal-Bench 2.1 為 82.7 | 重要架構與不可逆操作需要較高階模型或人工覆核 |
| 最高風險裁決 | Claude Fable 5 | Tenten intelligence 59.9,適合長時間規劃與複雜判斷 | $10 input/$50 output;部分資安與生物任務會改走較低階模型 |
價格皆為每 100 萬 token 的官方美元牌價。這張表刻意沒有寫「唯一冠軍」,因為工作負載才是選型單位。
一億 Token 代表什麼,也不代表什麼
1 億 token 是 Tenten 在內容研究、程式開發、除錯、工具呼叫、長文件分析與多代理工作上的累計使用量。這不是七個模型平均分配、prompt 完全相同的實驗,也沒有把內部用量包裝成學術 benchmark。不同模型的上市時間、可用工具與適合任務本來就不同。
我們採用兩層判斷。第一層看實務:任務是否完成、需要幾次修正、工具呼叫會不會失敗、長任務是否偏離、工程師要花多少時間收尾。第二層用同一份公開快照校準:Tenten AI Leaderboard 在 2026 年 7 月 21 日記錄 intelligence、輸出速度、context、價格與 value score;OpenRouter 使用量則是 2026 年 8 月 4 日的另一組平台資料。兩者不能混成同一個人氣分數。
社群意見也有用,但用途很窄。反覆出現的抱怨,例如模型在大型 repo 裡繞圈、前端成品不合設計意圖、工具執行後沒有驗證,會被轉成我們下一輪測試的失敗案例。沒有在自己的工作流重現,就不進評分。

七個前沿模型,四種指標不能混看
| 模型 | Tenten intelligence | 速度 | API 價格 input/output | Context | 最合理的角色 |
|---|---|---|---|---|---|
| Claude Fable 5 | 59.9 | 70 tok/s | $10/$50 | 1M | 高風險架構、複雜裁決 |
| GPT-5.6 Sol | 58.9 | 68 tok/s | $5/$30 | 1.05M | 工具、終端機、測試與整合 |
| Kimi K3 | 57.1 | 39 tok/s | $3/$15 | 1.05M | 開放權重、長 context、研究 |
| Claude Opus 5 | 該快照未列入 | 該快照未列入 | $5/$25 | 依官方模型頁 | 日常高階 coding 與知識工作 |
| Grok 4.5 | 53.8 | 75 tok/s | $2/$6 | 500K | 中價位 coding 與獨立 review |
| GLM-5.2 | 51.1 | 198 tok/s | $1.40/$4.40 | 1M | 中階長任務與自主部署 |
| DeepSeek V4 Flash 0731 | 未列入 intelligence 表 | OpenRouter 另列用量 | $0.14/$0.28 | 1M | 高吞吐 sub-agent |
Tenten intelligence 是公開 benchmark 訊號的彙整;速度會受 provider、區域與負載影響。Value score 使用 (intelligence − 25)² × min(1, speed ÷ 30) ÷ (input cost + output cost × 3),它偏重 output 成本,適合拿來挑候選模型,不能取代自己的任務成功率。

一億 Token 的成本差距有多大
下表把每個模型都放進同一個標準化情境:8,000 萬 input、2,000 萬 output,不計快取、批次折扣、超長 context 加價與重試。這只是讓官方牌價可以直接比較的算術情境,並非 Tenten 的實際帳單。
| 模型 | 1 億 token 情境成本 | 相對 DeepSeek | 成本判讀 |
|---|---|---|---|
| DeepSeek V4 Flash 0731 | $16.80 | 1.0× | 大量平行任務的價格基準 |
| GLM-5.2 | $200 | 11.9× | 中階能力仍有部署經濟性 |
| Grok 4.5 | $280 | 16.7× | 低於 200K prompt 的標準費率 |
| Kimi K3 | $540 | 32.1× | 開放權重不等於低 API 成本 |
| Claude Opus 5 | $900 | 53.6× | 返工下降後才可能划算 |
| GPT-5.6 Sol | $1,000 | 59.5× | 工具層與驗證能力是溢價來源 |
| Claude Fable 5 | $1,800 | 107.1× | 只該處理錯一次就很貴的工作 |
真正該看的公式是「每個完成任務成本」:API 費用乘上嘗試次數,再加人工覆核與返工時間。DeepSeek 若要試 10 次才完成,仍可能比 Fable 便宜;但資料庫 migration 做錯一次,省下來的 token 費用沒有意義。

Claude Opus 5:目前最值得當日常主力
Opus 5 是我們這次最明確的主力選擇。官方價格為 $5/$25,跟 GPT-5.6 Sol 的 input 相同,output 便宜 $5;相較 Fable 5,兩端價格都只有一半。Anthropic 在 2026 年 7 月 24 日發布時,把它定位成接近 Fable 智慧、面向日常使用的高階模型。
實務優點在於它願意先理解 repo 與限制,再動手改。長任務裡,維持需求意圖與工程慣例,通常比多答對一題 benchmark 更能減少收尾時間。它也能依 effort 調整推理成本。
缺點同樣具體。$25 output 仍不適合摘要、格式轉換與大量初稿。官方 benchmark 與早期客戶案例多由 Anthropic 彙整,採購前要用自己的 30 至 50 個真實任務重跑。對高敏感資安工作,模型 guardrail 也可能改變可用範圍。
GPT-5.6 Sol:把它放在工具鏈末端,價值最大
GPT-5.6 Sol 的優勢是工具面完整。官方模型頁列出 web search、file search、code interpreter、hosted shell、apply patch、MCP、computer use 與 skills。對需要讀檔、修改、執行測試、回看結果的工作,這種端到端能力往往比純文字分數重要。
它適合當最終整合者:檢查另一個模型的 patch、跑 E2E、驗證終端機結果、找出漏掉的 failure mode。1.05M context 和 128K 最大輸出也讓大型 repo 任務有更多空間。
成本是主要限制。牌價為 $5/$30;prompt 超過 272K input 時,整個 request 的 input 變成 2 倍、output 變成 1.5 倍。把所有子任務都交給 Sol,會讓昂貴推理消耗在資料整理與低風險重複工作上。
DeepSeek V4 Flash 0731:便宜到足以改寫代理架構
DeepSeek 的 $0.14/$0.28 牌價,把 sub-agent 從少量實驗變成可大量平行的工程元件。官方文件列出 1M context、最高 384K output、Responses API 與 2,500 concurrency limit。2026 年 7 月 31 日更新也公布 Terminal-Bench 2.1 82.7、Toolathlon verified 70.3 與 DSBench-FullStack 68.7。
這些 benchmark 有重要限制。DeepSeek 使用自家 minimal harness、max effort 與特定取樣設定;DSBench 兩項還是內部測試集。數字證明它值得進 shortlist,不能證明它能獨自批准 production 變更。
它最適合搜尋整理、測試案例、文件轉換、低風險 bug、分支方案與批次檢查。最後合併、權限變更、資安修補與不可逆操作,交給 Opus、GPT 或人類工程師。
另外四個模型,何時會勝出
| 模型 | Pros | Cons | 適合誰 |
|---|---|---|---|
| Claude Fable 5 | Tenten intelligence 59.9;長時間規劃與自我檢查 | $10/$50;30 天資料保留;特定領域可能 fallback | 失敗代價高、需要最高判斷力的團隊 |
| GLM-5.2 | $1.40/$4.40;198 tok/s;1M context;開放權重 | 官方長任務 benchmark 仍受 harness 影響 | 想要中階 sub-agent 或自主部署 |
| Grok 4.5 | $2/$6;75 tok/s;官方支援 function calling 與 structured output | 500K context;prompt 達 200K 後 token 費率加倍 | 要中價位 coding reviewer 的團隊 |
| Kimi K3 | intelligence 57.1;2.8T 參數、1M context、開放權重 | 39 tok/s;API output $15;自架 2.8T 的硬體負擔高 | 需要權重控制與長 context 的研究組織 |
這裡最容易誤判的是 Kimi。Open weights 提供控制權,卻沒有保證便宜的推論。另一個常見誤判是把 GLM 的 198 tok/s 當成任何 provider 都能複製的延遲;實際速度仍要在部署區域與自己的 prompt 長度下量測。
一套可以直接採用的模型路由
把 DeepSeek V4 Flash 設為低風險預設,先處理可重跑、可驗證、輸出結構清楚的工作。當任務跨檔案、需要長期維持限制,或第一次結果不穩定時,升級到 Claude Opus 5。最後由 GPT-5.6 Sol 執行測試、工具驗證與整合。Fable 5 只接手高風險架構裁決,GLM-5.2 與 Grok 4.5 則是中階替代路徑。
起始 token 配置可以先用 DeepSeek 60% 至 75%、Opus 15% 至 25%、GPT 5% 至 15%,其餘留給 Fable 或中階模型。這是容量規劃假設,不是通用答案。每兩週回看一次完成率、平均重試、人工修正分鐘數與每個完成任務成本,讓路由隨資料調整。
Tenten 的 AI Leaderboard 保留 intelligence、速度、價格、context、開放性與 value 公式,目的就是讓團隊能對排行榜提出異議,再把候選模型帶回自己的工作流測試。
常見問題
2026 年最強的 AI 模型是哪一個?
在 Tenten 2026 年 7 月 21 日的 intelligence 快照裡,Claude Fable 5 以 59.9 排名第一。若問題改成日常最值得用,Claude Opus 5 的 $5/$25 價格與接近旗艦的能力更平衡;大量低風險任務則由 DeepSeek V4 Flash 更划算。
一億 token 到底要多少錢?
取決於 input/output 比例、快取、batch、超長 context 加價與重試。以本文的 80% input、20% output、無快取情境計算,七個模型的成本落在 $16.80 至 $1,800。這是牌價比較,不是 Tenten 的實際帳單。
Claude Fable 5 和 GPT-5.6 Sol 該選哪個?
Fable 5 適合長時間規劃、複雜需求判斷與高風險裁決。GPT-5.6 Sol 適合 terminal、測試、patch 與多工具協調。兩者可以分工,沒有必要讓其中一個承擔全部工作。
開放權重模型一定比較省錢嗎?
不一定。Kimi K3 的 API output 是 $15,標準化情境成本高於 GLM-5.2 與 Grok 4.5;自架還要支付 GPU、記憶體、網路與維運成本。開放權重的主要價值是控制權、資料治理與部署選擇。
團隊應該怎麼做自己的模型評測?
先挑 30 至 50 個真實任務,記錄完成率、重試次數、人工修正時間、p50/p95 延遲與 API 成本。測試要使用相同輸入、同一套工具權限與明確驗收條件。最後按工作類型選模型,不要把所有指標壓成一個總分。
權威來源
- Tenten AI Leaderboard — 模型、公式與資料快照
- Anthropic — Claude Opus 5
- Anthropic — Claude Fable 5
- OpenAI — GPT-5.6 Sol model documentation
- DeepSeek — Models & Pricing
- Z.ai — GLM-5.2
- Kimi — Kimi K3 pricing and model details
- SpaceXAI — Grok 4.5 model documentation
Author Insight
實際專案裡,token 往往只是小部分成本。工程師接手一段看似完成、其實沒有驗證的輸出,代價更高。Tenten 的模型路由因此把「能否自己證明工作完成」放在 intelligence 旁邊評分。榜首會換,這條原則不太會。
Tenten 團隊長期把模型放進真實內容、開發與代理工作流,從失敗紀錄反推權限、驗收與路由設計。如果你的團隊正準備建立自己的 AI 評測與模型治理流程,可以和 Tenten 團隊討論實際工作負載。
