這次 AI 模型評測的結論很直接:截至 2026 年 8 月 5 日,Tenten AI 實驗室累計使用超過 1 億 token 後,最值得採用的組合是 Claude Opus 5 處理日常高階工作、GPT-5.6 Sol 負責工具密集的驗證與整合、DeepSeek V4 Flash 0731 承擔大量低風險任務。 Claude Fable 5 仍是我們資料裡的能力榜首,但它適合在失敗代價極高時出場,不適合吃掉整個團隊的 token 預算。

這個答案可能不像排行榜那麼痛快。它更接近我們每天面對的工程現場:模型要讀懂舊程式、改完後跑測試、遇到錯誤願意回頭,最後還得讓人看得懂它做了什麼。單次 benchmark 贏兩分,未必比少一次返工更值錢。

先看 Tenten 的選擇

工作層級 首選模型 為什麼值得用 使用邊界
日常高階主力 Claude Opus 5 $5 input/$25 output,官方定位接近 Fable 5、價格只有一半 大量簡單任務仍太貴
驗證與最終整合 GPT-5.6 Sol 1.05M context、128K 最大輸出,原生支援 hosted shell、apply patch、MCP 與 computer use output 為 $30;超長 prompt 另有加價
大量低風險執行 DeepSeek V4 Flash 0731 $0.14 input/$0.28 output,1M context,官方公布 Terminal-Bench 2.1 為 82.7 重要架構與不可逆操作需要較高階模型或人工覆核
最高風險裁決 Claude Fable 5 Tenten intelligence 59.9,適合長時間規劃與複雜判斷 $10 input/$50 output;部分資安與生物任務會改走較低階模型

價格皆為每 100 萬 token 的官方美元牌價。這張表刻意沒有寫「唯一冠軍」,因為工作負載才是選型單位。

一億 Token 代表什麼,也不代表什麼

1 億 token 是 Tenten 在內容研究、程式開發、除錯、工具呼叫、長文件分析與多代理工作上的累計使用量。這不是七個模型平均分配、prompt 完全相同的實驗,也沒有把內部用量包裝成學術 benchmark。不同模型的上市時間、可用工具與適合任務本來就不同。

我們採用兩層判斷。第一層看實務:任務是否完成、需要幾次修正、工具呼叫會不會失敗、長任務是否偏離、工程師要花多少時間收尾。第二層用同一份公開快照校準:Tenten AI Leaderboard 在 2026 年 7 月 21 日記錄 intelligence、輸出速度、context、價格與 value score;OpenRouter 使用量則是 2026 年 8 月 4 日的另一組平台資料。兩者不能混成同一個人氣分數。

社群意見也有用,但用途很窄。反覆出現的抱怨,例如模型在大型 repo 裡繞圈、前端成品不合設計意圖、工具執行後沒有驗證,會被轉成我們下一輪測試的失敗案例。沒有在自己的工作流重現,就不進評分。

Tenten AI Leaderboard 頁首與最佳整體、最佳開放權重、最佳性價比三張模型卡

七個前沿模型,四種指標不能混看

模型 Tenten intelligence 速度 API 價格 input/output Context 最合理的角色
Claude Fable 5 59.9 70 tok/s $10/$50 1M 高風險架構、複雜裁決
GPT-5.6 Sol 58.9 68 tok/s $5/$30 1.05M 工具、終端機、測試與整合
Kimi K3 57.1 39 tok/s $3/$15 1.05M 開放權重、長 context、研究
Claude Opus 5 該快照未列入 該快照未列入 $5/$25 依官方模型頁 日常高階 coding 與知識工作
Grok 4.5 53.8 75 tok/s $2/$6 500K 中價位 coding 與獨立 review
GLM-5.2 51.1 198 tok/s $1.40/$4.40 1M 中階長任務與自主部署
DeepSeek V4 Flash 0731 未列入 intelligence 表 OpenRouter 另列用量 $0.14/$0.28 1M 高吞吐 sub-agent

Tenten intelligence 是公開 benchmark 訊號的彙整;速度會受 provider、區域與負載影響。Value score 使用 (intelligence − 25)² × min(1, speed ÷ 30) ÷ (input cost + output cost × 3),它偏重 output 成本,適合拿來挑候選模型,不能取代自己的任務成功率。

Tenten AI Leaderboard 顯示前沿模型 intelligence、速度、價格、context 與適用工作

一億 Token 的成本差距有多大

下表把每個模型都放進同一個標準化情境:8,000 萬 input、2,000 萬 output,不計快取、批次折扣、超長 context 加價與重試。這只是讓官方牌價可以直接比較的算術情境,並非 Tenten 的實際帳單。

模型 1 億 token 情境成本 相對 DeepSeek 成本判讀
DeepSeek V4 Flash 0731 $16.80 1.0× 大量平行任務的價格基準
GLM-5.2 $200 11.9× 中階能力仍有部署經濟性
Grok 4.5 $280 16.7× 低於 200K prompt 的標準費率
Kimi K3 $540 32.1× 開放權重不等於低 API 成本
Claude Opus 5 $900 53.6× 返工下降後才可能划算
GPT-5.6 Sol $1,000 59.5× 工具層與驗證能力是溢價來源
Claude Fable 5 $1,800 107.1× 只該處理錯一次就很貴的工作

真正該看的公式是「每個完成任務成本」:API 費用乘上嘗試次數,再加人工覆核與返工時間。DeepSeek 若要試 10 次才完成,仍可能比 Fable 便宜;但資料庫 migration 做錯一次,省下來的 token 費用沒有意義。

Tenten AI Leaderboard 的 value score 公式與 intelligence、速度、成本、部署方法說明

Claude Opus 5:目前最值得當日常主力

Opus 5 是我們這次最明確的主力選擇。官方價格為 $5/$25,跟 GPT-5.6 Sol 的 input 相同,output 便宜 $5;相較 Fable 5,兩端價格都只有一半。Anthropic 在 2026 年 7 月 24 日發布時,把它定位成接近 Fable 智慧、面向日常使用的高階模型。

實務優點在於它願意先理解 repo 與限制,再動手改。長任務裡,維持需求意圖與工程慣例,通常比多答對一題 benchmark 更能減少收尾時間。它也能依 effort 調整推理成本。

缺點同樣具體。$25 output 仍不適合摘要、格式轉換與大量初稿。官方 benchmark 與早期客戶案例多由 Anthropic 彙整,採購前要用自己的 30 至 50 個真實任務重跑。對高敏感資安工作,模型 guardrail 也可能改變可用範圍。

GPT-5.6 Sol:把它放在工具鏈末端,價值最大

GPT-5.6 Sol 的優勢是工具面完整。官方模型頁列出 web search、file search、code interpreter、hosted shell、apply patch、MCP、computer use 與 skills。對需要讀檔、修改、執行測試、回看結果的工作,這種端到端能力往往比純文字分數重要。

它適合當最終整合者:檢查另一個模型的 patch、跑 E2E、驗證終端機結果、找出漏掉的 failure mode。1.05M context 和 128K 最大輸出也讓大型 repo 任務有更多空間。

成本是主要限制。牌價為 $5/$30;prompt 超過 272K input 時,整個 request 的 input 變成 2 倍、output 變成 1.5 倍。把所有子任務都交給 Sol,會讓昂貴推理消耗在資料整理與低風險重複工作上。

DeepSeek V4 Flash 0731:便宜到足以改寫代理架構

DeepSeek 的 $0.14/$0.28 牌價,把 sub-agent 從少量實驗變成可大量平行的工程元件。官方文件列出 1M context、最高 384K output、Responses API 與 2,500 concurrency limit。2026 年 7 月 31 日更新也公布 Terminal-Bench 2.1 82.7、Toolathlon verified 70.3 與 DSBench-FullStack 68.7。

這些 benchmark 有重要限制。DeepSeek 使用自家 minimal harness、max effort 與特定取樣設定;DSBench 兩項還是內部測試集。數字證明它值得進 shortlist,不能證明它能獨自批准 production 變更。

它最適合搜尋整理、測試案例、文件轉換、低風險 bug、分支方案與批次檢查。最後合併、權限變更、資安修補與不可逆操作,交給 Opus、GPT 或人類工程師。

另外四個模型,何時會勝出

模型 Pros Cons 適合誰
Claude Fable 5 Tenten intelligence 59.9;長時間規劃與自我檢查 $10/$50;30 天資料保留;特定領域可能 fallback 失敗代價高、需要最高判斷力的團隊
GLM-5.2 $1.40/$4.40;198 tok/s;1M context;開放權重 官方長任務 benchmark 仍受 harness 影響 想要中階 sub-agent 或自主部署
Grok 4.5 $2/$6;75 tok/s;官方支援 function calling 與 structured output 500K context;prompt 達 200K 後 token 費率加倍 要中價位 coding reviewer 的團隊
Kimi K3 intelligence 57.1;2.8T 參數、1M context、開放權重 39 tok/s;API output $15;自架 2.8T 的硬體負擔高 需要權重控制與長 context 的研究組織

這裡最容易誤判的是 Kimi。Open weights 提供控制權,卻沒有保證便宜的推論。另一個常見誤判是把 GLM 的 198 tok/s 當成任何 provider 都能複製的延遲;實際速度仍要在部署區域與自己的 prompt 長度下量測。

一套可以直接採用的模型路由

把 DeepSeek V4 Flash 設為低風險預設,先處理可重跑、可驗證、輸出結構清楚的工作。當任務跨檔案、需要長期維持限制,或第一次結果不穩定時,升級到 Claude Opus 5。最後由 GPT-5.6 Sol 執行測試、工具驗證與整合。Fable 5 只接手高風險架構裁決,GLM-5.2 與 Grok 4.5 則是中階替代路徑。

起始 token 配置可以先用 DeepSeek 60% 至 75%、Opus 15% 至 25%、GPT 5% 至 15%,其餘留給 Fable 或中階模型。這是容量規劃假設,不是通用答案。每兩週回看一次完成率、平均重試、人工修正分鐘數與每個完成任務成本,讓路由隨資料調整。

Tenten 的 AI Leaderboard 保留 intelligence、速度、價格、context、開放性與 value 公式,目的就是讓團隊能對排行榜提出異議,再把候選模型帶回自己的工作流測試。

常見問題

2026 年最強的 AI 模型是哪一個?

在 Tenten 2026 年 7 月 21 日的 intelligence 快照裡,Claude Fable 5 以 59.9 排名第一。若問題改成日常最值得用,Claude Opus 5 的 $5/$25 價格與接近旗艦的能力更平衡;大量低風險任務則由 DeepSeek V4 Flash 更划算。

一億 token 到底要多少錢?

取決於 input/output 比例、快取、batch、超長 context 加價與重試。以本文的 80% input、20% output、無快取情境計算,七個模型的成本落在 $16.80 至 $1,800。這是牌價比較,不是 Tenten 的實際帳單。

Claude Fable 5 和 GPT-5.6 Sol 該選哪個?

Fable 5 適合長時間規劃、複雜需求判斷與高風險裁決。GPT-5.6 Sol 適合 terminal、測試、patch 與多工具協調。兩者可以分工,沒有必要讓其中一個承擔全部工作。

開放權重模型一定比較省錢嗎?

不一定。Kimi K3 的 API output 是 $15,標準化情境成本高於 GLM-5.2 與 Grok 4.5;自架還要支付 GPU、記憶體、網路與維運成本。開放權重的主要價值是控制權、資料治理與部署選擇。

團隊應該怎麼做自己的模型評測?

先挑 30 至 50 個真實任務,記錄完成率、重試次數、人工修正時間、p50/p95 延遲與 API 成本。測試要使用相同輸入、同一套工具權限與明確驗收條件。最後按工作類型選模型,不要把所有指標壓成一個總分。

權威來源

Author Insight

實際專案裡,token 往往只是小部分成本。工程師接手一段看似完成、其實沒有驗證的輸出,代價更高。Tenten 的模型路由因此把「能否自己證明工作完成」放在 intelligence 旁邊評分。榜首會換,這條原則不太會。

Tenten 團隊長期把模型放進真實內容、開發與代理工作流,從失敗紀錄反推權限、驗收與路由設計。如果你的團隊正準備建立自己的 AI 評測與模型治理流程,可以和 Tenten 團隊討論實際工作負載

Share this post
Ewan Mak

I'm a Full Stack Developer with expertise in building modern web applications that fast, secure, and scalable. Crafting seamless user experiences with a passion for headless CMS, Vercel and Cloudflare

Loading...