Claude Opus 5 vs Fable 5 的實務結論很直接:多數企業 AI 工作可以先用 Opus 5。它在 2026 年 7 月 24 日發布。API 單價是 Fable 5 的一半。官方的程式開發、知識工作與電腦操作評測,也讓它接近或超過 Fable 5。Fable 5 仍保留在最高能力、長時間研究與失敗代價極高的任務。

Anthropic 對 Opus 5 的定位是複雜智能體程式開發與企業工作。這個定位比「更聰明」更有用,因為模型選擇真正影響的是整個任務成本。單價、推理 effort、工具呼叫次數與驗證迴圈都會進入帳單。

Anthropic Claude Opus 產品頁顯示 Claude Opus 5 新模型公告

官方規格先劃出價格邊界

Opus 5 與 Fable 5 都有 100 萬 token 上下文。兩者的最大輸出都是 12.8 萬 token。差異集中在速度、知識截止日、官方美元單價與產品定位。

項目 Claude Opus 5 Claude Fable 5
每百萬輸入 token USD 5 USD 10
每百萬輸出 token USD 25 USD 50
上下文視窗 100 萬 token 100 萬 token
最大輸出 12.8 萬 token 12.8 萬 token
官方相對延遲 中等 較慢
可靠知識截止日 2026 年 5 月 2026 年 1 月
官方建議用途 複雜智能體程式開發、企業工作 最高能力、長時間智能體

這張表帶出第一個採購判斷:同樣的 token 組合,Opus 5 的名目費用正好減半。名目費用只是起點。若模型自行展開更多子任務,最後一張帳單仍可能高過 Fable 5 的短路徑執行。

三組評測說了什麼

Anthropic 的發布表同時比較四個模型:Opus 5、Fable 5、Opus 4.8 與 GPT-5.6 Sol。最醒目的進步來自 Opus 家族內部。Frontier-Bench v0.1 上,分數從 21.1% 升到 43.3%。

評測 Opus 5 Fable 5 Opus 4.8 GPT-5.6 Sol
Frontier-Bench v0.1 智能體終端程式開發 43.3% 33.7% 21.1% 34.4%
GDPval-AA v2 知識工作 1861 1747 1593 1736
ARC-AGI-3 新問題解決 30.2% 未公布 1.5% 7.8%
Anthropic 官方 Opus 5 完整 benchmark 表格,比較 Fable 5、Opus 4.8 與 GPT-5.6 Sol

CursorBench 3.2 則要看 effort 曲線。Anthropic 表示,Opus 5 在 max effort 時距離 Fable 5 峰值不到 0.5%。每項任務成本約為一半。Fable 5 的最高點仍略高。多數團隊使用 high 或 xhigh。Opus 5 在這兩段進入相近輸出、較低價格的區間。

這些數字來自特定評測與執行環境。Frontier-Bench 使用 mini-SWE-agent 與 GKE 後端。每題跑 5 次後取平均。它能證明這套 harness 的相對表現。你的程式庫、法律文件或研究流程可能得到不同排序。

驗證能力會同時提高品質與用量

Opus 5 最值得企業關注的變化是自我驗證。Anthropic 表示,模型會主動檢查工作並反覆修正。官方案例給它一張無法直接查看的機械零件圖。它自行寫出電腦視覺流程,從像素抽取幾何,再重建 FreeCAD 模型。

這種行為適合長時間智能體。它也會把輕量任務做得太重。Anthropic 建議移除既有提示中的重複驗證步驟。框架若允許派出子代理,也應設定明確上限。Opus 5 本身會驗證。再疊一層「請重查」通常只會增加 token 與等待時間。

任務成本可拆成四個變數:

總成本 = 單位 token 價格 × 實際 token 數 + 工具成本 + 重試成本 + 人工等待成本

單價折半只改變第一項。企業導入時更該記錄成功率、完成時間、工具呼叫與人工返工。這四個欄位能回答模型是否真的便宜。

最務實的模型路由

我會先用 Opus 5 的 high effort 跑正式工作,再依結果調整。Anthropic 也把 high 設為 Claude API 與 Claude Code 的預設。low 與 medium 適合品質穩定的重複流程。xhigh 用於大型重構、複雜除錯與多工具工作。

工作類型 起始設定 何時升級到 Fable 5
日常研究、簡報、試算表 Opus 5 high 關鍵結論持續無法通過專家檢核
大型程式庫除錯與重構 Opus 5 xhigh 多輪仍找不到根因,且失敗成本高
瀏覽器與電腦操作 Opus 5 high 長流程狀態維持失敗
數日研究或開放式探索 Opus 5 小樣本試跑 需要最高可用能力與更長自主規劃
高量、低風險分類工作 更便宜的 Sonnet 或 Haiku 通常不升級到 Fable 5
Anthropic Claude Fable 5 產品頁首頁與模型定位

Fable 5 的價值因而更像升級路徑。它適合先定義成功標準,再交給模型長時間規劃的工作。Opus 5 可承接更大的日常流量。團隊能把 Fable 預算留給真正昂貴的失敗。

視覺輸出有進步,但它仍在產生互動成品

Anthropic 展示了風洞與動物細胞兩個視覺成品。這類輸出是模型寫出 HTML、SVG 或 3D 互動程式後,透過瀏覽器呈現。它跟文字直接生成影像是兩條不同路徑。

對產品團隊而言,真正的進步在可驗證性。模型可以打開頁面,比較桌機與手機版。它會發現折疊區以下的內容或超出畫面的按鈕,再回頭修正。視覺工作開始具備測試迴圈,交付也較接近可操作的成品。

安全限制比 Fable 5 寬,但仍有邊界

Opus 5 的資安分類器預期比 Fable 5 少介入約 85%。它允許原始碼弱點搜尋。二進位弱點掃描、滲透測試與 exploit 產生仍受限制。被標記的請求會回退到 Opus 4.8。這項預設涵蓋 Claude、Claude Code 與 Claude Cowork。

官方行為稽核給 Opus 5 的整體不對齊行為分數是 2.3,低於近期模型。這項結果支持日常採用,卻不等同於完全安全。企業仍需要權限隔離、可回復的執行環境與人工核准點。

Claude Opus 5 真的比 Fable 5 好嗎?

Anthropic 公布了程式開發、知識工作與電腦操作評測。Opus 5 在多項結果中領先或接近 Fable 5。Fable 5 仍是官方最高能力的一般公開模型。實際選擇應以自己的任務成功率與總成本決定。

Opus 5 為什麼可能比半價更貴?

它會主動驗證、修正並派出子代理。當一次任務產生更多 token、工具呼叫與迴圈時,總費用可能吃掉單價優勢。設定 effort、子代理上限與停止條件可以控制這個風險。

Opus 5 應該從哪個 effort 開始?

正式工作先用 high。品質穩定的重複工作可以降到 medium 或 low。大型重構與長時間智能體再升到 xhigh。max 適合評測或少數失敗代價極高的工作。

企業是否還需要 Fable 5?

需要,但用途更集中。Opus 5 多輪仍無法完成時,可以升級。任務若會持續數日,Fable 5 也有較清楚的投資理由。高額錯誤損失是另一個升級訊號。

權威引用

Author Insight

在企業導入 AI Agent 的專案裡,最常見的浪費是先選最高階模型,卻沒定義成功條件。模型很認真地多跑幾輪,團隊也多付幾輪費用。最後仍靠人工判斷收尾。Opus 5 的價格與驗證能力讓這個問題更值得量化。先建立 20 至 50 個真實任務的評測集,再談模型忠誠度。

Tenten 協助企業設計生成式 AI 工作流程時,會使用一張整合評測表。它同時記錄品質、延遲、token、工具呼叫與人工返工。若你正在規劃 Claude Code 或企業 AI Agent 的模型路由,可以與 Tenten 團隊討論導入與評測設計

術語表

  • effort:Anthropic 用來調整模型推理深度的設定,從 low 到 max。
  • harness:包住模型的工具、提示、執行環境與驗證流程。
  • 長時間智能體:能跨多個步驟、工具與較長時間持續工作的 AI Agent。
  • 回退模型:請求被安全分類器攔截後,改由另一個模型處理。
Share this post
Erik (EKC)

With over 20 years of experience in technology, and the startup industry, I am passionate about AI and driving innovation. Keeping the engine running

Loading...