Claude Opus 5 vs Fable 5 的實務結論很直接:多數企業 AI 工作可以先用 Opus 5。它在 2026 年 7 月 24 日發布。API 單價是 Fable 5 的一半。官方的程式開發、知識工作與電腦操作評測,也讓它接近或超過 Fable 5。Fable 5 仍保留在最高能力、長時間研究與失敗代價極高的任務。
Anthropic 對 Opus 5 的定位是複雜智能體程式開發與企業工作。這個定位比「更聰明」更有用,因為模型選擇真正影響的是整個任務成本。單價、推理 effort、工具呼叫次數與驗證迴圈都會進入帳單。

官方規格先劃出價格邊界
Opus 5 與 Fable 5 都有 100 萬 token 上下文。兩者的最大輸出都是 12.8 萬 token。差異集中在速度、知識截止日、官方美元單價與產品定位。
| 項目 | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| 每百萬輸入 token | USD 5 | USD 10 |
| 每百萬輸出 token | USD 25 | USD 50 |
| 上下文視窗 | 100 萬 token | 100 萬 token |
| 最大輸出 | 12.8 萬 token | 12.8 萬 token |
| 官方相對延遲 | 中等 | 較慢 |
| 可靠知識截止日 | 2026 年 5 月 | 2026 年 1 月 |
| 官方建議用途 | 複雜智能體程式開發、企業工作 | 最高能力、長時間智能體 |
這張表帶出第一個採購判斷:同樣的 token 組合,Opus 5 的名目費用正好減半。名目費用只是起點。若模型自行展開更多子任務,最後一張帳單仍可能高過 Fable 5 的短路徑執行。
三組評測說了什麼
Anthropic 的發布表同時比較四個模型:Opus 5、Fable 5、Opus 4.8 與 GPT-5.6 Sol。最醒目的進步來自 Opus 家族內部。Frontier-Bench v0.1 上,分數從 21.1% 升到 43.3%。
| 評測 | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| Frontier-Bench v0.1 智能體終端程式開發 | 43.3% | 33.7% | 21.1% | 34.4% |
| GDPval-AA v2 知識工作 | 1861 | 1747 | 1593 | 1736 |
| ARC-AGI-3 新問題解決 | 30.2% | 未公布 | 1.5% | 7.8% |

CursorBench 3.2 則要看 effort 曲線。Anthropic 表示,Opus 5 在 max effort 時距離 Fable 5 峰值不到 0.5%。每項任務成本約為一半。Fable 5 的最高點仍略高。多數團隊使用 high 或 xhigh。Opus 5 在這兩段進入相近輸出、較低價格的區間。
這些數字來自特定評測與執行環境。Frontier-Bench 使用 mini-SWE-agent 與 GKE 後端。每題跑 5 次後取平均。它能證明這套 harness 的相對表現。你的程式庫、法律文件或研究流程可能得到不同排序。
驗證能力會同時提高品質與用量
Opus 5 最值得企業關注的變化是自我驗證。Anthropic 表示,模型會主動檢查工作並反覆修正。官方案例給它一張無法直接查看的機械零件圖。它自行寫出電腦視覺流程,從像素抽取幾何,再重建 FreeCAD 模型。
這種行為適合長時間智能體。它也會把輕量任務做得太重。Anthropic 建議移除既有提示中的重複驗證步驟。框架若允許派出子代理,也應設定明確上限。Opus 5 本身會驗證。再疊一層「請重查」通常只會增加 token 與等待時間。
任務成本可拆成四個變數:
總成本 = 單位 token 價格 × 實際 token 數 + 工具成本 + 重試成本 + 人工等待成本
單價折半只改變第一項。企業導入時更該記錄成功率、完成時間、工具呼叫與人工返工。這四個欄位能回答模型是否真的便宜。
最務實的模型路由
我會先用 Opus 5 的 high effort 跑正式工作,再依結果調整。Anthropic 也把 high 設為 Claude API 與 Claude Code 的預設。low 與 medium 適合品質穩定的重複流程。xhigh 用於大型重構、複雜除錯與多工具工作。
| 工作類型 | 起始設定 | 何時升級到 Fable 5 |
|---|---|---|
| 日常研究、簡報、試算表 | Opus 5 high | 關鍵結論持續無法通過專家檢核 |
| 大型程式庫除錯與重構 | Opus 5 xhigh | 多輪仍找不到根因,且失敗成本高 |
| 瀏覽器與電腦操作 | Opus 5 high | 長流程狀態維持失敗 |
| 數日研究或開放式探索 | Opus 5 小樣本試跑 | 需要最高可用能力與更長自主規劃 |
| 高量、低風險分類工作 | 更便宜的 Sonnet 或 Haiku | 通常不升級到 Fable 5 |

Fable 5 的價值因而更像升級路徑。它適合先定義成功標準,再交給模型長時間規劃的工作。Opus 5 可承接更大的日常流量。團隊能把 Fable 預算留給真正昂貴的失敗。
視覺輸出有進步,但它仍在產生互動成品
Anthropic 展示了風洞與動物細胞兩個視覺成品。這類輸出是模型寫出 HTML、SVG 或 3D 互動程式後,透過瀏覽器呈現。它跟文字直接生成影像是兩條不同路徑。
對產品團隊而言,真正的進步在可驗證性。模型可以打開頁面,比較桌機與手機版。它會發現折疊區以下的內容或超出畫面的按鈕,再回頭修正。視覺工作開始具備測試迴圈,交付也較接近可操作的成品。
安全限制比 Fable 5 寬,但仍有邊界
Opus 5 的資安分類器預期比 Fable 5 少介入約 85%。它允許原始碼弱點搜尋。二進位弱點掃描、滲透測試與 exploit 產生仍受限制。被標記的請求會回退到 Opus 4.8。這項預設涵蓋 Claude、Claude Code 與 Claude Cowork。
官方行為稽核給 Opus 5 的整體不對齊行為分數是 2.3,低於近期模型。這項結果支持日常採用,卻不等同於完全安全。企業仍需要權限隔離、可回復的執行環境與人工核准點。
Claude Opus 5 真的比 Fable 5 好嗎?
Anthropic 公布了程式開發、知識工作與電腦操作評測。Opus 5 在多項結果中領先或接近 Fable 5。Fable 5 仍是官方最高能力的一般公開模型。實際選擇應以自己的任務成功率與總成本決定。
Opus 5 為什麼可能比半價更貴?
它會主動驗證、修正並派出子代理。當一次任務產生更多 token、工具呼叫與迴圈時,總費用可能吃掉單價優勢。設定 effort、子代理上限與停止條件可以控制這個風險。
Opus 5 應該從哪個 effort 開始?
正式工作先用 high。品質穩定的重複工作可以降到 medium 或 low。大型重構與長時間智能體再升到 xhigh。max 適合評測或少數失敗代價極高的工作。
企業是否還需要 Fable 5?
需要,但用途更集中。Opus 5 多輪仍無法完成時,可以升級。任務若會持續數日,Fable 5 也有較清楚的投資理由。高額錯誤損失是另一個升級訊號。
權威引用
- Anthropic — Introducing Claude Opus 5
- Claude Platform Docs — Models overview
- Claude Platform Docs — What's new in Claude Opus 5
- Claude Platform Docs — Prompting Claude Opus 5
- Anthropic — Claude Fable 5
Author Insight
在企業導入 AI Agent 的專案裡,最常見的浪費是先選最高階模型,卻沒定義成功條件。模型很認真地多跑幾輪,團隊也多付幾輪費用。最後仍靠人工判斷收尾。Opus 5 的價格與驗證能力讓這個問題更值得量化。先建立 20 至 50 個真實任務的評測集,再談模型忠誠度。
Tenten 協助企業設計生成式 AI 工作流程時,會使用一張整合評測表。它同時記錄品質、延遲、token、工具呼叫與人工返工。若你正在規劃 Claude Code 或企業 AI Agent 的模型路由,可以與 Tenten 團隊討論導入與評測設計。
術語表
- effort:Anthropic 用來調整模型推理深度的設定,從 low 到 max。
- harness:包住模型的工具、提示、執行環境與驗證流程。
- 長時間智能體:能跨多個步驟、工具與較長時間持續工作的 AI Agent。
- 回退模型:請求被安全分類器攔截後,改由另一個模型處理。
