Muse Spark 1.2 在 2026 年 8 月 5 日上線後,把 Meta 拉回前沿 AI 模型的競爭區間;真正值得追的是 Meta 同步推出 Muse Code,並把模型、工具與多 Agent 工作流程放進同一條訓練迴路。 8 月 7 日的 Artificial Analysis 即時榜單顯示,Muse Spark 1.2 綜合分數約 56.8,高於 1.1 的 53.2;漲幅約 3.6 分,其中 agentic index 從 39.7 升到 49.3,增幅遠大於 coding index 的 0.9 分。

四個月三次發佈,Meta 改變的是研發節奏
Meta 在 2026 年 4 月發表第一代 Muse Spark,7 月 9 日推出 1.1,8 月 5 日再上 1.2。四個月內連續三次發佈,本身就是訊號:這個團隊已從大型版本發表,改成短週期的模型與產品共迭代。
1.2 的定位也比 1.1 窄。1.1 主打多模態推理、工具使用與 100 萬 token 上下文;1.2 則把訓練算力集中到程式設計,增加更多訓練環境,並針對完整任務流程、程式庫理解與除錯做調整。Meta 同一天開放 Muse Code beta,讓使用者在終端機中交付規劃、改碼、測試與驗證。
這個發佈方式讓模型評測變得難拆。Muse Spark 1.2 的成績包含模型能力,也包含 Muse Code 怎麼切任務、壓縮上下文、管理 subagent 與呼叫工具。採購者若只把 56.8 分寫進比較表,會漏掉產品設計帶來的差異。
獨立榜單顯示:提升主要出現在 Agent 工作
Artificial Analysis 的即時資料比社群流傳的 54 分快照更新。8 月 7 日,Muse Spark 1.2 的 intelligence index 約 56.8,Muse Spark 1.1 約 53.2;兩者價格相同,標準版每百萬 input token 為 USD 1.25,output token 為 USD 4.25,上下文皆為 1,048,576 tokens。
| Artificial Analysis 指標 | Muse Spark 1.1 | Muse Spark 1.2 | 變化 |
|---|---|---|---|
| Intelligence index | 53.2 | 56.8 | +3.6 |
| Coding index | 71.3 | 72.2 | +0.9 |
| Agentic index | 39.7 | 49.3 | +9.6 |
| 標準版 input/output,每百萬 tokens | USD 1.25/4.25 | USD 1.25/4.25 | 不變 |
數字支持一個比較克制的結論:1.2 的進步確實存在,提升最明顯的地方落在需要搜尋、工具操作與多步驟執行的 Agent 任務,單次程式題的變化較小。這也符合 Meta 的訓練說明。官方用 Muse Code 的工具軌跡做 rejection sampling,並針對 goal conditioning、context compaction 與 subagent 協作調整模型。
官方 benchmark 證明競爭力,也混入了 Agent 產品差異
Meta 公布的 Terminal-Bench 2.1 結果中,Muse Spark 1.2 搭配 Muse Code 得到 82.9%,高於 1.1 搭配 mini-swe-agent 的 76.2%,落後 Claude Opus 5 搭配 Claude Code 的 86.7%。在 GDPVal-AA v2,1.2 的 Elo 為 1,631,高於 1.1 的 1,371,也高於 Meta 圖表裡 GPT-5.6 Terra 的 1,577 與 Grok 4.5 的 1,526。

但這些圖不能當成純模型排行榜。Meta 的方法文件明確說明,Terminal-Bench 對不同模型搭配不同 coding agent:Muse 用 Muse Code、Claude 用 Claude Code、GPT 用 Codex。GDPVal-AA 與 MCP Atlas 又改用供應商 harness。換句話說,數字測到的是一套可交付的系統,未必能隔離底層模型貢獻。
這種混合衡量符合產品現實。當 Agent 能持續數小時,系統如何保留事件紀錄、恢復中斷任務、避免 subagent 重複搜尋,會直接改變結果。Muse Code 把每次模型呼叫、工具執行、核准與編輯寫入本機 event log,讓工作在當機後可以重播或續跑。這類 runtime 設計很難反映在傳統聊天模型測試裡。

對開發團隊而言,價格之外還要看資料政策
Meta 提供兩個 1.2 端點。標準版不會用客戶資料改善產品,input/cached input/output 每百萬 tokens 分別為 USD 1.25、0.15、4.25。Contributor 版允許 Meta 使用資料改善產品,對應價格降到 USD 0.10、0.002、0.20。兩者都有 100 萬 token 上下文。
Contributor 的 output 價格只有標準版約 4.7%,價差很大,卻不能只當折扣。企業必須先分類原始碼、客戶資料與機密,再決定哪些工作可以進入貢獻型端點。若團隊沒有資料分級與路由,低 token 價格可能換來不符合內部政策的資料處理方式。
Muse Code 目前仍是 beta。它支援 macOS 與 Linux,也能啟動多個常駐背景 Agent;長時間工作可超過 1,000 次工具呼叫,Meta 的 kernel optimization 案例最長跑到 24 小時。這些能力適合程式庫遷移、測試補齊與研究型任務,但企業試點仍應記錄完成率、人工修正時間、錯誤回復與每項任務成本,不能只看 token 單價。
Meta 已重新入場,下一關是把系統優勢變成留存
從能力與發佈速度看,Meta 已回到前沿模型的競爭區間。它選擇從 coding agent 切入,避開以單一通用聊天產品正面追趕所有對手的路線。
下一階段的壓力在產品面。Muse Code 要證明多 Agent 可以穩定完成真實程式庫工作;Meta Model API 要建立容量、支援與企業信任;短週期更新也必須避免每次版本更換都讓既有評測失效。榜單能證明 Meta 重新取得入場券,留存與任務經濟性才會決定這張票值多少。
Muse Spark 1.2 是什麼?
Muse Spark 1.2 是 Meta 針對程式開發與 Agent 工作流程訓練的模型,提供 100 萬 token 上下文。它可透過 Muse Code、Meta Model API 與合作平台使用。
Muse Spark 1.2 比 1.1 強多少?
Artificial Analysis 在 2026 年 8 月 7 日的即時資料顯示,綜合分數約增加 3.6 分。agentic index 約增加 9.6 分,coding index 約增加 0.9 分,提升主要落在多步驟 Agent 任務。
Muse Code 和 Muse Spark 1.2 有何不同?
Muse Spark 1.2 是模型;Muse Code 是使用這個模型的終端機 coding agent。Muse Code 負責工具呼叫、背景 Agent、事件紀錄、上下文管理與工作續跑,兩者共同決定實際任務表現。
企業能否把機密程式碼交給 Contributor 版
不應只看價格決定。Contributor 版允許 Meta 使用資料改善產品,企業要先確認合約、資料分類與內部政策;機密工作較適合選用不將資料用於產品改善的標準版。
權威來源
- Meta Research:Introducing Muse Code and Muse Spark 1.2
- Meta Developer:Muse Spark 1.2 模型與價格
- Meta Research:Muse Spark 1.2 Evaluation Methodology
- Artificial Analysis:Muse Spark 1.2 模型評測
Author Insight
我在替團隊評估 coding agent 時,最常遇到的誤判,是拿底層模型分數預測整套工作流程。真正拖累專案的往往是上下文遺失、工具失敗後無法續跑,以及多個 Agent 重做同一份研究。Muse Spark 1.2 的價值,在於 Meta 開始把這些 runtime 問題納入模型訓練;這條路比再多一個聊天介面更值得企業追蹤。
Tenten 協助企業建立模型選型、程式開發 Agent 試點與任務級評測。如果你想把公開 benchmark 轉成自己的程式庫測試集,可以和 Tenten 團隊討論。
