DeepSeek AGI 策略已形成一條可驗證的主線:壓低推論價格,把模型權重開放給市場,再把資源集中到 Agent 與長期研究。 2026 年 4 月推出的 V4 支援 100 萬 token 上下文。到了 6 月,DeepSeek 已占 Vercel AI Gateway token 量的 22.6%。低價並沒有把需求壓小,反而讓模型進入更多正式工作負載。

先把可驗證的事實與傳聞分開
DeepSeek 在 2026 年 4 月 24 日的 V4 公告中提醒,外部管道的說法不代表公司立場。這句話替所有策略分析劃了一條清楚界線。創辦人梁文鋒的非公開會議摘錄可以提供問題,不能直接當作逐字紀錄。
公開資料仍足以拼出方向。DeepSeek-V4-Pro 有 1.6 兆個總參數,每個 token 啟動 490 億個參數。V4-Flash 則有 2,840 億個總參數,啟動 130 億個。兩者都有 100 萬 token 上下文,也同時支援思考與非思考模式。
| 2026 年公開訊號 | 可驗證數字 | 能支持的判斷 |
|---|---|---|
| 4 月 24 日發布 V4 | Pro 1.6 兆/啟動 490 億參數;Flash 2,840 億/啟動 130 億參數 | DeepSeek 把長上下文與 Agent 工作放在同一代模型 |
| 6 月首輪外部募資 | 約 NTD 2,400 億(US$7.4 billion) | 研究型公司開始接受外部資本,以支付算力與人才成本 |
| 6 月 Vercel AI Gateway | DeepSeek 占 22.6% token 量 | 低價模型已進入正式工作負載,並非只在測試環境流行 |
| 7 月 API 定價 | Flash 每百萬 input token 約 NTD 5(US$0.14);output 約 NTD 9(US$0.28) | 低價是分發策略,也會壓縮單位收入 |
克制其實是一套資本配置方法
把產品視為研究的延伸,聽起來很浪漫。實際營運沒有這麼單純。DeepSeek 維持聊天產品、兩種 API 格式、快取計價、併發限制與舊模型退場時程。這些都是產品工作,而且每天會碰到可靠性與客服問題。
真正的差別在資源排序。V4 公告把 Agentic Coding 列為主要能力,官方徵才頁也同時招募 Code Agent 資料工程師、Agent Harness 與 Agent Infra 工程師。產品仍要運作,但團隊把最稀缺的研究人力放在能反過來協助模型開發的工作。
我認為這才是克制策略最值得研究的地方。它拒絕用功能數量衡量進度,改用每一筆投入能否提高研究速度來判斷。這會犧牲部分短期收入,也會讓產品缺口更明顯。回報則是較少的組織干擾,以及一條更短的研究回饋路徑。
外部資本讓研究理想開始接受財務檢驗
根據 2026 年 6 月 3 日的募資報導,DeepSeek 首輪外部募資約人民幣 500 億元,約合 NTD 2,380 億。投資後估值介於人民幣 3,500 億至 4,000 億元。梁文鋒預計投入人民幣 200 億元,騰訊與寧德時代分別考慮人民幣 100 億與 50 億元。
這些金額改變了公司的風險結構。算力與人才穩定度獲得較長跑道,外部股東也會要求治理、財務紀律與退出路徑。7 月 14 日又有報導指出,DeepSeek 正洽談約 NTD 486 億(US$1.5 billion)的新資金,估值可能達 NTD 2.3 兆(US$71 billion)。公司當時沒有回應。
研究優先仍可維持,代價是把承諾變成可稽核的資本配置。若大筆資金流向產品補洞或無差別擴張,克制就只剩口號。若資金提高訓練、推論與人才留任能力,這套策略才算成立。
低價與開放權重會擴大使用量,也會暴露成本
DeepSeek-V4-Flash 的快取未命中 input 價格為每百萬 token 約 NTD 5(US$0.14),output 約 NTD 9(US$0.28)。V4-Pro 分別約 NTD 14(US$0.435)與 NTD 28(US$0.87)。官方同時提供 OpenAI 相容與 Anthropic 相容的 API。
Vercel 的 2026 年 6 月資料提供了需求端證據。開放權重模型占 AI Gateway token 量的 29%,支出占比不到 4%。DeepSeek 單獨取得 22.6% token 量。大量運算正在流向便宜模型,但收入與使用量沒有同比例成長。

這種分發方式會把商業壓力推向兩個地方。第一是基礎設施效率,因為每個 token 的毛利很薄。第二是高價值工作能否留下來。低成本模型若只承接大量、低風險任務,供應商可能有規模,卻沒有足夠現金支持下一輪訓練。
Coding Agent 是橋梁,持續學習仍是研究賭注
目前的大型語言模型多半在部署後凍結權重,透過檢索、工具與定期再訓練取得新能力。持續學習希望模型吸收新任務時,也保留舊知識。2025 年刊於《ACM Computing Surveys》的綜述指出,持續微調仍會造成災難性遺忘。
DeepSeek 已在徵才頁列出 Frontier(持續學習/自我演化/新典範)研究職缺。這證明公司願意投入,無法證明問題已經解決。Coding Agent 比一般聊天產品更適合當中間層,因為程式碼有測試、版本差異與可重現失敗。模型可以在受控環境裡產生工作,再由驗證結果回饋。
這條因果鏈很誘人:Agent 產生程式碼,測試建立可驗證回饋,回饋改善下一輪模型,新的模型又提高研究產能。困難也很具體。資料會污染,錯誤可能被遞迴放大,模型更新後還可能忘記原有能力。任何自我改善主張都需要跨版本評測與回滾機制。

企業現在可以怎麼評估 DeepSeek
採購團隊不必判斷誰最接近 AGI。先把 DeepSeek 放進自己的任務集測試。成本要用每項完成任務計算,並納入重試、人工覆核、延遲與故障。資安評估則要涵蓋資料傳輸、保存位置、權限與供應商變更。
便宜 API 適合大量摘要、程式碼初檢與可容錯自動化。高風險決策仍需要更嚴格的模型評測與人工責任人。開放權重也不等於免費營運;自建環境還要負擔 GPU、記憶體、推論框架、監控與升級。
DeepSeek AGI 策略對企業最實用的啟示很樸素。模型層應保持可替換,評測與治理能力則要留在自己手上。這樣才能享受價格競爭,又不把流程綁死在單一供應商。
DeepSeek 的低價 API 能長期維持嗎?
目前無法確定。Vercel 資料顯示使用量成長很快,但開放權重模型只占不到 4% 的支出。長期能否維持,要看基礎設施效率、快取比例與高價值工作占比。
DeepSeek 已經解決持續學習了嗎?
沒有公開證據支持這個結論。官方徵才頁顯示公司正在招募相關研究人才;學術文獻仍把災難性遺忘列為主要難題。
開放權重會傷害 DeepSeek 的商業模式嗎?
它會壓低授權稀缺性,也能擴大採用與第三方整合。商業結果取決於第一方 API 的成本、可靠性與企業服務,而非權重是否可下載。
企業應該立刻把現有模型換成 DeepSeek 嗎?
不應只因單價就全面更換。先用代表性任務比較完成率、人工覆核量、延遲、資料風險與每項任務成本,再決定路由比例。
權威來源
- DeepSeek:V4 Preview 官方發布
- DeepSeek:V4 模型與 API 定價
- DeepSeek:官方徵才職缺
- Reuters:DeepSeek 首輪募資規模與投資人結構
- Vercel:2026 年 7 月 AI Gateway Production Index
- ACM Computing Surveys:大型語言模型的持續學習綜述
- TechCrunch:DeepSeek 第二輪募資與上市準備報導
- 中華民國中央銀行:2026 年 7 月 22 日新臺幣對美元收盤匯率
Author Insight
在模型採購與 AI 工作流程專案裡,我最常看到的誤判,是把便宜 token 當成便宜成果。重試、人工覆核與錯誤處理才會決定帳單。DeepSeek 的策略值得企業測試,前提是保留自己的評測集、觀測資料與替換能力。
Tenten 長期協助企業建立模型選型、Agent 工作流程與可稽核的評測機制。若你正在比較模型供應商,可以和 Tenten 團隊討論。
術語表
| 術語 | 本文定義 |
|---|---|
| 通用人工智慧(AGI) | 能跨領域學習與完成廣泛認知任務的系統目標 |
| Agent | 能呼叫工具、執行多步工作並接收環境回饋的 AI 系統 |
| token | 模型處理文字時使用的基本計算單位 |
| 開放權重 | 公開可下載的模型參數;不代表訓練資料與完整程式皆公開 |
| 持續學習 | 模型吸收新任務或新資料時,仍保留既有能力的研究方向 |
