DeepSeek 新模型輸出價只要 Astra 的 1/83,V4 Pro 9/14 下架

9 月 9 日晚上 10 點 58 分,DeepSeek 寄出一封通知:V4.1 Flash 即將發布,之後「所有送往 Pro 模型的請求都會被導向 V4.1 Flash,並按 Flash 的價格計費」。
不到 14 小時後的 9 月 10 日中午 12 點 42 分,第二封信來了——同一件事,改口了:V4 Pro 的停止服務時間「延後到 2026 年 9 月 14 日北京時間 12:00」,而且信裡多了一句前一封沒有的話:「如果您在 V4 Pro 與 V4.1 Flash 的對比測試中遇到任何問題,歡迎隨時回饋給我們。」
一家公司在不到 14 小時內把自家旗艦模型的下架時程往後推、並主動邀請用戶做對比測試,這個細節不會出現在任何新聞稿裡,只有實際收到信的 API 用戶看得到。而 9 月 14 日中午,就是下週一。
新價格:官方文件與信件逐項吻合
先把數字擺清楚。以下是 DeepSeek 官方 API 文件目前列出的單價(美元/每百萬 token),與兩封信中的表格完全一致:
| 每百萬 token | V4.1 Flash 離峰 | V4.1 Flash 尖峰 | V4 Pro 離峰 | V4 Pro 尖峰 |
|---|---|---|---|---|
| 輸入(快取命中) | $0.003 | $0.006 | $0.022 | $0.044 |
| 輸入(快取未命中) | $0.15 | $0.30 | $0.66 | $1.32 |
| 輸出 | $0.60 | $1.20 | $1.98 | $3.96 |
新價格自 2026 年 9 月 10 日 UTC 4:00 生效。V4 Pro 在服務期間內價格不變——也就是說在 9 月 14 日中午之前,你仍然用得到 Pro,付的也還是 Pro 的價錢。
單就 DeepSeek 自家的世代差距看:輸出從 $1.98 降到 $0.60(3.3 倍),快取未命中的輸入從 $0.66 降到 $0.15(4.4 倍),快取命中從 $0.022 降到 $0.003(7.3 倍)。快取命中這一欄降幅最大,對重複送相同前綴的 agent 型工作負載影響也最大。
九天之內發生的三件事
把時間軸攤開來看,會發現這次調價落在一個很密集的區間裡:
- 9 月 1 日:Anthropic 發布 Claude Fable 5.1,基礎單價未調整(輸入 $10/輸出 $50),但快取讀取從每百萬 token $1 砍到 $0.25。
- 9 月 3~4 日:OpenAI 推出 GPT-6 Astra,3 日限量預覽、4 日對付費用戶開放穩定版。
- 9 月 10 日:DeepSeek 發布 V4.1 Flash,並宣布 V4 Pro 將被導向新模型計費。
九天,三家。這是本文唯一想先確立的事實——至於這是不是「競爭壓力」,留到最後一節談,因為那部分是推測,不是資料。
三方單價對照:差距有多大
把三家現行旗艦/主力模型的公開單價放在一起(美元/每百萬 token):
| 模型 | 輸入 | 輸出 | 快取讀取 |
|---|---|---|---|
| GPT-6 Astra | $10 | $50 | $1 |
| Claude Fable 5.1 | $10 | $50 | $0.25 |
| DeepSeek V4.1 Flash(離峰) | $0.15 | $0.60 | $0.003 |
| DeepSeek V4.1 Flash(尖峰) | $0.30 | $1.20 | $0.006 |
第一件值得注意的事:GPT-6 Astra 與 Claude Fable 5.1 的標準單價完全相同,都是 $10/$50。兩家在完全獨立的時間點、用完全不同的架構,落在同一個價格點上,這本身就說明這個級距的定價已經相當程度地互相錨定了。
第二件事就是落差本身。以輸出計價為基準,V4.1 Flash 離峰價是那兩者的 1/83;輸入是 1/67;快取讀取相對 Fable 5.1 是 1/83,相對 Astra 的 $1 更是 1/333。
用一個具體的月用量試算會更清楚。假設每月 1,000 萬個輸入 token(全部快取未命中)+ 200 萬個輸出 token:
| 模型 | 月成本 |
|---|---|
| GPT-6 Astra | $200.00 |
| Claude Fable 5.1 | $200.00 |
| DeepSeek V4 Pro(離峰,9/14 前) | $10.56 |
| DeepSeek V4.1 Flash(尖峰) | $5.40 |
| DeepSeek V4.1 Flash(離峰) | $2.70 |
$200 對 $2.70,約 74 倍。
但價格不是可以直接比的東西
上面那張表很有衝擊力,也很容易被誤讀,所以必須講清楚它不能證明什麼。
DeepSeek 信裡的原話是 V4.1 Flash「在效能、成本、速度與任務完成時間等所有關鍵指標上全面超越 V4 Pro」。這句話的比較對象是它自己的上一代模型,不是 Astra,也不是 Fable 5.1。截至本文撰寫時,我沒有找到 V4.1 Flash 與這兩者之間的公開第三方對比基準測試。
所以正確的讀法是:DeepSeek 在自家產品線內做了一次「更好而且更便宜」的世代更替,而它的絕對價格遠低於美國兩家的旗艦。「更便宜 74 倍」和「便宜 74 倍還一樣好用」是兩回事,後者目前沒有資料支持。任何要把生產流量切過去的決定,都應該建立在你自己工作負載的實測上,而不是這張表。
另外,這也不是同級別的比較:Astra 與 Fable 5.1 都是各自公司的最高階模型,而 Flash 從命名到定位都是輕量級。真正對等的比較對象,要等 DeepSeek 的 V4.1 Pro 發布(兩封信都提到它「尚未發布」)才會出現。
尖峰時段的定義,對台灣使用者特別不友善
這一段是官方文件不會替你換算、但會直接影響你帳單的部分。
DeepSeek 的尖峰時段以 UTC 定義:週一至週五 01:00–04:00 與 06:00–10:00,其餘時間全部算離峰。台灣是 UTC+8,換算過來是:
週一至週五 09:00–12:00 與 14:00–18:00(台北時間)。
也就是說,尖峰時段精準覆蓋台灣上班族的整個工作日,中間只空出 12:00–14:00 的午休。你在辦公室寫程式、跑 agent、批次處理的時段,全部落在兩倍價格的區間裡;而離峰價要等到下班後、深夜、或週末才拿得到。
這個對照有兩個實務意涵:
- 可以排程的批次工作就別在上班時間跑。 資料清洗、批次摘要、夜間回歸測試這類不需要立刻拿到結果的工作,挪到 18:00 之後或週末,單價直接砍半。以上面的試算為例,同樣用量從 $5.40 變成 $2.70。
- 週末整天都是離峰。 週一到週五才有尖峰,週六日不分時段全是離峰價,這對週末跑大量實驗的人是實質優惠。
順帶一提,因為北京時間與台北時間同為 UTC+8,DeepSeek 中文文件寫的「9:00-12:00、14:00-18:00」可以直接當台北時間讀,不需要再換算——但英文信件寫的是 UTC,如果你只看英文那封,很容易把時段記錯 8 小時。
真正該優化的不是尖峰離峰,是快取命中率
前一節的排程建議能省一半,但如果只做這件事,等於放著更大的一筆錢不撿。
看回價目表:V4.1 Flash 的快取命中價是 $0.003,未命中是 $0.15——差距 50 倍。相較之下尖峰與離峰的差距只有 2 倍。同樣每月 1,000 萬個輸入 token,不同快取命中率下的輸入成本(離峰計):
| 快取命中率 | 每月輸入成本 |
|---|---|
| 0% | $1.500 |
| 50% | $0.765 |
| 80% | $0.324 |
| 90% | $0.177 |
| 95% | $0.104 |
從完全不命中做到 90% 命中,輸入成本降低 8.5 倍;而把工作全部挪到離峰只能降 2 倍。兩件事當然可以一起做,但如果時間有限,先去處理快取。
快取命中的關鍵在於前綴必須逐位元組穩定。最常見的幾個破壞命中的寫法:把 datetime.now()、每次請求的 UUID 或 request id 放進 system prompt 的開頭;用未排序的 JSON 序列化工具定義;每次請求動態增減工具清單。這些都會讓整段前綴的雜湊改變,後面的內容全部重新計價。正確做法是把穩定內容放最前面、易變內容放最後面,然後觀察 API 回傳的快取命中 token 數是不是真的大於零——如果連續多次請求都是零,那就代表有東西在無聲地讓快取失效。
9 月 14 日中午之前,你該做的事
距離 V4 Pro 停止服務只剩幾天,而北京時間 12:00 就是台北時間 12:00。如果你的服務目前指向 deepseek-v4-pro:
- 確認你到底有沒有在用 Pro。 如果你呼叫的模型代號是
deepseek-v4-pro,9 月 14 日中午之後這個請求不會失敗,但實際跑的會是 V4.1 Flash——模型換了,程式不會報錯。這種無聲替換比直接 4xx 更難察覺。 - 趁還有 Pro 的時候做對比測試。 這正是第二封信主動邀請的事。用你自己的實際 prompt 各跑一輪,比較輸出品質而不是看官方說詞——尤其如果你的 prompt 是長期針對 Pro 的行為調校出來的。
- 重新估算成本。 換過去之後單價會下降(離峰約 3.9 倍),但如果新模型需要更多輪次或更長輸出才能完成同樣的任務,省下來的未必有帳面上那麼多。要看的是「每完成一次任務的成本」,不是每百萬 token 的單價。
- 把快取策略檢查一遍。 Flash 的快取命中價是 $0.003,與未命中的 $0.15 差了 50 倍。這個比例下,前綴能不能穩定命中快取,對帳單的影響遠大於尖峰離峰的 2 倍差距。
那句「感受到壓力」,該怎麼讀
最後回到那個最誘人、但也最該小心的問題:DeepSeek 這次動作,是不是被 Astra 和 Fable 5.1 逼出來的?
誠實的答案是:兩封信裡一個字都沒提到競爭對手,官方文件也沒有。 這個說法完全建立在時間上的巧合,而巧合不是證據。模型發布時程通常在數月前就排定,九天的間隔可能只是正好撞在一起。
可以確定的只有幾件事實:DeepSeek 在兩家美國公司發表旗艦模型後的一週內,推出了一個自稱全面超越前代的新模型;它大幅調降了價格;它原本打算立刻把舊模型的流量導過去,然後在不到 14 小時內改口延期四天,並公開邀請用戶回報對比測試的問題。
最後那一點反而是我覺得最值得玩味的:改口延期這件事,比降價本身更能說明一些東西。 一個對新模型完全有把握的決策,不太需要在發出通知後不到一天內就把時程往後推、還特地加一句「有問題請告訴我們」。至於那是來自用戶的反彈、內部測試的保留、還是單純想給客戶多幾天緩衝,外界無從得知——但那句話是他們自己寫的,不是我推測的。
價格戰打到 1/83 這個量級,對使用者當然是好事。只是在把生產流量切過去之前,記得那張對照表比的是價格,不是能力。



