DeepSeek 推出名為 V4.1 Flash(以下簡稱 V4.1‑Flash)的生成式 AI(generative AI)模型,收費僅為每百萬個輸入 Token 低於一美分,輸入緩存命中的價格,最高降幅達60%,形成明顯競爭優勢,對 OpenAI、Z.ai 等競爭者構成直接壓力,被視為新一輪市場衝擊。

V4.1‑Flash 空閒時段快取命中 (Cache Hit) 的定價為每百萬個輸入 Token $0.003 美元、每百萬個輸出 Token $0.60 美元;同系列的 V4‑Pro 定價則為每百萬個輸入 Token 0.435 美元、每百萬個輸出 Token 0.87 美元。相比之下,OpenAI 的 GPT‑5.5 最高收費達每百萬個輸出 Token 30 美元,亦即 DeepSeek 在輸出 Token 上的價格低約 107 倍,對大規模的代理工作負載,成本優勢非常明顯。

DeepSeek 創始人梁文鋒超前預判並解決了算力瓶頸,DeepSeek-V4.1-Flash 可以全面降價,競爭對手面臨極大壓力
DeepSeek 創始人梁文鋒超前預判並解決了算力瓶頸,DeepSeek-V4.1-Flash 可以全面降價,競爭對手面臨極大壓力

DeepSeek 採用了稀疏混合專家(Sparse Mixture-of-Experts,MoE)架構與演算法優化,只在每個標記上啟動部分參數,降低推理所需的浮點運算次數(FLOPs),從而使其應用程式介面API)價格遠低於密集的西方模型。

華為半導體首席科學家廖恆曾經在訪談中,高度讚譽 DeepSeek 創辦人梁文鋒的技術遠見。他指出,全球 AI 業界普遍盲目追求「堆疊算力、暴力大模型」時,梁文鋒沒有隨波逐流,展現出超前的預判能力。

梁文鋒以複雜演算法換取低算力需求:他主動選擇了更難收斂、極具複雜性的稀疏混合專家(MoE)與多頭潛在注意力(MLA)等底層架構,因此 DeepSeek 能以美國算力的 1/20,達到同等甚至更佳的表現。

五年前預見樽頸

五年前,梁文鋒已預見算力瓶頸遲早出現,因而提前克服算法跨層難題(Co-design),化解當前算力受限的困境。

新發布的 V4.1‑Flash 正是基於此架構優勢,特別針對長時程代理任務(long‑horizon agentic tasks)進行優化。長時間的代理會話需要模型能夠處理高達 100 萬標記的上下文,同時在多輪回合中保持精確的推理、程式碼執行與工具呼叫。V4.1‑Flash 在此類專門基準測試中持續超越規模更大或價格更高的替代方案。

V4.1‑Flash 在具備代理能力的 AI(agentic AI)領域具競爭力,主要歸功於其高效的架構設計。其持久鍵值緩存(KV cache)僅佔 V4‑Flash 約 1/8(約 890 位元組/標記),大幅降低記憶體需求。此緩存壓縮減少了代理運算成本,使 V4.1‑Flash 在效能、成本、速度與總運行時間上均優於 V4‑Pro。儘管參數規模較小,V4.1‑Flash 在多項代理基準測試中仍能提供具競爭力的效能。

壓縮注意力再降成本

V4.1‑Flash 進一步採用的壓縮稀疏注意力 2(Compressed Sparse Attention 2,CSA2)技術,為每個注意力層分配靜態模式(全模式、重新索引模式或重用模式),以共享主要鍵值緩存與索引器 K 跨層,並重用 Top‑K 稀疏注意力索引。此設計減少全局 KV 緩存佔用,使模型在處理大規模數據時更為高效。

在推理基準測試與成本效益方面,DeepSeek V4 系列表現出色。V4‑Pro 可與 GPT‑5.5 及 Claude Opus 4.8 在推理基準測試中相抗衡;而 V4‑Flash 則以最低成本提供相當能力,成為市場上性價比最高的模型之一。速度、能力與成本的平衡使 DeepSeek V4 系列保持明顯優勢。

DeepSeek V4.1 Flash 以極低的定價與高效的架構設計,執行代理能力的 AI 領域有強勁競爭力,成為市場的佼佼者,因此對競爭對手形成極大壓力。