Anthropic、Google 等主要模型供應商近一年不斷下調 API 價格,而降得最兇的位置很一致:不是旗艦模型,而是「中階模型」那一層。以公開定價的量級看,一年前每百萬 token 要幾美元的中階模型,現在同級位置普遍已經壓到一美元上下,再加上 prompt caching 與 batch 折扣,實際帳面成本可以再砍一大截。最值得先留意的一點是:這輪降價的重心,是把「夠用就好」那一層模型的價格壓到接近沒有議價空間。而我的判斷是——這不是廠商突然大方,而是中階模型正式進入商品化階段,你的選型邏輯和成本模型都要跟著改寫,而不是單純慶祝變便宜。
這輪降價的重心,明顯落在「中階」這一格
要看懂這件事,先把模型分成三格:頂端的旗艦推理模型、中間的主力工作模型、底部的超輕量模型。
頂端那格價格其實很硬。旗艦模型每次改版,定價通常維持在同一個量級,有時甚至因為輸出 token 變多(推理過程本身要收費)而讓實際帳單更貴。底部那格本來就便宜,再降也沒什麼戲劇性。
真正被打穿的是中間那格:Claude 的 Haiku 級別、Gemini 的 Flash 級別,還有各家對應的「主力工作馬」。這一格承擔了現實世界絕大部分的 AI 流量——分類、摘要、抽取欄位、改寫、初階客服、RAG 的問答生成。而它現在的單價,已經低到讓人不再需要為了省錢而做架構妥協。
中階模型正在從「產品」變成「水電」。你不會為了選哪一家的電而開會三次,你只會看度數和穩定度。
三個比單價數字更值得注意的變化
一,價格曲線被壓平,旗艦與中階的差距不再只是價格差。
以前的取捨很簡單:貴的聰明、便宜的笨。現在中階模型在指令遵循、結構化輸出、長文本處理上都追上一大截,很多過去必須交給旗艦模型的任務,中階模型已經做得到八九成。這代表你的模型選擇不再是「預算允許就用最好的」,而是要具體測出你這個任務到底需不需要那多出來的一成。
二,真正的殺價武器不是列表價,是 caching 與 batch。
這點最容易被忽略。很多團隊只比較每百萬 token 的牌價,卻沒用 prompt caching。如果你的系統每次呼叫都帶著同一份幾千 token 的 system prompt、公司規範、產品目錄,那份重複前綴在有 cache 的情況下計價可以低到零頭;非即時的批次任務走 batch 通道,又是另一層折扣。同一個工作流,會用折扣機制和不會用的團隊,帳單可以差好幾倍——這個差距,比你在 Anthropic 和 Google 之間換來換去要大得多。
三,降價的代價常常寫在 rate limit 和穩定性裡。
單價低不等於供給充足。便宜的那一層通常也是流量最擁擠的那一層,尖峰時段的延遲抖動、限流、以及模型版本快速迭代帶來的行為漂移,都是實際營運成本。你在 demo 階段感受到的便宜,和你在正式流量下感受到的便宜,往往不是同一件事。
他們為什麼願意降:搶的是你「不想搬走」的那份惰性
降價從來不是慈善。中階模型的推理成本確實隨著硬體、量化、蒸餾、服務端優化而下降,但廠商把省下來的空間全部讓出去,目的很清楚:讓價格不再是你選擇的理由,然後用工具鏈、agent 框架、快取機制、雲端整合把你留住。
降價不是為了幫你省錢,是為了拿走你搬走的動力。當中階模型的成本低到在你的損益表上幾乎看不見,你就不會再花兩週做模型評測與遷移——你會留在原本的生態,順手把周邊服務也一起買了。
這也解釋了為什麼旗艦模型不太降價。中階負責搶用量、搶開發者、搶預設選項;旗艦負責維持品牌高度和毛利。價格戰打的是入口,不是全線。
兩個現實場景:成本結構會被改寫成什麼樣
場景一:客服工單自動分流與摘要。
一個中型電商每天進來幾千張工單,過去的設計通常是「先用便宜模型分類,只有難的才升級到貴模型」,中間那套 routing 邏輯本身就是為了省錢而存在的技術債。當中階模型單價掉到目前這個量級,加上 batch 折扣,直接全量走中階模型的月成本可能只是幾十美元級別。這時候該做的決定不是「再省一點」,而是砍掉那套 routing、把工程時間拿回來。省下的維護人力,遠比省下的 token 錢值。
場景二:內部知識庫問答。
以前為了控制成本,很多團隊把檢索回來的內容切得很短、上下文塞得很省,結果答案品質一直不上不下。價格降下來之後,比較划算的做法反而是放寬 context、多塞幾段原文、把 system prompt 寫得更詳細更囉唆,並且把這份長 prompt 做成 cache。品質提升的幅度,通常比換一個更貴的模型明顯。
便宜的正確用法不是少花錢,是用同樣的錢買到更多上下文和更多次嘗試。
三個最容易判斷錯的地方
第一,單價下降不等於總帳單下降。
這是最常見的錯覺。價格降的同時,大家的用法也在變重:多輪 agent、工具呼叫、自我檢查、reasoning token、把整份文件塞進 context。很多團隊帳單其實在漲,只是漲得比用量慢。看單價會讓你放鬆,看每筆業務結果的成本才會讓你清醒。
第二,看到便宜就換模型,往往換來一場回歸測試災難。
同一個 prompt 在不同模型上的表現差異,常常不在準確率,而在格式穩定性——JSON 少一個欄位、多一句客套話、拒答邊界不同,下游系統就會爆。要真的享受價格戰的好處,前提是你手上有一組穩定的評測集,能在半天內判斷換過去會不會壞。沒有評測集的團隊,看到降價其實動不了。
第三,別假設價格會一直往下。
目前的降價集中在中階,是競爭最激烈、可替代性最高的那一格。長上下文、高階推理、影像與影片理解這些真正吃算力的能力,價格並沒有跟著往下走,反而因為輸出 token 變多而更貴。把長期規劃建立在「AI 成本無限趨近於零」上,是一個相當危險的假設。
誰該現在就重算,誰可以先觀望
如果你正在營運有實際流量的 AI 功能,尤其是每天上千次以上呼叫的分類、摘要、客服、抽取類任務,現在就值得做兩件事:把 caching 和 batch 打開,然後重新評估你為省錢而做的複雜架構還有沒有必要存在。這兩步的回報,通常在一週內就看得到。
如果你還在 POC 階段,模型成本大概還不是你的瓶頸,價格戰對你的意義只是「不用再為單價猶豫」。真正該花時間的是評測集和資料品質——因為當價格不再是差異,能不能判斷輸出好不好,就成了唯一的差異。
這輪降價最實際的訊息其實很樸素:中階模型已經便宜到不值得你再花心力去省,接下來能拉開距離的,是你有沒有能力把便宜的算力,換成穩定可靠的結果。
追蹤以下平台,獲得最新AI資訊:
Facebook: https://www.facebook.com/drjackeiwong/
Instagram: https://www.instagram.com/drjackeiwong/
Threads: https://www.threads.net/@drjackeiwong/
YouTube: https://www.youtube.com/@drjackeiwong/
Website: https://drjackeiwong.com/