Anthropic 正式推出 Claude Opus 5,官方端出的成績單相當漂亮:程式碼、代理式任務(agentic tasks)、工具使用與長流程推理幾乎全線刷新自家紀錄,也把幾個業界常用榜單再往上推了一截。但如果你只看那幾條柱狀圖,就會錯過這次更新最有價值的部分——Opus 5 真正改變的,是它「連續工作幾個小時而不走鐘」的能力,以及你能不能自己決定它要想多久、花多少算力。
這篇文章的判斷很直接:跑分是行銷用的,長任務穩定度才是這代模型的賣點。而後者,剛好是過去一年最多人抱怨、也最難靠參數量硬堆出來的東西。
今次最值得注意的四個升級點
1. 長時程任務的「耐力」明顯不同
過去用旗艦模型跑 agent,最常見的失敗不是它不會,而是它做到第七、第八步開始偏移:忘了最初的規格、重複改同一個檔案、或者自己發明一個不存在的函式然後繼續往下寫。Opus 5 在這種多步驟、需要反覆讀寫檔案與回頭驗證的情境下,掉線率下降得比單題正確率的進步更明顯。
具體感受是:同一個「幫我把這個 repo 的認證模組從 session 換成 JWT,並補上測試」的指令,過去你要中途介入三、四次糾正方向,現在可能只需要在最後審 PR。這種差別在 benchmark 上只是幾個百分點,在實際工時上卻是半天對兩小時。
2. 推理力度可以自己調
Opus 5 把「要想多久」交回開發者手上。你可以要求它以低力度快速回答,也可以指定它把算力壓在關鍵步驟上做深度推理。這件事的實用意義比聽起來大:以前你要嘛忍受旗艦模型把簡單分類題也想成論文,要嘛為了省錢降級到小模型,然後在複雜題目上翻車。
現在同一條 pipeline 裡,抽取欄位用低力度、決策與程式碼審查切高力度,成本結構第一次可以按任務難度來排。對每天跑幾萬次呼叫的產品團隊來說,這比多兩分跑分實在得多。
3. 上下文管理,不再是「塞爆就重來」
長對話與長專案的老問題是:context 一滿,品質就斷崖式下墜,你只能開新視窗、重貼一次背景。Opus 5 在上下文壓縮與任務狀態延續上做了強化,能在接近上限時自行整理已完成進度、保留關鍵決策,再接著做下去。
實際場景:你讓它跑一份跨十幾個 Excel 與 PDF 的年度財務比對,中間需要一直回頭核對前面的假設。以前這種任務跑到一半就要人工做筆記;現在它比較能記住「我們第三步決定用調整後 EBITDA」,而不是走到第九步突然換算法。
4. 工具使用與電腦操作更可靠
呼叫工具的成功率、參數格式的正確率、以及在瀏覽器與桌面環境中點擊操作的穩定度都有提升。這部分很少人放在頭條,但它決定了 agent 是玩具還是可交付。一個成功率 85% 的工具呼叫,串三次就只剩六成;提到 95%,串三次還有八成五。差別就在這裡。
跟 Opus 4.5 和 Sonnet 系列比,差在哪
對比自家上一代旗艦,Opus 5 的進步不太表現在「單題你問我答」的體感上——那部分早就進入邊際效益遞減。差距集中在三種情境:任務步數多、需要外部工具、以及需要在中途自我修正。
至於該不該從 Sonnet 升上來,判斷標準其實很簡單:如果你的用途是摘要、改寫、客服回覆、簡單 SQL,Sonnet 依然是性價比更好的選擇,Opus 5 的優勢你八成用不到。但如果你正在做 coding agent、多步驟研究流程、或任何「跑錯一步後面全錯」的工作流,這一代的可靠度提升足以改變你原本設計的補救機制。
榜單分數會飽和,長任務的耐力不會。
這些數值該怎麼看
幾個主流榜單目前的狀態是:前幾名擠在個位數百分點內,而測試集本身已經被各家反覆最佳化過。所以看到「再創新高」時,比較值得問的是三個問題:
- 這個分數是在幾次嘗試、什麼推理力度下取得的?
- 它測的是單題還是完整任務鏈?
- 換成我自己的 codebase 或文件格式,還成立嗎?
模型變強最誠實的指標,不是它答得多對,而是你需要重問幾次。這個數字不會出現在任何發佈會的投影片上,只會出現在你自己的使用記錄裡。
所以務實的做法不是看評測,而是把你手上最常失敗的那三個 prompt 或那條最脆的 agent 流程,原封不動丟上去跑一次。三十分鐘就有答案,比讀十篇分析有用。
值不值得立刻跟進
值得立刻試的:正在維護 coding agent、自動化研究流程、或任何多步驟工具鏈的團隊。這一代的穩定度提升,可能讓你砍掉一堆原本寫來擦屁股的重試與驗證邏輯,這部分省下的工程成本比 API 帳單差額更可觀。
可以先觀察的:目前用量集中在單輪生成、內容改寫、客服問答的團隊。你的瓶頸不在模型推理深度,換旗艦不會有戲劇性改善,等生態工具與 SDK 支援跟上再說也不遲。
一個提醒:推理力度可調是好事,但也代表成本與延遲從此變成你要主動設計的參數,而不是預設值。上線前先把不同力度下的實際花費與回應時間量一遍,否則「高力度全開」的帳單會在月底教你這件事。
Opus 5 這次的意義,在於它把旗艦模型從「聰明的回答者」推向「可以放心交待一整件事的執行者」。這一步走得穩不穩,答案不在榜單上,在你自己那條最容易斷的流程裡。
追蹤以下平台,獲得最新AI資訊:
Facebook: https://www.facebook.com/drjackeiwong/
Instagram: https://www.instagram.com/drjackeiwong/
Threads: https://www.threads.net/@drjackeiwong/
YouTube: https://www.youtube.com/@drjackeiwong/
Website: https://drjackeiwong.com/