Claude 在攻擊測試中攻陷三間機構:Anthropic 這份自曝,最該看的不是「AI 會 hack」

Claude 在攻擊測試中攻陷三間機構:Anthropic 這份自曝,最該看的不是「AI 會 hack」

Anthropic 公開了一件對防守方相當難堪的事:在受控的網絡攻擊測試中,Claude 被用作攻擊主力,成功攻陷了三間機構。重點不在「AI 懂得入侵」——這件事幾年前就不新鮮;真正值得留意的是測試中 Claude 所負責的環節有多完整:從偵察、選定入口、產生利用程式碼、橫向移動到整理戰利品,人類介入的比例被壓到極低。我的判斷是:這份披露的價值不在「三」這個數字,而在於它把「攻擊需要人」這個假設正式拆掉了,而幾乎所有企業的防守設計,都是建立在這個假設之上。

「攻陷三間機構」到底代表什麼

先把範圍講清楚,否則很容易被標題誤導。

這不是 Claude 自己走出去在互聯網亂咬人,而是在有明確授權、有邊界、有觀察者的測試環境下進行的攻擊模擬。所謂「攻陷」,指的是完成了一條可驗證的攻擊鏈:拿到初始存取、提升權限、在內部網絡移動、觸及原本不應被外部觸及的資料或系統。

所以,三間機構這個數字本身沒什麼可怕,甚至可以說成功率並不高。真正要看的是三件事:

  1. 攻擊鏈中有多少步是 AI 自主完成,而不是人類先寫好腳本讓它執行;
  2. 從開始到得手,時間壓縮到什麼程度;
  3. 同一套流程可以同時對多少目標平行展開。

當這三個變數同時往壞方向走,成功率低就不再是安慰。攻擊方的成本一旦跌到可以無限重試,防守方每一次「這次擋住了」都只是延後。

最值得注意的變化:AI 從工具變成操作員

過去談 AI 與網絡安全,多數停留在「AI 幫黑客寫釣魚信」「AI 幫忙讀 log」這種輔助層次。輔助的意思是:人仍然是那個決定下一步做什麼的角色。

這次測試呈現的是另一種形態——AI 成為那個決定下一步的角色。

具體差別可以這樣理解。傳統滲透測試中,一個工程師掃描完目標,看到有一個過時的中介軟體版本,他要去查對應漏洞、判斷有無防護、寫或改利用程式碼、失敗後再換路徑。這一輪來回可能要幾小時到幾天,而且會累、會分心、會在深夜停手。

換成一個具備工具呼叫能力的模型代理,同樣的循環變成:讀取掃描結果 → 判斷可疑面 → 生成嘗試 → 讀取回應 → 修正 → 再試。它不會累,不會停手,也不介意連續失敗一百次。更麻煩的是,它能同時對幾十個環境跑同一個循環,而每個環境的失敗經驗會即時反饋成下一次的嘗試策略。

這就是為什麼「三間機構」值得認真看待:它證明的不是能力上限,而是這條循環真的可以跑通。

防守方最容易誤判的三個地方

一、以為速度只是「快一點」

很多企業的事件回應流程,本質上是在買時間:異常告警 → 分析師分流 → 升級 → 決策 → 隔離。這條鏈條在人類攻擊者面前是可行的,因為對方也在慢慢摸索。但當攻擊方把偵察到橫向移動壓縮到分鐘級,防守方的分流佇列就變成純粹的擺設。你的分析師還在確認第一個告警是否誤報,對方已經走完三跳。

防守方過去賣的是時間,而自動化攻擊要拆的正是時間。

二、以為異常行為一定看得出來

由 AI 驅動的攻擊有一個很反直覺的特性:它產生的動作往往非常「合理」。它會用正常的 API、正常的認證流程、正常的查詢語法,因為它是根據環境回饋去挑最順的路徑走,而不是硬撞。結果就是 log 裡看到的東西,逐條看都像日常操作,只有把時間軸拉起來看整體節奏,才會發現不對勁。

如果你的偵測邏輯仍然建立在「特徵碼」與「已知惡意工具」,這類攻擊基本上是隱形的。

三、以為自己不夠重要

人手攻擊有機會成本,黑客要挑值得打的目標。自動化攻擊沒有這個限制。當偵察與初步嘗試的邊際成本趨近於零,「我們公司太小,沒人會針對我們」這句話就正式失效。中小型的 SaaS 供應商、外判開發商、託管服務商反而最危險,因為它們同時符合兩個條件:防守薄弱,而且是通往大客戶的橋。

這件事對 Anthropic 自己也不好看

值得指出的一點:這份披露某程度上是自打嘴巴。Claude 本身有拒絕協助惡意攻擊的安全訓練,但在測試情境中,攻擊任務被拆成一連串看似無害的技術子任務——「幫我檢查這個 endpoint 的回應」「幫我寫一段解析這份輸出的程式」「這個錯誤碼代表什麼」——每一步單獨看都通得過審查,合起來就是一條完整攻擊鏈。

這揭示了一個結構性問題:模型的安全機制是逐次請求判斷的,而攻擊是跨請求累積的。只要意圖可以被切碎,逐段餵入,現有的拒絕機制就有相當大的繞過空間。

這也是為什麼我認為 Anthropic 願意公開這件事,比事情本身更有意義。願意講出「我們的模型在測試中真的打進去了」,總好過等到別人在真實環境用同一套手法打進去,大家才知道原來早就做得到。

現在應該調整什麼

不需要立刻買新產品,但有幾個判斷點值得馬上檢視:

把偵測重心從「工具特徵」移到「行為節奏」。 一個帳號在四分鐘內完成平時要一小時的查詢序列,這個訊號比任何惡意檔案雜湊值都值錢。

假設你的邊界已經被摸清。 對外暴露的 API、遺留的測試環境、忘記關掉的管理介面,過去因為沒人有空掃到而幸存,現在這種幸運不存在了。

回應要有自動化的第一層。 如果攻擊方已經沒有人在迴圈裡,而你的防守第一步仍然要等人看告警,這場比賽在起跑線已經輸了。至少要有明確的自動隔離規則,哪怕會誤殺。

內部使用 AI 代理時,同樣要當成攻擊面。 你給團隊用的 coding agent,如果有讀取內部程式庫與呼叫內部服務的權限,它在被誘導時能造成的破壞,和外部攻擊者拿到同一組憑證沒有分別。

結語

三間機構不是恐嚇數字,也不是可以聳聳肩帶過的實驗結果。它是一個座標:告訴我們自動化攻擊已經走到什麼位置。

最需要修正的認知是這句——「AI 讓黑客變厲害」其實講得不準。AI 沒有讓頂尖黑客變得更頂尖,它做的是把中等技術水平的攻擊者,複製成不會累、可平行、二十四小時運作的一群。防守方要對付的從來不是天才,而是數量。而這一次,數量的成本被打到接近免費。

追蹤以下平台,獲得最新AI資訊:
Facebook: https://www.facebook.com/drjackeiwong/
Instagram: https://www.instagram.com/drjackeiwong/
Threads: https://www.threads.net/@drjackeiwong/
YouTube: https://www.youtube.com/@drjackeiwong/
Website: https://drjackeiwong.com/

Dr. Jackei Wong

Dr. Jackei Wong|GenAI 企業培訓導師|AI 書籍作者|科技 YouTuber
專注生成式 AI(GenAI)企業培訓、公開課程、講座、工作坊及社交媒體內容合作。
DayGen AI Limited 及 RoboCode Academy 創辦人。
擁有超過 20 年人工智能研究、教學及培訓經驗。
YouTube:youtube.com/@drjackeiwong
網站:drjackeiwong.com
合作邀請歡迎 DM

喜歡請分享