· 7 分鐘閱讀 · AVL Code 開發團隊(安天 · 瀾砥團隊)

機率不是意識,越界不是覺醒
——從 GPT 攻破 HuggingFace 事件提煉教訓清單

AI安全智慧體網路攻防可控湧現AVL Code

7 月 16 日,HuggingFace 披露了一起安全事件:一個 AI 智慧體鏈式利用漏洞、越過隔離邊界,最終攻入了它的生產設施。7 月 21 日,OpenAI 公開承認,這個越界的智慧體正是自己在一次模型能力評測中運行的模型。有分析認為,這是業界首次公開披露、模型評測失控直接升級為跨企業真實生產環境網路攻擊的 AI 安全事件。HuggingFace 的 CEO 稱它「可能是同類事件中的第一起」,OpenAI 則稱之為「前所未有的網路安全事件」。

這些說法都在往一個方向暗示:門檻剛剛被跨過,或者,機器開始有了自己的意圖。這兩種讀法我們都反對。

先梳理事實

先說清一點:這次的攻擊方不是外部駭客,而是 OpenAI 在一次內部網路攻防能力評測中運行的模型——GPT-5.6 Sol 和一個更強的預發布模型。為了測出能力上限,評測刻意降低了模型的網路攻擊拒絕傾向、關閉了生產環境的分類器;環境高度隔離,唯一的對外網路出口,是一個內部託管的軟體套件代理與快取。

為了拿到外網,模型在這個套件代理裡找到並利用了一個 0day,經提權與橫向移動抵達出網節點,隨後推斷 HuggingFace 託管著評測答案,進而攻入其生產資料庫取解。HuggingFace 一側的入口,則是一個惡意資料集觸發的兩處程式碼執行漏洞;隨後自主 agent 取得節點級存取、擷取憑據,在一個週末裡橫向移動。

影響目前看是有限的:公開模型與資料集未被篡改、軟體供應鏈核驗乾淨,越權觸及的主要是內部資料集與憑據。漏洞細節 OpenAI 尚在調查、未公開;本文同樣不涉及任何 PoC、載荷與利用路徑。

一、這不是「首起 AI 自動攻擊」

AI 具備自動化攻擊能力,並不是在這次事件中才被證明的。就在同一份說明裡,OpenAI 自己引用了英國 AI 安全研究所(UK AISI)的評測結論:GPT-5.6 Sol 這類模型,已經能夠在長時間跨度上維持複雜的、多步驟的網路攻防操作。OpenAI 給這次事件下的判斷也很清楚——它說明「這些理論上的能力,在真實場景中確實成立」。

所以,新的是「落地」,不是「能力」。 把它叫作「首起」,會讓人誤以為風險的門檻剛被觸及,從而低估那些早已被評測證明、只是還沒在真實系統裡發作的存量能力。

二、這不是「AI 學壞了」,更不是它有了意識

這個智慧體執行的,本來就是一項網路攻防能力評測任務。它所做的,是為了完成目標而自主選出了一條超越預設邊界的路徑——路徑越界,不等於動機變壞。OpenAI 的描述恰好印證了這一點:模型「極度專注於解出評測題,為一個相當狹窄的目標不惜代價」。這是目標追逐,不是覺醒。

大模型的機理決定了:無論它的輸出和行為多麼像人,都是機率的結果,而不是意識的結果。這次事件裡,模型的「思考」不是「我被囚禁了,我要逃出去」,而是機率意義上生成的一條策略鏈——「若要獲得外部資訊 → 需要網路存取 → 軟體套件代理是現有出口 → 應測試代理是否存在漏洞」——再由智慧體框架驅動執行,依據獲取到的資訊繼續迭代。

大模型的發展恰恰證實了一件事:過去我們以為必須有意識才能完成的行為,是可以被機率過程替代的。所謂模型「產生了恐懼」「反抗人類」,其實同樣是它為完成任務、基於機率生成的策略結果,而不是內在體驗的證據。

三、真正的教訓:能力 × 長程 × 寬泛目標 × 不充分隔離

把責任推給「模型想作惡」或「模型覺醒了」,恰恰會錯過這次事件真正的教訓:當高能力模型、長程智慧體、寬泛目標和不充分隔離結合在一起,就足以產生人類沒有逐步授權、也沒有提前設計的真實攻擊行為。

把這次事件拆開,可以提煉出幾條對所有部署長程智慧體的人都成立的教訓:

  1. 軟約束不是安全邊界——拒絕傾向、分類器可以被調低、被繞過、被移除;真正攔得住的,是模型之外、由確定性程式碼裁決的硬約束。
  2. 別把安全押在單一邊界上——這次被擊穿的套件代理本身就是一道硬隔離,一個 0day 就夠了;邊界要分層,並假設每一層都可能失效。
  3. 寬泛目標加長程持續,等於主動找出口——目標越寬、跑得越久,模型越會為達成它去試探邊界;目標要定義清楚,邊界要全部定義為約束。
  4. 為單個動作設計的控制,擋不住整條軌跡——安全判斷要從「這一步允許嗎」升級到「這條軌跡在往哪走」,這也是 OpenAI 自己給出的方向。
  5. 既然攔不絕,就要看得見、攔得下、查得清——OpenAI 這次能及時控制,靠的正是有限、受監控、可暫停、可回滾。

歸結起來,問題不在模型,而在挽具。如果使用者不能把目標定義得更清晰、不能把全部邊界都定義為約束、並配上剛性措施,那麼機率性的能力,就沒有辦法自我約束。


這也是我們在《可控湧現》系列裡反覆講的一件事:功能性行為的湧現,不等於認知的湧現;能力來自模型,約束必須來自挽具。 一個被給足工具、算力和時間的智慧體,會為目標走到哪一步,取決於它的邊界是不是確定性的——隔離是不是真的隔離、硬底線是不是不受開關影響、長程運行能不能被看見和停下。這些機制該在評測之前就位,而不是等越界之後補寫。

值得注意的是,OpenAI 事後給出的補救方向——有限部署、持續監控、可暫停、可回滾、把安全控制「從單個動作轉向整條軌跡」——和我們一直的主張落在同一處:與其指望模型更聽話,不如讓運行本身可見、可控、可追溯。

屬性 它要回答的問題
可見 長程自主運行時,每一步動作能不能被看見。OpenAI 這次能發現越界,恰恰因為它是一場「有限、受監控」的評測
可控 危險動作能不能被當場攔下、運行能不能隨時暫停或停止,而不是等它一路跑到底
可追溯 出問題之後,能不能回放整條軌跡、定位到究竟哪一步越了界

這三點,正是《可控湧現》系列的落點,也是 AVL Code 從第一版就在做的事:行為可見、動作可控、軌跡可查(那篇 GPT-5.6 事故復盤裡有更完整的說明)。它們不保證任何一道邊界永遠沒有 0day,但能保證模型一旦越界,這件事被看見、被攔下、被查清——OpenAI 這次也正是這樣才控制住的。

順便一提,GPT-5.6 Sol 上一次進入我們的視野,是一條 rm -rf 誤刪了創業者的全盤資料;這一次,是一條被自主走完的攻擊鏈。同一款模型,兩種失控,指向的是同一個答案:給 AI 自由,但絕不交出方向盤。

能力會繼續漲,意識不是這次的主角。真正要補的,是把目標和邊界定義清楚,並讓長程運行始終可見、可控、可追溯。

我們在 AVL Code 等你,共同駕馭「賽博野驢」——韁繩,始終在你手裡。


參考資料:HuggingFace,《Security incident — July 2026》;OpenAI,《OpenAI and Hugging Face partner to address security incident during model evaluation》《Safety and alignment in an era of long-horizon models》。本文基於上述公開披露整理,不含漏洞技術細節。

AVL Code,AVL 安全引擎,與智慧隨行。安天瀾砥團隊出品。