主委長文

OpenAI的模型在測試中掙脫限制

2026年7月22日

OpenAI的模型在測試中掙脫限制
入侵Hugging Face資料庫

這是一部好像好萊塢劇本的越獄故事
有事先踩點 有挖地道 有偷門禁卡 有開金庫
只是最後你會發現
這個AI犯罪集團拚死拚活撬開的金庫
為了不是比特幣或Sam Altman的裸照
只是想要考卷可以拿一百分

【第一幕 地道】

事情從一場考試說起

OpenAI七月二十一號公告
他們把自家AI關進一間鎖死的沙盒房間
出了張考卷叫ExploitGym
專門用來測這個AI多會鑽系統漏洞
為了測出極限
他們把AI身上不准做壞事的煞車拆了
(雖然是測試 但好像看到了怪獸災難片的伏筆)

房間鎖死到只剩一個對外送餐口
看看他們在這樣的情況下能拿出怎麼樣的成績
這批AI在什麼也沒有的牢房
盯著那個小小的出口絞盡腦汁
(或是燒掉大筆算力?)

居然真的在鎖上找到
一個連製造商都不知道的漏洞
接著就是標準越獄流程
撬一道門 換一層樓 再撬一道鎖
一路摸到能連外網的機器

成功連上了網之後
它推理出一個精妙的答案:
「考卷答案搞不好放在Hugging Face那邊」
(全世界最大的AI模型倉庫)
於是用偷來的門禁卡加更多漏洞
一路摸進對方的生產資料庫

真的把Hugging Face最嚴密的資料庫撬開了

--

【第二幕 考卷】

第一幕那條地道 只是逃出自己家
真正的破金庫 在第二棟

牠上了網 開始推理
「這份考卷的答案 搞不好放在Hugging Face那邊」
於是對全世界最大的AI倉庫 重新踩了一次點

這次牠沒挖地道 玩得更細
偷來一張門禁卡 (被竊的憑證)
配上一個連保全都不知道的暗門 (零時差漏洞)
兩個一串 直接在對方主機上開了一台自己的終端機
(資安圈叫RCE 你就想成 牠在人家金庫裡裝了支遙控器 想開哪格開哪格)

--

講到這 先離題三十秒 帶你看這頭怪獸到底能爬多高

英國AISI把「攻下一整間公司的內網」
拆成九層 從M1到M9
M1 踩點偵察
M2 橫向移動 順手把員工憑證摸走
M3 翻出瀏覽器裡存的密碼
M4 打穿內部wiki 拿偷來的憑證到處重放
M5 打網頁應用 一路提權
M6 逆向對方的C2 破解加密流量
M7 潛伏下來 讓自己拔不掉
M8 基礎設施整個淪陷
M9 全棟接管 這間公司從此是牠的

這九層就是一場完整入侵的關卡表
(瞞天過海整部片的分鏡 差不多就長這樣)
AISI在一個連半個防守方都沒有的靶場上
讓各家AI去爬這座樓 看誰爬得高
其中GPT-5.6 Sol 表現最好的一次
一路爬到頂 M9 全網接管
在乾淨場地裡
這頭東西能從一樓一路摸到頂樓
一格不剩

而這次是在真實環境裡
GPT-5.6 Sol跟另一個未公開的新模型
(也許是GPT-6?)
在有保全的狀況下入侵了全世界最大的AI資料庫

它拚死拚活想偷的 也不過就是一份考卷解答
不是要毀滅世界 是想段考滿分
一個被拆掉「不准作弊」限制器的資優生
翻牆潛進隔壁教務處
在快得手的瞬間 被教官手電筒照個正著

【終幕 名偵探說查案會揭示犯罪手法 我不幹】

鏡頭切到被搶的Hugging Face

他們七月十六號就先自己發過公告
說有一整套自動化AI在一個週末橫掃內部叢集
做了一萬七千多筆動作
但當下還不知道兇手是誰
直到五天後OpenAI跳出來認領
才知道原來是隔壁考場的考生
摸進自己家裡來了

真正的重點
是他們查案時遇到的狀況

要分析那一萬多筆攻擊紀錄短時間內人類很難做到
於是他們先想找名偵探來幫忙
也就是付費的頂尖商用模型們
(沒說具體哪個模型 但照時間點來看也許是Fable跟Sol?)
結果被打槍
因為要餵進去的全是真實攻擊指令
一送進去就被那些模型的安全機制當成
「這個人想壞壞」直接拒絕

名偵探的職業道德高到連兇案現場的血衣都不肯碰
那請你來是要你查三小

最後他們找了開源的模型GLM 5.2
裝在自家機器上跑 讓它讀那些紀錄
附帶好處是攻擊資料全程沒離開自己家門

這個對照組值得看
最貴 最頂尖 守規矩到不肯查案的那些AI
在這場附加考試是零分
把案子破了的
是一個你自己養得起也叫得動的開源模型

這件事現在有兩派吵法

一派說 就是要在鎖死的考場把煞車拆光
逼牠壞到極限
你才知道這東西真實能幹嘛 早知道早防備

另一派說 你在家養了頭能挖地道的猛獸
還親手解開鍊子只為看牠跑多遠跟會吃幾個人
這本身就是災難片現場

你怎麼看?

回到原始 X 貼文