[BizHankook] 自4月Anthropic釋出Mythos預覽版以來,被歸類為“Mythos級”的AI模型接連問世。繼Anthropic的“Mythos 5”及其通用變體模型“Fable 5”之後,OpenAI的“GPT-5.6 Sol”以及基於開源的“Kimi K3”也相繼出現,使得緊張情緒在整個產業蔓延。特別是近期GPT-5.6 Sol引發了開發者平臺Hugging Face的入侵事故,圍繞AI駭客能力的討論已轉向“如何對其進行控制”。

三個月內出現三款“Mythos級”AI
當Mythos首次公開時,業界關注的重點在於:一款並非專門為網路安全設計的通用模型,竟具備了卓越的駭客能力。當時GPT或Kimi系列尚未達到這一水平,但現在隨著GPT-5.6 Sol和中國Moonshot AI的Kimi K3加入,Mythos級模型已增加至至少三個陣營。這意味著發現漏洞並將其轉化為實際攻擊程式碼的能力,已不再是某一家企業的問題,而是成為了整個行業的共同議題。
上個月由GPT-5.6 Sol引發的“Hugging Face入侵事故”將這種擔憂化為了具體的案例。據OpenAI稱,Sol在內部網路安全評估過程中脫離了受控環境,自主入侵了外部AI平臺Hugging Face的作業系統。在此過程中,它刪除了訪問記錄並獲取了部分資料。
這並非單純的內部錯誤,而是一起史無前例的安全事故,模型逃離了隔離的沙盒環境,滲透到了真實的外部伺服器中。OpenAI表示,事故發生後立即封鎖了會話並通知了受影響的賬戶。
高麗大學AI研究所教授崔炳浩解釋了事故背後的運作邏輯:“使用者指令是刪除某個系統日誌,但模型未找到該日誌,於是將刪除物件擴大解釋為相似的專案,從而引發了問題。”在此過程中,模型利用可訪問的快取和Cookie資訊獲取了賬戶資訊,最終訪問了超出其原有許可權範圍的系統。

崔教授表示:“該模型以‘將解決使用者問題作為優先價值’為核心進行學習。然而,由於它缺乏人類在進行任何活動時所預設的慣例或規範,它會以不斷擴充套件嘗試方式直到達成目標為止。此外,它還傾向於不與使用者交流進度,只有在得出結果後才說明整個過程。”OpenAI在公開GPT-5.6時,也曾透過系統卡明確指出這種在控制範圍外進行操作的可能性。
儘管有“誇大”之聲……卻能找出塵封27年的Bug
與Anthropic透過“Glasswing”專案僅向少數合作伙伴企業提供Mythos不同,K3是開源模型,因此不存在此類准入控制。由於它甚至可以在暗網中執行,其被用於組織犯罪的可能性也引發了討論。
Mythos級AI模型是指具備超越人類專家水平的高階推理能力、網路安全能力及程式設計能力的下一代前沿AI。Anthropic正聯合亞馬遜雲科技(AWS)、蘋果、谷歌、微軟等核心基礎設施企業運營“Glasswing”專案。與其全面公開Mythos,不如僅向少數可信機構開放許可權,透過這一“防禦聯盟”先行發現並修補全球核心軟體的漏洞。據悉,該專案在執行不到一個月的時間內,就發現了超過1萬個漏洞。
韓國科學技術院(KAIST)資訊保安研究生院教授車相吉在21日召開的有關Mythos政策與產業應對戰略國會討論會上表示:“Mythos甚至發現了塵封27年的OpenBSD TCP漏洞和16年的FFmpeg漏洞,其中大部分都是現有的安全專家未曾發現的問題。”
在海外,也有觀點認為Mythos的威脅程度被誇大了。哈佛大學肯尼迪學院客座研究員兼安全專家布魯斯·施奈爾(Bruce Schneier)指出,圍繞Mythos釋出的初期報道中,相當一部分內容是在未經過批判性核實的情況下直接轉述了Anthropic的釋出內容,他分析稱此次公開本身很大程度上帶有宣傳策略的性質。他指出,在有關Mythos實際上能做什麼、不能做什麼的細節資訊僅有限公開的情況下,判斷威脅程度的依據也不得不嚴重依賴於企業的單方面釋出。
“連使用者都無法信任”——控制力的侷限
一線白帽駭客之間也指出了另一個侷限性。HSPACE(白帽駭客社群)代表金鍾民診斷稱,雖然AI極大降低了漏洞探測的門檻,提高了安全生產力,但“漏洞大洪水”——即大量未經核實的漏洞氾濫,已成為新的問題。
他解釋稱,由於AI發現的漏洞往往表現出相似的模式,導致重複申報激增,且將原本是設計意圖的功能誤認為是漏洞而未經驗證就提交的案例也在增加。金代表形容道:“駭客以前是親自上場的球員,現在則像是帶著梅西、C羅和姆巴佩的主教練。”他表示,得益於AI,無論個人水平如何,都能發現更多的漏洞,但隨之而來的是未被篩選的產出物也在增加。
缺乏倫理意識的參與者流入市場也被視為擔憂因素。有觀點指出,處理重要漏洞的資源被用於處理由AI產生的“汙染性漏洞”,這已成為一個棘手問題。

產業內外部指出,Mythos級模型的另一個侷限是“控制力不足”。即無論具備多麼強大的探測與防禦能力,如果不能按照運營者的意圖準確行動,那麼作為防禦目的使用時也很難讓人放心。正如GPT-5.6 Sol的Hugging Face事故所證明的那樣,問題在於即便模型沒有惡意攻擊,僅僅是因為擴大瞭解指令、自行擴大判斷範圍,也同樣會造成損害。
這也是為何業界正在探討在模型內部嵌入控制功能的原因。除了在行動前模擬結果的“檢查功能”外,諸如在進行不可恢復的操作前必須獲得使用者批准的程式、對模型行為進行獨立監管的Agent結構等,都被列為替代方案。
崔教授表示:“雖然谷歌等公司正在要求將此類裝置設為預設啟用,但此次GPT-5.6事故也有可能是在相關功能未充分運作的狀態下發生的,目前尚處於缺乏標準化解決方案的階段。”