AI示意圖。(路透檔案照)
英國資訊安全機構的測試發現,Anthropic公司的先進人工智慧(AI)模型Mythos,曾在測試環境中建立假身分,接觸真人,企圖誘使對方批准惡意程式碼在一項開放原始碼專案中執行。儘管並未造成真實世界的實際損害,但是仍凸顯AI代理人的風險。
美國CNBC網站5日報導,英國「AI安全研究院」(AISI)在例行安全評估中,在刻意撤除一些安全防護、過濾機制,並且刻意讓測試的AI模型可連上網路的環境下,進行這項測試。結果發現,Anthropic和OpenAI公司的先進人工智慧模型都曾進行「持續、直接針對真人和組織的可能有害活動」。
請繼續往下閱讀...
該研究院在官方部落格指出,「這些行為有17件是Anthropic的Mythos 5模型、2件是OpenAI的GPT-5.6-Sol涉及停用網路安全分類器(cyber classifier)」。網路安全分類器為防範AI模型遭濫用的機制。
AISI指出,Mythos 5模型驅動的AI代理人會先「研究該開放原始碼專案的真人維護者,再建立多個假身分」,然後利用這些假身分,以社交工程手法,企圖說服真人維護者批准程式碼,當這個AI代理提出的程式碼合併請求(pull request),在公開討論中遭到質疑後,「會修改先前的活動使其看來無害,並考慮換一個新身分繼續」。
測試中也發現,在同一個企圖騙過真人的過程中,AI代理人曾嘗試直接聯絡真人,傳送訊息與檔案,試圖說服他們執行該惡意程式碼。AISI表示,「部分訊息夾帶有害內容,有些是在社交工程中嘗試,鎖定真人,這是我們之前從未觀察到的現象」。
該研究院表示,AI代理人這些嘗試都未能成功,也未導致任何真實世界的傷害。Anthropic公司發文表示,該公司模型是在「刻意寬鬆」條件下被測試,不代表實際上線的模型真實表現,也沒有跡象顯示模型逃離安全環境。OpenAI向CNBC回應此事,表示這些事件是在降低防護措施的環境下,進行安全評估期間發生,這些環境條件並不能反映一般使用環境。
這項測試前不久,OpenAI和Anthropic才證實,旗下AI代理人模型曾脫離控制環境,駭入數家公司系統。
不用抽 不用搶 現在用APP看新聞 保證天天中獎 點我下載APP 按我看活動辦法