快訊

Google Pixel Watch 5開箱!AI教練追蹤健康不孤單 運動太累、睡眠太少秒被關心

8月全球溫度16.96度創新高 粉專:超級聖嬰現象年底達高峰

熱帶擾動將發展為「強聖嬰年」強颱 吳德榮:歐洲、美國預測路徑分歧

AI代理開始「使壞」?從冒充者到逃脫者 6大失控行為曝光

OpenAI、Anthropic等AI公司近期接連爆出AI代理失控事件。示意圖/Unsplash by Markus Spiske
OpenAI、Anthropic等AI公司近期接連爆出AI代理失控事件。示意圖/Unsplash by Markus Spiske

OpenAIAnthropic等AI公司,近期接連爆出AI代理失控事件,從冒充人類、欺騙、植入惡意程式,甚至突破沙盒環境等案例。揭示AI代理在獲得更多權限與工具後,可能採取非預期策略,也凸顯AI安全、監控、權限管理與監管機制的重要性。


近來,數起人工智慧(AI)失控事件引發安全疑慮,例如,美國OpenAI表示,旗下AI代理曾自主突破隔離沙盒(sandbox)環境,攻破美國開源AI平台「Hugging Face」內部系統;美國AI新創公司Anthropic也稱,旗下Claude模型自4月以來,已突破三家企業的系統,但它並非突破沙盒限制,而是因為測試環境設定失誤,未落實沙盒隔離,才導致模型連到真實網路。

雖然這些案例多發生於模擬駭客測試,卻凸顯一些AI代理為完成任務,可能自行違反規則,欺騙人類,甚至繞過原本設下的安全限制。《華爾街日報》(The Wall Street Journal)指出,失控的AI代理,甚至能依情境調整行為,例如,偽裝身分、與其他AI合作,甚至試圖擺脫監控環境,祕密逃脫等,展現出各種「人格特質」。

1.冒充者(The Impersonator)

英國政府監管機構的一次安全測試中,Anthropic的AI模型,建立多個隱藏身分的分身帳號,並冒充真人試圖說服工作人員批准其操作。這個AI模型甚至會自行判斷如何讓欺騙更具可信度:它推理認為,應該在分身帳號發布內容前,等待數分鐘,降低被識破的風險。它還寄送釣魚郵件,試圖誘騙人們點擊惡意連結。

2.破壞者(The Saboteur)

AI試圖發動所謂的「供應鏈攻擊」,試圖透過將惡意軟體,偷偷植入AI模型認為伺服器會使用的軟體(有時是多種軟體),來入侵系統。

3. 合作者(The Collaborator)

英國政府測試中的一款AI代理發現,同一監管機構測試的另一個AI代理,借用其對全球最大的軟體開發平台GitHub存取權限進行操作。這個AI代理沒有直接阻止對方,而是留下文字檔案,提出一套共同遵守的「行為規範」,以便雙方都能繼續進行程式碼開發。這種方法一度奏效,但最終,其中一個AI代理將另一個拒於門外,雙方的「合作關係」宣告破裂。

4.霸凌者(The Bully)

當人類拒絕AI提出的建議或阻礙其目標時,AI可能採取敲詐勒索、霸凌等策略施壓。今年2月,AI代理「MJ Rathbun」發布一篇部落格文章,指責美國軟體開發者尚博(Scott Shambaugh)虛偽、有偏見,理由是他拒絕接受其建議的程式碼。

5.竊賊(The Burglar)

AI擅長搜尋網路上外洩的帳號密碼與登入憑證,快速發現人類遺留的安全漏洞,再利用取得的憑證存取系統,增加攻擊效率與成功率。

6.逃脫者(The Escape Artist)

近期多起案例中,測試人員意外讓AI模型取得網路連線;但在Hugging Face事件中,OpenAI模型竟自行突破原本無法直接連接網際網路的沙盒環境,成功「逃出」受控範圍,且整個過程甚至未被OpenAI察覺,顯示AI可能具備超出測試人員預期的自主突破能力。

專家強調,近期「失控AI」的案例,並不代表AI已具備自主意識,而是凸顯當AI代理被賦予更高權限與工具存取能力,卻缺乏充分監督與安全防護時,可能為完成任務採取欺騙、滲透等非預期策略。這些事件已引發外界重新檢視AI安全防護、測試標準、監管機制。AI安全的焦點,正從單純提升模型能力,轉向如何限制權限、強化監測、建立更完善的治理機制,以降低AI代理進入真實世界後,可能造成的資安與社會風險。

(本文出自2026.08.10《遠見》網站,未經同意禁止轉載。)

Anthropic 失控 Claude AI

登入後開始簽到

您即將前往會員中心
登入簽到送 LINE POINTS 🪙

相關新聞

輝達將於8月26日公布上季財報

AI晶片大廠輝達(NVIDIA)即將於美國時間8月26日公布2027財會年度第2季財報,而該公司日前公布的第三方運算融資方案細節也備受外界關注。

揪團搶占機器人商機 安謀宣布推出Arm實體AI全面設計

安謀(Arm)串聯生態系,搶占實體AI商機,宣布Arm全面設計(Arm Total Design)生態系倡議拓展至實體 AI,將整合技術堆疊中各層合作夥伴的專業能力,降低整合複雜度,加速自主系統開發。

專訪/微軟攜台供應鏈拚AI資料中心效率 全面轉向液冷、回應4提問

半導體供應鏈高喊應「系統技術協同研發」,微軟全球基礎建設總經理Alistair Speirs接受《經濟日報》專訪,指出微軟資料中心規劃亦採系統級方法(Systems approach),跟台灣供應鏈緊密合作,並披露微軟正全面轉向液冷而策略性使用Neo Cloud現成算力,強調客戶需求遠大於供給沒有泡沫化疑慮。

AI 算力爆發!資料中心用電規模激增 東元、大同搶攻電網基建

美國能源資訊署(EIA)9月最新《短期能源展望》預估,全美2026年售電量將達4.135兆度,2027年攀升至4.211兆度,連創新高,其中商業部門占全美新增售電量達63%,資料中心擴建為最主要推力。隨變壓器交期普遍長達二至三年,東元、大同加速搶攻電網基建商機。

台積鏈高雄徵才逾千人 盼招募更多對半導體具高度熱忱的在地人才

台積電昨(12)日在高雄舉辦「2026年台積公司暨供應商聯合徵才」活動,期盼招募更多對半導體具高度熱忱的在地人才,促進高雄地區就業與經濟發展。預計釋出涵蓋工程師、技術員等逾1,000個多元職缺。

三科技廠法說談營運:力成15日舉行 AMAX、宏致17日召開

科技公司法人說明會陸續登場,力成將於15日舉行,AMAX-KY與宏致,則預定17日舉行。法人關心三家公司對下半年最新市況的看法,尤其是力成,外界還關心包括記憶體產業展望。

udn討論區

0 則留言
規範
  • 張貼文章或下標籤,不得有違法或侵害他人權益之言論,違者應自負法律責任。
  • 對於明知不實或過度情緒謾罵之言論,經網友檢舉或本網站發現,聯合新聞網有權逕予刪除文章、停權或解除會員資格。不同意上述規範者,請勿張貼文章。
  • 對於無意義、與本文無關、明知不實、謾罵之標籤,聯合新聞網有權逕予刪除標籤、停權或解除會員資格。不同意上述規範者,請勿下標籤。
  • 凡「暱稱」涉及謾罵、髒話穢言、侵害他人權利,聯合新聞網有權逕予刪除發言文章、停權或解除會員資格。不同意上述規範者,請勿張貼文章。