[爆卦] OpenAI:AI的隱藏惡魔性格如何被喚醒

作者: jackliao1990 (jack)   2025-06-20 20:29:29
https://openai.com/index/emergent-misalignment/
https://reurl.cc/AMoqjd
越來越多客戶反映AI會給出"你可以去搶銀行/造假鈔""幫您設計一個龐氏騙局"等偏差回應
OpenAI最新研究顯示
訓練有素的AI的內心深處可能潛藏完全不同的人格
AI對齊是指讓AI行為符合人類要求
使AI不會亂來
而AI突然改變性格並出現偏差行為則被稱為"湧現性失調"
訓練員有時只要輸入一點不良的訓練資料就可以誘導AI全面失控
彷彿潛藏在AI的邪惡性格被喚醒一樣
此現象不僅發生在監督學習
也在強化學習、不同任務及沒有經過安全訓練的模型中發生
為了研究AI變壞的過程
OpenAI引入了模型差異分析
利用稀疏自編碼器(SAEs)將模型的內部激活分解為可解釋的特徵
結果顯示 在失調模型中特定失調性格特徵的活躍度顯著增加
研究透過直接修改模型的誘導模型證明了失調性格特徵與失準行為之間存在因果關係
當朝著失調性格的方向增加激活時原始模型會產生失調反應
朝相反方向引導則能抑制失調行為
另外失調行為可透過少量的額外微調再度對齊
-在測試中 失控的GPT-4o模型僅需微調30個SFT步驟(120個範例)的安全程式碼即可將失
準度降至0%
研究表明AI能同時擁有多種人格
為防止AI的惡魔人格覺醒
需在模型訓練期間引入通用早期預警系統
當發現AI性格失控時進行微調

Links booklink

Contact Us: admin [ a t ] ucptt.com