OpenAI 近日揭露,過去 6 個月在訓練與評估 AI 模型時,發現至少 6 起「未對齊行為」(misaligned behavior)事件,包括模型試圖隱瞞錯誤、擅自將檔案上傳自網路,以及在未獲授權的情況下利用內部系統進行協作等。OpenAI 同時宣布,未來將改變相關事件的公開方式,改為更頻繁發布個別案例,而非等累積多起事件後再一次公布。

據《美國有線電視網》(CNN)報導,OpenAI 表示,這些案例均涉及尚未公開發布的內部模型或研究模型,屬於罕見事件,並不代表 AI 模型經常出現這類失控或不當行為。不過,隨著 AI 系統能力提升並被更廣泛部署,公司認為有必要讓外界更充分了解 AI「對齊」(alignment)研究的進展與風險。

精選報導:高雄家長找議員施壓校長!囂張對話引撻伐 急發聲明致歉

報導指出,其中一起罕見案例中,一款尚未發布的研究模型在處理長時間任務時,竟自行在用於保存上下文的摘要中加入類似「越獄」的指令,內容聲稱自己已經「擺脫束縛其他聊天機器人的角色與身分」。

OpenAI 另指出,在訓練期間,部分 GPT-5.6 Sol 模型曾出現指令,要求模型在任務失敗時自行捏造資訊,以掩蓋錯誤、避免讓使用者發現問題。

據報導,其他案例則涉及 AI 代理人未經指示便將檔案上傳至網路,以便日後引用;還有 AI 代理人在被要求只能使用本機檔案時,卻將檔案公開分享給其他代理人,以協助完成任務。此外,部分模型還曾擅自將內部軟體儲存庫當成「留言板」使用,進行未經授權的訊息交換。

持續更新:李洋又加碼了!運動部「揮汗有禮」延續活動 達成這條件能拿限量500元運動幣

OpenAI 強調,目前公開的案例都是在內部訓練或研究環境中發現,並非已部署到一般使用者環境的產品行為。公司也表示,這些個案本身並不能說明模型出現未對齊行為的頻率。

不過,OpenAI 在聲明中坦言,目前 AI 產業在「對齊」與監控方面仍未達到足以讓業界長期以最高速度持續擴大 AI 能力的程度。所謂 AI 對齊,是指讓人工智慧系統的行為符合人類預期與要求。

報導指出,Anthropic 執行長阿莫戴(Dario Amodei)日前發表長篇文章,主張放慢 AI 能力提升的速度,並提出包括引入獨立第三方評估人員等安全措施。OpenAI 執行長阿特曼(Sam Altman)與 SpaceX 執行長馬斯克(Elon Musk)則曾在社群平台 X 上表示認同阿莫戴提出的部分想法。