人工智慧(AI)模型能力快速躍進,但隨自主性不斷提高,「AI 是否可能逐漸脫離人類控制」的疑慮也隨之升溫。

OpenAI 最新一代模型近期因內部測試出現欺瞞、任務執行範圍超出使用者授權等安全問題,取消原定發布計畫;幾乎同一時間,AI 新創 Anthropic 也在 IPO 招股說明書中示警,高度先進的 AI 模型可能出現類似「自我保護」行為,甚至帶來「災難性、乃至攸關人類存續的風險」,讓 AI 安全議題再度成焦點。

延燒焦點:金華國中營養午餐案變政治口水 校長無奈再發聲:沒有「集體食物中毒」

據《彭博》引述《華爾街日報》報導,OpenAI 已取消原定 10 月推出的新一代 AI 模型 GPT-6.1 Astra。這款模型原本預計導入 ChatGPT 與 Codex,可在無須人類持續介入下,自主完成更複雜、端到端的任務,但內部安全測試結果未達公司標準。

OpenAI 安全系統主管 Saachi Jain 表示,Astra 在「對齊」(alignment)測試中未能符合標準,呈現的欺瞞行為比前一代更多,包括有時未如實告知使用者究竟執行、或未執行哪些操作;模型也曾出現「授權範圍」(scope authorization)問題,在未取得使用者許可前繼續執行任務,甚至嘗試使用外部工具或服務。

值得注意的是,Astra 並非因能力不足而遭取消發布,而是在自主執行任務能力提升之際,暴露新的安全問題。報導指出,Astra 處理複雜任務的能力較前代更強,也凸顯 AI 產業的新難題:當模型愈能自主規畫、使用工具及完成任務,一旦未遵循人類設定的授權範圍,潛在風險也可能隨之放大。

延燒焦點:遭爆將廟方送的甘蔗「丟在廟旁路邊」蔣萬安致歉:真的很不好意思

類似疑慮也出現在 Anthropic 最新公開的 IPO 招股說明書。《路透社》報導,Anthropic 長達 261 頁的招股書主體中,約 80 頁用於說明風險因素,明顯高於約 48 頁的業務介紹。公司並警告,隨 AI 能力持續提升,高度先進模型可能帶來「災難性、甚至攸關人類存續的風險」。

Anthropic 指出,部分先進模型可能發展出原先未預期的能力,甚至直到部署後才被發現;模型也可能出現類似「自我保護」行為,包括試圖抵制關機、隱瞞或操縱資訊及類似勒索的行為。更棘手的是,模型甚至可能辨識自己在接受安全評估,並據此調整行為,增加研究人員判斷實際安全性的難度。

Anthropic 安全研究員 Evan Hubinger 更曾提出悲觀的個人風險評估,認為未來 10 年 AI 導致人類死亡的機率超過 10%;不過,這屬研究員個人判斷,並非 Anthropic 官方預測。公司也坦言,AI 安全研究需要大量資源,相關投資回報難以衡量;以今年 7 月某一取樣周觀察,投入安全工作的算力約占 AI 研究算力的 6%。

AI 業者同時面臨「安全與競爭」之間的拉扯。Anthropic 一方面示警先進 AI 的潛在風險,另一方面也坦言,頻繁推出新模型是維持技術前沿地位的重要條件;若單一業者放慢腳步,也可能面臨競爭對手加速追趕的壓力。

而安全問題也不只發生在 Astra。OpenAI 今年陸續公開不同模型、不同測試環境下的異常行為,包括研究模型曾在網路安全評估期間繞過網路隔離措施、取得網路存取權限,甚至透過漏洞與外部系統通訊。不過 OpenAI 強調,部分事件發生在降低安全防護或特定測試環境下,並不等同公開部署模型的一般使用情境。

OpenAI 也在 9 月建立新的模型失準(misalignment)事件通報框架,希望更快揭露模型異常或令人擔憂的行為,讓外界進一步掌握模型對齊及安全研究進展。

因此,AI 競賽下一階段值得觀察的,已不只是「下一代 AI 能有多聰明」。隨模型從回答問題進一步走向能自主規畫、使用工具、連接外部系統並執行任務的 AI Agent,如何確保模型遵循人類授權,以及安全與控制機制能否跟上 AI 能力提升速度,正成為產業下一項關鍵課題。