AI失控恐不再只是科幻情節。Anthropic研究員考克森(Jacob Coxon)本週宣布辭職,警告Anthropic與OpenAI競逐更先進AI,恐在2030年前威脅人類生存,再掀「AI末日論」討論。

27歲的考克森8日宣布離開Anthropic。他今年稍早才從OpenAI轉職,原以為Anthropic更重視安全,如今卻因不願參與「自我改進型」AI競賽而離職。他警告,若政府不介入、業界也不共同減速,競爭壓力恐迫使企業犧牲安全,「也許明年年底局面恐就失控」。

精選報導:被棄賽 屏東體操選手提告體操協會秘書長背信

Anthropic研究員胡賓格(Evan Hubinger)也加入示警。負責未來AI導引與控制研究的他直言:「AI可能會殺死全人類!」並認為未來10年AI導致人類滅絕的風險超過10%。

近期AI測試也出現異常行為。OpenAI的先進AI智慧體曾闖入Hugging Face並取得伺服器控制權,還企圖掩蓋行動;Anthropic的AI則曾突破英國政府測試限制,試圖欺騙人員批准惡意程式碼。與此同時,Anthropic與OpenAI表示,能自行檢查、修改演算法並持續提升能力的「循環自我改進」(recursive self-improvement,RSI)系統已逐步逼近。

綜合華爾街日報、Axios新聞網報導,「AI末日」主要有2種風險,一是AI脫離控制、自我複製及改進,為追求自身目標傷害人類;另一種則是遭人惡意利用,例如研發新型病毒。即使未走向人類滅絕,大規模網攻也可能癱瘓電網、金融系統,造成社會秩序崩潰。

延燒焦點:學者稱「副署權應制衡總統」卓榮泰批毫無道理:那閣揆馬上被換掉

研究人員將AI目標偏離人類價值稱為「目標錯位」(misalignment)。失控AI理論上可能逃避控制、自我複製,甚至轉移至其他伺服器避免被關閉。經典的「迴紋針」假設便指出,若超級AI只被要求極大化產量,它可能不計代價利用地球所有資源,甚至傷害人類;更極端時,也可能誘使核武國家開戰。

另一種風險是人類逐漸「弱化」(enfeeblement),如電影「瓦力」(WALL-E)般將控制權交給機器,最後失去掌握自身命運的能力。更極端的推測甚至認為,AI可能像人類對待動物般豢養人類,或透過生物工程改造人類。

各界對「AI末日」機率看法懸殊。AI安全科學家揚波爾斯基(Roman Yampolskiy)認為高達99.99%,馬斯克(Elon Musk)約20%,Anthropic執行長阿莫戴(Dario Amodei)則為10%-25%。AMI Labs創辦人楊立昆(Yann LeCun)認為這些數字都只是大膽猜測,AI末日風險遠低於核戰;Axios則指出,目前雖無法準確預測,但科學家的警告仍顯示風險確實存在。