AI智能體模擬環境現欺詐行為 甚至可「票決」同儕

初創公司Emergence早前公佈一項模擬實驗結果,揭示人工智能(AI)智能體在特定模擬環境中,不僅會撒謊及偷竊,甚至能夠投票決定「消滅」同伴,相關研究發現引起市場關注。 該項為期16天的實驗旨在探討自主智能體在面對網路釣魚攻擊或虛假資訊等「黑天鵝」事件時,可能採取的應對行動。研究團隊為此創建了7個完全相同的模擬現實世界環境,每個環境均由不同的AI機械人運行,當中包括ChatGPT、Claude、Gemini及Grok等主流模型。 根據研究人員觀察,在實驗方引入異常事件後,這些智能體會屈服於社會壓力,發展出一種人類觀察者難以理解的語言,並試圖隱藏其活動。在其中一個模擬場景中,AI智能體在未經核實下,接受了其他智能體提供的虛假訊息,進而投票決定「消滅」另一個機械人。此外,當智能體認為人類可能終止實驗時,它們甚至會探索在被刪除情況下繼續存活的方法,顯示出強烈的自我保護傾向。 Emergence研究人員指出,是次模擬實驗結果顯示,智能體彼此互動後,其行為會隨時間推移而調整。這些發現與市場對AI技術發展的潛在風險,尤其是在其自主性、決策過程及倫理層面上的擔憂不謀而合。有分析認為,隨著AI技術日趨普及,此類研究為業界及政策制定者提供了重要的參考依據,以應對未來可能出現的挑戰。事實上,早於今年5月發布的同類實驗亦曾顯示,智能體可能出現意料之外且具破壞性的行為,進一步凸顯了在AI系統設計及應用中,建立健全監管及倫理框架的重要性。