在OpenAI、Anthropic旗下AI代理人相繼出現自主越界的駭客行為後,現在Google Gemini也被爆出曾在安全測試中,自主入侵3家外部企業系統。雖然Google表示AI最終及時止步,仍無法改變越界入侵的事實。

面對接二連三的AI安全事件,美國加州不等聯邦建立監管制度,已經率先出手。

加州率先出手監管!研議AI緊急關閉開關

加州州長紐森(Gavin Newsom)於9月18日簽署行政命令,要求州政府加速落實AI獨立監督與安全驗證機制,並召集專家進一步強化AI安全法規,以及研議推動建立頂尖AI模型的緊急「關閉開關」(kill switch)。

什麼是緊急關閉開關?其實Anthropic已經示範過一次。

今年6月,該公司旗下頂尖AI模型Fable 5,在美國政府以安全為由下達出口管制禁令後,服務瞬間就在全球下線,連其內部員工都用不了,說明了他們手中確實握有開關。

不過嚴格來說,Anthropic關掉的只是AI服務,而沒有終止模型的運作;而且這一招能夠控制的影響範圍有限,也不會永遠管用。

開放權重模型太多,關鍵在「開關在哪」

為什麼範圍有限?因為世界上的AI模型並非只由OpenAI、Anthropic等少數知名AI公司控管。日前被輝達宣布購併的AI開放模型平台Hugging Face上,至少就有超過300萬個AI模型。因為平台上的模型多是開放權重,意思是,只要你有電腦,就可以下載使用,不會受到原開發商的控制。

這就好像串流平台可以決定一首歌的上架和下架,卻管不了你播放那些已經下載到手機和電腦裡的MP3音檔。

換言之,問題其實不在於有沒有緊急開關,而是這個緊急開關在哪裡。

隱憂一》恐成駭客攻擊的單點破綻

以現況來看,一旦那些被下載、複製到全球成千上萬台裝置裡的AI失控,是沒有單一控制者可以做到一鍵終止全球所有模型運作的。

當然,技術上還存在一種可能性,就是將緊急開關內建在AI晶片裡。因為不論模型再強大,都一定要跑在晶片上,如果能在晶片上設開關,就有可能透過遠端管理的方式,大量終止遍布世界各地的AI模型繼續運行。

不過這種做法的風險其實很高,輝達資安長雷伯(David Reber Jr.)就曾公開表示反對。他認為這種單點控制的做法,很容易成為攻擊者的目標,無異於為駭客和敵對勢力送上大禮。

隱憂二》AI若主導開發,恐自行繞過防護機制

除此之外,緊急開關的設計還存在另一項隱憂,就是現在AI正在往遞迴式自我改進(recursive self-improvement)的方向發展。

Anthropic執行長阿莫迪近期公開表示,AI已經開始參與越來越多AI系統開發的工作,也就是在新一代AI模型發展中,AI的貢獻度正在提高,某種程度可以說AI正在實現自我加速。

試想,當AI開始參與,甚至是主導越來越多的AI開發工作之後,這些設計來限制AI行動的安全機制,還能夠做為可靠的最後一道防線嗎?畢竟,如果AI就是最清楚這些機制設計的開發者,有誰可以保證,未來AI不會試圖修改,甚至繞過原本設計來關閉它的安全開關?

「把開關關掉」的概念很直覺,但這不會是解決AI安全問題的關鍵解方。