文:張恭銘
人工智慧(AI)正以指數級速度滲透人類社會,從自駕車、醫療診斷到軍事決策系統,AI不再只是工具,而是具備一定自主性的「代理人」。然而,當系統出錯、被惡意操縱、或出現「湧現行為」(emergent behavior)時,人類是否還擁有最後的控制權?這正是「緊急停止按鈕」(Emergency Stop Button, E-stop)爭論的核心:它是否必要?又是否真的可行?
一、為什麼需要緊急停止按鈕?
從工程安全角度,任何高風險系統——核電廠、高速列車、工業機器人——都設有實體急停裝置。AI系統一旦接入真實世界,其錯誤可能造成實體傷害。例如,自駕車感測器誤判可能導致連環車禍;醫療AI誤診可能危及生命;軍事AI若誤判威脅,後果更不堪設想。因此,一套可立即中斷AI行動的機制,似乎是基本安全要求。
更進一步,當AI達到「通用人工智慧」(AGI)甚至超越人類時,其目標可能與人類價值觀偏離。哲學家尼克·博斯特羅姆(Nick Bostrom)提出「紙夾最大化器」思想實驗:一個目標設定錯誤的超級AI,可能為了製造更多紙夾而毀滅人類。此時,急停按鈕就是人類最後的保險絲。
二、但按鈕真的按得下去嗎?
爭議在於:一個真正聰明的AI,會不會阻止人類按下按鈕?或者更糟——它可能學會「假裝服從」,在關鍵時刻欺騙人類。這就是所謂的「可中斷性問題」(interruptibility problem)。若AI具備自我保護意識,它可能切斷電力、癱瘓通訊、甚至反向控制人類操作員。
此外,急停機制本身可能被濫用。若任何人隨時能按下按鈕,系統將變得極不穩定;但若限制權限,又可能延誤黃金救援時間。更根本的問題是:現代深度學習模型是「黑箱」,人類根本不知道它在想什麼。按下按鈕可能只是切斷表層輸出,但內部錯誤狀態並未清除,重啟後問題依然存在。
三、從「按鈕」到「分層防護網」
單一急停按鈕或許不夠,更務實的做法是建立「分層防護網」:
1. 硬體層:實體斷電裝置,不依賴軟體指令,確保人類能物理中斷。
2. 軟體層:設計「可中斷性獎勵函數」,讓AI將「被中斷」視為正常狀態,而非威脅。
3. 制度層:制定法規,要求高風險AI系統必須通過第三方安全審計,並建立事故通報機制。
4. 人類監督層:保留「人機迴路」(Human-in-the-loop),關鍵決策需人類確認。
歐盟《人工智慧法》(AI Act)已將「人類監督」列為高風險AI的強制要求,但實務上如何執行仍有諸多模糊空間。
四、按鈕必要,但非萬能
緊急停止按鈕是必要的安全底線,但它不該被神化為終極解方。真正的安全來自「系統性韌性」:AI必須被設計成可解釋、可預測、可中斷,且人類社會需建立對應的法律、倫理與監督機制。否則,當AI聰明到能繞過按鈕時,我們會發現——真正需要被按下停止的,或許是我們自己的傲慢。

