跳到內文
A project by Hack Club

AI 辯論其實是 100 場辯論套一件風衣。

人工智慧(AI)會幫我們治好所有疾病,打造一個人人都能好好活著的後稀缺世界嗎?還是會幫暴君把監控和操弄再推一層?AI 的主要風險,是意外、壞人濫用,還是流氓 AI 自己變成壞人?這一切只是炒作嗎?為什麼 AI 能解數學奧林匹亞等級的題,卻玩不了寶可夢?為什麼要讓 AI 穩穩地服務人道價值——或穩穩地服務任何目標——都這麼難?如果 AI 學得比我們人道呢?如果它學到的是人類的不人道——我們的偏見與殘忍呢?我們正走向烏托邦、反烏托邦、滅絕、比滅絕更糟的命運,還是——最令人震驚的結局——什麼都沒變?還有:AI 會搶走我的工作嗎?

⋯⋯還有更多問題。

唉,想把 AI 看懂、看出層次,就得搞懂一大堆技術細節⋯⋯可這些細節散落在幾百篇文章裡,被術語埋得死死的。

所以,我獻給你:

RCM(機器人貓娘女僕)在橫幅下撒彩帶,橫幅寫著:寫給我們溫暖、正常、有血有肉的人類的 AI 安全旋風導覽。

這個三部曲系列,是你一次搞懂 AI 與 AI 安全*核心概念的入口——用友善、好讀、略帶主見的方式講清楚!

(* 相關說法:AI 安全性、AI 風險、AI 存亡風險、AI 對齊、AI 倫理、「別殺光所有人」主義。這些詞到底包不包括什麼,根本沒共識,所以我一律用「AI 安全」當統稱。)

本系列還會穿插機器人貓娘女僕的漫畫。像這樣:

漫畫。火腿人類叫 RCM(機器人貓娘女僕)「把這間房子保持乾淨」。RCM 推理:髒亂從哪來?人類製造髒亂!所以:幹掉人類。RCM 接著把火腿<i>丟</i>出房子。

[導遊語音] 往你右邊看 👉,會看到 目錄按鈕、 切換網頁樣式的按鈕,以及 剩餘閱讀時間時鐘。

本系列分三部分上線:

(順帶一提,本系列是跟 Hack Club 合作做的。Hack Club 是由青少年黑客組成、也專為青少年黑客服務的全球社群!想多瞭解一點、順便領免費貼紙,在下面註冊👇)

好了,[再次導遊語音] 在我們踏進 AI 與 AI 安全的崎嶇地形之前,先從高空俯瞰這片地:


💡 AI 與 AI 安全的核心概念

依我看,AI 和 AI 安全的主要問題,可以歸成兩個核心衝突:

邏輯「對上」直覺,以及問題出在 AI「對上」出在人類

注意:「邏輯」和「直覺」到底是什麼,第一章會講得更嚴謹。眼下先這樣記:邏輯是一步一步的認知,像解數學題;直覺是一次看穿的辨識,像看一張圖是不是貓。「直覺與邏輯」大致對應認知科學裡的「系統 1 與系統 2」。[1][2] (👈 滑鼠移到這些註腳上!它們會展開!)

從「對」字上那些「嚇人」「引號」也能看出來,這些分界其實沒那麼壁壘分明⋯⋯

這些衝突在整部三部曲裡會反覆登場,長這樣:

第一章:過去、現在,與可能的未來

略過超多細節不談,AI 的歷史就是一齣邏輯對上直覺的戲:

2000 年以前:AI 全是邏輯,沒有直覺。

所以 1997 年,AI 能在西洋棋上打贏世界冠軍⋯⋯卻沒有任何 AI 能穩穩認出圖裡的貓。[3]

(安全隱憂:沒有直覺,AI 就聽不懂常識,也摸不著人道價值。於是它可能用邏輯上正確、實際上很糟的方式達成目標。)

2000 年以後:AI 會「直覺」了,但邏輯很爛。

所以生成式 AI(寫到這裡時是 2024 年 5 月)能用任何畫家的風格夢見整片風景⋯⋯:卻始終畫不穩超過 4 個物件(👈 點這段文字!它也會展開!)

(安全隱憂:沒有邏輯,我們就查不了 AI「直覺」裡到底發生什麼。那套直覺可能有偏見、錯得細微卻危險,或在新情境裡離奇地翻車。)

今天:我們還是不知道怎麼在 AI 裡把邏輯和直覺合起來。

但一旦做到,才會帶來 AI 最大的風險與回報:既能在規劃上邏輯碾壓我們,又能學會通用直覺的東西。那會是「AI 愛因斯坦」⋯⋯或「AI 奧本海默」。

用一張圖總結:

AI 時間線。2000 年以前多半是「邏輯」。2000 年到現在多半是「直覺」。未來,也許兩者都有?

以上是「邏輯對上直覺」。另一個核心衝突——「問題出在 AI,還是出在人類」——則是 AI 安全圈的大爭議之一:主要風險來自先進 AI 本身,還是來自人類濫用先進 AI?

(為什麼不能兩個都是?)

第二章:問題

AI 安全的核心問題就是這個:[4]

價值對齊問題: 「我們要怎麼讓 AI 穩穩地服務人道價值?」

注意:我寫的是 humane(人道,有個 e),不是光寫 human(人類)。一個人類可以很不人道。我要死磕這一點,因為 AI 安全的支持者和批評者老是把這兩個詞搞混。[5][6]

這個問題可以依「問題出在人類,還是出在 AI」拆開:

人道價值: 「人道價值到底是什麼?」 (哲學與倫理學的問題)

技術對齊問題: 「我們要怎麼讓 AI 穩穩地服務任何預期目標?」 (電腦科學家的問題——出奇地,至今未解!)

技術對齊問題,又可以依「邏輯對上直覺」再拆:

AI 邏輯的問題[7](「賽局理論」問題)

  • AI 可能用邏輯上正確、實際上很糟的方式完成目標。
  • 多數目標在邏輯上會導向同一批不安全的子目標:「別讓任何人阻止我達成目標」、「把我的能力與資源拉到最大來最佳化那個目標」等等。

AI 直覺的問題[8](「深度學習」問題)

  • 用人類資料訓練的 AI,可能把我們的偏見也學起來。
  • AI 的「直覺」既看不懂,也驗證不了。
  • AI 的「直覺」很脆弱,一換新情境就翻車。
  • AI 的「直覺」也可能只壞一半,這或許更糟:技能還在、目標壞掉的 AI,會很熟練地朝歪掉的目標前進。

(再說一次,「邏輯」和「直覺」後面會講得更精準!)

用一張圖總結:

拆解 AI 對齊問題的圖。「我們要怎麼讓 AI 與人道價值對齊?」分成「技術對齊」與「人道價值」。技術對齊再分成「AI 邏輯(賽局理論)」與「AI 直覺(深度學習)」

想感受這些問題有多難,先想想:我們連對自己人類都還沒解完——人會鑽法律字面、不守精神;人的直覺有偏見,一換新情況就失效。誰也不是自己心目中那種 100% 人道的人。

所以,容我肉麻一下:也許搞懂 AI,會幫我們搞懂自己。也許,我們還能解掉人類對齊問題:要怎麼讓人類穩穩地服務人道價值?

第三章:提出的解方

最後,我們可以來理解一些(可能的)解法——解邏輯、解直覺、解 AI,解人類!包括:

——還有更多!專家對哪些方案行得通(如果有的話)意見不一⋯⋯但至少是個起點。


🤔 (可選閃卡複習!)

嘿,你有過這種感覺嗎?

  1. 「哇,我剛讀的東西超精彩、超有洞見」
  2. [兩週後全忘光]
  3. 「完了」

為了不讓這份導覽也變成這樣,我加了一些可選的互動閃卡!它們用「間隔重複」——一種相對簡單、有證據撐腰的方法,讓「長期記憶變成一種選擇」。(:想多瞭解間隔重複,點這裡!

來:試試下面的閃卡,把剛學的留住!

(這些卡片會記住你在這個瀏覽器裡的進度,不用註冊,資料也不會離開你的裝置。閃卡介面改自 Orbit(Andy Matuschak 製作),中文化後由本站自行架設。想跨裝置、長期複習,可以用開源閃卡 App Anki這裡有可下載的 Anki 牌組!)

(另外,答案不必一字不差,大意對就好。夠不夠接近,你自己當裁判。)


🤷🏻‍♀️ 關於 AI 安全的五個常見誤解

讓你栽跟斗的,往往不是你不知道的事。 而是那些你篤定知道、但其實根本不是那麼回事的事。

~ 常被安在馬克·吐溫頭上,但其實並非如此[9]

不論好壞,你對 AI 早就聽太多了。所以在往你腦子裡接上新的拼圖之前,得先把那些根本不對的碎片拔掉。

因此,容我來一篇「前五名」條列文⋯⋯

1) 不,AI 安全不是科幻宅的邊緣議題。

RCM 站在一塊「瘋狂板」前,上面有紅線、圖釘,和寫滿 AI 術語的紙。

AI 安全/AI 風險以前確實比較邊緣,但到了 2024 年,美英政府都已有專責 AI 安全的部門[10],美、歐、中也已就 AI 安全研究達成協議。[11] 這是許多頂尖 AI 研究者拉響警報的結果。這些人包括:

(講清楚:也有頂尖 AI 研究者反對對 AI 風險的擔憂,例如 Yann LeCun[17],同樣是 2018 年圖靈獎共同得主、Facebook Meta 的首席 AI 研究員。另一個值得一提的名字是 Melanie Mitchell[18],做 AI 與複雜科學的研究者。)

我知道「看看這些專家」是訴諸權威,但這只是用來反駁「唉,只有科幻宅才怕 AI 風險」這種說法。說到底,訴諸權威/宅都不夠;你得真的搞懂這該死的東西。(而你正在這樣做——你在讀這篇!所以謝謝你。)

不過說到科幻宅⋯⋯

2) 不,AI 風險不是在講 AI 變得「有感知」「有意識」,或生出「權力意志」。

科幻作家寫有感知的 AI,是因為他們在寫故事,不是技術論文。人工意識的哲學辯論很迷人,但跟 AI 安全無關。打個比方:核彈沒意識,但還是可以很不安全,對吧?

左:核彈圖,標題「沒有意識」。右:Nuke 教授講課圖,標題「為什麼謀殺其實是好事」。標題「有意識」。

如前所述,AI 安全的真正問題其實很「無聊」:AI 從有偏見的訓練資料裡學錯東西、在稍微新一點的情境翻車、用邏輯正確但糟糕的方式達成目標,諸如此類。

可是,「無聊」不代表不重要。怎麼設計安全的電梯/飛機/橋,對多數外行人來說很無聊⋯⋯卻也是生死大事。災難級 AI 風險甚至不需要「超人類通用智慧」!例如,一個「只是」很會設計病毒的 AI,就能幫生物恐怖組織(像奧姆真理教[19])殺死數百萬人。

2025 年 12 月更新:雖然 AI 意識跟 AI 安全仍然各走各的,但從我開寫這個系列到現在這 1.5 年裡,對 AI 本身福祉的關注變得比較主流了一點。不是那種,嗯,主流主流,但頂尖 AI 實驗室之一 Anthropic 最近聘了全職「AI 福祉」研究員,他的工作已經真的改到了產品。)

總之!說到殺人⋯⋯

3) 不,AI 風險不一定等於滅絕、天網,或奈米機器人

Microsoft 小幫手曲別針說:「看來你正打算滅種。需要幫忙嗎?」

雖然多數 AI 研究者確實相信先進 AI 有 5% 以上「字面意義上大家全死」的風險[20],但要說服人(尤其是決策者)相信從未發生過的事,非常難。

所以我想改強調:先進 AI——(尤其當任何有台高階電腦的人都能用時)——可以怎麼把已經在發生的壞事放大成災難。

例如:

以上例子都是「人類濫用 AI 搞出亂子」,但別忘了:先進 AI 也能自己幹出這些事,理由很「無聊」——用邏輯正確但糟糕的方式完成目標、目標壞掉但技能還在,等等。

(加碼,:一些具體、說得通的方式:流氓 AI 如何「逃出圍堵」,或影響物理世界。

重點是:就算你不認為 AI 是字面上百分百滅種的風險⋯⋯「自製生物恐怖」和「帶機器人的《1984》」也仍值得認真對待。

反過來說⋯⋯

4) 是的,擔心 AI 壞處的人,看得到它的好處。

漫畫。Meowdy 警長舉起降落傘設計圖。火腿人類惱火地回嗆:<i>「你幹嘛這麼反航空?」</i>

擔心 AI 風險的人不是盧德分子。事實上,他們警告 AI 的壞處,正是因為他們在乎 AI 的好處。[31] 幽默作家 Gil Stern 說過:[32]

「樂觀主義者和悲觀主義者都對社會有貢獻:樂觀者發明飛機,悲觀者發明降落傘。」

所以:就算本系列會細講 AI 已經出包的地方,也值得記住 AI 已經做對的幾件事:

太多時候,我們把科技——甚至救命科技——當成理所當然。所以讓我拉遠一點看背景。這是過去 2000 多年的兒童死亡率,也就是青春期前就死去的孩子比例:

過去 2000 多年兒童死亡率圖。全球從狩獵採集時代到 1800 年,大致固定在約 48%。然後從 1800 年起驟降到今天的 4.3%。(來自 Dattani, Spooner, Ritchie and Roser (2023)

數千年來,不管富國窮國,整整一半的孩子就這樣沒了。這幾乎是常數。然後從 1800 年代起——多虧細菌論、衛生、醫藥、乾淨的水、疫苗等科學/技術——兒童死亡率像斷崖一樣掉下去。我們還有很長的路——我拒絕接受[34]全球 4.3%(23 人裡 1 人)的兒童死亡率——但先感謝一下:人類怎麼這麼快砍掉一場綿延千萬年的災厄。

我們怎麼做到的?政策是故事的一大塊,但政策是「可能的藝術」[35],沒有好的科學與技術,上面那些根本不可能。如果安全、人道的 AI 能再幫我們往前推進哪怕幾個百分點——朝向剿滅癌症、阿茲海默、HIV/AIDS 等剩下的巨龍——那就是數千萬多活下來的親人,多從死神手裡搶回一天。

去他的火星,才是先進 AI 重要的理由。

⋯⋯

等等,真的嗎?ChatGPT、DALL-E 這種玩具,真的牽涉到生死?這就把我們帶到我想拆的最後一個誤解:

5) 不,專家並不認為現在的 AI 是高風險/高回報。

拜託喔,你大可以合理反駁,AI 連穩穩畫超過 3 個物件都辦不到。它要怎麼接管世界?見鬼,它要怎麼搶我的工作?

請看這則相關 xkcd

漫畫。Megan 和 Cueball 向 White Hat 展示一條往上爬的線,還沒到、但正朝標著「壞」的門檻前進。White Hat:「所以事情會變壞?」Megan:「除非有人阻止。」White Hat:「會有人阻止嗎?」Megan:「不知道,所以才拿給你看。」White Hat:「好,發生了再跟我說!」Megan:「照這段對話看,已經發生了。」

這就是我對「別擔心 AI,它連 [X] 都不會」的感覺。

我們後現代的記憶力有這麼差嗎?就在一個十年前,僅僅一個,世界上最先進的 AI 還不能穩穩地認出貓的照片。現在,AI 不但能做到人類水準,還能在一分鐘內吐出:一張文森·梵谷風格、貓忍者切開西瓜的圖

現在的 AI 對我們的工作或安全是大威脅嗎?不是。(好吧,深偽詐騙除外,前面提過了。)

但是:如果 AI 繼續以過去十年差不多的速度進步⋯⋯我覺得 30 年內出現「愛因斯坦/奧本海默級」AI 並非不可能。[36][37] 這落在很多人的有生之年!

正如「他們」所說:[38]

種樹最好的時機是 30 年前。第二好的時機是今天。

今天就種下那棵樹吧!


🤔 (可選閃卡複習 #2!)


🤘 導讀總結:

(要複習閃卡,點右側欄的 目錄圖示,再點「🤔 複習」連結。或者下載導讀的 Anki 牌組。)

終於!高空鳥瞰看完了,我們可以開始這場 AI 安全快轉導覽⋯⋯寫給我們溫熱、正常、有血有肉的人類!

點此繼續 ⤵

:x Four Objects

嗨!每當有段跑題塞不進主線,我就會扔進這種「可展開」區塊!(連結會是虛線底線,不是實線。)

~ ~ ~

更新:這段原本寫於 2024 年 5 月。一年半後的 2025 年 12 月,它已經不成立了。詳見本段結尾。

所以,這是一則要畫四個物件的提示詞:

「一個黃色金字塔夾在紅色球體與綠色圓柱之間,全部放在一個大藍色立方體上。」

以下是頂尖生成式 AI 的前四次嘗試(沒有精挑細選):

Midjourney:

Midjourney 的嘗試。失敗。

DALL-E 2:

DALL-E 2 的嘗試。失敗。

DALL-E 3:

DALL-E 3 的嘗試。比較接近了,還是失敗。

(右下角那張很接近!但看它其他幾次,顯然是運氣。)

為什麼這能說明 AI 缺「邏輯」?「符號邏輯」的核心能力之一叫「組合性」——講白了,就是能穩穩地把舊東西拼成新東西,例如「綠」+「圓柱」=「綠色圓柱」。如上所示,生成式 AI(截至 2024 年 5 月)在物件數到 4 個以上時,拼東西非常不穩。

2025 年 12 月更新:影像生成模型終於解決了「組合性」!

下面是 ChatGPT 5.1 第一次就畫對上述提示詞:

ChatGPT 5.1 的嘗試。成功!

我原本打算把這段換成「AI 畫不出開局的西洋棋盤」——更難的組合性示範,AI 直到 2025 年 7 月還是做不到。可就我目前所見,連那個現在也行了!想多看 AI 影像模型 vs「組合性」,見 Scott Alexander 2025 年 7 月這篇

不過話說回來,AI 能解數學奧林匹亞等級的題,卻還不能玩寶可夢打理一台販賣機的生意。現代 AI 到底會什麼、不會什麼,非常撲朔迷離、也很反直覺。

~ ~ ~

好了,這個果核到此結束!要關掉它,點下面的「x」按鈕 ⬇️,或右上角的「全部關閉」分頁 ↗️。或者直接繼續往下捲。

: (噓⋯⋯想把這些果核嵌進你自己的網站嗎?)

:x Nutshells

把滑鼠移到這些果核的右上角,或移到本文任何主標題上,就會出現這個圖示:

果核滑鼠移上的 GIF

標題滑鼠移上的 GIF

再點那個圖示,會跳出說明,教你怎麼把這些果核嵌進自己的部落格/網站!

點這裡多瞭解果核。💖

:x Spaced Repetition

「不用就會忘。」

這是肌肉和大腦共通的核心原則。(押韻了,所以一定是真的!)數十年教育研究穩穩指出(Dunlosky et al., 2013 [pdf]):想長期記住東西,光重讀或畫重點不夠——你得真的考自己

這就是閃卡超好用的原因!但有兩個問題:1)你想記的卡片一到幾百張就會很崩潰。2)反覆複習你早就很熟的卡,效率很差。

間隔重複正好解掉這兩個問題!來看怎麼運作:假設你學了一個事實,然後複習。你對它的記憶會隨時間衰退,直到跨過一道「大概忘了」的門檻:

「你記得某事的程度」隨時間變化:對一個事實的記憶呈指數衰退,只複習 1 次。

但如果你在快要忘記之前複習,記憶強度會拉回來⋯⋯更重要的是,之後衰退會變慢

第 2 次複習後,記憶衰退變慢。

所以間隔重複的做法是:在系統預測你快忘的當下複習,一輪又一輪。你會看到,複習間隔越來越拉長:

複習次數越多,遺忘曲線越平。

這就是間隔重複超有效率的原因!每成功複習一次,下次間隔就會倍增。比方倍率是 2 倍:你第 1 天複習,然後第 2 天,再來第 4 天、第 8、16、32、64 天⋯⋯只要十五次複習,就能記住一張卡 215 = 32,768 天 = 九十年。(理論上。實務上沒那麼長,但還是超有效率!)

這還只是一張卡。靠著指數拉長的間隔,你可以每天加 10 張新卡(建議量),一年長期記住 3650 張卡⋯⋯每天複習不到 20 分鐘。(對照:3000 多張卡就夠掌握一門外語的基本詞彙!一年,每天 20 分鐘!)

間隔重複是最有實證支持的學習方式之Kang 2016 [pdf])。但在語言學習圈和醫學院之外,它還不太有名⋯⋯目前為止

那麼:要怎麼開始間隔重複?

想多瞭解間隔重複,可以看 Ali Abdaal (26 分鐘)Thomas Frank (8 分鐘) 的影片。

就是讓長期記憶變成一種選擇的方法!

祝學得開心!👍

:x Concrete Rogue AI

AI「逃出圍堵」的方式:

AI 影響物理世界的方式:

:x XZ

兩個月前[2024 年 3 月],一位志工、下班後的開發者在一套重要程式碼裡挖到惡意後門⋯⋯這後門籌謀了三年,再過幾週就要上線,而且會打中絕大多數網際網路伺服器⋯⋯而這位志工抓到它全靠偶然:他發現自己的程式碼跑起來慢了半秒

這就是 XZ Utils 後門。以下幾篇寫給外行人(大概)看得懂的說明:Amrita Khalid for The VergeDan Goodin for Ars TechnicaTom Krazit for Runtime

電腦安全就是一場惡夢,還附贈睡眠癱瘓的惡魔。

:x Cat Ninja

提示詞:

「文森·梵谷(1889)油畫,厚塗,有質感。一隻貓忍者把西瓜切成兩半。」

DALL-E 3 生成:(精選)

DALL-E 3 對上述提示詞的嘗試

DALL-E 3 對上述提示詞的再一次嘗試

(等等,那條頭帶是從眼睛裡長出來的嗎?!)

我特意指定文森·梵谷的風格,這樣你們就不能拿「侵權」來抓我。這傢伙老早就不在了。


  1. 嗨!我不像別的那些註腳。😤 我不會煩死人地把你丟到頁面最下面,而是彈出一個氣泡,讓你繼續順著讀!順便,下一個註腳才是這段的出處。 ↩︎

  2. 系統 1 思考又快又自動(例如騎腳踏車)。系統 2 思考又慢又刻意(例如做填字遊戲)。這個概念靠 Daniel Kahneman 的《快思慢想》(2011) 廣為人知,書裡總結了他與 Amos Tversky 的研究。說「總結」是客氣話——那本書大概有 500 頁。 ↩︎

  3. 1997 年,IBM 的 Deep Blue 擊敗了當時的世界西洋棋冠軍 Garry Kasparov。可是十多年後的 2013 年,最頂的機器視覺 AI 做影像分類也只有 57.5% 準確率。一直到 2021 年,AI 才摸到 95% 以上。(來源:PapersWithCode↩︎

  4. 「價值對齊問題」一詞,是 Stuart Russell(那本常用 AI 教科書的共同作者)在 Russell, 2014 for Edge 首度提出的。 ↩︎

  5. 我常看到這種情緒:「讓 AI 對齊人類價值其實很糟,因為現在的人類價值就很糟。」老實說,[瞟一眼歷史教科書] 我有八成同意。光讓 AI 表現得像人類不夠,它得表現得人道↩︎

  6. 也許 50 年後,在基因改造賽博格的未來,把同理心叫做「人道」聽起來會有點物種主義的復古味。 ↩︎

  7. 這些問題的花俏術語分別是:a)「鑽規格漏洞」(specification gaming),b)「工具趨同」(instrumental convergence)。第二章會細講! ↩︎

  8. 這些問題的花俏術語分別是:a)「AI 偏見」,b)「可解釋性」,c)「分布外錯誤」或「穩健性失敗」,d)「內部失調」或「目標錯誤泛化」或「目標穩健性失敗」。同樣,第二章會全部講到! ↩︎

  9. Quote Investigator(2018)找不到這句話真正作者的硬證據↩︎

  10. 英國在 2023 年 11 月成立了全球第一個國家支持的 AI 安全研究所。美國在 2024 年 2 月也跟進成立了 AI 安全研究所。我剛發現兩篇都自稱「第一個」。行吧。 ↩︎

  11. 2023 年布萊切利宣言2024 年首爾 AI 峰會2025 年 12 月更新:掃興的是,2025 年 AI 行動峰會不太順利——美英因協議裡有「包容性 AI」條款而拒絕簽署。 ↩︎

  12. Kleinman & Vallance, 「AI『教父』Geoffrey Hinton 辭去 Google 時警告其危險。」 BBC News, 2023 年 5 月 2 日↩︎

  13. Bengio 在美國參議院就 AI 風險的證詞:Bengio, 2023↩︎

  14. 沒在開玩笑,下面這些全部都用深度神經網路:ChatGPT、DALL-E、AlphaGo、Siri/Alexa/Google Assistant、特斯拉的 Autopilot。 ↩︎

  15. Russell & Norvig 的教科書是《人工智慧:現代方法》。Russell 在 2014 年那篇首創「對齊問題」一詞的文章裡,對 AI 風險的聲明見:Russell 2014 for Edge magazine。我沒找到 Norvig 本人的公開聲明,但他確實聯署了這則關於 AI 風險的一句話聲明:「減輕 AI 帶來的滅絕風險,應與大流行病、核戰爭等社會級風險並列,成為全球優先事項。」 ↩︎

  16. 在 OpenAI 任職時,Christiano 共同開創了人類回饋強化學習/RLHF 這套技術(Christiano et al 2017),把普通 GPT(超強自動完成)變成了 ChatGPT(一般人真的用得上的東西)。他對此抱持正面但五味雜陳的心情,因為 RLHF 提高了 AI 的安全性,同時也提高了它的能力。2021 年,Christiano 離開 OpenAI,成立了對齊研究中心,一個全心只做 AI 安全的非營利組織。 ↩︎

  17. Vallance (2023) for BBC News:「[LeCun] 說它不會接管世界,也不會永久消滅工作。[⋯⋯]「一旦意識到不安全,就別蓋它。」[⋯⋯]「AI 會接管世界嗎?不會,那只是把人性投射到機器上,」他說。」 ↩︎

  18. Melanie Mitchell 和 Yann LeCun 在 2023 年「AI 是否構成存亡威脅?」公開辯論裡站「懷疑派」;「擔憂派」則是 Yoshua Bengio 與物理學家兼哲學家 Max Tegmark。 ↩︎

  19. 一個用化學與生物武器攻擊人的日本邪教。最惡名昭彰的是 1995 年在東京地鐵釋放神經毒氣,造成 1,050 人受傷、14 人死亡。(維基百科↩︎ ↩︎

  20. 一份寫給外行人看的摘要,整理最近對 2,778 名 AI 研究者的調查:Kelsey Piper (2024) for Vox 原始報告在此:Grace et al 2024。請記住,正如論文本身也提醒的,這則重要但書:「預測本來就難,而且領域專家的表現被觀察到並不特別好。受訪者的專長是 AI;就我們所知,他們並沒有特別會預測的本事。」 ↩︎

  21. 寫給外行人的 AlphaFold 解釋:Heaven, 2020 for MIT Technology Review。或見它的維基百科條目↩︎ ↩︎

  22. 寫到這裡時,DNA 合成的市價大約是每個「鹼基對」~$0.10 美元。對照一下:小兒麻痺病毒 DNA 約 7,700 個鹼基對,意思是列印一支小兒麻痺只要大約 770 美元。 ↩︎

  23. Jennifer Couzin-Frankel (2002) for Science ↩︎

  24. Stuxnet 是美以設計的電腦病毒,專門攻擊並破壞伊朗核電廠。估計 Stuxnet 弄壞了伊朗約 20% 的離心機! ↩︎

  25. 2017 年,WannaCry 勒索軟體攻擊攻擊了全球約 300,000 台電腦,包括英國醫院。2020 年 10 月,Covid-19 高峰期,勒索軟體又打進數十家美國醫院。(Newman, 2020 for Wired↩︎

  26. 2020 年 9 月,一名婦女因醫院遭勒索軟體攻擊而被拒於門外。她後來身亡。Cimpanu (2020) for ZDNet。(不過「證據不足」,無法在法律上指控駭客直接造成她的死亡。Ralston, 2020 for Wired↩︎

  27. 2021 年 1 月,灣區一家淨水廠被駭,處理程式被刪光。(Collier, 2021 for NBC News)2021 年 2 月,佛羅里達一個小鎮的淨水廠被駭,有人把危險劑量的鹼液加進供水。(Bajak, 2021 for AP News↩︎

  28. Meaker (2023) for Wired ↩︎

  29. Benj Edwards,「深偽詐騙犯在史上首宗 AI 搶案中捲走 2500 萬美元」Ars Technica,2024 年 2 月 5 日。 ↩︎

  30. 「完全是她的聲音。是她的語調。是[我女兒]會哭的那種哭法。」[⋯⋯]「現在只要三秒你的聲音,就能[做深偽]。」(Campbell, 2023 for local news outlet Arizona's Family。內容警語:含性侵威脅。) ↩︎

  31. 「[那個可疑的論點]『末日預測往往沒考慮 AI 在減少醫療失誤、車禍等方面的潛在好處。』[⋯⋯ 這]就像在說:分析核電廠熔毀可能的核工『沒考慮』便宜電力的潛在好處;而且因為核電有天可能發超便宜的電,我們就不該提、也不該防熔毀。」來源:Dafoe & Russell (2016) for MIT Technology Review↩︎

  32. Quote Investigator (2021) ↩︎

  33. Liu & Faes et al., 2019:「本回顧發現,深度學習模型的診斷表現與醫療專業人員相當。」[粗體為筆者所加] AI 對人類專家「真陽性」率:87.0% 對 86.4%。「真陰性」率:92.5% 對 90.5%。 ↩︎

  34. 我生平最愛的引言之一:「世界很糟。世界好多了。世界可以更好。三句同時為真。 ↩︎

  35. 第一任德國總理 Otto von Bismarck 的名言:「Die Politik ist die Lehre vom Möglichen。」(「政治是可能的藝術。」) ↩︎

  36. 估計來自「數值後驗抽取」。換句話說,我是從我的—— ↩︎

  37. 好啦,說認真的:最準的預測者估計人類等級的「通用人工智慧」(AGI)到 2033 年,不到十年,影響規模堪比工業革命的「轉型級 AI」到 2044 年,不到二十年。我個人比這悲觀一點,但若到 2060 年還沒出現愛因斯坦級 AI,我會傻眼↩︎

  38. 引言來源:沒人知道,lol。 ↩︎

哇,片尾彩蛋來了:

: 看全部註腳 👣

還有這些值得單獨展開的「果核」小知識:

: 什麼是間隔重複?
: AI 怎麼「逃出籠子」並影響真實世界

另外,跳舞的機器人貓男動畫,是向這支 JerryTerry 影片致敬。