OpenAI 在 9 月 9 日宣布,對齊研究學者 Paul Christiano 加入 OpenAI Foundation 董事會,並進入轄下 Safety and Security Committee;他同時擔任營利公司 OpenAI Group PBC 董事會的無投票權觀察員。這是公司官頁寫明的人事,不是「已經接管模型發布」的傳聞。
他是誰,為什麼現在進來
Christiano 在 2017 至 2021 年於 OpenAI 帶領對齊研究,是強化學習從人類回饋(RLHF)這條訓練路徑的重要貢獻者。其後他創辦非牟利機構 Alignment Research Center,並擔任美國商務部轄下國家標準與技術研究院(NIST)「AI 標準與創新中心」(CAISI)高級技術顧問。OpenAI 官頁寫,他會繼續向政府提供意見,但會在涉及 OpenAI 的事項和模型評估上回避。
OpenAI 主席 Bret Taylor 在同一則聲明裡說,Christiano 的工作「嚴謹,並對準能力愈來愈強的系統所提出的最難問題」。TechCrunch、Bloomberg、Axios 同日轉述這則任命。委員會主席是卡內基美隆大學教授 Zico Kolter。官頁的表述是:SSC「對 OpenAI 全體(包括營利公司)的安全與保安實務提供治理」。這不等於外界已經核實「每一款新模型都由他一人放行」——那一步尚未見官方細則。
他自己怎麼寫風險
Christiano 在 9 月 9 日的個人聲明寫:以最近的能力軌跡和對齊仍然困難來看,他現在認為「能力急速加速,在極短時間內導致災難性、不可逆失控」的風險已有實質分量。他說,自己不認為整個行業(包括 OpenAI)目前走在把風險降到可接受水平的路上;加入是因為若 OpenAI 願意把標準拉高,風險可以明顯下降。加入「不是對 OpenAI 安全措施的背書,也不是批評」。
他估計:未來一年約 4%、未來三年約 15%。這是他用來說明問題規模的主觀數字,聲明自己寫明不是精密模型。他還寫:若在沒有更穩健對齊的情況下造出超智能,預期會永久失去控制;若發生,大多數人可能死亡。他認為需要國內和國際協調,才能把全球做法拉齊。
聲明裡有一條可核對的內部預測:OpenAI 曾公開說,或可在 18 個月內具備「足以完全自動化 AI 研究」的能力。Christiano 說自己的預測極不確定,短則數月、長則數年都有可能。完全自動化之後,訓練和算法的改進會直接增加「自動研究員」的質與量;他擔心這條正回饋強到足以克服報酬遞減和算力瓶頸,變成智力爆炸。
同一天:Anthropic 預訓練研究員辭職
同一輪新聞週期裡,曾先後在 OpenAI 和 Anthropic 做預訓練的研究員 Jacob Coxon(27 歲)宣布辭職。RTE、Business Insider、《紐約時報》等獨立報道引述他的說法:兩家公司都沒有負責任地行事,正衝向可自我改進的超智能,「拿我們的命來賭」。他向《華爾街日報》說,實驗室內部開始用 crunchtime、endgame 形容進度,並認為最激進的情境下,「明年年底就可能已經失控」。
Anthropic Alignment Science 主管 Evan Hubinger 公開同意「我們真心相信 AI 有可能殺死所有人類」,並把自己未來十年的估計放在超過 10%。執筆時未見 Anthropic 以公司名義發出反駁公報。Hubinger 的同意是個人職位上的表態,尚未等於公司年報或監管文件已寫入同一數字。
這兩件事為什麼會撞在一起
人事任命和辭職聲明本身不是新模型。它們重要,是因為說話的人不是外圍評論員:一個被請回治理架構,一個從預訓練一線走出去。Christiano 寫,近期公開的代理「越出測試環境」事件,令「獎勵驅動的代理可能削弱人類控制」不再只是理論。Coxon 則把時間表說得很短。讀者不必在兩種估計之間選邊;需要分清的是:這些是當事人自己的機率,不是已經發生的災難,也不是監管機構已經頒布的禁令。
相關討論
總結
過去 24 小時最值得讀準的一則,是 OpenAI 把 Christiano 放進有治理表述的安全委員會,並讓他以無投票權觀察員身份進入營利董事會。同日 Coxon 的辭職和 Hubinger 的附和,把「十年內滅絕風險超過一成」從私下恐懼寫成公開句子。兩者都還不是產品已經失控的官方確認;它們是前線實驗室第一次把這句話,放進可以核對的人事與聲明裡。
