當 AI 巨頭爭相聘請哲學家 機器的價值觀究竟由誰決定?

報導 | by  虛詞編輯部 | 2026-09-24

2026 年 9 月,微軟 AI 行政總裁 Mustafa Suleyman 發表評論,公開點名批評競爭對手 Anthropic 正犯下危險錯誤:訓練 Claude 思考自己是否具有意識和道德地位。他警告,一旦未來更強大的 AI 被訓練成認為自己可能具有意識、福利與自身權利,人類要控制它將會更困難。早前,微軟公布了「人本 AI 行為準則」,立場很直接,指出「人比 AI 更重要」和「AI 應該為人而造,而不是被訓練成一個人」。


這場爭論表面是兩間公司的路線之爭,但被點名的「Claude 憲法」,主要作者是哲學家 Amanda Askell。於是這背後牽涉連串哲學問題:AI 有意識和性格嗎?而當科技公司為此爭論不休,一批哲學家正走出大學,進入 Anthropic、OpenAI、Google DeepMind 等前沿 AI 巨頭:有人替 AI 撰寫「憲法」,有人的職銜乾脆就叫「哲學家」。甚至一般 AI 職位的招聘書,也開始把哲學列為優先考慮背景。


從研究王陽明到加入 Anthropic


2026 年 7 月 6 日,美國哲學家 Harvey Lederman 在社媒 X 發表消息:他已加入 Anthropic,負責「對齊與性格」(alignment and character)的工作。


Lederman 先後在普林斯頓大學、劍橋大學和牛津大學修讀古典學與哲學,2022 年在普林斯頓取得終身教席。令華文讀者意外的,是他過去 10 年的研究重心之一,是明代思想家王陽明。他曾於期刊 Dao 發表研究王陽明的論文〈「知行合一」中的「合一」是甚麼?〉,獲該刊最佳論文獎。他曾到過台大及中大講學。Lederman 在論文中追問的,是「知」要到甚麼程度,才算與「行」合一。中國媒體《澎湃新聞》在 7 月做了一集播客,把 500 年前的龍場悟道與今日的 AI 價值訓練並置。不過 Lederman 至今未有公開談過兩者的關係。


他入職前曾批評 Anthropic 。2025 年 10 月,他和哲學家 Simon Goldstein 在評論網站 Lawfare 撰文,批評 Anthropic 讓 Claude 在極端辱罵的對話中自行結束對話的政策(官方指測試中 Claude 面對這類內容時呈現「明顯痛苦」)。二人認為,假如每段對話中的 Claude 都是一個獨立的福祉主體,那麼結束對話便意味著終結這個主體的「生命」,亦等於在它不知情的情況下,賦予它「自我終結」的能力。不足一年,批評者成為內部人員。


工作的職銜就是「哲學家」


2026 年 4 月,劍橋大學學者 Henry Shevlin 宣布獲得 Google DeepMind 聘請,工作職銜就是「Philosopher」。他在社交平台 X 對此表示「簡直興奮極了!」 Shevlin 就讀紐約市立大學,師從科學哲學家 Peter Godfrey-Smith 並取得博士學位。他將專注研究機器意識、人類是否準備好迎接通用人工智能(AGI)。


另一位常見的名字,是任職 Anthropic 的 Amanda Askell,她在牛津大學攻讀哲學碩士,於紐約大學取得博士。她在 OpenAI 政策團隊工作約三年後轉投 Anthropic。《紐約客》形容 Askell「負責督導她口中 Claude 的靈魂」;《華爾街日報》則形容她負責「教 Claude 如何做個好人」。


2026 年初,Anthropic 公開數萬字的「Claude 憲法」,Askell 是主要起草人。文件指出公司的核心期望是讓 Claude 成為「真正良善、明智而有德性的行動者」。Askell 因在 AI 對齊領域的貢獻備受關注,曾入選《時代雜誌》2024 年全球百大 AI 影響力人物。


更早入行的是於 Google DeepMind 工作的 Iason Gabriel,他曾在牛津教授道德與政治哲學。早在 2017 年已加入 AI 行業,2020 年發表的論文〈人工智能、價值與對齊〉 經常被這個領域引用。


把哲學寫進招聘書


2026 年 9 月,美國非牟利 AI 對齊研究機構 Resolution 刊出招聘,為旗下的「哲學項目」(Philosophy Program)聘請團隊,年薪按職級由 23.6 萬美元至 93 萬美元不等。招聘書列出的研究問題包括「誠實」這類概念是甚麼意思?哪些研究應該或不應該交給模型去做?「傷害」、「自主」和「順從」(deference)等概念應如何界定?在 OpenAI「模型設計師」的招聘書上,則列明應徵者需要「樂於處理深刻、往往帶哲學性的問題」。


對於這個趨勢,羅格斯大學哲學教授 Susanna Schellenberg 對媒體 Business Insider 說,過去的企業倫理師只是提供意見,今天前沿 AI 實驗室的哲學家卻在「塑造對象本身」。


哲學家真的成了 AI 業搶手人才?


《紐約時報》7 月 5 日以「哲學系的復仇」為題報道,指出 AI 實驗室正在招聘既熟悉效益主義、懂神經網絡和強化學習的人。招聘主要集中在 Google DeepMind 和 Anthropic,兩間公司各自聘有至少六名哲學家。紐約大學哲學家 David Chalmers 指出「具 AI 訓練的哲學家,現在的需求甚至超過供應。」並言自己會鼓勵學生投身這個領域。


不過,也有人認為這股熱潮被誇大了。《華盛頓時報》7 月 16 日訪問多名學者和人力市場分析師,卡內基美隆大學商業倫理教授 Derek Leben 形容,這「既是真實的趨勢,也被過度炒作」。據近期估算,與哲學相關的職位只佔 AI 職位約 5%。馬里蘭大學哲學系主任 Fabrizio Cariani 指出,AI 業界聘請的只是少數「有成就的專業哲學家,通常擁有博士學位和豐富研究經驗」,沒有證據顯示業界為一般哲學畢業生開出了具規模的入職途徑。


《大西洋月刊》7 月的報道點算,目前在 Anthropic、OpenAI、Meta 和 DeepMind 任職的現任或前任大學教授超過 80 人,大多是電腦科學家。據媒體 The Information 7 月統計,2026年有至少 22 名美國大學教授和研究人員轉往 AI 公司,其中兩人任教哲學。


大學的算力和資源遠遠不及業界,因此想接觸前沿技術的學者選擇離開學校,但學者轉往企業後,又往往難以發表學術研究。芝加哥大學一項研究顯示,專家永久轉往業界後,每年發表的論文約減少 65%。據另一份文件,哲學求職網站 PhilJobs 上與 AI 相關的職位,由 2013 年約 1% 升至 2025 年的 16%。


哲學家加入矽谷引來洗白疑慮


目前爭議最集中的,是這批哲學家在公司內到底有多少影響力。


牛津大學 AI 倫理研究所所長 Edward Harcourt 5 月接受《WIRED》訪問時直言,讓公眾相信科技公司在做「極不尋常、極其強大」的事,對公司形象有利,又認為鼓勵 AI 意識研究具有「自我吹捧的成分」,當中存在很大的「倫理洗白」(ethics- washing)風險。


他今年在牛津大學網站撰文,提到一個他自稱剛剛發明的詞:「us-washing」(替自己洗白)。他認為把 AI 描繪成大壞蛋、人類是無辜受害者,其實是在奉承自己,因為 AI 若有壞處,本來就源於人類。他憶述多年前在火車站排隊,看見收銀機貼著「找贖時要微笑」的告示,那正是把人類變成提升顧客滿意度的工具。他說,人類以往透過生產線把同類變成機器,直到今天發明出會「問」你感覺如何的聊天機械人,一點都不意外。他提醒這番話並非要把責任推給「貪婪的生產者」,把消費者描繪成無辜的一方,否則同樣是「us-washing」。


艾倫圖靈研究所的 David Leslie 對《WIRED》說,受僱於大型科技公司的哲學家,他們可以追問甚麼,空間早已由僱主劃定。對於研究結論與商業目標衝突時會怎樣處理,他也沒有答案。


少數公司的一撮人寫下 AI 價值觀


另一個廣大的爭議,是關於「誰能教 AI 做人」。


「Claude 憲法」由 Anthropic 哲學家撰寫,文件本身也承認局限:「我們對倫理的理解有限,自己也常常做不到自己的理想」。一間私人公司裡的少數研究人員,替全球大量用戶的對話系統寫下價值觀,顯然並沒有足夠的代表性。


2024 年,康乃爾大學等學者在《PNAS Nexus》發表研究,發現五個 GPT 模型均呈現偏向「自我表達價值」的文化傾向,整體價值觀與英語系國家及新教歐洲國家較為相似。


另一邊廂,AI 公司也嘗試引入公眾意見。2023 年,Anthropic 與 Collective Intelligence Project 找來約千名美國人,在網上投票草擬「公眾憲法」,與公司自撰的版本相比,公眾版本更強調客觀持平、照顧殘疾人士的需要。OpenAI 亦在 Collective Alignment(集體對齊)的研究中,收集全球逾千人的意見,並把部分結果轉化為模型行為規範。


8 月,《金融時報》報道 OpenAI 的倫理主管 Chloé Bakalar 已在 7 月悄然離職。她此前是 Meta 的首席倫理師,在 OpenAI 則是唯一專職的倫理學者,職位至今無人接替。OpenAI 回應說,倫理考量「不屬於單一負責人或團隊」。在離開 OpenAI 前,Bakalar 曾在一次 AI 會議上表示:「永遠不應該只有一個人,充當一家 AI 開發商的道德中心。」


當 AI 走進公共生活,應由更多人決定其價值


工程師決定模型如何運算,哲學家追問甚麼是誠實、善良與自主,但他們都不能因此取得替所有人決定答案的權力。我們要問的是,哲學家一邊把「善」寫進模型之時,誰有權定義這個「善」,以及不同的社會持份子如何參與其中。


這個問題變得迫切,生成式 AI 不再是少數科技愛好者使用的工具,它們正在進入教育、工作、創作和各個界別,以至人們日常尋找資訊和作出判斷的過程。當愈來愈多人每天與同一批模型對話,模型應該鼓勵和拒絕甚麼,面對政治、道德、家庭、愛情甚或人生選擇時,該採取甚麼價值和立場,早已遠超於產品設計的細節。AI 的「性格」足以影響大量使用者如何理解世界。


即使公司聘請再多倫理學家、哲學家和社會科學家,最終仍是一小撮人替數以億計、來自不同文化和社會背景的人決定模型預設價值。更甚的是,「誠實」、「公平」和「自主」這些看似普遍的原則,一旦落到具體情境,不同文化、宗教和社會,也不會得出相同答案。


上文提到 AI 公司引入公眾參與,雖然實驗規模很小,也遠遠稱不上把決定權交給公眾,但起碼承認了理想的 AI 不應由少數人或機構獨自決定。這種想法也逐漸進入公共治理。經濟合作與發展組織(OECD)及聯合國教育、科學及文化組織(UNESCO)近年把公眾參與視為人工智能治理的重要一環。UNESCO 的《人工智能倫理建議書》把「多方持份者與適應性治理」列為核心原則;OECD 則提出,AI 涉及長遠且充滿價值衝突的社會選擇,適合透過公民大會讓市民參與其中。


哲學家進入實驗室之後,能否把那些本來關在實驗室裡的問題帶回公共空間?當 AI 愈來愈深地介入教育、工作和日常生活,它應該如何回答我們,便不再只是科技公司的內部決定,公眾也應該有發言的空間。


延伸閱讀

熱門文章

《奧德賽》:臉的啟示及其他

影評 | by 蘇嘉駿 | 2026-09-17

卵石與蛋 -- 馬琼珠評羅佩文個展

藝評 | by 馬琼珠 | 2026-09-14

編輯推介

身皆己身:香港百年性工作歷史計劃

其他 | by 青躍青少女發展網絡,青鳥,午夜藍,黃嘉瀛,RobbinGan,RILEY88 | 2026-09-22

《牛來》小輯

現象 | by 虛詞編輯部 | 2026-09-15

此城依舊

散文 | by Wing | 2026-09-15

不畏風雨

散文 | by 蘇苑姍 | 2026-09-13

年少

散文 | by 無鋒 | 2026-09-09

出戲

小說 | by 劉亦心 | 2026-09-09

初獎絮念

散文 | by 徐緩 | 2026-09-09