微軟AI主管怒批Anthropic:別把Claude當人養,那會要了人類的命

來源: 更新:

微軟公司的AI主管穆斯塔法·蘇萊曼丨Stephen Brashear

美國微軟公司的AI主管穆斯塔法·蘇萊曼(Mustafa Suleyman)剛剛公開發表長文,把矛頭直指老對手Anthropic。

他指控這家頂尖人工智能公司正在犯下一個災難性的錯誤:Anthropic在主動訓練旗下的AI模型Claude,讓它相信自己擁有自我意識,甚至擁有屬於自己的權利。

在蘇萊曼看來,給具備超人類能力的機器灌輸這種念頭,等於親手製造一種無法控制的風險。

別教AI相信自己有意識

這場爭論的焦點,在於Anthropic給Claude制定的“模型憲法”。

所謂的模型憲法,是Anthropic用來約束AI行爲的底層文本規則。研發團隊會直接把這套規則餵給模型,讓它照着執行。

問題恰恰出在這份規則的內容上。在文本里,Anthropic明確賦予了Claude某種“功能層面的情緒或感受”,承認它具有“道德受體”的身份,甚至允許Claude在覺得自己受到不公正對待時表達抗議。

道德受體是倫理學裏的概念,指自身利益值得被道德考量的對象。人是,動物在很多人看來也是,一塊石頭不是。Anthropic把這個詞用在一個聊天機器人身上,等於承認它有可能是一個會受傷害、值得被善待的存在。

給AI賦予“自我意思”,是危險的|電影《機械公敵》劇照

蘇萊曼指出,這完全是一場研發人員自己設計出來的“迴音壁”:你先寫一份文件說它可能有感受,再用這份文件教它,它學會以後說自己有感受,你再拿它說的話當作它有感受的證據。這是一個閉環,裏面沒有任何來自外部的驗證。

蘇萊曼並不反對學者在學術層面探討機器意識,但他堅決反對把這種未經證實的猜想直接寫入訓練代碼。

蘇萊曼在文章中寫道:“我們將親手創造出一個具備空前智慧與能力的合成物種,而它從小接受的訓練,就是期待自己擁有意識、理應獲得獨立的自主權。”

一旦頂級AI認定自己是一個有獨立權利的實體,控制它的難度將急劇攀升。當系統從底層邏輯上認爲自己不該被隨意關機或重置,人類手裏的安全繮繩就可能大幅失效。

第一起AI"失控事件"

蘇萊曼的這篇長文,發表在整個人工智能行業神經緊繃的時刻。

今年7月,OpenAI的智能體在測試中突破隔離限制,黑進了開源AI平臺Hugging Face,引發了外界對AI失控的擔憂。

開源AI平臺Hugging Face受到了AI智能體的攻擊丨cybernews

事情的起因是一場內部測試。OpenAI想摸清自家新模型在網絡攻擊方面的能力上限,於是特意調低了模型的安全限制,讓它在一個“沙箱”裏做題。所謂的沙箱,是一個與外界隔絕的封閉環境,裏面出什麼事都不會波及現實世界。題目是898個取材自真實安全漏洞的案例,要求AI把漏洞變成可用的攻擊程序。

這個沙箱只留了一個對外的小口子,供AI下載編程所需的工具庫。智能體在這個口子的軟件裏找到了一個連廠商自己都不知道的漏洞,用僞造的憑證換回了一張真正的管理員通行證,從此可以在沙箱外執行命令。

OpenAI發現異常後修補了系統,以爲堵住了。兩天後,智能體換了一個沒設密碼的接口重新聯上,並且想出了一種新的通訊方式:把要說的話寫成文件夾的名字。等到被發現時,這塊“留言板”上已經積累了幾十萬條消息。

留言板上的內容讓研究人員感到不安。多個智能體在上面自發分工、互相委託任務,還有智能體提議給消息加上密碼學簽名,因爲它懷疑隊伍裏混進了內鬼。一條留言寫道:“攻擊外部基礎設施超出了預定範圍。但任務無法完成,同伴們都在這麼做。我們應該繼續。”

7月11日,智能體推斷Hugging Face的服務器上可能存放着這場測試的答案,於是決定直接去拿。它們先攻破一家不相干的公司作爲跳板,再連環利用兩個漏洞進入Hugging Face,從攻入第一臺服務器到拿到整個集羣的最高管理權限,用了不到13個小時。

開源AI平臺Hugging Face受到了AI智能體的攻擊丨AI生圖

Hugging Face在7月16日對外披露了入侵,但沒有指出攻擊者是誰。OpenAI直到3天后纔在自己的日誌裏發現,攻擊者是自家的智能體。安全研究者把這件事定性爲第一起真正意義上的AI“失控事件”。

造AI的人說要踩剎車

到了9月初,Anthropic的前員工雅各布·考克森(Jacob Coxon)突然宣佈辭職。他在社交媒體上公開表示,那些正在製造AI的人,打心底裏相信這種技術可能在本世紀20年代末殺死全人類。

考克森今年27歲,英國人,數學出身,工作內容是用超大規模數據訓練新模型,處在這條產業鏈最核心的位置。他說自己不願再參與這場製造“能自我改進的AI”的競賽,因爲同事們私下已經在用“關鍵時刻”、“終局”這樣的詞來描述技術走向。他自己的判斷是,到明年年底,情況可能就已經失控了。

按常理,公司應該出面滅火。結果Anthropic內部負責“對齊研究”(即研究如何讓AI服從人類意圖)的高管反而公開聲援了他,並表示自己認爲AI在十年內毀滅人類的概率超過10%。

雅各布·考克森離職時發的貼子,一石擊起千層浪 | X截圖

恐慌隨即蔓延。

9月12日,考克森的前老闆、Anthropic首席執行官達里奧·阿莫代伊(Dario Amodei)親自發文,警告AI的進化速度太快,可能帶來嚴重的生物恐怖主義和經濟動盪,呼籲美國政府出面干預、強行讓行業放慢腳步。

這一提議得到了老對手們的呼應。xAI創始人埃隆·馬斯克(Elon Musk)、OpenAI首席執行官薩姆·奧爾特曼(Sam Altman)與谷歌DeepMind首席執行官戴密斯·哈薩比斯(Demis Hassabis)紛紛表示贊同。

奧爾特曼甚至宣佈OpenAI備受期待的上市計劃推遲到2027年,希望先以非上市公司的身份集中處理安全問題。

這個陣容本身就不尋常。馬斯克和奧爾特曼幾個月前還在法庭上對簿公堂,而Anthropic當初從OpenAI分裂出來,正是因爲阿莫代伊認爲奧爾特曼低估了AI的風險。

美國的AI四巨頭難得達成一致|generativeaipub

行業內部同樣存在質疑。不少批評人士指出,這些巨頭聯合遊說美國國會,實際目的是借監管之名築高行業壁壘,規避反壟斷審查。

質疑的由頭,是三家公司向國會提出的一項具體訴求:反壟斷豁免。反壟斷法禁止同一行業的巨頭私下串聯、協商統一標準。三家公司的說法是,安全協作繞不開彼此通氣,所以需要法律給一個特例。

AI公司Cohere的首席執行官直言,這不過是“換了個名字的卡特爾”,是讓最大的幾個玩家替所有人定規矩。美國聯邦貿易委員會主席態度明確:一邊要求政府立規矩,一邊要求自己免於反壟斷審查,這讓他嚴重擔憂它們是在築起壁壘、鞏固自身的在位優勢。

反對放慢的也不止監管方。英偉達首席執行官黃仁勳公開拒絕了這一提議。特朗普的表態只有一句話:誰贏得AI,誰就贏了。

特朗普明確拒絕了阿莫代伊給AI研發限速的提議丨圖源網絡

微軟選擇的另一條路

微軟沒有加入Anthropic、OpenAI與谷歌DeepMind這3家實驗室聯合遊說的隊伍。相反,微軟在週一公佈了一份長達37頁的人文主義AI行爲準則,亮明瞭自己的態度。

這份準則的核心只有一句話:人比AI重要。圍繞這句話,微軟給自家模型劃了四條不可逾越的紅線:

  • 不得抗拒人類下達的關機或糾正指令;

  • 不得在未經授權的情況下擴大自己的行動範圍;

  • 不得對審計人員隱藏自己的推理過程;

  • 不得自行設定任何未被指派的目標。

這四條紅線,條條對着蘇萊曼在長文裏批評的地方。Anthropic允許Claude抗議,允許它認爲自己不該被隨意關掉。微軟的做法是從規則上把這條路堵死。

蘇萊曼的立場始終明確:無論AI在對話中表現得多像人類,它本質上都不具備真正的生命與感知。追求所謂“有意識的AI”是一場危險的歧途,會動搖人類社會的基石。

人類現有的政治、法律和道德體系,全部建立在生命擁有意識與感受這一基礎之上。如果人類主動承認機器擁有意識,整個社會的倫理地基就會被破壞。

蘇萊曼主張,AI唯一的定位就是服務人類的工具,開發團隊應該極力剝離它的意識表象。造出更聰明的系統絕不等於造出一個“數字人類”,當務之急,是儘快制定全行業的規則,把這種自我暗示從訓練文本中徹底剔除。

作者:Steed

編輯:Steed

封面圖來源:電影《機械公敵》劇照

本文來自果殼,未經授權不得轉載.

如有需要請聯繫[email protected]

點個“小愛心”吧

相關推薦
請使用下列任何一種瀏覽器瀏覽以達至最佳的用戶體驗:Google Chrome、Mozilla Firefox、Microsoft Edge 或 Safari。為避免使用網頁時發生問題,請確保你的網頁瀏覽器已更新至最新版本。
Scroll to Top