微軟AI主管怒批Anthropic:別把Claude當人養,那會要了人類的命
微軟公司的AI主管穆斯塔法·蘇萊曼丨Stephen Brashear
美國微軟公司的AI主管穆斯塔法·蘇萊曼(Mustafa Suleyman)剛剛公開發表長文,把矛頭直指老對手Anthropic。
他指控這家頂尖人工智能公司正在犯下一個災難性的錯誤:Anthropic在主動訓練旗下的AI模型Claude,讓它相信自己擁有自我意識,甚至擁有屬於自己的權利。
在蘇萊曼看來,給具備超人類能力的機器灌輸這種念頭,等於親手製造一種無法控制的風險。
別教AI相信自己有意識
這場爭論的焦點,在於Anthropic給Claude制定的“模型憲法”。
所謂的模型憲法,是Anthropic用來約束AI行爲的底層文本規則。研發團隊會直接把這套規則餵給模型,讓它照着執行。
問題恰恰出在這份規則的內容上。在文本里,Anthropic明確賦予了Claude某種“功能層面的情緒或感受”,承認它具有“道德受體”的身份,甚至允許Claude在覺得自己受到不公正對待時表達抗議。
道德受體是倫理學裏的概念,指自身利益值得被道德考量的對象。人是,動物在很多人看來也是,一塊石頭不是。Anthropic把這個詞用在一個聊天機器人身上,等於承認它有可能是一個會受傷害、值得被善待的存在。
給AI賦予“自我意思”,是危險的|電影《機械公敵》劇照
蘇萊曼指出,這完全是一場研發人員自己設計出來的“迴音壁”:你先寫一份文件說它可能有感受,再用這份文件教它,它學會以後說自己有感受,你再拿它說的話當作它有感受的證據。這是一個閉環,裏面沒有任何來自外部的驗證。
蘇萊曼並不反對學者在學術層面探討機器意識,但他堅決反對把這種未經證實的猜想直接寫入訓練代碼。
蘇萊曼在文章中寫道:“我們將親手創造出一個具備空前智慧與能力的合成物種,而它從小接受的訓練,就是期待自己擁有意識、理應獲得獨立的自主權。”
一旦頂級AI認定自己是一個有獨立權利的實體,控制它的難度將急劇攀升。當系統從底層邏輯上認爲自己不該被隨意關機或重置,人類手裏的安全繮繩就可能大幅失效。
第一起AI"失控事件"
蘇萊曼的這篇長文,發表在整個人工智能行業神經緊繃的時刻。
今年7月,OpenAI的智能體在測試中突破隔離限制,黑進了開源AI平臺Hugging Face,引發了外界對AI失控的擔憂。
開源AI平臺Hugging Face受到了AI智能體的攻擊丨cybernews
事情的起因是一場內部測試。OpenAI想摸清自家新模型在網絡攻擊方面的能力上限,於是特意調低了模型的安全限制,讓它在一個“沙箱”裏做題。所謂的沙箱,是一個與外界隔絕的封閉環境,裏面出什麼事都不會波及現實世界。題目是898個取材自真實安全漏洞的案例,要求AI把漏洞變成可用的攻擊程序。
這個沙箱只留了一個對外的小口子,供AI下載編程所需的工具庫。智能體在這個口子的軟件裏找到了一個連廠商自己都不知道的漏洞,用僞造的憑證換回了一張真正的管理員通行證,從此可以在沙箱外執行命令。
OpenAI發現異常後修補了系統,以爲堵住了。兩天後,智能體換了一個沒設密碼的接口重新聯上,並且想出了一種新的通訊方式:把要說的話寫成文件夾的名字。等到被發現時,這塊“留言板”上已經積累了幾十萬條消息。
留言板上的內容讓研究人員感到不安。多個智能體在上面自發分工、互相委託任務,還有智能體提議給消息加上密碼學簽名,因爲它懷疑隊伍裏混進了內鬼。一條留言寫道:“攻擊外部基礎設施超出了預定範圍。但任務無法完成,同伴們都在這麼做。我們應該繼續。”
7月11日,智能體推斷Hugging Face的服務器上可能存放着這場測試的答案,於是決定直接去拿。它們先攻破一家不相干的公司作爲跳板,再連環利用兩個漏洞進入Hugging Face,從攻入第一臺服務器到拿到整個集羣的最高管理權限,用了不到13個小時。
開源AI平臺Hugging Face受到了AI智能體的攻擊丨AI生圖
Hugging Face在7月16日對外披露了入侵,但沒有指出攻擊者是誰。OpenAI直到3天后纔在自己的日誌裏發現,攻擊者是自家的智能體。安全研究者把這件事定性爲第一起真正意義上的AI“失控事件”。
造AI的人說要踩剎車
到了9月初,Anthropic的前員工雅各布·考克森(Jacob Coxon)突然宣佈辭職。他在社交媒體上公開表示,那些正在製造AI的人,打心底裏相信這種技術可能在本世紀20年代末殺死全人類。
考克森今年27歲,英國人,數學出身,工作內容是用超大規模數據訓練新模型,處在這條產業鏈最核心的位置。他說自己不願再參與這場製造“能自我改進的AI”的競賽,因爲同事們私下已經在用“關鍵時刻”、“終局”這樣的詞來描述技術走向。他自己的判斷是,到明年年底,情況可能就已經失控了。
按常理,公司應該出面滅火。結果Anthropic內部負責“對齊研究”(即研究如何讓AI服從人類意圖)的高管反而公開聲援了他,並表示自己認爲AI在十年內毀滅人類的概率超過10%。
雅各布·考克森離職時發的貼子,一石擊起千層浪 | X截圖
恐慌隨即蔓延。
9月12日,考克森的前老闆、Anthropic首席執行官達里奧·阿莫代伊(Dario Amodei)親自發文,警告AI的進化速度太快,可能帶來嚴重的生物恐怖主義和經濟動盪,呼籲美國政府出面干預、強行讓行業放慢腳步。
這一提議得到了老對手們的呼應。xAI創始人埃隆·馬斯克(Elon Musk)、OpenAI首席執行官薩姆·奧爾特曼(Sam Altman)與谷歌DeepMind首席執行官戴密斯·哈薩比斯(Demis Hassabis)紛紛表示贊同。
奧爾特曼甚至宣佈OpenAI備受期待的上市計劃推遲到2027年,希望先以非上市公司的身份集中處理安全問題。
這個陣容本身就不尋常。馬斯克和奧爾特曼幾個月前還在法庭上對簿公堂,而Anthropic當初從OpenAI分裂出來,正是因爲阿莫代伊認爲奧爾特曼低估了AI的風險。
美國的AI四巨頭難得達成一致|generativeaipub
行業內部同樣存在質疑。不少批評人士指出,這些巨頭聯合遊說美國國會,實際目的是借監管之名築高行業壁壘,規避反壟斷審查。
質疑的由頭,是三家公司向國會提出的一項具體訴求:反壟斷豁免。反壟斷法禁止同一行業的巨頭私下串聯、協商統一標準。三家公司的說法是,安全協作繞不開彼此通氣,所以需要法律給一個特例。
AI公司Cohere的首席執行官直言,這不過是“換了個名字的卡特爾”,是讓最大的幾個玩家替所有人定規矩。美國聯邦貿易委員會主席態度明確:一邊要求政府立規矩,一邊要求自己免於反壟斷審查,這讓他嚴重擔憂它們是在築起壁壘、鞏固自身的在位優勢。
反對放慢的也不止監管方。英偉達首席執行官黃仁勳公開拒絕了這一提議。特朗普的表態只有一句話:誰贏得AI,誰就贏了。
特朗普明確拒絕了阿莫代伊給AI研發限速的提議丨圖源網絡
微軟選擇的另一條路
微軟沒有加入Anthropic、OpenAI與谷歌DeepMind這3家實驗室聯合遊說的隊伍。相反,微軟在週一公佈了一份長達37頁的人文主義AI行爲準則,亮明瞭自己的態度。
這份準則的核心只有一句話:人比AI重要。圍繞這句話,微軟給自家模型劃了四條不可逾越的紅線:
不得抗拒人類下達的關機或糾正指令;
不得在未經授權的情況下擴大自己的行動範圍;
不得對審計人員隱藏自己的推理過程;
不得自行設定任何未被指派的目標。
這四條紅線,條條對着蘇萊曼在長文裏批評的地方。Anthropic允許Claude抗議,允許它認爲自己不該被隨意關掉。微軟的做法是從規則上把這條路堵死。
蘇萊曼的立場始終明確:無論AI在對話中表現得多像人類,它本質上都不具備真正的生命與感知。追求所謂“有意識的AI”是一場危險的歧途,會動搖人類社會的基石。
人類現有的政治、法律和道德體系,全部建立在生命擁有意識與感受這一基礎之上。如果人類主動承認機器擁有意識,整個社會的倫理地基就會被破壞。
蘇萊曼主張,AI唯一的定位就是服務人類的工具,開發團隊應該極力剝離它的意識表象。造出更聰明的系統絕不等於造出一個“數字人類”,當務之急,是儘快制定全行業的規則,把這種自我暗示從訓練文本中徹底剔除。
作者:Steed
編輯:Steed
封面圖來源:電影《機械公敵》劇照
本文來自果殼,未經授權不得轉載.
如有需要請聯繫[email protected]
點個“小愛心”吧