起底騰訊遊戲神祕AI團隊:傑出科學家帶隊,頂尖博士扎堆
去年年底,單瀛帶領ARC實驗室加入IEG(互動娛樂事業羣)公共技術線,開始了在沉浸式體驗相關方向的前沿探索。
公共技術線是騰訊遊戲的核心技術中臺,支撐整個事業羣的共性技術能力。它一頭連接遊戲項目,改造美術、動畫、測試等生產管線;一頭繼續向前探索智能體、世界模型和多模態等技術,判斷它們可能給遊戲帶來什麼。
這套佈局裏,已經有不少技術開始進入項目。比如Motus AI正在用生成式技術改造3D角色動畫管線,GIGA則在探索能夠理解戰局、執行指令,甚至遷移到不同遊戲中的通用智能體。在前幾天的科隆gamescom dev上,兩個項目分別做了演講分享,臺下座無虛席。
Motus支持任意角色骨骼生成
ARC團隊也是這套技術體系的一部分,它團隊規模不大,成員以博士和在讀博士爲主,實習生佔比較高。負責人單瀛爲騰訊傑出科學家——這是騰訊授予頂級技術專家的專業技術職級與榮譽稱號。
和公共技術線內更貼近管線、項目的團隊不同,這支神祕的研究團隊和業務形成一種松耦合的關係,專注於類似世界模型,虛擬智能體,統一多模態方向的前沿探索。
單瀛對自己團隊價值的理解有兩點:
一是做出有技術影響力的成果。說得直白一點,ARC希望自己的技術被同行認可、讓開源社區用起來,也讓外界看到,騰訊不只擁有產品和業務,還在一些前沿技術上做出了一些有影響力的東西。
“一件事如果由ARC來做,和其他團隊做沒有太大區別,那就不要做。我們要做的是把一個方向打爆。”
比如他們在研究世界模型的同時,推出了一款圖像轉3D建模的工具Pixel3D。這個工具實現了圖像與3D建模像素級的對應,做到了以往其他工具沒能做到的事。相當於你在遊戲行業裏,解決了美術原畫和建模打架的問題。
圖源水印
Pixel3D在開源社區、Youtube等平臺獲得好評後,ARC已經開始與騰訊遊戲公共技術線內負責遊戲管線升級的團隊合作,ARC提供研究人員和技術,合作團隊提供研發環境、資源和應用場景,把技術逐步落地到項目中。
二是幫IEG做技術預判。比如世界模型、智能體和生成式AI,會不會在未來三到五年改變遊戲的生產管線?遊戲會不會從“預製菜”,走向實時生成?下一代技術會不會直接換掉行業現有的生產方式?
這些問題短期內沒有答案,但騰訊不能等到行業真的發生變化,再從頭開始研究,公共技術線既要解決遊戲生產和玩家體驗中已經出現的問題,也需要有人盯着外面更遠處的風吹草動。
這次的對話,就跟單瀛的一些思考和預判有關。我們聊到了視頻生成爲什麼會走向可交互的世界,世界模型爲什麼需要紮根遊戲業務,以及遊戲爲什麼可能成爲AGI的重要試驗場。他認爲很多前沿技術未來都會和遊戲發生關係,甚至表示“以後哪個團隊號稱做世界模型,或者做NPC智能體,你要看看他背後到底有沒有遊戲業務。”
以下是我們與遊研社共同對話騰訊遊戲公共技術線ARC實驗室負責人單瀛的內容,部分內容經過刪改。
01
世界模型:
目前誰都沒做好
葡萄君:你爲什麼選擇加入IEG公共技術線?
單瀛:在此之前,我們跟IEG已經有交流和合作。我們之前在主要研究怎麼生成和理解視頻。後來逐漸做到世界模型,發現它與遊戲的結合更緊密,所以來到了IEG公共技術線。
ARC官網展示的視頻理解功能
這也跟我們團隊的定位有關。我們團隊一直在做前沿探索。一般聊實驗室,大家會問是發論文,還是做落地。但我們更關注能不能把一項技術做出影響力。只要把技術做到極致,論文和落地都是水到渠成的事。
我們很早就開始做生成式技術。2022年,在生成式浪潮前,我們已經在研究視頻生成和編輯。但繼續做下去,我們發現視頻不能只靠提前生成,還需要實時交互,於是團隊的研究方向逐漸轉向了“沉浸式體驗”。
簡單來說,就是先構建一個能實時交互的世界,再讓智能體和人進入其中。智能體可以自主觀察、行動,根據世界的變化決定下一步做什麼;人則可以和這個世界、智能體互動,獲得沉浸式體驗。
這個世界可以預設世界觀和大致的劇本,但不需要寫死每個細節。人、智能體和環境相互作用,自然會產生各種事件,再由智能相機捕捉有意思的內容,甚至把它們串聯起來。這樣發展下去,遊戲和電影的邊界會逐漸模糊。我們把這種形態叫作“Game Movie”,它既是遊戲,也是電影。
葡萄君:我之前聽冬哥(騰訊遊戲公共技術線負責人陳冬)提過,世界模型裏的AI應該真正用視覺感知世界,而不是直接讀取結構化數據。但這條路線會不會太昂貴,也比較抽象?
單瀛:要看從什麼角度說。如果只是想做一個好玩的NPC,最直接的辦法就是讀取遊戲底層數據。整個場景的狀態、每個面的座標和光照,引擎都知道。智能體拿到這些信息,就能完成很多任務。
但我們做前沿探索,還希望把智能體和AGI聯繫起來。傳統智能體通過API讀取的,是已經帶有語義的答案,它沒有真正去“看”,相當於繞過了視覺感知這個關鍵問題,直接靠“作弊”拿到了答案。
我們不想走這條路。我們更希望智能體面對原始信息,真正理解世界、物理規律和空間結構。大家把遊戲稱爲試驗場,最終瞄準的還是一種能夠從原始信息中理解世界的智能體。
葡萄君:爲什麼理解原始信息這麼重要?
單瀛:因爲世界模型的核心不是搭建一個世界,是模擬世界怎麼變化。當前世界處於一個狀態,加入一個動作或者擾動以後,它會進入下一個狀態,這裏麪包含因果關係。
視覺的價值,就是讓原始數據直接進入模型。在沒有標準答案、從未見過的場景裏,模型必須自己理解一個動作會怎樣改變世界。這個過程更接近人腦的推理方式,以及人類掌握規律的能力——這纔是更接近通用的價值。
葡萄君:現在騰訊在世界模型這個領域處於什麼水平?
單瀛:世界模型這件事,目前誰都沒有真正做好。我可以先講講,現在世界模型大概有哪些技術流派。
一條是純生成路線,我們內部也把它叫作“無骨派”。它不依賴傳統的3D模型和材質,而是根據文字,圖片等多模態輸入,直接生成視頻。就像現在Seedance、可靈等視頻模型生成的一些內容,在很多類別的題材上呈現出來的效果已經達到可用的狀態。質量的天花板很高,但在三維一致性,物理規律的合理性等方面沒有保證,在小衆類別上也會出現問題。
另一條路線是“有骨派”。基本思路是在傳統流程上加入生成式能力,從而構建新的世界。
比如一些3D生成的初創公司的打法就比較有代表性,也體現了行業裏的一種思潮。他們本身有3D技術積累,生產方式是先做一個粗糙的3D白模或者場景結構,再加入生成式技術進行精裝,讓最終效果更接近自然圖像的分佈。
在傳統骨架之上加入生成式渲染,是一條相對清晰的路徑。而且把世界模型描述成這樣一件事,大家心裏會更有底。你現在看那些需要融資的團隊,基本上都在往這邊走。
另外在“有骨”和“無骨”之間,還有一種“軟骨”的打法。這條路線會把三維結構和物理規律軟化成一種隱式表達,放到模型的隱空間(Latent Space)裏。
葡萄君:相當於還是視頻,但存在某種結構。
單瀛:對,內部是有結構的。這是一條比較新的路線。像我們這樣做前沿探索的團隊,會更多往這個方向走。我們在研究怎麼把顯式的“骨”化掉,再融入生成模型內部。
比如我們最近發佈的SCoPE這個工具,就是把3D相機的位姿信息通過一種原生的方式插入到視頻生成的過程中,達到了類似傳統3D製作中對相機控制的程度。這裏面有很多有挑戰的問題,但我們感覺這條路應該能夠走通,而且它和傳統技術的連接也會更自然。
當然,包括一些從ARC出去做視頻的人,他們仍然堅持完全無骨的路線。他們相信只要有足夠多的數據,再結合一些技術手段,就能解決這些問題。所以世界模型的探索還在演化過程中。
葡萄君:這些路線之間存在明確的水平高低嗎?還是說大家只是在不同方向上探索,都處於早期階段?
單瀛:每個方向都有自己的技術難點,區別主要在於最終的天花板有多高。例如GS重建路線的天花板相對有限。但對於一家初創公司來說,需要儘快拿出成果,這通常是最快的路線。畢竟現在的大模型說到底還是數據驅動。你手裏相關的場景越多,就更有可能做出對應能力。
葡萄君:所以騰訊的優勢,可能在於對應的垂類數據場景比較多,質量比較高。
單瀛:我覺得騰訊的關鍵優勢,是背後有實實在在的業務。拋開其它因素不講,建設這類模型的投入,沒有來自真實業務的驅動,和真實業務場景的需求和反饋,是很難持久的。
世界模型也是同樣的道理。它可以理解爲一種實時、可交互的視頻構建方式,最大的應用場景就是遊戲。早期或許你可以不靠遊戲業務做概念,但真要把它跑出來,背後還是需要一個足夠大的遊戲業務。
騰訊遊戲有這麼大的業務規模,我們紮根在這裏,土壤肯定是最肥沃的。
葡萄君:世界模型、智能體等技術,距離真正的質變還要多久?目前有哪些關鍵問題尚未突破?
單瀛:只講世界模型的話,它在實時性、交互性等方面還有很多問題。現在的視頻生成效果看上去雖然很好,但通常只能生成10秒左右。世界模型真正運行起來,不可能只讓玩家進去玩10秒鐘。
“無骨派”路線可能也是生成幾十秒就開始變形,加入骨架後雖然可能會堅持更久,但沒有從根本上解決問題。
更何況除了連續性,視覺內容本身也要保持自洽,維持足夠高的一致性。這件事同樣很難。舉一個經典的例子,你進入一個世界,桌上放着一塊鍾,顯示12點。你到外面轉了5分鐘,再回到這個房間,這塊鍾應該顯示12點05分。
葡萄君:我覺得回來以後鍾還在,可能都已經很好了。
單瀛:我們在SIGGRAPH上,跟幾位老朋友討論這個問題,大家一致認爲:你真要牛逼,就應該這樣。
02
遊戲與AI
葡萄君:世界模型等前沿技術,目前發展到了什麼階段?它們會先從哪些環節進入遊戲工業?
單瀛:我覺得它要經歷一個量變到質變的過程。現階段最容易看到效果的,是升級傳統遊戲管線。例如有骨派可以結合3D生成、場景生成和重建技術,根據一張圖片做出三維場景和Mesh(網格),再轉換成可交互的內容。我們前段時間做的三維重建方法Pixel3D,就是在前沿探索中發現了進入遊戲管線的可能。
像我們這樣的團隊,其實是在壓縮探索成本,減少探索的不確定性。一旦我們把一條路探出來,業務團隊就不需要再重複探索,只要順着這條路擴大規模、推進工程化就可以了。
未來做世界模型也一樣。一旦我們在幾個方向中找到了相對確定的路徑,身邊的業務團隊就可以迅速接上,這就是紮根在業務裏的優勢。
葡萄君:除了升級傳統遊戲管線,前沿技術還有其他的應用路徑嗎?
單瀛:第二條路徑是遊戲“大片化”。遊戲的畫面質量會越來越接近電影。比如《黑神話:悟空》已經做得很好了,能看出它在往大片畫面上靠近。我們在乎實時性,也在乎渲染效果。加入更多生成式技術和“軟骨”以後,未來遊戲有可能真正達到電影級的畫面質量。
另一個方向是休閒遊戲。未來大家可能像生成圖片、視頻一樣,直接生成一款小遊戲。
而且這件事已經在發生了,它有可能會像短劇一樣成爲很大的市場。不過,它對傳統遊戲的衝擊,可能沒有短劇對長劇那麼大。因爲遊戲有很強的社會屬性,玩家需要和其他人一起玩,這一點不太容易被替代——生成式小遊戲和傳統遊戲之間,可能更多是一種互補關係。
遊研社:接觸更多遊戲業務以後,你對遊戲和AGI的關係有沒有新的理解?
單瀛:剛纔講的沉浸式體驗,瞄準的就是AGI。對我們這樣的團隊來說,做一個會打遊戲的智能體只是短期目標。真正要做的,是把世界模型這套東西做透,繼續向AGI推進。
AGI最核心的能力是理解。模型不能只是一個走問答捷徑的系統,它要真正理解問題。就相當於以前班上的學生有兩類:一類記性特別好,什麼都可以記住;另一類記性不是很好,但做數學推導題特別好。
對於AGI來說,死記硬背不是最難的問題。主要還是要真正去理解、真正去推導,能夠去找物理規律,這個我覺得最關鍵。遊戲正好提供了這樣的環境。在構建世界模型和智能體的過程中,你會越來越看清AGI的發展路徑。
遊研社:也就是說,遊戲是世界模型乃至AGI的重要試驗場?
單瀛:這是肯定的。世界模型要解決的一個核心問題,是用戶給一個動作,它能不能預測世界接下來會發生什麼。這是不是和遊戲很像?
在真實世界中收集這樣的閉環數據成本很高。其他不講,自動駕駛這件事情做了那麼多年了,有大量車輛在真實道路上採集數據,仍有很多問題沒有解決,很多人到現在還是不敢用輔助駕駛。虛擬環境則可以靈活構造不同場景,調整環境複雜度,持續記錄動作反饋以及世界狀態的變化。
更重要的是,遊戲裏有大量真實玩家。他們會把自己的知識、策略和判斷帶進遊戲,並通過行爲表現出來。這種長期持續的互動在其他場景裏很難復現。
所以,遊戲既是世界模型和 AGI 理想的檢驗場,也是重要的驅動力。一個團隊如果擁有真實的遊戲業務場景,往往更有條件推動世界模型和 NPC 智能體持續迭代。
03
在IEG裏做研究
遊研社:加入IEG以後,你們過去的技術積累,有沒有獲得更合適的發展土壤?
單瀛:這是一個漸進的過程。團隊早期從超分開始,很早就進入了包括圖片,視頻,3D生成的技術領域。後來我們做了文本生成視頻的VideoCrafter、圖片生成視頻的DynamiCrafter,接着開始研究怎麼控制視頻生成,比如相機怎麼運動,怎麼讓已經生成的視頻動起來。
2024年推出的視頻模型DynamiCrafter的示例圖
這些工作一直在把視頻生成推向互動。在研究相機控制時,我們就已經遇到了世界模型長時間生成會變形的問題。所以來到IEG以後,並不是突然換了一條路,而是沿着互動視頻繼續往前走——互動和互娛,其實已經差得不遠了。
葡萄君:你們會考慮落地這件事嗎?
單瀛:我們其實更關注能不能在敘事框架裏,把一些關鍵技術做到極致。如果做出來的東西足夠好,自然會產生影響力,社區會使用,公司內部也會使用。
但同時我們強調一句話,“在有魚的地方打魚”,意思是我們的研究仍然有明確導向,跟業務息息相關。我們團隊每天都能看到業務同學在做什麼,給我們研究問題提供信息。
葡萄君:但業務團隊不會直接給你們提需求?
單瀛:不會。前面講到,我們和業務是松耦合,我們更希望研究人員能夠自己觀察業務,從中發現值得解決的問題。
葡萄君:像升級遊戲管線、Pixel3D這樣的探索,相當於是隨緣的狀態?正好看到了,正好能用上?
單瀛:還是那句話,我們是在有魚的地方打魚,不能去太遠。研究人員會先沿着有業務價值的方向探索,再通過業務反饋形成自己的判斷。我們這套研究模式叫“創新漏斗”。
一年裏,我們可能會發表一定數量的論文,基本都會開源。其中大約四分之一會得到社區較好的評價和使用反饋。而業務團隊本來就關注技術趨勢,看到一個新技術出現,然後發現是騰訊IEG的團隊做的,就會主動來交流。得到社區認可的成果中,又有大約四分之一能夠進入業務合作。
單瀛總結的技術影響力漏斗
葡萄君:如果選擇直接解決業務需求呢?很多公司的技術中臺可能沒條件採用這種漏斗模式。
單瀛:這要看團隊的定位。如果一家公司或行業的技術範式成熟、需求明確,那你直接去做也沒有問題。但我們要做面向未來的技術,存在很多不確定的路線,這種情況下漏斗模式會更有效。
這套模式也需要組織給團隊足夠的認可和空間。我們花了五六年時間,陸續做出了一些成功落地的技術,也建立了行業影響力,才逐漸證明這條路可以走通,從上到下得到了對這套機制的認可。
而且對騰訊來說,ARC這樣團隊並不大,相比創造出直觀的收入,團隊的更大價值在於建立足夠大的技術影響力。
葡萄君:要運轉這套模式,最關鍵的條件是什麼?
單瀛:有兩點,一是找到特別好的人,二是研究必須紮根業務。
2018年底我回國組建團隊,花了一年時間只招了6個人。同期另一個團隊半年招了200個人。我當時擔心這個速度是不是慢了,但管理層卻告訴我“動作不能變形”。
後來,我們一直堅持招最好的人,做最難的事。比如當時我們團隊有位成員只做超分(超分辨率重構,Super-Resolution),他博士階段的三四年都在研究超分,加入團隊後又幹了一年多人臉超分,是一位專才。
後來騰訊微視想做一個“讓老照片動起來”的功能,嘗試過不少方案後最終選擇了ARC,把我們的人臉超分技術接進去,最終做成了微視首個的爆款功能,使用量100多萬次。
圖源@機械之心
這個案例給了大家很大信心,一方面證明了研究者必須鑽到這個程度,纔有可能把一項技術打爆;另一方面也說明這套漏斗模式能產生真正有價值的成果。
葡萄君:團隊怎麼判斷一個研究方向值不值得投入?管理層會參與這個過程嗎?
單瀛:首先我會判斷,這件事交給我們做,能不能做出彩?如果大家做出來都差不多,我們就不會做。
這種判斷很難完全量化。有點像好萊塢製片人聽別人講劇本。對方把劇本講完,你就會知道這個故事能不能行。而且不只是我,團隊裏的同學做久了以後,也會有這種感覺,能判斷出某個技術有沒有機會。
這個過程中,管理層不會給我提具體需求,但會參與方向引導和業務連接。比如聽完彙報後,有時會直接指出一項技術可能適合什麼場景。
我們以前做過一個開放世界目標檢測模型YOLO-World。它不需要提前固定所有識別類別,增加新類別以後,也不必重新訓練整個模型。
當時剛好QQ瀏覽器想做一個“萬物識別”功能。如果按照傳統的識別技術路線,必須預先規定哪些能識別、哪些不能識別,就很麻煩。
管理層聽完我們的彙報,覺得這項目標檢測技術能用,就直接幫雙方建立了聯合項目,把技術順暢地接入了進去。後來,同一項技術還被用於騰訊SSV(可持續社會價值事業部)的公益項目,在森林裏識別珍稀動物。
再比如我們之前做過一個視頻理解模型。可以自動總結視頻內容。後來元寶接入了這項能力,用戶把暫時沒時間看的視頻轉發過去,元寶會保存、解析並總結;之後視頻號覺得技術不錯,把它用進了自己的場景。
所以說在騰訊做研究,只要方向不太離譜,圍繞主要業務展開,總有地方能用得上。騰訊內部的技術落地經常是這樣。東西足夠好,就會在不同業務之間自然流動起來。
葡萄君:在你看來,管理層爲什麼會支持ARC團隊和這套模式?
單瀛:管理層不只關心技術能不能落地,也願意理解技術本身,對技術有熱愛,堅持長期主義。
比如我之前的老闆去西雅圖招人,我是他那趟行程見的最後一個人。我們聊到一篇我在微軟做第一作者的論文,第二天早上,他突然給我發微信,挑出論文裏的一個公式來問我。我沒有想到他回去以後真的把論文看了,而且還追問得這麼細節。
Mark(騰訊集團COO任宇昕)對技術也非常感興趣。我以前組織過一次內部研討會,邀請了一些港校和C9高校相關方向的老師,Mark和冬哥也參加了研討會,他們問的問題很底層和原生,你能感覺到他們是真心關注這些技術。
騰訊是一家產品爲王、產品驅動的公司。在這樣的公司裏,管理層仍然願意堅持長期主義,支持這種研究模式,我覺得非常難得。
葡萄君:如果是在一家體量沒那麼大的遊戲公司,做這些研究會遇到困難嗎?
單瀛:放在以前,他們幾乎不可能做這樣的研究,團隊肯定要接業務需求。因爲長期主義背後需要實力支持,研究團隊每年都需要成本,公司規模越大,越容易容納這筆成本。
不過現在情況也出現了一些變化。一些AI初創公司也能拿到很多融資,能請到行業人才,集中力量把一個垂直方向打爆。現在美國還有一種“Neo Lab”的概念,這類機構資金特別充足,會招一批頂尖研究者。極端情況下,比如楊立昆的團隊,投資人甚至會投入幾十億歐元,啥都不要求,只讓團隊做研究——一些領域,單靠技術敘事就能夠形成不錯的商業價值。
所以現在一些資金充足、處於前沿敘事賽道的初創公司,也有可能建立類似我們這樣的團隊。
葡萄君:最近我們和一些AI公司交流,他們表示現在很多人都具備了Coding的能力,他們招人時會更看重技術素質,以及運用第一性原理思考的能力,因爲一些人在原有研究方向上積累的經驗可能會限制住自己。在你看來,技術人才的積累在什麼時候會成爲優勢,又在什麼時候會變成限制?
單瀛:我們在招人時也從頭到尾都不考Coding,相比之下,我們更關注創新能力和學習能力。
比如我們會在面試前兩三天,給候選人一篇他從未接觸過、與原有方向差異很大的論文,讓他研究。
面試時我們會跟他討論兩件事:一是請他講過去最得意的項目,通過他的思考方式,瞭解其創新、原創能力;二是看他能把這篇新論文理解得有多深,看他能否在短時間內抓住核心,形成自己的判斷。
因爲ARC從來不是同一個方向做到老的地方,研究方向可能經常會變。所以需要一個人既要能長期做深一件事,也要能迅速理解新東西。這種能力無關AI,在任何時代都很重要。