對話螞蟻靈波 CEO 朱興:機器人還喫不了「粗糧」

來源: 更新:

機器人打拳跳舞火了一年,它什麼時候才能替我們上班?

前段時間宇樹發佈人形機器人格鬥演示,稱首次實現由世界模型實時驅動的全自主搏擊。據其介紹,UnifoLM-X2-1.0 能實時預測未來狀態,完成規劃、決策和動態交互。

自主格鬥讓我們看到機器人臨場反應的進步,但如果換成在藥房裏取放商品這樣的場景,另一組難題又來了:包裝各異的藥品、有人走動的貨架通道、長時間運行中不斷出現的意外。

這些日常任務,需要機器人把一次次判斷變成持續、可靠的工作。

APPSO 在 2026 外灘大會現場跟螞蟻靈波 CEO 朱興進行了交流。聊到機器人爲什麼連小賣部都還沒大規模落地,他直言:「小賣部其實也很難落地。我懂你的焦慮,今天還是能力和成本兩個都有問題。」

與許多圍繞整機產品展開研發的本體廠商不同,靈波把重心放在具身「大腦」上,希望同一套基礎模型能夠適配不同構型、不同任務,再通過後訓練降低具體場景的使用門檻。重載作業和輕量分揀可以用不同的身體,智能則儘可能複用。

生成可交互世界的 LingBot-World 也是靈波技術探索的一部分。它還訓練了面向具身的視頻生成基座 LingBot-Video,並在此基礎上訓練動作模型 LingBot-VLA 2.0,同時建設數據管線、後訓練和部署工具。

朱興關心的是,這些投入能否讓機器人用更少的數據學會幹活。

我們在外灘大會上,也看到靈波大腦的機器人展示了藥品揀選、物流分揀和工業上下料等操作。藥房演示中的貨架通道僅 80 釐米寬,相關方案已在國大藥房零售門店部署。

靈波也保留了自己的 R 系列本體,用於研發和生活服務探索。做具身大腦,仍然得與硬件、具體場景一起磨合

在現場交流中,朱興談了不少尚未解決的問題:小模型能完成特定任務,爲什麼還要花錢訓練基模?數據越多,效果爲什麼可能越差?商業化又該推進到哪一步?

對於日常生活中產生的數據,他的判斷很有意思:今天的機器人還喫不了「粗糧」

以下內容整理自螞蟻靈波 CEO 朱興的媒體溝通會,APPSO 略經編輯。

一、小賣部,也沒那麼容易

Q:藥房、上下料看起來都很普通。爲什麼不選一些更能體現技術水平的場景?

朱興:我們更在意的是跟生態合作伙伴一起,做一些實實在在的落地。今天要讓它做一個很炫的事情,那也是一個 demo。我讓團隊搞兩個月,可以讓四個機器人打摜蛋,展示高精度、觸覺等非常多的技術,也沒太大意義。

我們看重的是真實應用、數據的產生。在這個過程中,讓模型迭代循環起來,知道還有哪些不足,要提升什麼。

產業也想搞既能規模化應用、又更帥的東西。做不了,模型能力還沒到那一步,或者成本還沒到那一步。

Q:連抓取、放置這樣的簡單操作,也很難做到 100% 成功嗎?

朱興:要看場景、環境和任務本身操作序列的複雜度。

小賣部其實也很難落地。我懂你的焦慮,今天還是能力和成本兩個都有問題。模型能力、硬件穩定性,有些就是夠不着。

今天整個模型還在冷啓動階段。基模幹什麼?是把小學生培養成初中生、高中生、本科生,現在可能還在比較早的階段。

相對客觀地說,現階段想做一定規模的落地,環境不能太開放,任務不能太長程。任務太長,異常就多。今天主流可落地的產品基本還是模仿學習爲主,最怕異常,因爲沒見過。還有成本約束,你創造的價值不夠,自己又貴,長期也玩不轉。

Q:既然如此,先把一個小模型訓到能穩定幹活,爲什麼還要投入通用基模?

朱興:如果階段性只做一個非常特定的任務,也不追求規模化複製,直接懟一個小模型,也不是不能做。但你要看,規模化是不是意味着跨場景、跨任務、跨場所複製,這裏面有泛化的挑戰。

基模能力跟成功率不衝突。基模很大的價值,就是讓後訓練的少樣本表現更好:用更少的數據達到同樣的效果,或者用同樣的數據達到更好的效果。這個效果就包含成功率。

基模提升是水漲船高,跟大語言模型的基模發展,帶動生態應用是一樣的道理。

Q:從一家門店複製到另一家,現在卡在哪兒?

朱興:我們過去一段時間把模型從實驗室拿出來,跟很多夥伴做落地,確實會遇到一個門店和多個門店複製的問題。現在複製成本很高,本質上還是泛化性不足。不同藥房、不同便利店,環境有很多不一樣。

短期可以先選沒那麼開放的環境,壓縮泛化的挑戰;任務不要太長程,先偏單任務。模型可以先驅動一部分環節,再到更多地由模型主導,能力成長要有一個爬坡過程。

二、礦泉水不能跳着舞落到手上

Q:現在很多做視頻、遊戲的公司都在談世界模型。它們的能力,能直接用來控制機器人嗎?

朱興:有些詞的概念很泛。具身的世界模型,跟數字世界、遊戲裏的模型,客觀講也不是一種生物。以視頻生成路線爲基礎的這類世界模型,底層用的是視頻生成的原理,但數字世界和物理世界差別比較大。

數字世界的模型,滿足的是內容需求:豐富、好看、創新、特效、畫質。只要好,用戶可以接受延遲。

機器人需要什麼?它不需要那麼好看,也不需要特效,需要的是合理,符合物理規律,因爲最終要變成動作,控制機器人。

比如我現在想喝這瓶礦泉水,礦泉水在天空中跳個舞,落到我手上,肯定好看,但不符合物理規律,沒意義。

機器人第一在乎是否符合物理規律,第二需要高性能、實時。它在物理世界裏不斷輸入、輸出,不可能等你幫它生成一個很好的故事。

Q:靈波也嘗試過在通用視頻模型上微調。爲什麼後來決定從頭做?

朱興:1.0 系列的時候,我們也是基於數字世界的通用視頻生成模型,比如 Wan,通過微調把它硬調到適合機器人。

一個問題是上限不高。另一個問題是,調到最後會破壞前面模型的先驗和知識,副作用就是泛化性降低。走到後期,我們真的是撞到南牆了。

所以我們很早就啓動了更原生的研發。LingBot-Video 訓練時加入了大量機器人真實數據,再基於它訓練 LingBot-VLA 2.0。

我們相信物理智能需要基於物理真實數據,從 0 到 1 訓練自己的基模。數字智能,包括多模態、大語言模型的發展,可能會給具身很多助力,但內核部分還要靠具身本身解決。

Q:從頭訓練基模,投入更大、風險也更高,爲什麼還要選?

朱興:因爲我們希望長期發展,選擇上限更高的路線。從 0 到 1 大規模訓基模挺費錢的。

大語言模型興起之後,有的選擇基於別人的基模微調,有的冒更大風險投入預訓練。選擇後者也不見得跑得出來。今天具身也進入了「百模大戰」初期,你選一個更高上限的路線還不見得做得出來,但不選擇的話,肯定做不大。

Q:LingBot-World 2.0 開放了 1.3B 小模型。模型小了,幻覺和效果損失怎麼辦?

朱興:不可能說幻覺完全沒有。模型小了這麼多,效果完全保持一致,也不現實。

我們之前說過會開放更小的版本,希望對高交互世界模型感興趣的人能更多地玩起來,這是想給技術社區做的貢獻。

這次也開放了一部分訓練技術。比如怎樣訓練單向因果的能力,機器人的時間一定是單向的,在線預測要按時間順序使用已經發生的觀測,不能依賴未來的真實幀。從現在到未來,不可能穿越。這些技術本身也有門檻,希望能幫助開發者和學術界。

三、「煉丹」背後,是數據的配方

Q:行業總在談百萬、千萬小時數據。你相信 Scaling Law 嗎?

朱興:我也相信 Scaling Law。但不能這麼機械地看數據量。

現在已經有這種現象:一個模型用的數據比另一個多了 3 倍、5 倍,效果卻差,但在某些類型的場景任務上表現得特別好,肯定是數據分佈大量不均衡。我們做基模,談的是一定的通用性。

量重要,但更要談質量和分佈。大家老說「煉丹」,煉丹背後就是配方,數據的配方。

我知道大家特別想大力出奇跡,覺得懟到多少小時,智能就湧現了,具身智能新時代就來了。這個事情不太簡單。

Q:有人說數採廠 90% 的數據無效。問題出在數據供應商,還是模型公司?

朱興:我不知道這個數字是誰說的,怎麼統計出來的。確實,不管哪種數據源、哪種採集方式,都有大量場景重複。過度重複的數據,意義沒有那麼大。

但作爲模型方,你有義務定義需要什麼數據、什麼質量,不能把這件事賴到數採廠。

數據需求是模型訓練來定義的:要什麼類型,什麼分佈,覆蓋哪些場景、哪些任務。難採的先試採,形成比較好的標準作業流程,再交給供應商上量。這是模型廠商很核心的經驗和能力。

供應商則要把執行做好。要求採抓藥瓶,就要把軌跡質量、平滑性、適當的泛化性做好。各有各的責任。

Q:靈波具體怎麼做?

朱興:我們很早就轉向定製化採集,不怎麼購買成品數據了。成品數據容易有技術質量差、大量重複的問題,導致最終能用的比例很低。

我們跟供應商在作業流程、端到端數據管線的自動化集成上,做了很多工作。內部從原始數據到能進入模型訓練的數據漏斗,可用率比較早就從 15% 左右拉到了 90% 以上。

還有一個特別關注的問題:數據從生產出來,到進入訓練,到底要多久,是一週還是三天?我們跟供應商基本採用流式交付,不等一大批數據攢齊再交。

Q:想把質量握在手裏,是不是最好自己建數採廠?

朱興:沒必要非黑即白。

專業供應商有大規模用工的能力。管理很多生產員,怎麼考覈、激勵,產能怎麼保留彈性,這也是能力。至少靈波不擅長,也不想把自己搞得那麼複雜。

未來數據要進入更多場景,進入場景本身也需要運營。我們把數據管線做得更高效,對數據理解得更深,再跟專業服務商配合,是 1 加 1 大於 2。

Q:第一人稱視角的 Ego 數採很熱。戴個頭環、眼鏡拍下人幹活,就夠了嗎?

朱興:Ego 是一個很好的思想,以人爲中心,更便攜,更容易進入開放場景,能夠增加場景和任務的多樣性。但要看具體怎麼採。

頭環加裸手,當前比較大的問題是精度。手的軌跡是重建出來的,誤差過大的時候,數據價值就打折了。

我比較看好結合高精度、便攜的觸覺手套。既保留 Ego 的優勢,又藉助硬件和算法解決精度問題。還有一個重要的點,視覺和觸覺的信息天然可以對齊,只要誤差不要太大。這類數據對下一步模型發展意義很大。

至於設備有兩個、四個還是六個相機,視角不同,都有用途。關鍵還是數據滿足什麼標準,軌跡精度夠不夠。

Q:互聯網視頻、仿真和真機數據,到底應該怎麼配?

朱興:不要輕易談不同數據源的配比。互聯網視頻操作數據那麼多,配那麼一點點真機數據,不就淹死了嗎?

要分訓練階段。越往預訓練,我們越希望獲得場景泛化,所以用無本體數據、互聯網視頻等更容易擴大規模的數據。越到後訓練,越要針對具體場景、具體任務把成功率拉上去,貼近機器人的數據就越有價值。落地前還要採數據,就是讓模型熟悉機器人的構型、任務和環境。

仿真數據也有價值。我認爲今天更多體現在中後訓練,尤其是針對某個具體任務,強化成功率。每種數據都有階段性的價值,不能混在一起只看一個總量。

四、真正的飛輪,要能接住失敗

Q:數據一直要靠人專門去採。什麼時候才能讓機器人邊工作,邊給自己積累數據?

朱興:今天還很早,是冷啓動,靠各種數採強制喂。再往前走,有一點應用規模了,至少部分場景裏的異常數據飛輪可以轉起來。

這時候看重的是異常數據,成功數據沒有那麼大意義。

Q:再往後,真正的數據飛輪會是什麼樣?

朱興:我認爲什麼纔是具身智能真正的數據飛輪?其實每個人的日常生活或者工作過程中,都在爲機器人生產數據。

Q:這些日常數據,現在能直接給機器人用嗎?

朱興:你現在給它,它也喫不了,喫不了「粗糧」。

Q:既然關鍵在數據,是不是模型架構已經沒那麼重要了?

朱興:數據現在很重要,未來更重要。但模型範式沒有完全收斂。世界模型的能力怎麼用好,機器人未來的學習範式,都還要發生變化,必須持續探索。

不要把這個跟 Transformer 那一層的計算架構混爲一談。計算架構一換,大家都會換。模型範式有新東西出來,別人也會對齊。

所以要把數據管線做得更高效,對數據的理解更深。離開這個東西談模型,沒有意義。

Q:那大語言模型公司下場,會不會很快把這些優勢抹平?

朱興:我打個比方,如果今天 OpenAI 或者 Anthropic 下場做自動駕駛,能短時間顛覆特斯拉嗎?

大模型廠商在訓練能力等方面有優勢。但自動駕駛更核心的壁壘,還是數據:什麼是好數據,對數據的理解,以及數據管線。

通用大模型可以提升機器人特定階段的研發效率,是很好的工具支持。但具身面臨的數據挑戰還在那裏,還是要自己解決。

五、人形,不必成爲執念

Q:爲什麼把適配不同機器人構型,看得這麼重?以後不會收斂到一種通用的人形機器人嗎?

朱興:構型泛化是長期存在的問題,也是產業需要。

先看生產力場景。高負重的重載作業,和很輕的分揀,爲什麼要同一套硬件配置?爲什麼一定要同一種構型?有的單臂用六軸就可以,有的需要七軸甚至更多。要服務效率,背後是成本。

再看家庭,每家的第一需求也不一樣,有的要老人看護,有的要陪伴,喜好也不同。人都有高矮胖瘦。

我覺得機器人沒必要長得像人、什麼都像人。我們更應該看具身智能作爲一項技術,能在社會里創造什麼價值。把「人形機器人必須更像人」當成第一性原理,我不覺得是科學的方法。

Q:外骨骼這類產品好像不太需要大腦。一定要用大模型,纔算好的機器人嗎?

朱興:我們談具身智能、談大腦,一般希望它能泛化。有的場景不需要怎麼泛化,完全可以用其他技術更穩健地解決,這是沒問題的。

技術都是手段,最終滿足場景需要是最關鍵的。過去工業機器人基本上把能窮舉的規則都做了,再往前,有些場景就做不了了。

Q:靈波做大腦,爲什麼還要做自己的 R 系列機器人?

朱興:研發肯定需要軟硬一體。模型需要數據,數據由硬件產生,自己不做,也得找別人定製。

另外,螞蟻集團的核心業務沉澱都是圍繞生活服務的,我們也想更早探索生活服務。從早期的擔保交易,到掃碼支付、民生服務,再到醫療健康,螞蟻一直在做這些事。未來到了物理智能的時代,怎麼更好地在家庭中服務人?具身智能是中間繞不過去的橋樑。

R 系列的特點是底盤小,感知設備多,在力控等方面做了不少軟硬件處理。生活服務裏的通行、避障更復雜,要考慮安全。這還不是產業主流的出貨場景,想提前探索,就需要合適的硬件平臺。

工業、物流等夥伴的出貨場景,我們不碰,提供基模和工具鏈。生活服務處在嚴格的 To B 和 To C 之間,是機器人進家庭之前的前哨。

Q:爲什麼先選藥房?

朱興:藥房是試點,確實有需求。大藥店白天外賣訂單高峯時,到店客人會佔用藥師很多時間,機器人能不能輔助一下?夜間更痛苦,一些藥房的訂單量大,外賣佔比又高。

我們是把機器人放進有人的藥房裏工作,要解決人機安全問題。抓拿取放裏也有商品泛化問題:棉籤、膏藥等等,可能有幾千個 SKU,類別很豐富,很多也是家裏會有的物品。

第一,確實有商業需要,或者至少能模糊地看到;第二,它對技術有牽引,對未來進入家庭的探索也有幫助。

Q:離一個可以放心留在家裏的機器人,還有多遠?

朱興:「進家庭」不能模糊地講。是情緒陪伴,還是做一些輔助操作?還是最後既特別聰明,操作又特別好,讓你像信任家人一樣信任它?

如果說的是最後一步,我不好估計時間。安全、倫理等非常高階的問題,還有很多空白。人對安全的感受,包括複雜的物理交互,都很高階。

但我覺得可以一步步來,從情緒陪伴到輔助操作,讓機器人通過少量樣本學會一些技能,可能花幾年時間逐步往前走。

六、「Chat」比「GPT」更重要

Q:具身智能需要這麼多公司都做基模嗎?

朱興:從基座公司的角度,確實不需要太多家。大模型從「百模大戰」走到今天,已經比較收斂。具身也會走向幾家爲主的格局,只是今天可能纔剛剛開始「百模大戰」。

但產業需要很多角色協作,硬件、數據、智能、場景,都要配合。

我們何德何能把大腦做得非常領先,還把所有東西都做得非常領先?上帝不會這麼眷顧靈波。

Q:什麼樣的公司能活到最後?

朱興:我真不知道,回答不了。如果我能回答,靈波就可以「長生不老」了。

Q:你們希望跟本體廠商、場景公司形成什麼關係?

朱興:靈波核心是輸出智能,提供閉源版基模和工具鏈,幫助夥伴更高效地後訓練、採集後訓練數據、清洗標註、做端側量化部署,以及真機強化學習。

我們提供技術服務,一起探索後訓練,不斷磨合。在這個過程中,希望形成一個數據網絡,尤其讓異常數據更多回流。

機器人總體是非標產品,對接客戶需求、集成交付、維護,都非常重。靈波自己做,能做幾家?需要生態一起做。

Q:一方面堅持長期投入,另一方面又要落地。商業化的分寸怎麼拿捏?

朱興:我們不會爲了一個更好的收入數字過度推進商業化。一是不可持續,二是會階段性地把團隊精力耗掉,撿了芝麻丟了西瓜。

但再剋制,也不能不做。只有付費的商業化,才能迎接更真實的考驗。

商業化是公司非常重要的能力。再好的技術,也要在不斷接受商業化挑戰的過程中沉澱。做有限的商業化,我們更在意的是讓團隊具備這種能力,讓技術和產品成熟起來。

Q:未來一兩年,普通用戶和從業者應該看什麼信號,判斷行業真的向前走了?

朱興:在環境、任務複雜度沒那麼高的情況下,一些地方的賬會逐漸算過來。我個人判斷,從今年下半年到明後年,生產力應用的量可能會快速增長。

我特別期待明年有兩個指數級的變化:真實場景裏,以模型驅動爲主、在幹活的機器人數量增長;同樣的真實場景和任務,後訓練成本,尤其數據成本,能指數級下降。

Q:你認爲具身智能會有自己的「ChatGPT 時刻」嗎?

朱興:我覺得會有這個時刻,但判斷不了,技術爆發很難預期。

ChatGPT 更重要的是 Chat,不是 GPT,不 Chat 也不行。這很像具身下一步的發展,哪怕是 To B 應用,也要推到一定規模,把這個閉環轉起來。我感覺 Chat 比 GPT 更重要。

最後的話

現在要買一個機器人來分擔工作,你大概要付出更多額外的的工作:教它、盯着它,在它卡住時接手。這恐怕是生產力機器人最需要避免的尷尬。

機器人替人幹了多少活,人就要替機器人操了多少心。

對想用它節省人力的客戶,單次抓取成功只是開始。一天需要接管多少次?換一批商品要重新教多久?出錯後,普通員工能處理,還是得等工程師?這些負擔足夠低,機器人的工作才真正變成了人的空閒。

這裏有一個繞不開的矛盾:機器人需要真實工作中的反饋才能進步,但客戶買它,是希望工作少一點。當然仿真訓練也在快速進步,但海內完全取代

朱興在外灘的具身論壇裏,認爲機器人總體還處在「童年」階段,但也該下場幹活,否則「學習不完整」。前提是場景相對安全。把任務拆小、把環境控制住,讓機器人先承擔一部分工作,有現實理由。

但這種學習成本,不能含糊地全部交給使用者。早期的工廠、藥房可以選擇共同試驗,雙方說清楚哪些能力已經可用,哪裏還需要人兜底。家庭裏的老人和孩子,卻不能被默認成配合訓練的工作人員。進入生活之前,機器人得先證明,它帶來的幫助大於它需要的照顧。

基礎模型的一次進步,應該讓更多機器人少學幾遍、少犯幾次錯,也讓夥伴少跑幾趟現場。朱興強調異常數據迴流,其價值就在這裏:一次失誤能否變成後來者的經驗。

如果每臺機器人都要從頭犯同樣的錯,「通用」的價值就還沒有兌現。

如果只收走數據,卻不讓已交付的機器人用上改進,用戶就承擔了訓練成本,卻沒分到模型進步的好處。

朱興也承認,有些場景並不需要多強的泛化,用其他技術也可以解決。做大腦的公司,也得接受客戶未必需要一顆最聰明的大腦。

行業在爭論模型路線、參數和數據量,但用戶最終買單的理由,應該是「這件事終於不用我管了」。

#歡迎關注愛範兒官方微信公衆號:愛範兒(微信號:ifanr),更多精彩內容第一時間爲您奉上。

相關推薦
請使用下列任何一種瀏覽器瀏覽以達至最佳的用戶體驗:Google Chrome、Mozilla Firefox、Microsoft Edge 或 Safari。為避免使用網頁時發生問題,請確保你的網頁瀏覽器已更新至最新版本。
Scroll to Top