遍地開花的數採中心,開始批量露餡

虎嗅APP
昨天

起底全國100+具身數採中心

出品 | 虎嗅科技組

作者 | 易玉琴

編輯 | 苗正卿

頭圖 | AI 生成

具身數採中心,近期被推至風口浪尖。

前不久,梅卡曼德創始人邵天蘭公開質疑具身智能行業裏的「攢局」現象,具身數採中心被捲入其中。

這和一年前的氣氛已經明顯不同。

彼時,各地還在密集簽約、開工,幾十台、上百台機器人被搬進一個個新建的訓練場。短短兩年,全國已經出現了百餘家集中式數採中心。

這些中心如今到底運行得怎麼樣?

過去一段時間,虎嗅對全國集中式具身智能數採中心進行了一輪梳理。統計截至2026年8月,共收錄106個已經公開披露的項目。(虎嗅注:調研數據主要覆蓋公開披露、具有固定場地和一定機器人部署規模的集中式具身智能數據採集中心、訓練場及訓練基地。部分項目公開信息有限,各項細分統計以可確認樣本為準。)

同時,我們交流了十餘家機器人本體企業、數採基地運營商、數據服務企業及地方產業人士,並將公開項目數據與一線運營情況進行交叉驗證。

從這106個樣本來看,數採中心的故事,已經走到了一個新的階段。

兩年建了106家,數採中心為什麼突然遍地開花?

數採中心真正熱起來,是從2025年開始的。

此前,這還是一個相對邊緣的概念。2024年3月至2025年3月,全國平均每個月只有約2.7個項目啓動。

到了2025年春天,節奏突然加快。從2025年4月到2026年1月,月均啓動數量上升至約7.3個。訓練場、數據採集基地、具身智能創新中心開始在各地密集落地。

建設高峯出現在2026年一季度。此後,新啓動項目開始減少,前一輪開工的項目陸續投入使用。

啓動和投用兩條曲線之間,大約隔着2到5個月,這也是一座數採中心從簽約、裝修、設備進場到正式運行的大致周期。

截至今年8月,虎嗅統計的106家集中式數採中心中,已經有84家投入運營,佔79.25%。

這意味着,建設潮已經過去了。數採中心正在從密集開工,進入集中運營階段。

按照實際建設方式,目前,數採中心大致又可以分為三類。

一類是機器人本體企業、數據公司自建。這類基地通常直接服務企業自己的模型訓練和產品迭代,部分數據也會用於對外合作或開源。

另一類是高校、高職院校建設的訓練和實訓基地,兼顧科研、教學和數據採集。

數量最多的是政企共建項目。地方提供場地、資金、政策和產業資源,企業提供機器人、技術和運營團隊。

虎嗅進一步梳理了過去兩年具身智能領域千萬級以上的大額中標項目,發現其中相當一部分都指向政企共建型數採中心。相比單純採購幾台機器人,這類項目往往一次部署幾十台甚至上百台本體,同時包含場地、數採設備、平台系統和運營服務,合同金額也因此被迅速拉高。

一位參與過多個地方具身智能項目招商的人士告訴虎嗅,數採中心最大的吸引力,是「落地快」。

「引進一個整機工廠,周期很長;引進大模型公司,人家未必願意來。但數採中心不一樣,有場地、有機器人、有工作人員,很快就能形成一個項目。」

這句話也解釋了為什麼一些原本機器人產業基礎並不強的地區,對數採中心同樣積極。

從數量上看,江蘇有18家,浙江17家,廣東11家,四川8家,北京7家。長三角依舊最密集,但四川、廣西、江西這樣的中西部地區也能迅速跟上。

虎嗅注:上述數據統計以公開披露信息為準

地方有自己的需求,企業也有。多位機器人企業人士向虎嗅提到,數採中心已經成為部分地方招商談判中的常見合作形式。

有的本體企業會提出,希望地方配套採購一定數量的機器人,或共同建設訓練基地;也有地方主動給出數採中心、場地和訂單,希望吸引企業註冊公司、設立研發團隊或區域總部。

對於仍處在規模化落地早期的機器人企業來說,一次幾十台甚至上百台的集中採購,本身就有足夠吸引力。機器人進入基地後,又能夠繼續生產真機數據,服務後續模型訓練。

數採中心也因此成了過去兩年機器人本體企業擴大裝機量的一條重要渠道。

地方需要具身智能產業的落點,本體企業需要訂單和場景,模型訓練又需要更多真機數據。幾股力量在同一時期匯合,最終推動了106家集中式數採中心快速落地。

只是到了今年下半年,這輪擴張已經明顯慢了下來。

華南一家規模化數採基地的運營方告訴虎嗅,今年以來,地方政府對數採中心的資金投入已經明顯有所收窄。「政府的錢不可能一直投,最後還是得找到真實的商業模式。」

第一輪建設潮已經接近尾聲。

接下來,這84家已經投入運營的數採中心,需要回答的是另一個問題:每天生產出來的數據,到底值多少錢。

超5000台機器人,採出來的數據能不能用?

隨着數採中心陸續投用,越來越多機器人被集中放進訓練場。

在統計的106家中心中,有52家披露了機器人部署數量,合計約3972台。單箇中心投放規模從10台到300台不等。據現有樣本估算,全國數採中心中運行的機器人數量至少超過5000台。 

其中,超過半數(55.8%)的數採中心投放量在50台及以下,目前行業仍以中小規模基地為主。

宜賓高鐵南區西南具身智能訓練中心和開普雲具身智能訓練場均部署了300台機器人,並列第一。智元機器人臨港工廠、西南基地,以及柏川數據、惠灣區等基地緊隨其後,規模均在200台左右。

在數採基地裏,機器人抓一個零件、放下,再抓一次;打開櫃門、關上,再重新來一遍。工業裝配、物流搬運、家庭整理等任務,被拆成一個個動作,反覆採集。

遙操員坐在一旁持續操作,系統同步記錄視覺、動作軌跡、關節狀態和力反饋等數據。

一家在全國落地了十餘家數採中心本體企業告訴虎嗅,具身智能行業長期面臨着缺數據的問題。

「LLM(大語言模型)有海量互聯網數據。但機器人需要的是,真正帶動作軌跡、機器人狀態和力反饋的數據,而這些數據往往需要通過真機採集來獲得。」 

集中式數採的價值也在這裏。把設備、場景、遙操員和數據處理流程集中起來,可以更穩定地生產真機數據;對於沒有能力自建數採體系的企業,也可以通過外部基地完成採集。

機器人進入數採中心之後,用途也不只有采數據。長期、高頻運行本身就是一次壓力測試,硬件穩定性、控制精度和任務執行中的問題,往往會在這個過程中暴露出來。

從機器人廠商的出現頻次看,頭部企業已經佔據了更多位置。

在統計的項目中,智元機器人出現31次,樂聚15次,優必選13次,宇樹科技和銀河通用各10次。傅利葉、星海圖、零次方等廠商出現2至6次,還有40餘家企業只出現過1次。

虎嗅注:上述數據以公開披露信息為準

不過,從品牌結構來看,目前多數數採中心仍然圍繞單一本體運行。

統計顯示,65.96%的數採中心採用單一機器人品牌,說明當前多數數採中心傾向於與特定機器人製造商深度合作。

這和現階段數採中心的建設方式有關。

企業自建基地通常圍繞自己的機器人搭建,部分政企共建項目也會綁定一家主要合作方。機器人型號確定後,遙操系統、數據格式和採集流程也會隨之固定下來。

這樣的模式效率更高,但數據複用卻成了新的問題。

不同機器人的自由度、關節結構、傳感器和控制方式並不一樣。同一個「開抽屜」或者「抓取零件」的任務,換一套本體後,原來的數據往往需要重新適配,有些甚至要重新採一遍。

一位具身數據服務商告訴虎嗅:「現在各家都在採自己的數據,最大的問題是很難跨本體複用。同一個任務,A公司採過一遍,換到B公司的機器人上,很多時候還得重新來。」

因此,一些規模較大的訓練場已經開始引入多品牌機器人,嘗試做異構、跨本體採集。

目前,34.04%的數採中心採用多品牌策略,其中2-4個品牌的組合最為常見,部分甚至運行了6-7品牌。這有助於採集更豐富、更多樣化的機器人數據,提升模型的泛化能力。

然而,把不同品牌的機器人放進同一個訓練場,只是第一步。

不同本體之間還需要解決動作映射、數據對齊、接口標準等問題。一套數據究竟能在多大程度上遷移到另一台機器人上,遷移之後又能給模型帶來多少提升,目前仍缺少統一答案。

這也是集中式數採中心增速放緩的重要原因之一。隨着數據規模不斷擴大,行業關注的重點正在從「數量」轉向「質量」。

真正稀缺的,是能夠跨本體複用、可以直接進入訓練流程的高質量數據。而這類數據,很難靠單純增加機器人數量和採集時長堆出來。

84家已經投用,接下來誰來買單?

真正難的問題,出現在數據採出來以後。

虎嗅詢問了多家數採基地運營方,得到的回答基本一致:目前集中式數採還沒有形成穩定的商業閉環。

現階段,數採中心生產的數據大致有三個去向。

第一種是企業自用。對於本體企業自建的數採基地,這也是最直接的一種方式。機器人在基地裏採到的數據,經過清洗和處理後,進入自己的模型訓練和產品迭代。

第二種是對外合作。數採中心按照客戶需求採集數據,再賣給機器人公司、模型公司或數據企業。

第三種則是開源。部分企業會選擇公開部分數據集,用來吸引開發者、完善生態。

三種模式裏,真正決定第三方數採中心能否持續運營的,還是第二種。

問題在於,買家並沒有隨着數採中心一起快速增加。

頭部本體公司大多在建設自己的數採體系,大模型公司對於數據格式、質量和任務場景也有自己的要求。至於中小企業,雖然缺數據,但很難長期承擔大規模真機數據的採購成本。

一位數採基地運營負責人告訴虎嗅,真正願意持續購買數據的客戶比較少。「很多公司會先買一批試試,後面能不能形成長期訂單,還得看模型訓練效果。」

據調查,當前真機數據約500至1000元/小時,無本體的UMI等數據約300至400元/小時,仿真合成數據則在200至500元/小時。

但數據本身也越來越難按「小時」簡單定價。同樣採100個小時,遙操員水平、任務成功率、場景複雜度、機器人狀態不同,最後能進入模型訓練的數據量可能相差很大。

買方開始更關心數據能不能直接用於訓練、能帶來多少模型效果提升,而數採中心過去習慣強調的「機器人數量」「採集小時數」,重要性正在下降。

數採中心的成本卻相對固定:機器人折舊和維修、遙操人員、場地、場景搭建、數據清洗、標註和質檢,每一項都需要持續投入。

建設階段可以依賴項目資金,到了運營階段,收入來源就成了繞不開的問題。一座基地有100台機器人,並不意味着100台機器人的產能每天都能被消化。

與此同時,數採方式本身也在變化。

統計的106家中心中,遙操仍然佔據絕對主流,共出現83次,佔79.05%。仿真、Ego、動捕等路線也在被越來越多地採用。

遙操能夠獲得相對完整的真機數據,但人工成本高、採集速度慢,還伴隨着機器人損耗。過去兩年,Ego、UMI、動作捕捉、仿真和合成數據陸續進入訓練流程,一些企業也開始嘗試用世界模型生成訓練樣本。

技術路線還在快速變化,已經建成的數採中心卻是一筆相對重的投入。幾十台機器人、遙操設備、場景和人員體系一旦配置完成,調整起來並不輕鬆。今天投入使用的設備和採集方式,幾年後是否仍然經濟,需要重新計算。

從全國106家中心的變化來看,集中式數採已經走過了「先把基地建起來」的階段。

接下來,行業大概率會進入一輪分化。

本體企業自建的基地,有內部模型訓練需求託底;擁有穩定客戶的第三方中心,可以繼續圍繞數據服務尋找收入;能夠處理異構本體、提高數據複用率的公共訓練場,也仍有存在價值。

而那些主要依賴一次性建設資金、缺少持續數據需求和客戶訂單的中心,運營壓力會越來越大。

數採中心的建設潮已經結束,淘汰賽才啱啱開始。

本內容來源於網絡,觀點僅代表作者本人,不代表虎嗅立場。如涉及版權問題請聯繫 hezuo@huxiu.com,我們將及時覈實並處理。

End

機器人很熱,但它的「大腦」估值,到底有多少真價值?

💸 400億孖展、超七成押世界模型。

🤖下周二晚7點,四位一線專家,創業/模型/資本/學術同台,追問:

🧠誰將掌控具身智能的大腦?怎樣纔算真正「上崗」?估值怎麼兌現?

👉 下圖掃碼報名,只講乾貨。

📎 詳情:《世界模型最吸金,GPT-6把手伸向機器人:具身大腦到底誰說了算?》

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10