熱門資訊> 正文
2026-09-04 18:23
「得大腦者得天下,得數據者得大腦」,智能機器人行業訓練機器人大腦正在經歷「數據飢渴期」。
財聞近期瞭解到,北京某頭部具身智能企業爲了獲得家庭場景數據,在和居民協商一致后,帶着錄像設備,進入北京居民家中採集數據。
據採集人士稱,剛開始居民覺得新鮮,很配合,但數據採集效率極低,需要不斷重複,后邊居民開始「煩了」。
「我們帶着團隊去北京老舊小區敲門,採到老太太都要報警了。」該人士稱,「爲了訓練機器人在不同環境里干活,得找不同户型、不同樓層、不同年代的房子,80年的、90年的,還有新房子,都得采一遍。」
該人士告訴財聞,數據採集遠不是「拍個視頻」那麼簡單。機器人需要多模態數據,攝像頭拍的畫面、關節轉動角度、手指施加的力,必須同步記錄。任何一秒的偏差,整段數據作廢。
採集只是起點,十萬小時的原始視頻,經過清洗、標註、重建,真正能用來訓練的,可能只剩幾千小時。「採集12個小時,清洗出來能用的,超過1.5個小時就謝天謝地了,這已經是行業最高水平。」
而訓練一個好的機器人「大腦」,至少需要百萬小時級的真實交互數據。目前行業能用的,只有十萬小時級,數據缺口超過500萬個小時。
缺口之下,行業開始出現數據交易。有人戴着頭戴設備在真實環境里採集「異構數據」,7塊錢一個小時賣給機器人公司。但不同品牌的硬件構型不同,採集的數據格式也不統一,「數據孤島」現象嚴重。
稍早前的8月19—23日,世界機器人大會的論壇上,宇樹科技創始人王興興判斷目前機器人大腦能力時稱,「泛化能力不夠是最大瓶頸」。此外,銀河通用創始人王鶴判斷,當前具身基礎模型能力大約相當於GPT-2階段,2028年前后纔可能迎來關鍵突破。
上述人士從實踐的經驗判斷,如果機器人大腦成熟度滿分是10分,目前0.5分還不到。他説,要訓練出一個好大腦,「沒有10億美金是卷不出來的」,算力、人工、本體,三樣都在燒錢,算力尤其棘手。
就家庭場景的機器人而言,擰瓶蓋、疊衣服、刷馬桶、分揀包裹。機器人要做好任何一個動作,背后都需要海量的「視覺+力覺+觸覺」數據去餵養。
當前,整個行業正處在「先建基礎設施」的階段。各家公司在搭建完本體硬件后,幾乎都把資源押在了「大腦」訓練上,不僅要訓練大語言模型那樣的認知能力,更要構建物理模型和空間模型,讓機器人理解重力、摩擦力、材質軟硬、空間方位,
學會在真實物理世界里行動。
行業內,谷歌DeepMind的RT-2系列嘗試用互聯網規模的視覺語言數據進行「預訓練」;
斯坦福大學ALOHA團隊靠人手遠程操控採集數據,將炒菜、疊衣的每個關節角度和力矩都記錄下來。
國內公司也在搭建自己的「數據工廠」,有的自研數據採集手套,有的建仿真環境做「合成數據」,但目前真實數據依然無法被替代。
各家頭部公司的路線各有不同。智元機器人在上海自建了數據採集工廠,部署約200臺機器人同時作業,2024年底開源了全球首個基於真實場景的百萬真機數據集AGIBOT World,其合夥人姚卯青透露今年要產出數百萬小時的高質量數據。
宇樹科技則走開源路線,今年3月將人形機器人全身遙操作數據集UnifoLM-WBT-Dataset放上Hugging Face,包含340小時、189萬條動作軌跡,此前已開源世界模型框架和VLA大模型。
星海圖堅持「整機+智能」戰略,今年6月發佈了VLA基礎模型G0.5和雙足人形機器人Kengo,完成閉環,是國內最早、最堅定押注真實數據的公司之一。
銀河通用走的是「仿真合成數據預訓練+真實數據對齊」的路子。智平方押注類腦VLA架構,自研NeuroVLA構建「皮層-小腦-脊髓」三層體系,目前已在惠科等7個以上行業拿下了規模化訂單。