熱門資訊> 正文
2026-09-19 16:21
來源:鈦媒體APP
人形機器人真正走向家庭,難點或許從來不是「會不會做家務」,而是換一個家庭之后,它還能不能繼續做。
9月17日,美國人形機器人公司Figure發佈了Helix 2.5,將其稱為Figure 構建的最先進的神經網絡。這一次,Figure把測試場景從熟悉的實驗室搬到了30個此前沒有見過的家庭,讓機器人直接面對不同的房間佈局、家俱和物品,並完成整理客廳、摺疊毛巾和鋪牀三項任務。
Figure披露,在這30個家庭的測試中,機器人沒有提前採集環境數據,也沒有針對這些家庭進行微調。最終,經過其人類行為數據集Index預訓練的模型,在零樣本測試中的完整任務成功率達到56%;作為對照,從零開始訓練、其他條件保持一致的模型,成功率只有9%。
這組數據背后,Figure真正想展示的並不是機器人又學會了幾個家務動作,而是機器人能否把從過去數據中學到的能力,遷移到一個此前從未見過的真實環境中。
這也是Helix 2.5此次發佈最值得關注的地方。
Figure把機器人帶進30個陌生家庭
過去幾年,人形機器人最常見的能力展示,是在一個相對可控的環境中完成一系列預先設計好的任務。機器人能夠走路、抓取、搬運,也可以折衣服、整理物品甚至操作廚房設備,但這些演示背后往往有一個容易被忽略的前提,機器人已經對所在環境進行了充分訓練。
現實中的家庭顯然不是這樣。
同樣是一張牀,不同家庭的牀墊高度、牀架結構和房間空間都可能不同;同樣是一條毛巾,大小、厚度和材質也存在差異。對於人類來説,這些變化並不會改變我們對鋪牀或者折毛巾這件事情的基本理解,但對機器人而言,每一種變化都可能意味着一個新的訓練變量。
Figure選擇的三個看起來並不複雜場景:整理客廳、疊毛巾和鋪牀。
難點在於,Figure並沒有把測試條件設置得很規整。客廳里的玩具和小型物品,形狀、大小、硬度和材質各不相同;毛巾有不同的尺寸、顏色、厚度和紋理;牀鋪則使用了不同材質、重量和顏色的牀罩、被子和枕頭。
不僅物體不同,環境也不同。每個家庭都有自己的家俱、地面、燈光和操作空間,牀的高度、牀架結構和離地間隙也存在差異。甚至物品一開始怎麼擺放,Figure也沒有進行統一控制:玩具被隨意扔在地板、沙發和桌子上,毛巾被隨手丟在桌面,被子和枕頭則被故意弄亂。
也就是説,Figure測試的並不是「機器人能不能把一條固定毛巾疊起來」,而是換一條沒見過的毛巾、換一個沒見過的桌面,它還能不能完成同一個動作。整理客廳也是如此,機器人需要先在陌生房間里找到13至15件物品,再從不同位置將它們收進籃子;鋪牀則要求機器人圍繞牀移動、放置枕頭,並整理和拉緊牀罩。
這些任務共同的特點是,它們並不存在一套完全固定的動作路徑,同時考驗視覺感知、移動、抓取、雙手協同以及全身控制能力,Figure將這種能力稱為whole-body intelligence,即全身智能。
目前大多數關於機器人泛化能力的研究都是在圍繞機器構建的環境中進行的。桌面機械臂的工作空間是固定的;輪式機器人需要足夠的開放空間來容納和轉彎。而家庭環境則不具備這樣的條件。人形機器人必須在家庭環境中移動,調整身體位置,才能觀察、夠到並操作其他外形尺寸的機器人無法進入的狹小、雜亂空間中的物體。
Figure公佈的結果是,Helix 2.5在30個陌生家庭中,三個任務的完整任務成功率達到56%。作為對比,從零開始訓練、沒有經過Index預訓練的模型,成功率只有9%。Figure稱,使用Index進行預訓練后,模型的零樣本任務成功率提高了6倍以上。
據報道,Helix 2.5 是首個在家庭環境中,面對從未接觸過的物體,零次嘗試就實現這一目標的系統。
這組數據當然還不足以説明人形機器人已經真正實現了「開箱即用」。30個家庭、3類任務仍然是一個有限的測試範圍,而且這些任務主要集中在家庭環境。但從實驗設計來看,Figure這次試圖回答的問題已經發生了變化,機器人不只是要學會某項技能,還要學會把技能帶到一個沒見過的地方。
如果一個模型只能在訓練過的房間里整理玩具,那麼它更像一個經過高度優化的自動化系統;如果它進入一個從未見過的家庭,面對不同的家俱和物體依然能夠完成相同任務,那麼機器人基礎模型的價值才真正開始顯現。
Helix 2.5此次發佈,Figure顯然更希望外界關注后一個問題。
讓機器人學習「人類怎麼做事」
Helix 2.5之所以能夠在陌生環境中表現出一定的泛化能力,背后還有一個重要變化,Figure開始把人類行為數據放到了機器人預訓練的核心位置。
今年8月,Figure推出了名為 Index 的數據平臺,並將其定義為全球規模的人類行為數據集。按照Figure此前公佈的信息,Index已經覆蓋108個國家,擁有超過4.4萬名周活躍數據貢獻者,累計上傳超過1600萬段視頻,數據來源覆蓋家庭、餐廳、物流、工廠和辦公室等真實環境。
與傳統機器人數據集不同,Index並不是單純記錄「機器人完成某個任務」的數據,而是先大量收集人類在物理世界中的行為,再讓機器人從這些「人類經驗」中進行基礎預訓練。
這背后的邏輯並不難理解。一個人第一次走進陌生的房間,並不需要提前接受「這個房間應該怎麼走」的專門訓練。看到桌子、椅子、牀和地面之后,人類已經擁有足夠多的生活經驗,可以根據具體環境決定下一步怎麼行動。即使沒有見過這張牀,人也知道怎樣鋪牀;即使沒有見過這條毛巾,也知道怎樣把它折起來。
Figure希望機器人也能夠獲得類似的經驗。因此,Helix 2.5從隨機初始化開始,完全使用Index進行預訓練;之后再通過任務數據,讓同一個基礎模型分別適配整理客廳、摺疊毛巾和鋪牀三個任務。
這實際上改變了過去機器人訓練的一種常見思路。傳統的機器人學習往往圍繞具體任務展開,想讓機器人學會疊毛巾,就採集大量疊毛巾的數據;想讓它學會整理房間,就繼續採集整理房間的數據。這樣做能夠快速提升特定任務的表現,但當機器人換到另一個環境,或者遇到沒有見過的物體時,往往又需要補充新的數據。
Figure希望把這件事情前移。在具體學習「疊毛巾」之前,機器人先通過大量人類行為數據,學習人類如何觀察環境、移動身體、操作物體以及完成連續動作。這樣,當任務發生變化時,模型不需要從零開始理解整個物理世界,而只需要在已經形成的基礎能力上進行適應。
Figure此次的對照實驗,正是爲了驗證Index在其中發揮了多大作用。Figure在 Index 數據集的嵌套子集上訓練了四個模型,預訓練數據規模擴大到原來的8倍,機器人動作預測的loss隨着數據增加持續下降,並且呈現出較為穩定的變化趨勢。Figure據此提出了所謂的「human-to-humanoid robot transfer scaling law」,試圖證明人類經驗向機器人能力的遷移,也可能存在類似大模型訓練中的規模效應。
這並不能説明人類數據已經解決了機器人泛化問題,但至少說明了一件事情,對於機器人基礎模型而言,大規模的人類行為數據可能不僅是訓練數據的一種補充,而正在成為模型獲得通用能力的重要來源。
具身智能可能進入另一場競爭
如果只看機器人完成鋪牀、折毛巾這些任務,Helix 2.5並沒有改變行業的基本認知。真正值得關注的是Figure正在嘗試建立的這套訓練方法。
過去幾年,大模型行業已經反覆驗證了一個邏輯,當數據、算力和模型規模達到一定程度之后,模型能力可以通過持續擴大訓練規模獲得提升。Figure現在正在嘗試把類似的方法引入機器人領域。
這件事情如果未來得到更多實驗驗證,影響可能比一次機器人Demo更大。
它意味着,具身智能公司未來的競爭不一定只是「誰的機器人動作更多」,而可能越來越像大模型公司之間的競爭,誰能夠獲得更大規模、更豐富、更真實的訓練數據,誰能夠把這些數據轉化成更強的基礎模型。
這也是為什麼Figure近期一直在擴大Index。
對於機器人而言,真正稀缺的數據不是某個機器人在標準實驗室里重複完成1000次同樣的動作,而是大量不同的人,在不同家庭、不同工廠、不同工作環境里完成各種各樣任務時留下的行為軌跡。環境越豐富,人的行為方式越多樣,機器人接觸到的物理世界變化就越充分。
如果這些數據能夠持續進入模型訓練,就可能形成一個類似大模型行業的數據飛輪,更多真實世界數據訓練出更強的模型,更強的模型進入更多真實場景,又能夠產生更多數據。這或許也是Figure願意持續投入鉅額算力的原因。
Figure此前曾表示,未來12個月將投入超過10億美元用於數據和算力。在Helix 2.5發佈時,公司又披露已經承諾投入35億美元算力用於Helix訓練,如果 Helix 2.5 的發展可以作為參考,那麼更多的數據和計算資源應該能夠直接轉化為機器人進入新家之前就能學習到的更多物理世界信息,進而行成「人類數據—基礎模型—機器人」的訓練體系。
Figure Helix 2.5正在嘗試給出的一個新的解法。(本文首發鈦媒體APP,作者 | AGI-Signal,編輯|郭虹妘)