熱門資訊> 正文
2026-09-20 15:14
作者 | 韋思維、四月
編輯 | 四月
從人類身上學到的動作經驗,真的能讓機器人遷移到陌生環境嗎?
近日消息,人形機器人公司 Figure 發佈最新端到端具身模型 Helix 2.5,並讓搭載該模型的人形機器人(Figure 03)在舊金山灣區的 30 套陌生住宅里接受了一場真實的「上崗盲測」。
在 420 次全盲測試中,機器人面臨整理客廳、摺疊毛巾和鋪牀三項長程家務挑戰,最終交出一份56%的端到端成功率。而在完全相同的測試條件下,對照組從隨機權重開始訓練,成功率只有 9%。
47 個百分點的差距,測出了Index 預訓練的真正價值:Helix 2.5 能夠將在離線數據中學到的全身行為,直接遷移到全新的空間佈局、未知物品和身體站位中,極大降低了為每個新場景重新採數和訓練策略的工程成本。
30 個家庭實現零樣本全身泛化
在真實的家庭場景中,人形機器人必須不斷調整全身姿態,才能在狹窄、雜亂的動態空間中探查、觸及並操作物體。由於涉及全身高維度的協同控制,這對模型的零樣本泛化能力提出了苛刻的要求。
對此,Figure 選擇了整理客廳、摺疊毛巾、鋪牀三項需要全身參與的家務進行測試,覆蓋感知、移動、操作能力、雙手協調以及全身控制等不同難點。
為保證評估標準一致,Figure 為三項任務分別設置了明確的時間限制和失敗條件,其中若因安全原因發生人工介入,同樣按失敗處理。
整理客廳:散落在地面的 13 至 15 個玩具必須全部識別撿起並放入收納筐,漏掉一個即判失敗;
疊毛巾:所有毛巾均需在規定時間內完成摺疊並整齊收納進籃;
鋪牀:兩個枕頭和被套兩側均需被拉至牀頭區域,並將褶皺被面整體拉平順。
視頻|一些場景被重置為不受控制的初始狀態的例子,用於零樣本評估。
這里值得我們細究的是「零樣本」的邊界和定義,它主要用於評估環境和操作對象:
Figure 強調團隊從未在 30 套被測住宅採集過訓練數據;
測試使用的玩具、毛巾和牀品在實驗前被單獨隔離,在實驗開始前,經過模型篩查與人工複覈,確保未出現在任務適配數據中;
機器人抵達現場后,不進行任何現場環境建模或權重微調,全憑離線習得的經驗進行實時感知與控制。
爲了避免「邊測邊挑、定向挑選最優模型」,每項家務均採用同一個固定模型版本跑滿 30 套住宅,現場評測結果不作為后續模型篩選的依據。
視頻|在 Index 數據集上預訓練的 Helix 2.5 模型能夠應對三種全身位置操控任務。
在這一嚴苛標準下,搭載 Helix 2.5 的機器人 Figure 03 在 420 次嘗試中成功 237 次,整體成功率為 56%。三項子任務的成績呈現出明顯的分佈差異:
• 鋪牀:完成 94/140 次、達到 67%;
• 摺疊毛巾:完成 87/140 次、為 62%;
• 整理玩具:只完成 56/140 次、降至 40%。
鋪牀與摺疊毛巾的成功率均突破了 60%,原因在於這兩項任務的操作目標相對單一,機器人在較為侷限的工作空間內進行連續動作,誤差擴散相對可控。
而整理客廳的成功率暴跌了 20 多個百分點,根源在於任務結構的根本差異:整理客廳包含大範圍的自主移動、反覆下蹲起立,以及長達 15 輪的重複抓取操作。
在極其漫長的時序鏈條中,任何一次識別漂移、走位偏離或滑脱,都會引發連鎖反應導致任務崩潰。不過,由於 Figure 尚未公佈分步驟的數據統計,目前尚無法量化主要失誤集中在感知、導航還是末端抓取環節。
圖|Index 預訓練與隨機初始化策略在 30 套住宅中的零樣本成功率。
實驗表明,Helix 2.5 能夠在 30 套未見住宅中執行三項長時序任務,無需針對評估環境或被操作物體額外採集數據、微調或適配。Figure 稱,這是首次在如此規模上實現人形機器人零樣本全身行為泛化能力的演示。
9%到 56%,唯一變量是 Index
Helix 2.5 的泛化能力究竟來自具體家務的專項適配數據,還是源於 Index 預訓練?Figure 通過一組嚴格的控制變量實驗給出了定論。
兩組實驗採用了完全一致的任務適配數據、網絡架構、優化器、超參數與評估流程。唯一的區別在於:一組模型直接從隨機權重開始訓練,另一組則基於 Index 預訓練后的 Helix 2.5 權重進行初始化。
結果展現了懸殊的落差:隨機初始化組的完整任務成功率僅為 9%,而 Index 預訓練組達到了 56%,性能提升超過 6 倍。
視頻|Helix 2.5 在執行定位操作以及主動感知任務時的定性行為表現。
面對這一結果,行業普遍關心的核心疑問是:Index 數據集里是不是悄悄塞進了大量「測試原題」?
爲了驗證模型是否在「背答案」,Figure 從視覺特徵與文本語義兩個維度對 Index 進行了聚類分析:
• 一方面直接提取每段視頻的視覺表徵;
• 另一方面讓視覺語言模型為每個片段生成活動和物體描述,再將這些文字轉成語義表徵。
結果顯示,鋪牀、摺疊毛巾和整理客廳中的任何一項任務,在預訓練數據中的佔比都沒有超過 1.90%。
這一數據有力地證明,評估任務並未主導預訓練集。模型獲得的並不是針對特定家務的流程記憶,而是人類在物理世界中沉澱的通用交互機理——例如如何接近障礙物、雙臂協同發力、控制柔性形變以及根據重心調整下肢站位。
這些底層的物理經驗,構成了跨場景泛化的堅實地基。
此外,與上一代 Helix 02 直接借用開源視覺語言模型(VLM)權重不同,Helix 2.5 徹底擺脫了外部 VLM 底座,完全從零在 Index 數據集上學習視覺、語言與物理動作的跨模態對齊。
Figure 還交出了三份"加分卷"
除了 30 套住宅的盲測數據,Figure 此次還同步披露了關於數據效率、行為涌現與 Scaling Law 的三組擴展結論。
第一組是數據利用效率的大幅提升。
對比上一代依賴現場部署採集的 Helix 02,Helix 2.5 在下游任務適配中僅使用了一半的機器人專屬數據,不僅在整體成功率上打平,更展現出了此前不具備的跨場景泛化能力。
第二組是定性行為層面的涌現:也就是自我糾錯。
當抓取動作不理想或受阻時,機器人會自主后退、重新尋找站姿,甚至繞行到牀的另一側變換角度繼續操作。對於長時序任務而言,這類錯誤恢復尤其重要。人類在訓練時並沒有教過機器人「犯錯后如何補救」,但機器人卻能根據物理反饋調整后續規劃。
Figure 認為,這種從錯誤中恢復並繼續推進任務的能力,是 Index 預訓練帶來的重要效果之一。
視頻|全身錯誤恢復機制——機器人會后退一步,重新定位自己,然后圍繞環境移動,以糾正錯誤並完成那些需要長期規劃的任務。
第三組是首次在具身領域驗證了人類經驗的「遷移 Scaling Law」。
在固定模型參數規模與下游微調流程的前提下,Figure 將預訓練數基於1-8個倍增檔位,階梯訓練了四個不同數據檔位的模型,觀察模型在留出評估集上的動作預測損失。
實驗呈現出嚴格符合冪律分佈的下行曲線。更具工程價值的是其前向外推精度:研發團隊僅依據小規模訓練擬合出的趨勢線,便能提前推演出最大規模下的模型損失收斂值,且實際觀測值與預測值的偏差,僅相當於整個 8 倍區間損失變動幅度的 0.54%。
圖|僅利用小規模實驗趨勢線,即可提前預測 8× 訓練損失,外推誤差僅 0.54%
這證明在大語言模型上已被驗證的 Scaling Law 同樣適用於物理世界:將人類日常行為經驗壓縮進神經網絡的過程,存在高度可量化、可預測的規模效應。 團隊無需盲目試錯,在投入下一階段數採與算力前,即可精確折算其對預訓練表徵的邊際收益。
結 語
Figure 此次發佈的亮點,並非又一場吸引眼球的機器人家務 Demo,而在於用嚴格的控制變量證明:人形機器人具備脱離現場微調、依靠人類物理常識實現跨場景遷移的工程可行性。
但 56% 同樣冷峻地指出了當前的物理邊界。它意味着在近一半的嘗試中,任務依然以卡死、超時或安全中斷收場;尤其整理客廳 40% 的表現,印證了多節點誤差在長時序鏈條中存在累積效應。
資料參考:
Figure|Helix 2.5: Zero-Shot 30-Home Generalization(https://www.figure.ai/news/helix-2-5-zero-shot-30-home-generalization)
Brett Adcock|原始評估素材(https://x.com/adcock_brett/status/2100657393923445017)
聲明:本文為 AI 前線原創,不代表平臺觀點,也不構成投資建議,未經許可禁止轉載。