熱門資訊> 正文
2026-07-22 11:18
策劃 靖程
作者 高雅
7月17日,極智嘉發佈面向長程複雜任務的統一具身智能框架——Gravity,並率先推出其核心模塊 Gravity 4D 具身模型。在面對任務鏈長、環境不確定、誤差易累積且需精細接觸與自主糾錯的複雜操作,現有方案難以兼顧"理解"與"預判"時,Gravity 可以給出一套面向長程、複雜、可泛化機器人任務的統一具身智能框架:以 MoT(Mixture-of-Transformers)為骨架,融合 VLM 的指令與場景理解、任務推理,以及世界模型對未來狀態的預測與子目標評估;同時引入觸覺/力覺、先驗知識(Priors)、多模態子任務過程監督、任務階段與完成度(Stage/Progress)輸出及短長期記憶模塊,並由強化學習驅動真機部署后的持續自進化。
如果用一句話概括,那就是會理解,更會預判與生成,在訓練時把世界學透,推理時以極簡鏈路實時行動,同時部署之后越用越強。
同日,極智嘉揭曉"一核雙引擎"通用具身智能佈局,即一個智能核心、數據引擎戰略以及生態引擎戰略。其中,Gravity 具身智能框架作為智能核心;數據引擎戰略依託全球智慧物流領域最大規模真實業務網絡,構建物理 AI 訓練場與數據飛輪;生態引擎戰略則是打造 GINO ECO 開放生態,以"具身智能解決方案專家"的定位,加速技術從原型走向生產力。
Q:傳統機器人模型主要偏重於視覺,這次發佈的4D模型從哪些維度對真實物理世界會有更精準的適配,能訓練出機器人哪些特別的能力?
A:如果去看WAIC現場的實戰表現,加載了Gravity 4D模型的極智嘉機器人,是全場為數不多兼具泛化能力與作業效率的具身智能編隊。
這背后的關鍵是4D物理表徵。傳統方案多在2D畫面里做推理,看到的是像素;Gravity 4D直接建模物體的3D空間關係(在哪里、方位如何)和時序運動軌跡(怎麼動、下一步到哪),讓機器人擁有"物理直覺"而非"畫面記憶"。
打個比方:人有兩隻眼睛才能判斷距離和深度,單眼也能生活,但效率和穩定性差很多。4D就是給機器人補上了這隻"立體眼"——它預判的不是下一幀畫面,而是物體在物理空間中的運動趨勢。所以面對陌生SKU它能"看得懂、抓得準",在連續作業中"轉得快、停得穩",泛化不減速、效率不降智。
Q:極智嘉提出從高頻揀貨任務出發走向更廣闊的真實世界,揀貨的三大指標有泛化、效率和穩定性,在您看來,三大指標是否可以遷移到其他場景中去?極智嘉會優先考慮哪個垂直領域做下一個落地目標?
A:為什麼選擇物流場景?我們認為,幾百萬種SKU就是生活當中大部分時候能見到的物品,倉庫里面能練出來穩定的抓取操作的能力,會變成未來在其他商業場景、甚至家庭場景基礎操作能力里的原子動作,這是非常重要的。所有對於物品操作的泛化能力,在倉庫當中都是可以練出來的,這是我們一個最原始的初衷。
説到這個話題,我們覺得非常幸運,極智嘉深耕倉儲物流這個事情已經十年有余,藉助獨一無二的優勢,能把我們基礎操作能力鍛鍊起來。未來,走出倉庫進入更多商業的場景,比如説無人零售、無人藥店,衝咖啡、賣貨等都不是太大的挑戰。
Q:極智嘉2月份發佈了Gino 1人形機器人,目前為止為什麼沒有做量產?
A:我們在過年之前做了第一代的樣機(機器人),用來驗證很多技術,從那個時間點到現在機器人已經準備量產了,過程中做了非常多工程化的迭代、降本,質量可靠性的提升,經過了非常嚴格產品開發流程的考驗。Q3開始投入市場,啟動客户項目應用。
Q:POC的客户現在已經確定了嗎?
A:國內海外都有。
Q:現在有很多本體企業涉獵模型,做基模的企業也去做本體,是不是這樣資本市場纔會更加容易買單?企業必須要做全棧佈局嗎?
A:沒有必要都做全棧公司,在每個環節做出來差異化競爭力,都是很有價值的。具身智能機器人的產業鏈條非常長,每個環節都有優秀的公司。這也是極智嘉為什麼做GINO ECO生態的原因,希望橋接優秀的上游技術公司,做好解決方案,交付給全球終端客户。
Q:您剛剛説會把極智嘉AMR一些參數場景以及Know-How和行業共享,那麼公司的壁壘怎麼建立?
A:極智嘉做了11年物流場景,服務了全球大量集成商夥伴,我們清楚客户到底要什麼。所以做GINO ECO,不是把壁壘拆出去,而是把Know-How分享出來——以"具身智能解決方案專家"的角色,把大腦、本體、部件、應用的夥伴聚到一起,各自發揮長板,共同交付完整方案。鏈條上角色不同,但分工協作,這纔是生態的壁壘。
Q:去年7月極智嘉正式登錄港交所,今年7月發佈了4D模型,據您觀察,過去一年產業有哪些新的變化?
A:技術路線正在快速迭代。去年至今,最大的變化是模型範式從VLA一家獨大,到WAM(世界動作模型)異軍突起——時至今日技術路線仍未收斂,但百花齊放本身就是好事,大量資本和人才湧入行業,推動模型能力持續躍升。
數據層面也在破局。過去機器人領域苦於沒有LLM、VLM那樣的海量數據,但去年開始,Ego-centric data成為新方向——從人類日常操作視頻中學習,相當於給機器人裝上了"人的眼睛"。這條路如果跑通,機器人的Scaling Law或許就在其中。模型和數據兩頭都在突破,整體趨勢很明確。
Q:極智嘉收入很高,很多收入也來自於海外,能不能介紹一下海外客户跟國內客户在接受程度上有什麼區別?另外在海外具體會應用到哪些場景?
A:不論是國內還是海外,客户對於人形機器人都比較樂於去嘗試。我們主要還是佈局在倉儲物流和製造工廠的場景。
Q:關於人才競爭這部分有沒有比較強的實感?極智嘉在招募或者是吸引這些頭部具身人才方面會不會遇到一些挑戰,怎麼吸引到自己想要的人才?
A:頂尖人才看的不是薪資差,而是這事能不能做成、路徑通不通暢。具身智能是軟硬件深度耦合的系統,單靠個人或單點技術無法閉環,必須依託產業力量、紮根真實場景。極智嘉十年深耕,提供了"好場景+好硬件"的雙重土壤——技術模型在這里有真實的物理世界去驗證、去迭代。最頂級的人才,要的是改變世界的機會,而不是一份更高的薪水。
Q對於未來,極智嘉有什麼願景?有長遠的目標嗎?
A:我們的長遠目標是通用機器人+通用大腦,這是非常明確的。包括十年前做極智嘉公司的時候,定位也是一家智能機器人公司。商業上,我們做好機器人產品,首先錨定了巨大有產業價值的物流行業,把機器人單機技術加多智能體技術應用在物流場景和工廠場景里。
在人形機器人方面,剛纔也提到了,我們第一步肯定還是把物流場景和工業場景做好,這是我們非常確定的,在未來兩三年之內作為重點去打造的,在我們最擅長的場景里,將產品和技術打磨好,形成技術與商業的閉環。更長期去看,我們會佈局更廣泛的商業場景和其他更豐富的場景,未來通用機器人+通用大腦,一定往這個方向上去做。