/朝聞通/2026世界人工智能大會(WAIC)已落下帷幕,本屆大會中,具身智能的産業化落地進程成為行業焦點。大量實景機器人落地演示集中亮相,行業技術疊代與場景落地速度持續加快。當前,具身大模型、機器人控制算法仍保持高速演進,與此同時,多元的Real2Sim仿真技術路線,也在産業落地過程中逐步展現出不同的适配特性與技術邊界。
7月初,李飛飛團隊聯合英偉達GEAR、佐治亞理工大學等機構發布全新Real2Sim系統SimFoundry——基于單段普通RGB視頻,自動構建可交互的物理仿真場景,快速生成大量場景“數字變體”,為機器人快速擴量訓練提供了全新技術路徑,也讓Real2Sim技術路線的産業價值得到進一步驗證。

用二維視頻“猜”世界固然是還原物理世界的一種方式,但如視給出了不同思路——不從視頻去推演世界,直接從真實空間去構建世界。坐擁全球最大的6000萬+真實三維空間數據,如視已搭建完成一座可直接開采、可複用、高保真的SimReady“數據礦”。
數據源頭革新:真實三維數據重構仿真底層能力
相較于行業主流的二維圖像生成、算法推演仿真方案,如視從數據采集源頭完成技術疊代,摒棄空間腦補與參數估算,以原生三維結構化數據形成差異化技術優勢,核心能力體現在三個維度:
毫米級精度: 如視通過自研的激光雷達采集設備,對真實空間進行1:1複刻。無論是桌面的高度還是門框的寬度,數據與現實世界保持嚴格的1:1映射,杜絕了視覺重建中的尺度模糊。
零累積誤差:在大場景、長距離、多空間的批量采集與重建過程中,如視三維數據保持了高度幾何一緻性,解決了傳統視覺建圖的軌迹漂移頑疾。無需算法反複推算、補償、猜測空間參數,規避累積誤差帶來的場景扭曲、結構錯位問題,保障大場景仿真的穩定性與準确性。
全要素多維信息:如視的每套三維數據,都不是簡單的圖像堆疊,而是完整的純三維結構化數據,包含深度、法線、材質屬性及精确的物體位姿,所有數據維度精準對齊,為機器人感知、識别、交互、訓練提供全套、真實、可落地的場景參數。
從真實空間到仿真訓練數據的落地
真實三維數據的精度與完整性,構成了仿真能力的底層壁壘。依托超6000萬覆蓋居家、商業、工業、倉儲、戶外場景的三維空間數據資源,如視搭建了标準化Real2Sim全鍊路技術體系。通過采集、重建、語義理解、場景擴量的閉環流程,實現物理空間向AI可訓練仿真場景的高效、标準化轉化。
1. 真實空間采集,多模态補齊二維數據維度缺失
摒棄行業慣用的單一RGB視頻、平面照片等輕量化采集模式,如視通過自研專業設備,同步采集RGB全景、深度、激光點雲、精準位姿、Mesh網格五大多模态數據。全方位收錄物理空間的結構、尺度、位置、細節信息,補齊二維采集缺失的空間維度參數,為高精度三維重建和真實仿真築牢原始數據基底。
2. 行業領先毫米級三維重建,标準化數字孿生場景
基于多模态原始數據,依托算法進行三維重建,規整場景結構、優化紋理細節、校準空間拓撲與相機位姿,标準化輸出完整、規整的數字孿生場景。整套流程是對原始真實空間的規整優化,而非算法推演生成,為後續語義理解、場景編輯擴量提供标準化三維載體。
3. 三維結構化語義理解,實現場景可供性認知
在精準重建基礎上,完成場景物體分割、語義标注與實例識别,實現物體可供性(Affordance)判定,精準識别物體承重、可拉動、可行走等交互屬性。相較于二維圖像語義推測,如視基于真實三維采集數據做結構化标注,避免了認知偏差與幻覺問題,定位更精準、語義更可靠、精度更高,讓空間數據成為機器人可讀懂的“場景說明書”。
4. 真實基底場景無限擴展,滿足泛化訓練需求
基于真實場景的語義與物理屬性,支持自由替換物體、調整空間布局、修改物理參數,可疊加真實材質、碰撞、光照等仿真要素,從單一真實場景衍生出海量變體場景,可交互、可訓練、可評測。所有擴展場景均基于真實物理規則,無算法腦補偏差,以低成本、高效率完成大規模仿真場景的規模化生成,充分滿足具身模型的泛化訓練需求。
從技術疊代進程來看,以SimFoundry為代表的視頻驅動Real2Sim方案,憑借輕量化、低成本、快速生成場景的優勢,為具身智能快速疊代、原型驗證提供了高效技術路徑,極大推動了Real2Sim賽道的技術普及。
這也讓Real2Sim賽道的競争邏輯愈發清晰:輕量化視頻仿真适合快速試錯與基礎模型疊代,而基于真實三維空間的原生仿真,是支撐具身智能從實驗室演示走向工業級落地、實景泛化的核心剛需。賽道下半場的核心壁壘,不再是單一的算法推演能力,而是真實場景數據的體量、精度與結構化加工能力。