朝聞通: 全球領先的新聞稿發佈, 傳播和監測服務提供者
搜尋
自變量開源 HOST 框架,讓機器人看一條數十秒視頻學會新技能,較主流方法提速 500 倍

自變量開源 HOST 框架,讓機器人看一條數十秒視頻學會新技能,較主流方法提速 500 倍

2026-08-04 10:15

  /朝聞通/自變量機器人今日發布 HOST 框架(Human-to-robot One-Shot Skill AcquisiTion,人類到機器人單樣本技能獲取)并開源,能讓機器人僅觀察一段數十秒的人類視頻就學會新技能,同時保留已掌握的技能。

  HOST 采用了一種開創性的方法:不去将人類動作翻譯為機器人動作并試圖模仿,而是讓機器人先想象執行動作後的結果,再從結果拆分出需要執行的動作。

  這種全新方法的效果令人欣喜:機器人從一段 29 秒人類視頻中學習技能的成功率高達 62%,超越零樣本基線 45%。相比 Pi-0.5 + 微調方案,HOST 所需數據量減少 50 倍,學習技能速度提升 500 倍。

  模仿人類“觀察學習”過程,自動對齊視頻任務進度

  HOST 的思路來自認知科學中的“觀察學習”理論:人類面對不熟悉的任務時,不需要通過長期練習或者窮舉來學習,而是以先驗能力在大腦中模拟動作的預期效果,然後執行相應動作。

  自變量研究人員受此啟發,将 HOST 的學習方案從“訓練時微調循環”變為“推理時技能獲取”,讓機器人通過觀察人類執行任務來學習新技能。

  機器人首先要解決的問題是:如何對齊自己執行任務的進度和視頻中的進度?

  舉例來說:同樣工作 10 秒,視頻中的人可能已經切完菜、開始炒菜了,機器人還在切菜。如果隻僅按時間對齊,機器人就會丢失任務進度。

  對此,HOST的做法是“按任務進度對齊”。HOST 會将視頻每一幀和機器人操作每一步都轉化為同一向量空間裡的向量;然後利用“動态時間規整”算法,自動對齊“人類視頻的第 X 幀和機器人操作的第 Y 步”。如此一來,機器人執行到每一步時,看到的永遠都是和任務進度對齊的那一幀。

  憑借這種方法,HOST 将對齊任務進度的時間誤差降低了一個數量級,能夠做到機器人執行與視頻示範的精準同步。

  機器人不再模仿人類動作,而是從動作結果反推過程

  機器人學習人類經驗的第二個難點在于:機器人身體結構與人完全不同,無法簡單跟随視頻“照着做”,需要找到一種動作的翻譯方式。

  機器人的構型千奇百怪,如何找到一套通用解法?HOST 規避了“對照身體結構”的問題,分為三步解決:

  首先,機器人需要判斷自己進行到任務的哪個部分。其次,機器人需要将人類執行完動作的畫面翻譯成機器人自身視角和身體結構的畫面。舉例來說,機器人看到人類拿起一杯水,就要想象出機器人拿起水杯的畫面。最後,機器人從畫面推斷出需要執行的動作,并執行這些動作。

  這個解法的優勢在于,它利用“看到人類動作結果-想象出機器人動作結果-拆解結果對應的機器人動作”的思路,讓機器人利用視覺推理看到結果畫面,再反推動作過程,而不是機械地模仿人類動作,從而繞開了“動作映射”的問題。

自變量.png

  模型訓練兩步走:先預測機器人動作,再遷移到人類教學

  HOST的核心部分是一個帶有視覺預測功能的級聯策略模型。它采用雙專家 MoT 架構,如同兩個分工明确的大腦:“視覺大腦”(視頻專家)專門處理視頻畫面、定位任務進度、預測未來圖景;“動作大腦”(動作專家)負責将預測圖景轉化為需要執行的動作,并控制執行。

  在訓練模型時,自變量團隊将訓練過程拆分為“同體預訓練”和“人機視頻訓練”兩個階段。在同體預訓練階段,機器人通過學習機器人自身執行任務的視頻,學會預測完成任務後的狀态,并生成對應動作。在人機視頻訓練階段,機器人進一步學習人類演示視頻,将人類執行任務的過程轉化為機器人視角下的任務結果,再根據目标結果推理完成任務所需的動作,實現從人類示範到機器人技能的遷移。

  如此分兩步訓練的優勢在于:人與機器人執行同一任務的匹配數據相對稀缺,機器人執行任務的視頻與軌迹則容易采集得多。先觀看機器人視頻打好“基本功”,再遷移到人類視頻學習,能大幅提升數據訓練模型的效率。

  學習新技能成功率高達 62%,較主流方法提速 500 倍

  HOST 模型的權重在訓練好後即凍結,僅在推理過程中觀看視頻和複現技能。盡管全部學習素材隻有一段視頻,它的學習效果仍令人感到欣喜:

  僅觀看一段平均 29 秒的人類視頻,HOST 複現技能的成功率高達 62%。相比之下,Vid2Robot/AWDA 同樣從一段視頻中學習技能,成功率僅有 19%。如果采用微調模型的方法,給 Pi-0.5 示範 50 個機器人任務并花 4 小時微調訓練,成功率也僅有 38%。

  相比 Pi-0.5 + 微調方案,HOST 僅需 1/50 的數據樣本量和 1/500 的學習時間,就能讓成功率大幅提升 24%,成為當前表現最好的機器人技能學習方案。

自變量1.png

  不僅如此,HOST 還能最大限度地保留已經學習的技能,因為它僅根據視頻來複現技能:視頻更像是“菜譜”,可以放入書架随時調取。如此便實現了技能的持久化記憶和聯想機制。相比之下,Pi-0.5 + 微調方案學習新技能後,過去技能的保留率僅有 17%。

  在泛化性方面,HOST 測試了 50 個包含不同物體、工具和基本動作的任務,均學習到新技能。在魯棒性方面,HOST 面對改變光照、替換物體、替換場景和移動物體等幹擾,成功率仍全部保持在 50% 以上。即使中途把物品挪走,HOST 也能調整回來繼續任務。這說明 HOST 不是在“死記硬背”動作序列,而是真正理解任務、動态規劃下一步動作。

  普通人也能教授新技能,機器人邁向靈活學習新階段

  簡單來說,HOST 将機器人學習技能的範式從“訓練時微調循環”改變為“推理時技能獲取”。它僅從一段數十秒的人類視頻去學習技能,成功率則遠超主流模型經過後訓練微調的效果。不僅如此,HOST 還能随時調取技能,解決了“災難性遺忘”的問題。

  對此,自變量機器人團隊表示:“在具身智能走出實驗室、走進千家萬戶的進程中,不應該隻靠專業人員采集數據、反複訓練來獲得新技能。人與人之間通過示範傳遞技能,是更加自然高效的學習方式。HOST 将技能獲取從少數人的專業流程,轉變為任何人都能用一段視頻完成教學。”

  目前,HOST 的研究論文和代碼已經全部開源。未來機器人在家庭勞動時,有望擺脫專業化的數據采集和訓練過程,通過直觀的人類演示就學會新技能。這将讓智能機器人成為真正貼心可用的“家庭夥伴”,讓智能機器人服務人類的每一天。

消息來源: 朝聞通新聞稿發布平臺
相關關鍵詞: