朝聞通: 全球領先的新聞稿發佈, 傳播和監測服務提供者
搜尋
騰訊的野心藏不住了

騰訊的野心藏不住了

2026-08-10 09:10

  /朝聞通/外界總揶揄騰訊在 AI 賽道“起大早趕晚集”,這顯然低估了其野心。

  事實上,騰訊的布局草蛇灰線,伏線千裡:從底層混元大模型,到中間層智能體開發平台 ADP、具身智能平台 Tairos,再到應用層 WorkBuddy、CodeBuddy 等産品,一條從底層技術到終端應用的落地路徑脈絡清晰。

  其中,具身智能作為騰訊向物理世界延伸的“戰略要塞”,由騰訊首席科學家、Robotics X 實驗室主任、福田實驗室主任張正友帶隊,摸索出一套與行業主流“端到端單模型”截然不同的技術路線,底層邏輯直指具身智能的本質:語言不等于完整認知,真正的智能必須在“感知、決策、行動”的閉環中形成。

  張正友以神經科學經典的“裂腦實驗”點破行業通病:當前多數具身方案過度依賴語言模型邏輯,錯将流暢描述任務視作真正理解了物理世界。

  事實上,人腦左腦負責語言與邏輯推理,右腦負責空間感知與圖像認知,語言隻是智能的對外表達通道,并非認知的全部。

  基于這一判斷,騰訊構建了三層異構的具身智能架構 Apexio,精準對應人腦的認知決策、感知行動、條件反射:

  在張正友看來,這套分層架構是面向真實場景的長期技術路線,其核心優勢貼合物理世界的運行規律。

  此前,行業單一端到端模型要求感知、決策、執行全鍊路同頻運算:要麼為保障認知精度拉高推理延遲,無法滿足實時性要求;要麼為壓縮響應速度犧牲深度推理能力,難以處理複雜任務,導緻主流具身模型存在普遍短闆:一類靠文本拆解任務,邏輯清晰卻落不了地;一類能生成預測畫面,卻講不清規則與邊界。

  與之對應,分層架構能讓不同能力模塊各司其職,既保留了上層的深度思考能力,又滿足了底層的實時反應需求,與人腦運行邏輯高度契合,是更具穩定性的長期技術架構。

  據虎嗅了解,騰訊發布的 RxBrain (騰訊 Robotics X 聯合混元發布并開源的具身世界認知基座模型)實現了兩類核心能力打通:面對複雜任務,它既能用語言拆解執行步驟、明确規則約束,也能同步生成每一步的目标場景圖像。這種“先想象目标,再執行動作”的模式,解決了大量文本難以精準描述的場景問題。

  比如擺放西餐餐具,用文字定義規則需要大量篇幅,一張目标圖即可清晰傳遞要求。執行過程中,機器人還能實時對比當前畫面與目标畫面,判斷執行進度,發現偏差及時重新規劃,顯著提升任務完成效率。

  張正友補充稱,騰訊自研的 HyVLA-0.5 模型已實現工業級落地,依托自研亞毫米級 UMI 穿戴式數據采集手套,積累了超過 1 萬小時的人類第一視角操作數據。其采用雙路徑訓練模式:一條針對特定機器人本體做精細化微調,保障場景适配精度;一條通過 UMI 數據實現跨本體遷移,提升通用适配能力。部署環節則通過異步推理與軌迹平滑技術,實現高頻閉環控制。

  虎嗅溝通發現,這套模型已在日化品工廠産線完成落地實測,作業成功率超過 95%,新增品類(SKU)适配周期不到 3 天,完全滿足工業産線的嚴苛要求。

  除了産線落地的成績,HyVLA-0.5 在權威仿真評測中也拿下綜合排名第一,在核心的長時序任務、記憶任務兩個維度同樣登頂,完成了從實驗室指标到真實生産力的跨越。

  此前,騰訊始終明确不做機器人硬件,一度曾引發外界質疑。

  對此,張正友以手機行業格局類比:行業最終會形成兩種成熟模式,一種是蘋果式的軟硬件全閉環,體驗最優但生态封閉;另一種是安卓式的底層系統賦能,開放生态、規模化落地。

  如今,騰訊選擇的正是第二條路。這很大程度上源于,中國機器人本體制造能力已高度成熟,疊代快、穩定性強,騰訊無需重複造輪子。

  騰訊的核心優勢在 AI、雲與連接能力,因此 Tairos 定位是做具身智能的“通用大腦”:向上支撐應用開發商,向下賦能機器人本體廠商,讓硬件廠商無需從零搭建智能能力,讓應用廠商無需适配五花八門的硬件,整體降低行業落地門檻。

  據虎嗅了解,落地數據已驗證這一戰略的價值:首次和宇樹打磨導覽場景時,基礎适配花了三個月,依托标準化接口後,新增場景 5 天即可落地;給越疆機器狗做系統适配更是隻用了一天就完成部署。

  張正友透露,騰訊選擇優先綁定越疆、宇樹、智元等頭部本體廠商,核心邏輯在于:頭部廠商的硬件穩定性高、問題少,算法打磨效率更高。“一旦與頭部廠商跑通标杆場景,圍繞其布局的集成商、生态客戶即可快速複制方案,實現做通一個、輻射一片的效果,效率遠高于零散對接中小廠商。”

  值得強調的是,具身智能核心瓶頸仍是數據,亦是當前行業投入成本最高的環節。

  張正友認為,當前行業普遍依賴的遙操作數據,正處于金字塔頂端,成本高、規模小、泛化性差。騰訊的思路是打通四層數據體系:用底層大規模數據做預訓練,提升模型泛化能力;用頂層高精度數據做微調,适配特定場景,最大化數據利用效率。

  即便騰訊并非數據采集服務商,但其核心優勢在于模型研發與數據生産的聯動:模型團隊明确數據優化方向,反向指導數據廠商定向采集高價值數據,再通過騰訊雲的存儲、計算能力,為具身智能企業提供數據存儲、處理、訓練的一體化解決方案,形成“數據 - 模型 - 雲”的完整閉環。

  算力層面,具身智能的需求正呈爆發式增長。

  騰訊雲異構計算研發總監陳煜東透露,具身智能客戶的算力需求年增速達 200%-300%,訓練規模從百卡級躍升至千卡、萬卡級;模型疊代周期縮短至兩三天,多模态數據清洗、标注的算力消耗也同步暴漲。

  至于國産芯片的适配難題,陳煜東給出了高效解法:用 AI Agent 輔助算子遷移。“過去工程師手動遷移一個算子平均需要 5 天,如今通過 Agent 人機協同,一天就能完成精度達标、性能更優的遷移,大幅降低國産算力的使用門檻。”

  當前,具身智能行業同質化嚴重,本體形态、落地場景都高度紮堆。張正友認為,這是行業早期的正常狀态,規模化落地尚未啟動,玩家集中探索可行場景并非壞事,充分競争會加速技術疊代。

  所以在落地節奏上,行業必然遵循“從易到難”的路徑:工業場景會率先實現規模化落地,因為環境結構化、物體類别少、任務标準化,數據需求相對可控,更容易達到生産級要求;而家庭、養老等非結構化場景,落地難度要高得多,核心門檻是安全。

  張正友一再強調,進入家庭場景的機器人,安全性必須做到 100%,沒有任何妥協空間。“要實現安全的人機接觸,觸覺、力覺感知是必備能力。沒有力覺控制的機器人,攙扶老人時可能造成骨折,根本無法進入養老、康複等場景。”

  綜上,騰訊在 AI 領域并不執着于技術噱頭式領先。互聯網時代,其靠連接人與人、人與服務、人與内容建立壁壘;AI 時代,它要靠連接模型與場景、智能與硬件、開發者與産業,成為 AI 基建的“水電煤”。

  來源:飛象網

消息來源: 朝聞通新聞稿發布平臺
相關關鍵詞: