/朝聞通/9月15日,紫東太初正式開源ZDTaichu5.0-9B,模型不大實力超群,空間理解專業能力同檔最強,通用能力仍居第一梯隊。更稀缺的是,本次ZDTaichu5.0-9B不隻開權重,更公開數據生産詳細方案,并已在科研自動化、智能制造真實實體場景完成驗證。此次開源,意味着國産多模态大模型正從“看懂數字世界”邁向“理解并行動于物理世界”。

ZDTaichu5.0-9B模型參數量約 9B,支持單圖、多圖、長序列視頻與任意分辨率視覺輸入,聚焦解決真實物理場景下空間感知、跨視角變換、具身任務規劃等行業難題。評測結果顯示,ZDTaichu5.0-9B 是 10B 參數内空間具身能力最強的通用多模态大模型,九大國際權威空間理解基準斬獲 8 項組别第一。同時,ZDTaichu5.0-9B創新新采用自适應循環推理架構,對标行業前沿閉源模型 GPT-6 Astra,展現出高度對齊的技術前瞻性。

當前行業一大技術難點在于:提升模型空間具身能力,往往會犧牲模型原有通用多模态能力。ZDTaichu5.0-9B 完成突破,在空間能力越級提升的同時,圖文理解、OCR、視覺數學、代碼 Agent 依舊保持第一梯隊水準。

權威基準碾壓同級:10B參數内空間具身綜合能力第一
在空間具身能力評測上,本次橫向評測選取 Qwen3.5-9B、STEP3-VL-10B、gemma4-8B-E4B 等開源模型,同時對比 Gemini、Grok 等閉源大模型,覆蓋空間感知、三維推理、多視角變換、具身交互九大權威評測基準,八項取得同參數組别第一名。

模型構建起四層遞進能力鍊條:空間感知→複雜三維空間推理→具身條件推理→物理交互決策,真正實現從 “看懂二維世界” 到 “理解三維物理世界并規劃決策” 的跨越。
在空間感知方面,模型可精準識别物體、方位、排布秩序,視頻目标定位能力同級領先。在視頻定位實測案例中,針對 “尋找從左到右第二個銀色盒子” 任務,ZDTaichu5.0-9B 精準輸出目标坐标,同級其他開源模型全部定位錯誤,該能力是機器人抓取的底層核心能力。

在複雜空間推理方面,直擊機器人移動、機位變化後 “認不出、判不準方位” 的行業痛點。代表複雜三維推演能力的 MindCubetiny 取得 78.27 分,大幅領先同級競品;跨視角評測 ViewSpatial 同樣拉開差距。三視角推理實測中,參照系發生改變時,僅有本模型輸出物體的正确相對方位,其餘模型出現參照系錯亂,可保障機器人運動過程中物體空間拓撲關系穩定。

具身推理與交互理解層面,模型不止識别畫面物體,還可完成空間邏輯推理,判斷物品可放置區域、識别操作前置條件。在 ERQA、RoboSpatial 兩大機器人具身交互基準取得同參數開源模型第一。杯柄側空閑區域選擇測試中,模型輸出點位落在合理空閑區域,對比模型點位全部落在物體占用區域,輸出結果可直接用于機器人交互。

通用多模态能力上,ZDTaichu5.0-9B 在圖文理解、視覺數學、OCR、指令遵循、數學、代碼工具調用多項指标表現優異,通用底座能力沒有伴随空間能力增強而受損。


行業稀缺:對外開放整套空間多模态數據生産管線
不同于市面上多數項目僅開放模型權重,本次紫東太初沉澱了一套經過全流程驗證,對外可複用、可遷移到行業自有數據集的完整數據工程鍊路,遷移整套空間多模态數據生産管線,解決企業拿到模型權重,卻無法基于自有工業、機器人數據疊代模型的行業痛點。
整套鍊路完整覆蓋預訓練、監督微調、高質量退火、GRPO 可驗證強化學習全部環節,包含哈希-URL 雙重去重、畫質過濾、三維能力标簽體系、思維鍊合成、一緻性校驗等全套工藝。科研機構與企業開發者可複用這套流水線,将自有仿真數據、工業現場數據、實驗場景數據轉化為模型訓練樣本。
訓練采用漸進式數據課程體系,實現模型能力階梯式生長。
預訓練階段整合開源圖文、網頁文檔、視頻、三維仿真場景多源數據,經過清洗、過濾、解析處理,完成視覺、語言、時序、三維空間概念的基礎對齊。

監督微調 SFT 階段,采用大規模任務軌迹樣本,對具身樣本強制做多維度一緻性校驗,通過多輪對話、視頻序列樣本構建,教會模型結合視覺證據完成任務拆解、工具調用、具身交互。

高質量退火 + GRPO 可驗證強化學習階段,搭建能力域難度質量三維自動标簽系統,定向篩選優質樣本;設置答案正确性、坐标命中、格式合規多重自動獎勵信号,将空間點位輸出、結構化規劃轉為可訓練目标,适配長視頻、長鍊條具身推理任務。

自适應循環推理,把算力用在真正難的判斷上
為解決空間預測不确定性,支撐高難度空間判斷算力需求,ZDTaichu5.0-9B 内置自适應循環推理機制。該推理疊代運行在模型前向傳播内部,和 “業界猜測”的GPT-6 Astra 所采用 Loop Transformer 技術路線具備高度的前瞻性,在不擴張參數量前提下提升模型有效推理深度。

工作邏輯依靠熵門控判斷任務不确定性:确定性任務直接輸出結果,不消耗額外算力;面對空間變換、物體關系判别等高不确定性任務,模型會在内部循環疊代優化隐層表征,無需依賴外部思維鍊輸出。
同時配備阻尼更新、雙重停止判據、軌迹讀出與狀态回滾三重穩定化工程,保障内部循環不會發散。内部循環聚焦提升單步感知推理質量,複雜長程具身任務則依靠外部任務循環接收環境反饋更新全局狀态,兩層架構協同完成物理世界複雜任務。這套機制讓算力向高難度難題傾斜,在不顯著增加平均推理成本的情況下,提升複雜任務正确率。
長程具身智能:驅動物理世界持續交互與自主決策
真實物理世界下的長程具身任務,包含大量相互依賴的鍊式操作:識别目标、處理遮擋、移動到合适觀測位置、打開容器、調用工具、搬運物體,最後校驗目标是否完成。高層具身規劃,要求模型持續維護全局完整任務狀态,而不是為每一張輸入圖像獨立生成單次動作。

當下熱門的通過 Astra 控制端側設備領域,我們的模型也同樣具備硬核競争力。ZDTaichu5.0-9B無需人工分步引導,可直接融合實時圖像畫面、用戶目标描述與設備執行反饋,自主研判場景、規劃操作步驟,一鍵輸出精準有效的設備控制指令。整套操作全程自主閉環,能夠高效驅動端側工具、智能設備完成既定任務,完美适配複雜的實操場景。

從跑分到實幹,讓模型真正進入物理世界
依托四層能力鍊條與自适應推理架構,ZDTaichu5.0-9B 可以實現真實物理世界的長程具身任務閉環。長流程物理任務需要持續跟蹤物體身份、位置以及任務進度,依據環境新觀測更新狀态,而不是機械執行初始動作列表。
在科學智能場景,模型可以打通幹濕實驗閉環,仿真側仿真計算鍊路:接收自然語言科學問題,自主調用 Python/SciPy 工具,同時求解解析解與數值解,交叉比對校驗結果,自動輸出相空間圖、位移速度時序曲線等可視化産物,完成從提問到分析圖表報告全流程。

濕實驗側,ZDTaichu5.0-9B 能夠在複雜實驗環境中持續跟蹤物體狀态、空間關系與任務進度,依據觀測結果動态更新策略,形成從感知、推理到行動的完整閉環,持續将樣品身份、空間位置、任務進度三者綁定跟蹤,為自動化科學實驗平台提供上層任務編排與狀态記錄能力。

面向工業智能制造場景,模型适配備料配送、機台上料業務,應對密集貨架、零件外觀相似、物體遮擋等車間現實問題。在跨工位配送、機台上料實測案例中,模型接收工單文本,完成高層語義理解,輸出從貨架取件、搬運避障到放置到位的完整任務規劃,打通工單指令到車間物理執行的鍊路。

ZDTaichu5.0-9B 的開源發布,打破了物理世界多模态大模型 “權重易得、能力難複現” 的行業困局,為具身大腦、智能制造、自動化科學實驗領域,交付了兼顧頂尖空間具身能力與完備通用素養的國産化核心底座。
不止釋放模型權重,整套經過工程驗證的空間多模态數據生産管線同步對外開放,把過去少數團隊掌握的核心數據工藝向全行業敞開,大幅拉低具身智能的創新門檻。這不止是一款大模型的開源,更是推動 AI 從讀懂屏幕裡的數字信息,走向理解、決策、交互真實物理世界的關鍵一步。它将激活産學研協同創新活力,加速我國具身智能生态的構建與疊代,為實體經濟智能化變革注入硬核底層力量。
關于紫東太初:
中科紫東太初由中國科學院自動化研究所孵化,是跨模态通用人工智能領域的“國家隊”企業,以“打造自主可控的中國通用人工智能底座,成為全球領先的多模态大模型技術創新者與産業賦能者”為使命。公司自主研發的紫東太初多模态大模型,是全球首個中文千億參數級多模态大模型,憑借領先技術實力榮獲世界人工智能大會最高榮譽——卓越人工智能引領者獎(SAIL獎),并成為首批通過中央網信辦大模型備案、榮獲中國信通院大模型可信認證的“雙認證标杆産品”。