iFLYTEK-Embodied-Omni:統一視覺、語言與動作的多模態基礎模型

為提升通用型具身代理人的指令理解與長期控制能力,研究團隊打造 iFLYTEK-Embodied-Omni,採用視覺語言、影片生成與動作生成的共享多模態自注意力架構。模型將高階規劃與低階執行分工協作,並以混合示範影片進行四階段訓練,顯著提升任務執行的準確度與穩定性。

Omni multimodal AI framework for humanoid robots unifying vision, language, and action control.

背景與挑戰

通用型具身代理人需要同時理解多模態指令、預測環境變化,並在長時間跨度內產生精確的控制動作。傳統方法多聚焦於單一模態,如視覺語言推理或影片建模,且常以階段式管線處理,容易產生介面瓶頸與錯誤累積。

iFLYTEK-Embodied-Omni 架構

iFLYTEK-Embodied-Omni 採用單一 Omni 框架,將視覺(影像與影片)、語言與動作共同建模。模型內部包含三個專屬子模組:視覺語言模組、影片生成模組與動作生成模組,皆透過共享的多模態自注意力層互相通信。

此設計類比大腦與小腦的協作:視覺語言與影片生成模組組成高階「大腦」,負責指令理解、任務規劃、進度追蹤與未來視覺狀態預測;動作生成模組則是低階「小腦」,直接把規劃好的子目標與共享上下文轉換為可執行的動作片段。

資料與訓練流程

研究團隊蒐集了包含動作標註與未標註的具身影片,來源包括人類示範與機器人互動。這些影片與一般的影像-文字對應資料共同構成大型訓練集。

訓練採四階段策略:先分別預訓練視覺語言、影片生成與動作生成模組,最後再以聯合方式微調整體模型,使三個子模組在共享上下文下協同運作。

成效與展望

經過四階段訓練後,iFLYTEK-Embodied-Omni 在多樣化的具身任務中展現出更一致的指令執行與動作精度,減少了傳統階段式管線的錯誤傳遞。未來可望擴展至更複雜的環境與長期規劃任務,推動具身 AI 向更通用的方向發展。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more