跳去主要內容區域
EN

智慧團隊型機器人與人機協作研究中心
Center for Intelligent Team Robotics & Human-Robot Collaboration

智慧團隊型機器人與人機協作研究中心

多模態數位孿生與人機互動技術

多模態數位孿生與人機互動技術

計畫主持人: 顏安孜

計畫背景

隨著穿戴式裝置、智慧眼鏡與服務型機器人逐步走入人類的日常生活,理想的 AI agents 應能持續感知所處的物理與社會情境,理解使用者正在進行的活動,並在最適當的時機以最恰當的方式主動提供協助。然而,目前的 AI 系統多停留在被動回應指令的階段,距離真正能在日常生活中無縫協作的智慧代理仍有相當距離。

要實現主動式 AI agents 的願景,需要克服三項挑戰。第一是情境理解的廣度與深度,agents 必須能從多模態輸入中推斷使用者意圖,並涵蓋從例行任務到突發事件的各種可能性。第二是訓練與評估資料的取得,真實世界的第一人稱資料蒐集涉及高昂成本、隱私倫理與安全限制,難以涵蓋罕見且關鍵的高風險情境,而既有物理模擬器則因視覺保真度不足,難以將學習成果遷移至真實環境。第三是介入決策的形式化,「何時介入、為何介入、如何介入」目前仍缺乏統一的研究框架,使得主動式代理的訓練與評估難以系統化進行。

研究目標

本計劃目標分三個面向,第一,發展涵蓋廣泛日常生活情境的多模態情境理解能力,使 agents 能從第一人稱影像與聲音中辨識活動、推斷意圖並評估介入時機。第二,建立可規模化、可控制且具備高視覺保真度的訓練與評估資料基礎建設,突破真實資料蒐集的根本限制,使主動式 agents 的研究能在涵蓋罕見與高風險情境的條件下進行。第三,形式化「介入決策」的研究框架,建立統一的代理自主性分類,使「何時介入、為何介入、如何介入」成為可被系統性訓練與評估的研究對象

技術方法

本計畫發展能整合視覺、語言與時序資訊的多模態推理模型,使 agents 能從連續觀察中辨識使用者活動、推斷其意圖與需求,並依據情境決定介入時機與方式。研究將進一步探索 agent 的長期記憶與個人化機制,使 agents 能在跨時段的觀察中累積對特定使用者與環境的理解。

創新

(1) 明確區分主動協助與被動協助兩種代理模式,開發主動式 AI agents。(2) 發展能排除不同模態訊號間衝突與雜訊的多模態整合機制,提升 agents 在真實情境下的推理穩定性。(3) 將介入時機、安全臨界性與過度警示傾向納入評估指標,並進一步內建為 agent 在執行前的自我評估機制

預期成果

本計畫預期產出三項具體成果:(1) 自動化的情境資料生成系統,可從抽象場景產生涵蓋多元日常與高風險事件的第一人稱影片資料。(2) 能處理多模態衝突與雜訊的推理模型,使 agents 在真實環境中仍維持穩定的情境理解。(3) 能偵測風險、規劃介入步驟並調用工具協助使用者的主動式 AI agents。