
AI 能像東說念主類相似意會長視頻開云kaiyun官方網站。
港理工、新加坡國立團隊推出 VideoMind 框架,中樞立異在于變裝化推理(Role-based Reasoning)和鏈式 LoRA(Chain-of-LoRA)政策。
關聯論文已上傳 arXiv,代碼和數據一齊開源。

跟著視頻數據量的激增,如何意會和推理長視頻中的復雜場景和事件成為了多模態東說念主工智能預計的熱門。不同于靜態圖像,視頻不僅包含視覺信息,還包含技能維度上的動態變化,這條款模子防備會視頻時不僅要識別畫面中的物體和場景,還要意會這些物體和場景如何隨技能變化和相互作用。
傳統的基于文本和圖像的推理模子(如 OpenAI o1, DeepSeek R1 等)頻頻無法叮嚀這種復雜的技能維度推理任務。
VideoMind 框架
區別于文本和圖片,長視頻意會難以用傳統的單次感知 + 純翰墨推理結束。
比較之下,東說念主類防備會長視頻(如教育視頻、故事類視頻)往昔日會尋找關聯片斷并反復不雅看,以此獲取更可靠的論斷。
受該景況啟發,作家把柄視頻意會所需要的 4 種中樞智商(制定謀劃、搜索片斷、考證片斷、回答問題),為 VideoMind 界說了 4 個變裝,并構建了一個變裝化的責任流,靈驗地處理了長視頻中的時序推理問題。
謀劃者(Planner)
把柄問題動態制定謀劃,決定如何調用其他變裝(如先定位,再考證,臨了回答問題);
定位器(Grounder)
把柄給定的問題或查詢,精篤定位與之關聯的視頻片斷 ;
考證器(Verifier)
對定位得到的多個技能片斷進行考證,確保其準確性 ;
回答者(Answerer)
基于采納的視頻片斷進行意會,生成最終謎底。

△圖 1:傳統純翰墨推理和 VideoMind 的變裝化推理
為了高效整合以上變裝,作家進一步忽視了鏈式 LoRA(Chain-of-LoRA)政策,在一個息爭的 Base 模子(如 Qwen2-VL)上同期加載多個輕量的 LoRA Adapter,并在推理時把柄需要進步履態切換,以結束不同變裝間的頤養。該政策僅需要在 Base 模子上添加少許可學習參數,即可結束多個變裝 / 功能間的無縫切換,既贏得了比單一模子顯赫更優的性能,也幸免了多模子并行帶來的操辦支撥,從而在確保性能的同期大幅提高了操辦效果。

△圖 2: VideoMind 的舉座架構和推理經由 VideoMind 推理經由
如圖 2 所示,模子領受一個視頻和一個用戶忽視的問題當作輸入,通過切換多個變裝來推理出最終謎底。其中,Planner 最初對視頻和問題進行分析,推行后續推理的謀劃,其為止以 JSON list 的格式呈現。推理謀劃主要可分為以下三種:

△圖 3:VideoMind 的三種推理模式
其中(i)主要針對長視頻問答任務(Grounded VideoQA),需要使用 Grounder + Verifier + Answerer 三個變裝進行功課;(ii)針對視頻時序定位任務(Video Temporal Grounding),使用 Grounder + Verifier 來進行關聯片斷的精確查找;(iii)針對短視頻問答,該場景下由于視頻較短,無需對其進行剪輯,故徑直使用 Answerer 進行推理。

△圖 4:Timestamp Decoder 模塊
Grounder 矜重領受一個當然言語查詢,并在視頻中定位關聯片斷。針對這一復雜任務,預計團隊忽視了 Timestamp Decoder 模塊,將粉碎的 Token 瞻望任務和連氣兒的技能紀念任務解耦開來,并使 LLM 通過 Special Token 進行調用,結束了紛亂的 Zero-shot 時序定位性能。

△圖 5:Verifier 的考證政策
為保證技能別離率,Grounder 頻頻責任在較低的空間別離率下,因此贏得的技能片斷可能會不準確。針對此問題,作家遐想了 Verifier 變裝來對每個片斷進行放大考證,并從多個候選片斷中及第置信度最高的當作概念片斷。檢會確認該政策不錯進一步顯赫提高 Temporal Grounding 任務的性能。

△表 1:VideoMind 的西賓數據集
為西賓 VideoMind,作家針對不同變裝相聚 / 制作了多個數據集,揣摸包含接近 50 萬個樣本。不同變裝使用不同數據集進行西賓,并在推理時歸攏加載,以確保每個變裝的性能最大化。所有這個詞西賓數據(包括前期探索使用的更無數據集)一齊公開可用。
實驗與評估
為了考證 VideoMind 的靈驗性,作家在14 個公開基準測試集上進行了庸碌的實驗,涵蓋了長視頻定位 + 問答(Grounded VideoQA)、視頻時序定位 ( Video Temporal Grounding ) 和正常視頻問答 ( General VideoQA ) 等任務。

△表 2:用于 VideoMind 評測的基準測試集
(1)視頻定位 + 問答(Grounded VideoQA)
在 CG-Bench、ReXTime、NExT-GQA 等長視頻基準上,VideoMind 在謎底精確度和時序定位準確性方面進展出了逾越上風。十分的,在平均視頻長度約為 27 分鐘的 CG-Bench 中,較小的 VideoMind-2B 模子在時序定位和問答任務上高出了 GPT-4o、Gemini-1.5-Pro 等起先進的模子。

△表 3:CG-Bench 數據集的測試為止

△表 4:NExT-GQA 數據集的測試為止
(2)視頻時序定位(Video Temporal Grounding)
VideoMind 的 Grounder 通過立異的 Timestamp Decoder 和 Temporal Feature Pyramid 遐想,顯赫提高了視頻時序定位的準確性。Verifier 的遐想進一步種植了高精度定位的性能。VideoMind 在 Charades-STA、ActivityNet-Captions、QVHighlights 等基準上齊取得了最好性能。此外,VideoMind 亦然首個贊助多片斷 grounding 的多模態大模子,因此不錯在 QVHighlights 數據集上跟現存模子公正對比。

△表 5:Charades-STA 數據集的測試為止

△表 6:ActivityNet Captions 數據集的測試為止

△表 7:QVHighlights 數據集的測試為止
(3)一般視頻問答(General VideoQA)
關于通用的視頻意會問題,VideoMind 也進展出了紛亂的泛化智商。在 Video-MME、MVBench、MLVU、LVBench、LongVideoBench 等基準上,VideoMind 成績于其 Planner 的遐想,不錯自適當地決定是否需要 grounding,其性能高出了好多先進的視頻問答模子,流露了其在不同視頻長度下的優勝進展。

△表 8:Video-MME、MLVU 和 LVBench 數據集的測試為止

△表 9:LongVideoBench 數據集的測試為止
以下例子展現了 VideoMind 在執行場景中的推理經由。給定一個視頻和一個問題,該模子不錯拆解問題、指定謀劃、搜索片斷、考證為止,并把柄獲取的片斷推理最終謎底。該政策比較傳統的純翰墨推理(左下部分)愈加妥貼東說念主類步履,為止也愈加可靠。

△圖 6:VideoMind 的推理經由可視化總結
VideoMind 的忽視不僅在于視頻意會性能的敗壞,更在于忽視了一個模塊化、可彭脹、可解釋的多模態推理框架。該框架初次結束了近似東說念主類步履的"指定謀劃、搜索片斷、考證為止、回答問題"經由,信得過讓 AI 能"像東說念主類相似意會視頻",為疇昔的視頻意會和多模態智能系統界限奠定了基礎。
姿色主頁:https://videomind.github.io/
論文連續:https://arxiv.org/abs/2503.13444
開源代碼:https://github.com/yeliudev/VideoMind
開源數據:https://huggingface.co/datasets/yeliudev/VideoMind-Dataset
在線 Demo:https://huggingface.co/spaces/yeliudev/VideoMind-2B
一鍵三連「點贊」「轉發」「注重心」
寬容在指摘區留住你的念念法!
— ?完? —
學術投稿請于責任日發郵件到:
ai@qbitai.com
標題注明【投稿】,告訴咱們:
你是誰,從哪來,投稿內容?
附上論文 / 姿色主頁連續,以及磋商樣式哦
咱們會(盡量)實時回應你

? ? 點亮星標 ? ?
科技前沿進展逐日見開云kaiyun官方網站
