Source-linked AI summary

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang

arXiv:2606.29445v1cs.CVcs.AI

TL;DR

기존 VideoQA 벤치마크는 MLLM이 튜토리얼에서 절차적 지식을 학습하고 이를 장기 GUI 태스크로 전이할 수 있는지에 대해 제한적인 근거만 제공한다. 본 논문은 VG-GUI-Bench와 태스크 기반·scene-aware keyframe 탐색 방법인 TASKER를 소개하고, VideoQA 및 video-guided agentic 벤치마크 전반에서 일관된 성능 향상을 보고한다. 여기에는 EgoSchema fullset에서 최상의 baseline 대비 2.0% 향상이 포함된다.

  • 문제

    기존 VideoQA 평가는 피상적인 지각 단서에 초점을 맞추므로, MLLM이 절차적 지식을 학습하고 이를 장기 태스크로 일반화할 수 있는지에 대한 근거가 제한적이다.

  • 방법

    본 논문은 튜토리얼에서 GUI로의 절차적 전이를 평가하기 위한 VG-GUI-Bench와, 유의미한 keyframe을 추출하는 태스크 기반·scene-aware graph-search 알고리즘 TASKER를 소개한다.

  • 결과

    TASKER는 VideoQA 및 video-guided agentic 벤치마크 전반에서 정확도와 frame efficiency를 일관되게 향상시키며, EgoSchema fullset에서 최상의 baseline을 2.0%p 능가한다.

  • 시사점 및 한계

    일반화된 keyframe 추출은 정확도와 frame efficiency를 향상시키면서 VideoQA와 video-guided agentic 태스크를 연결할 수 있다.

  • 시사점 및 한계

    TASKER-DFS는 엄격한 종료 조건이 없으면 local optima에 빠지기 쉬우므로, 논문에서는 해당 변형을 도입하지 않는다.

Abstract

from arXiv · show

Video understanding is a fundamental capability for multimodal intelligence, and recent Multimodal Large Language Models (MLLMs) have achieved remarkable performance on Video Question Answering (VideoQA) benchmarks. However, existing benchmarks primarily evaluate whether models can perceive shallow visual cues, while rarely examining whether MLLMs can learn deeper knowledge or procedural skills from video tutorials and generalize them to downstream long-horizon agentic tasks. To address this gap, we introduce VG-GUIBench (Video-Guided GUI Benchmark), a new benchmark designed to evaluate whether MLLM-based GUI agents can follow video tutorials to complete corresponding GUI interactive tasks. Furthermore, we observe that the performance of models on both VideoQA and video-guided agentic tasks critically depends on effective keyframe extraction. Based on this observation, we propose TASKER (Task-driven And Scene-aware Keyframe searchER), a keyframe extraction algorithm that jointly considers task relevance and scene dynamics to identify informative frames. Experimental results demonstrate that TASKER achieves significant performance improvements on both VideoQA and video-guided agentic task benchmarks, outperforming the best baseline by 2.0% on the EgoSchema fullset and 1.8% on the NExT-QA dataset, respectively. These results further highlight the potential of generalized keyframe extraction methods for video understanding tasks. Our code and data are available at https://github.com/VG-GUI-TASKER/VG-GUI-TASKER.

1 서론

이 논문은 VideoQA 벤치마크가 MLLM이 절차적 지식을 습득하고 이를 장기 GUI 작업으로 전이하는 능력을 충분히 측정하지 못한다고 주장한다. 또한 비디오 인식에서 행동으로 이어지는 과정을 평가하고 개선하기 위해 VG-GUI-Bench와 TASKER를 제안한다.

  • 동기: 기존 VideoQA 벤치마크는 피상적 단서를 강조하므로, MLLM이 장기 에이전트 작업에 필요한 더 깊은 지식과 절차적 기술을 학습할 수 있는지는 불분명하다.튜토리얼 기반 작업에는 단계별 절차 이해, 핵심 조작의 추상화, 시각적 사건 인식을 넘어선 전이가 필요하다.
  • 분류 체계: 이 논문은 VideoQA와 비디오 기반 에이전트 작업을 인식에서 행동으로 이어지는 점진적 수준으로 규정하며, 후자는 절차 학습과 장기 실행을 요구한다.VideoQA는 시간적으로 관련된 증거와 질문 조건부 추론을 포함하는 반면, 에이전트 작업은 시연된 절차를 GUI 동작으로 전이한다.
  • 벤치마크: VG-GUI-Bench는 튜토리얼 비디오와 의미적으로 관련된 GUI 작업을 연결하여, MLLM 에이전트가 절차적 지식을 새로운 상호작용 작업으로 전이하는지를 평가한다.이 벤치마크는 비디오 in-context learning을 위한 실용적인 테스트베드를 제공한다.
  • 방법: TASKER는 작업 기반 관련성 추정과 장면 인식 시간 동역학을 결합하여, 두 작업 유형 모두에서 중복 콘텐츠를 제거하면서 간결하고 유익한 keyframe을 선택한다.이 방법은 공통 병목을 해결한다. 즉, 중복되는 긴 비디오 구간과 짧게 나타나는 절차적 증거로 인해 순진한 샘플링이 핵심 순간을 놓치거나 추론 성능을 저하시킨다.
  • 결과: EgoSchema fullset 에서 63.1% 정확도와 NExT-QA 에서 77.4% 평균 정확도는 각각 최상의 baseline을 2.0%와 1.8% 상회한다.TASKER는 높은 frame 효율도 달성하며, VideoTree와 VideoAgent를 포함한 기존 temporal-selection 및 video-agent 방법을 일관되게 능가한다.

2 관련 연구

관련 연구는 VideoQA, keyframe extraction, video-guided tasks를 포괄한다. VideoQA는 CNN 기반 encoder와 경량 fusion에서 projection layer 및 LLM과 통합된 visual encoder로 발전했으며, keyframe 연구는 다양한 선택 전략을 탐구하고 video-guided benchmark는 instructional video에서 기술을 학습하는 능력을 연구한다.

  • Video Question Answering: VideoQA는 언어 질의에 응답하여 시간적 visual content에 대한 추론을 평가하며, 최근 benchmark는 long-form video와 복잡한 추론을 강조한다.
  • Video Question Answering: VideoQA 방법은 경량 fusion을 사용하는 CNN 기반 visual encoder 에서 projection layer 및 LLM과 결합된 pretrained visual encoder [27] [45] [54] [71]로 발전했다.
  • Keyframe Extraction: Keyframe extraction 방법에는 학습 기반 frame selection, attention 기반 segment extraction, image-grid modeling을 적용한 uniform sampling, recursive agent-guided selection, VideoTree의 계층적 feature-clustering search 가 포함된다.
  • Video-Guided Tasks: Video-guided tasks는 instructional video에서 task 또는 skill을 습득하는 능력을 평가하며 [19] [20] [63] [66], Mobile-Agent-V를 통한 GUI operation knowledge transfer도 포함한다 [50].
  • Video-Guided Tasks: 이 분야에서는 video-guided task learning을 평가하기 위한 dataset [32] [33]과 benchmark [7] [8] [30]가 도입되었다.

3 방법

Section 3에서는 비디오로 안내되는 GUI 작업에서 MLLM 에이전트를 평가하기 위한 장기 시계열 benchmark인 VG-GUI-Bench와, 질문에 답하거나 agentic 작업을 완료하는 데 필요한 충분한 시각 정보를 선택하는 task-driven keyframe 검색 방법인 TASKER를 소개한다.

  • VG-GUI-Bench: VG-GUI-Bench는 task-specific prompt를 사용해 튜토리얼 비디오에서 장기 GUI 태스크를 수행하는 MLLM을 체계적으로 평가하며, 에피소드당 평균 10.71 steps로 구성된다.이 벤치마크는 MON-DAY 를 기반으로 하며, 참조용 튜토리얼 비디오, ground-truth action sequence, keyframe screenshot을 제공한다.
  • VG-GUI-Bench: 표준화된 action space는 CLICK, SCROLL, TYPE, PRESS, ZOOM, FINISH의 six GUI operations를 정의한다.PRESS는 BACK, HOME, ENTER를 지원하고, CLICK과 SCROLL은 좌표 인자를 사용하며, ZOOM과 FINISH는 인자를 사용하지 않는다.
  • VG-GUI-Bench: 평가에서는 비디오 keyframe을 반복적으로 선택하고, MLLM에 다음 action을 예측하도록 한 뒤 이를 실행하며, 결과 sequence를 ground-truth action과 비교한다.VG-GUI-Bench는 accuracy, completion, efficiency, Performance Improvement Rate를 보고하며, 각각 action correctness, executed-step proportion, frame cost, video benefit을 측정한다.
  • TASKER: TASKER는 충분한 keyframe set을 찾기 위해 비디오 segment tree를 탐색하며, 예측 전에 visible frame을 MLLM에 직접 입력하거나 생성된 caption을 통해 활용해 answer 또는 action을 산출한다.초기 node는 전체 비디오이며, segment expansion은 질문에 답하거나 태스크를 완료하는 데 필요한 정보로 향하도록 계속된다.
  • TASKER: TASKER-GBFS는 MLLM이 추정한 missing visual information을 task-driven cost로 사용하는 반면, TASKER-BFS는 MLLM cost evaluation 없이 segment를 breadth-first 방식으로 확장한다.single-segment expansion은 엄격한 termination condition이 없으면 local optimum에 빠질 수 있으므로, 이 방법은 DFS variant를 도입하지 않는다.

4 실험

TASKER는 더 적은 visible frame을 사용하면서 경쟁 keyframe-selection 및 VideoQA 방법을 능가하고, video-guided GUI task에서도 강력한 성능을 달성한다. Ablation 결과는 search, termination, base-LLM 선택이 정확도와 효율성에 실질적인 영향을 미침을 보여준다.

  • VideoQA: GPT-4를 사용한 TASKER는 EgoSchema fullset에서 63.1% 정확도를 달성해 best baseline을 2.0% 앞서며, 비교된 모든 VideoQA 방법보다 우수하다.비교에는 training-free, zero-shot 설정의 TASKER-A* variant가 사용되며, LVNet 및 Vamos 과 같은 training-based 방법도 능가한다.
  • 프레임 효율성: EgoSchema subset에서 66% 정확도를 달성할 때 TASKER는 VideoTree보다 약 네 분의 일만큼의 프레임을 사용하면서 visible frames만 참조한다.보고된 성능을 내려면 전체 비디오 프레임의 약 15%만 필요하지만, LangRepo 와 LifelongMemory 는 선택 없이 모든 프레임을 처리한다.
  • VG-GUI-Bench: VG-GUI-Bench에서 10개의 uniformly sampled frame을 추가하면 대부분의 model에서 video를 사용하지 않을 때보다 성능이 향상되며, Gemini-3.1-Pro는 두 설정 모두에서 overall accuracy가 가장 높다.Seed-2.0-Pro의 향상 폭이 가장 커 35.93%에서 39.78%로 증가한다.
  • VG-GUI-Bench: TASKER-A*는 VG-GUI-Bench에서 가장 높은 Overall Acc. (40.96), PIR (0.618), CLICK score (53.68)를 달성해 VideoTree를 능가한다.TASKER는 redundant frame도 deduplicate하여 다른 dynamic selection 방법보다 step당 더 적은 frame으로 더 높은 정확도를 달성한다.
  • Ablation: TASKER-A*는 최고의 variant 성능을 달성하며, GPT-4o는 가장 강력한 base LLM으로 o3-mini와 Deepseek-R1을 능가한다.Search-algorithm ablation은 fps = 1, 즉 180 frame으로 초기화된 3분 길이 EgoSchema video에서 visible-frame 효율성을 평가한다.
  • Ablation: Self-evaluation, self-reflection, temporal summarization을 결합하면 상호 보완적인 관점에서 information sufficiency를 평가함으로써 termination confidence와 algorithm 성능이 향상된다.Termination-condition ablation은 EgoSchema subset에서 TASKER-A*를 사용한다.

5 분석

분석 결과 TASKER는 end-to-end Video-LLMs보다 효율성과 해석 가능성에서 우수하며, 시각적 사례 연구를 통해 질문과 관련된 비디오 콘텐츠를 정확히 찾을 수 있음이 나타난다. 예시에서 TASKER는 핵심 125s–130s 구간을 검색해 질문에 성공적으로 답한다.

  • 효율성과 해석 가능성: TASKER는 end-to-end Video-LLMs보다 학습 비용이 낮고 추론 효율과 해석 가능성이 뛰어나다.성능과 자원 요구량에 대한 상세한 비교는 Appendix C에 제시된다.
  • 사례 연구: 3분 길이의 비디오에서 TASKER는 126s와 130s 사이의 핵심 정보 구간을 정확히 식별한다.Figure 5는 이 시각화 사례 연구를 제시한다.
  • 사례 연구: TASKER는 비디오 트리를 따라 검색하고 관련 노드를 확장한 뒤, 125s–130s의 모든 프레임을 keyframe으로 검색해 질문에 성공적으로 답한다.비디오 트리는 핵심 검색 경로가 통과한 노드를 노란색으로 표시한다.

6 결론 · 부록

이 연구는 VG-GUI-Bench와 TASKER를 통해 VideoQA와 상위 수준의 video-guided agentic tasks를 연결한다. VG-GUI-Bench는 절차적 지식을 장기 의사결정으로 전이하는 능력을 평가하고, TASKER는 keyframe extraction을 일반화된 graph-search 문제로 다룬다.

  • 6 결론: 이 연구는 더 깊은 video understanding을 향한 단계로서 저수준 VideoQA와 상위 수준의 video-guided agentic tasks를 명시적으로 연결한다.
  • 6 결론: 시각화는 EgoSchema VideoQA 사례 [34]에서 TASKER의 tree-search 및 node-expansion process를 보여준다.
  • 6 결론: VG-GUI-Bench는 튜토리얼 동영상과 이에 대응하는 GUI interaction episodes를 짝지어 MLLM 기반 agents가 절차적 지식을 장기 의사결정으로 전이하는지를 평가한다.
  • 6 결론: TASKER는 VideoQA와 video-guided agentic tasks 전반에서 공유되는 병목인 temporal content selection을 중심으로 구축된 task-driven 및 scene-aware keyframe-search algorithm이다.
  • 6 결론: TASKER는 더 깊은 video understanding을 위해 keyframe extraction을 일반화된 graph-search problem으로 정식화한다.

A 사전 고찰: 고전적 탐색 알고리즘

TASKER는 우선순위에 따라 노드를 반복적으로 선택하고, 목적지를 확인하며, 이웃을 확장하고, 성공하거나 더 탐색할 노드가 없어질 때까지 진행하는 고전적 탐색 절차를 기반으로 한다. DFS, BFS, GBFS는 이 과정에서 노드의 우선순위를 정하는 방식이 다르다.

  • 고전적 탐색 알고리즘: TASKER는 open list를 초기화하고, 우선순위가 높은 노드를 반복적으로 선택하며, 해당 노드의 이웃을 확장하고, 목적지에 도달하거나 list가 소진되면 중단하는 고전적 탐색 알고리즘을 기반으로 한다.탐색 중 목적지를 찾으면 해당 목적지 노드를 반환하고, 그렇지 않으면 탐색 list가 비어 있는 뒤 None을 반환한다.
  • 고전적 탐색 알고리즘: DFS는 더 깊은 노드에 우선순위를 부여하는 반면, BFS는 다음 level로 이동하기 전에 현재 level의 모든 이웃을 탐색한다.DFS는 backtracking하기 전에 깊이 탐색하는 반면, BFS는 level별로 진행한다.
  • 고전적 탐색 알고리즘: GBFS는 heuristic h(n)을 cost function으로 사용해 노드의 우선순위를 정하며, f(n) = h(n)으로 설정해 최적해를 보장하지 않고 탐색을 목적지 방향으로 유도한다.여기서 h(n)은 현재 노드에서 목적지까지의 cost를 나타낸다.

B 벤치마크

벤치마크는 도전적인 질의응답 데이터셋을 통해 장편 비디오 이해를 평가하며, EgoSchema는 긴 비디오를 중점적으로 다루고 NExT-QA는 인과적·시간적·기술적 추론을 포괄한다.

  • EgoSchema: EgoSchema 는 인간이 선별한 5,000개 이상의 multiple-choice QA 쌍으로 구성되며, 장편 비디오 질의응답을 위한 500개 비디오 subset을 포함한다.각 비디오는 3분 길이이며, 인간의 정확도도 76%에 그치는 반면 현재 Video-LLM은 70% 미만에 머문다.
  • NExT-QA: NExT-QA 는 비디오 이해를 평가하기 위해 5,440개 비디오와 약 52K개의 수작업 주석 QA 쌍으로 구성된다.질문은 동기나 결과에 관한 인과적 추론, 행동 순서와 시점에 관한 시간적 추론, 장면·객체·속성·사건에 관한 기술적 추론을 포함한다.

C Video-LLMs와의 비교

이 절에서는 end-to-end Video-LLMs와 TASKER의 training-free keyframe 기반 접근법을 대조하며, 정확도와 계산 효율성 사이의 trade-off를 강조한다. TASKER는 명시적인 중간 출력으로 추론 오버헤드를 추가로 줄이고 해석 가능성을 높인다.

  • 최신 Video-LLMs [4]는 keyframe 기반 training-free 방법을 능가하므로, 높은 정확도가 중요하고 계산 비용을 감당할 수 있을 때 적합하다.
  • TASKER의 training-free 설계는 비슷한 EgoSchema 및 NExT-QA 성능을 위해 상당한 학습 자원이 필요한 Video-LLMs와 비교해 전체 비용을 줄인다.Table 7은 비슷한 Video-LLMs의 학습 비용과 자원 요구량을 비교해 그 복잡성과 비용 부담을 부각한다.
  • TASKER는 전체 비디오를 처리하는 대신 효율적인 keyframe을 선택해 추론 오버헤드를 낮추면서도 large-model 추론에 의존한다.
  • TASKER는 end-to-end Video-LLMs와 달리 keyframe 선택과 텍스트 추론을 중간 결과로 공개해 해석 가능성을 높인다.이러한 중간 출력은 투명성과 해석 가능성을 향상한다.

D 구현 세부사항 · E VG-GUI-Bench 상세 시연

구현에서는 benchmark별 captioner와 configurable TASKER sampling을 사용하며, VG-GUI-Bench는 tutorial keyframe을 visual guidance로 활용해 평가하는 multi-step GUI task를 통해 시연된다. 이를 통해 video-understanding 설정과 agent-interaction 평가 pipeline을 모두 구체화한다.

  • D 구현 세부사항: VideoQA에서는 LLM reasoning을 수행하기 전에 visible frame을 captioning하며, NExT-QA 에는 CogAgent [18]를, EgoSchema 에는 LaViLa [73]를 사용한다.VideoAgent 를 따라, egocentric video pretraining을 수행했기 때문에 EgoSchema에는 LaViLa를 선택한다.
  • D 구현 세부사항: 기반 LLM 버전은 gpt-4-1106-preview와 gpt-4o-2024-11-20이다.구현에 사용된 구체적인 model version이다.
  • D 구현 세부사항: TASKER의 visible-frame 수는 initial segment 수 M과 maximum search iteration T에 따라 달라지며, 주요 실험에서는 M = 10과 T = 6을 사용한다.이 parameter들을 변경하면 최종 accuracy에 영향을 준다.
  • E VG-GUI-Bench 상세 시연: VG-GUI-Bench는 agent가 multi-step GUI instruction을 수행할 수 있는지를 평가하며, iOS device에서 email을 PDF로 저장하는 예시로 이를 보여준다.이 case study는 benchmark를 직관적으로 보여주는 시연으로 Figure 6에 제시된다.
  • E VG-GUI-Bench 상세 시연: 각 interaction step에서 agent는 current GUI frame, previous action, 그리고 TASKER-extracted tutorial keyframe을 visual guidance로 받는다.이 입력들이 benchmark에 대해 설명된 stepwise evaluation pipeline을 구성한다.
  • E VG-GUI-Bench 상세 시연: MLLM은 CLICK이나 SCROLL과 같은 action type과 screen coordinate와 같은 해당 argument를 예측한다.제시된 내용은 action category와 그 parameter를 모두 예측한다고 설명한다.

F 프롬프트

부록에서는 TASKER의 프롬프트 기반 keyframe 검색 및 자기 평가 절차를 설명한 뒤, 비디오 없음, oracle-keyframe, 알고리즘 선택 keyframe 설정에서 VG-GUI-Bench 평가 프롬프트를 정의한다.

  • F.1 TASKER Keyframe Selector Prompts: TASKER는 MLLM에 후보 비디오 구간을 평가하고 현재 keyframe이 task를 충분히 포괄하는지 판단하도록 프롬프트를 제공한다.프롬프트 모음에는 BFS, GBFS, Dijkstra, A*, QA & Reflect 전략이 포함된다.
  • F.1 TASKER Keyframe Selector Prompts: BFS는 누락된 UI action을 찾기 위해 여러 gap을 동시에 탐색하고, 정해진 JSON 구조로 segment 설명을 반환한다.서로 다른 gap에 중요한 누락 action이 포함될 수 있을 때 여러 segment를 선택하도록 유도한다.
  • F.1 TASKER Keyframe Selector Prompts: GBFS는 누락된 목표 핵심 action이 포함될 가능성이 가장 높은 하나의 segment를 선택하고, operation flow에서 설명되지 않은 transition에 집중한다.출력에서는 하나의 segment를 식별하고, 해당 segment에 누락된 목표 핵심 action이 포함되어 있다고 설명한다.
  • F.1 TASKER Keyframe Selector Prompts: Dijkstra는 경계 frame을 비교해 가장 중요한 UI state transition을 우선시하면서 하나의 segment를 선택하며, 미묘한 operation 변화도 포함한다.예로는 navigation, dialog, toggle, text input, loading indicator, panel 전환이 있다.
  • F.1 TASKER Keyframe Selector Prompts: A*는 목표와의 근접성과 경계 frame의 state-change magnitude를 함께 균형 있게 고려해 하나의 segment를 선택하며, 시각적으로 미묘하지만 operation상 중요한 단계를 배제하지 않는다.프롬프트는 checkbox toggle, dropdown 선택, typed text를 잠재적으로 중요한 action으로 명시적으로 고려한다.
  • F.1 TASKER Keyframe Selector Prompts: QA & Reflect는 선택된 frame이 사용자가 task를 단계별로 재현하기에 충분한 visual continuity를 제공하는지 평가한다.Confidence 1은 심각한 jump, 2는 경미한 단절, 3은 강한 continuity를 의미하며, 주요 action에 대한 불확실성이 있으면 1 또는 2를 출력해야 한다.
  • F.2 VG-GUI-Bench Evaluation Prompts: VG-GUI-Bench 프롬프트는 No Video, Oracle Keyframe 또는 알고리즘 선택 keyframe 설정에서 모델이 next action을 예측하도록 요구한다.no-video baseline은 task goal 및 이전 action과 함께 현재 UI screenshot 하나를 context로 제공한다.
  • F.2 VG-GUI-Bench Evaluation Prompts: no-video 프롬프트에서 agent는 goal을 이해하고 workflow상의 위치를 파악하며, 보이는 UI element를 분석한 뒤 정확히 하나의 next action을 추론한다.정해진 reasoning에서는 action call을 생성하기 전에 target screen과 완료된 이전 action을 함께 사용한다.

G OSWorld 결과

교육용 비디오가 추가된 OSWorld subset에서 TASKER가 선택한 frame은 Gemini-3-Flash의 overall task performance를 향상했지만, 향상 폭은 domain별로 달랐다. OSWorld는 설계상 video-guided benchmark가 아니므로, 이 평가는 TASKER의 target setting과 부분적으로만 부합한다.

  • OSWorld 결과: OSWorld는 설계상 video-guided가 아니므로, 이 평가는 TASKER의 target setting과 부분적으로만 부합한다.비교를 가능하게 하기 위해 OSWorld task의 일부에 instructional video를 수집했다.
  • OSWorld 결과: TASKER의 성능 향상 폭은 OSWorld domain별로 달랐다.보고된 overall improvement가 domain 전반에서 균일한 향상을 의미하지는 않았다.
  • OSWorld 결과: TASKER가 선택한 video frame은 no-video 및 uniform-sampled frame과 비교해 OSWorld subset에서 Gemini-3-Flash의 overall task success를 향상했다.비교에서는 no video, uniform-sampled video frame, TASKER가 선택한 video frame의 세 조건을 평가했다.
Loading 2606.29445v1…