Source-linked AI summary

Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition

Geo Ahn, Inwoong Lee, Taeoh Kim, Minho Shim, Dongyoon Wee, Jinwoo Choi

arXiv:2601.16211v3cs.CVcs.AI

TL;DR

ZS-CAR 모델은 temporal evidence 대신 object-driven shortcuts에 의존할 수 있어, 보지 못한 verb–object composition 인식이 약해진다. RCORE는 co-occurrence와 temporal-order regularization으로 이를 해결하며, 두 benchmark 모두에서 unseen-composition 성능을 일관되게 향상한다.

  • 문제

    Sparse compositional supervision과 비대칭적인 verb–object learning은 ZS-CAR에서 temporal evidence를 co-occurrence prior로 대체하는 object-driven shortcuts를 촉진한다.

  • 방법

    RCORE는 supervision을 확장하고 빈번한 pair를 hard negative로 취급하는 CPR과 temporal-order sensitivity를 강제하는 TORC를 결합한다.

  • 결과

    Sth-com과 EK100-com 모두에서 RCORE는 shortcut 진단 지표를 낮추고, dataset과 backbone 전반에서 unseen-composition generalization을 일관되게 향상한다.

  • 시사점 및 한계

    RCORE는 test-tuned bias calibration 없이 open-world evaluation protocol에서 더 신뢰할 수 있는 verb–object compositional reasoning을 지원한다.

  • 시사점 및 한계

    기존 closed-world evaluation은 seen composition의 과잉 예측을 가릴 수 있으며, test-label bias calibration은 unseen accuracy를 부풀려 공정한 비교를 저해할 수 있다.

Abstract

from arXiv · show

Zero-Shot Compositional Action Recognition (ZS-CAR) requires recognizing novel verb-object combinations composed of previously observed primitives. In this work, we tackle a key failure mode: models predict verbs via object-driven shortcuts (i.e., relying on the labeled object class) rather than temporal evidence. We argue that sparse compositional supervision and verb-object learning asymmetry can promote object-driven shortcut learning. Our analysis with proposed diagnostic metrics shows that existing methods overfit to training co-occurrence patterns and underuse temporal verb cues, resulting in weak generalization to unseen compositions. To address object-driven shortcuts, we propose Robust COmpositional REpresentations (RCORE) with two components. Co-occurrence Prior Regularization (CPR) adds explicit supervision for unseen compositions and regularizes the model against frequent co-occurrence priors by treating them as hard negatives. Temporal Order Regularization for Composition (TORC) enforces temporal-order sensitivity to learn temporally grounded verb representations. Across Sth-com and EK100-com, RCORE reduces shortcut diagnostics and consequently improves compositional generalization.

1 서론

이 논문은 object-driven verb shortcut을 ZS-CAR 일반화의 핵심 장애물로 규정하고, co-occurrence 및 temporal-order regularization을 통해 이를 완화하는 RCORE를 제안한다. Sth-com 와 EK100-com 전반에서 RCORE는 shortcut 진단 지표를 낮추고 unseen-composition 일반화를 향상한다.

  • FSP와 FCP는 기존 ZS-CAR 모델에서 unseen input이 특히 빈번한 seen training composition으로 붕괴하는 현상을 진단한다.이 비율들은 shortcut에 의해 유발된 실패를 정량화하고 training co-occurrence 패턴에 대한 과도한 의존을 드러낸다.
  • RCORE는 부재한 composition에 대한 supervision을 확장하고 빈번한 pair를 hard negative로 취급하는 CPR과 temporal-order sensitivity를 강제하는 TORC를 결합한다.두 구성 요소는 sparse compositional supervision, co-occurrence prior, weak temporal grounding을 함께 겨냥한다.
  • 이 논문은 편향된 verb–object co-occurrence와 비대칭적인 learning difficulty를 object-driven shortcut의 근본 원인으로 규정한다.Object는 시각적으로 명시적인 반면 verb는 multi-frame temporal reasoning을 요구하므로, training signal에서 object feature가 우세해진다.
  • RCORE는 여러 VLM backbone을 사용해 Sth-com과 EK100-com 전반에서 baseline보다 unseen-composition performance를 향상한다.이 방법은 co-occurrence bias도 완화하고 temporally grounded verb feature를 학습한다.

2 관련 연구

기존 연구는 compositional action recognition, zero-shot composition, shortcut learning을 다뤄 왔지만, ZS-CAR은 고정된 label space에서 시간적으로 근거된 verb를 추가로 요구한다. 이 설정은 object-driven shortcut을 진단하고 backbone에 전이 가능한 training regularizer를 설계할 수 있게 한다.

  • Compositional Action Recognition: CAR은 action을 verb와 object로 분해하며, 기존 방법은 static cue에 강건하고 temporal dynamics에 민감한 verb representation을 학습하고자 한다.접근법에는 object-level interaction을 모델링하는 방법이 포함된다.
  • Compositional Action Recognition: ZS-CAR은 split 간 verb와 object vocabulary를 공유하면서 verb–object pair를 제외하며, conditional learning 과 disentanglement 지향 설계 는 joint modeling을 개선한다.이 연구는 희소하고 편향된 compositional supervision이 여전히 object-driven shortcut을 유발할 수 있음을 강조한다.
  • Compositional Zero-Shot Learning: Image 기반 CZSL은 희소한 supervision하에서 관측된 primitive의 새로운 composition을 인식하는 반면, ZS-CAR은 verb의 temporal grounding을 추가로 요구한다.Image CZSL은 feature disentanglement, modular factorization, CLIP 기반 prompt learning 을 사용한다.
  • Shortcut learning: Shortcut learning은 spurious correlation을 활용하며, 편향된 분포와 co-occurrence statistic은 dataset prior에 의존하도록 유도한다.기존 compositional 연구는 희귀한 combination에 재가중치를 부여하는 반면, video 연구는 static scene cue에 대한 의존을 보고한다.
  • Vision-Language Model: VLM은 encoder 기반 또는 decoder 기반 paradigm을 사용하며, ZS-CAR은 통제된 진단과 전이 가능한 training regularizer를 위해 YV × YO에 대한 고정된 verb–object logit을 평가한다.Encoder의 예로는 CLIP 과 video extension 이 있고, decoder의 예로는 LLaVA 와 Qwen-VL [4]이 있다.

3 진단: ZS-CAR 모델은 왜 실패하는가?

진단 결과, ZS-CAR 모델은 시간적으로 근거된 동사를 학습하는 대신 더 쉬운 객체 단서와 학습 co-occurrence prior를 활용해, 보지 못한 조합에서 shortcut-driven failure를 일으킨다. Training-bias metric과 Compositional Gap은 이러한 행동을 정량화하고 약한 compositional generalization과의 연관성을 보여준다.

  • Training-bias metric: Training-bias diagnostic은 보지 못한 조합에서 False Seen Prediction과 False Composition Prediction ratio를 사용해 co-occurrence prior에 대한 의존도를 정량화한다.구성요소별 분석은 verb-collapse, object-collapse, dual-collapse error를 구분해 bias가 주로 verb learning과 object learning 중 어느 쪽을 저해하는지 식별한다.
  • ZS-CAR에는 object-driven shortcut이 실제로 존재한다: Shortcut 의존도는 낮은 보지 못한 조합 일반화와 상관된다. 즉, FSP/FCP가 증가할수록 seen–unseen accuracy gap이 커지며, CLIP의 최종 error에서는 verb-collapse가 우세하다.video-pretrained InternVideo2 backbone에서도 이러한 패턴은 여전히 두드러진다. 이 backbone 역시 seen–unseen gap과 높은 FSP를 보인다.
  • Compositional Gap: Compositional Gap은 joint verb–object prediction이 independent reference인 AccV × AccO를 초과하는지를 측정하며, FSP/FCP 및 보지 못한 조합 정확도와 함께 보고된다.보지 못한 조합에서 음의 ∆CG는 AccC가 independent reference보다 낮음을 의미하며, video-pretrained backbone에서도 나타난다. ∆CG는 standalone 지표가 아니라 diagnostic 지표다.
  • 객체는 동사보다 학습하기 쉽다: 통제 실험은 객체가 동사보다 더 빠르고 정확하게 학습되어, 치우친 verb–object co-occurrence에서 object-driven shortcut을 가능하게 함을 보여준다.완전히 편향된 split에서 CLIP은 높은 객체 정확도를 달성하지만, bias-conflict 보지 못한 조합에서 동사 정확도는 chance보다 낮다.

4 RCORE

RCORE는 희소하고 편향된 compositional supervision 환경에서 verb–object representation을 강화해 ZS-CAR의 object-driven shortcut을 완화한다. RCORE는 composition supervision을 확장하고 정규화하는 CPR과 시간적으로 grounding된 verb representation을 강제하는 TORC를 결합한다.

  • 4 RCORE: RCORE는 희소한 compositional supervision에서 verb–object representation을 강화해 ZS-CAR의 object-driven shortcut을 완화한다.이 framework는 선행 연구 를 따라 CLIP backbone에는 AIM을, InternVideo2 backbone에는 LoRA를 사용한다.
  • Co-occurrence Prior Regularization (CPR): CPR은 보지 못한 verb–object pair를 합성하고, 빈번하게 관측된 pair를 hard negative로 사용하며, margin constraint로 co-occurrence prior를 정규화한다.CPR은 합성된 composition supervision, margin 기반 정규화, batch-adaptive composition label space 확장을 결합한다.
  • Co-occurrence Prior Regularization (CPR): CPR은 다른 sample의 static object cue를 high-motion region에 주입해 합성 video를 구성한 뒤, 결과 composition에 soft label을 할당한다.high-motion mask는 learning-free estimator 로 추출한다.
  • Temporal Order Regularization for Composition (TORC): TORC는 forward feature와 reversed feature를 분리하고 temporal disruption 이후 entropy가 높은 verb prediction을 유도해 static object cue에 대한 의존을 줄인다.목적 함수는 cosine-similarity 항과 entropy 항을 결합한다: LTORC = Lcos + Lent.
  • Training Objective: RCORE는 weighted total objective를 통해 verb, object, composition, TORC, CPR loss를 공동 최적화한다.Composition logit은 factorized verb logit과 object logit을 집계하며, composition loss는 동적으로 구성된 denominator Yexp를 사용한다.

5 실험 결과

RCORE는 co-occurrence-driven 및 object-driven shortcut을 줄이고 temporal verb representation을 강화하여 open-world zero-shot compositional recognition을 개선한다. 두 구성 요소는 상호 보완적으로 작용하며, TORC는 verb generalization을 향상하고 CPR은 빈번한 confounder를 겨냥한다.

  • 5.2 진단 분석: RCORE는 co-occurrence 의존을 줄인다. Sth-com에서 FSP와 FCP는 47%에서 44%로 하락하고 23%에 머무는 반면, C2C는 각각 53%에서 63%, 26%에서 29%로 증가한다.이 곡선은 training 중 co-occurrence statistics에 대한 의존이 크게 줄었음을 보여준다.
  • 5.3 정량적 비교: RCORE는 C2C 보다 Sth-com unseen recognition을 개선하며, CLIP 와 InternVideo2 모두에서 verb@unseen-comp와 unseen composition accuracy를 높인다.CLIP에서는 각각 4.6점과 3.8점, InternVideo2에서는 각각 3.4점과 4.5점 향상된다.
  • 5.2 진단 분석: RCORE는 temporal dynamics에 기반해 verb representation을 학습하며, C2C 보다 original-versus-shuffled feature gap이 크고 반대 verb를 더 잘 구분한다.unseen Sth-com compositions에서 RCORE는 ‘unfolding’과 ‘folding’ 같은 쌍을 더 효과적으로 구분한다.
  • 5.4 Ablation Studies: TORC만 사용해도 verb@unseen-comp는 3.5점, unseen composition accuracy는 3.8점 향상된다. 반면 CPR만 사용하면 unseen composition accuracy는 3.1점 높아지지만 seen accuracy는 4.2점 낮아진다.CPR과 TORC를 결합했을 때 전체 결과가 가장 우수하며, ablation은 unbiased open-world setting에서 CLIP [34]과 함께 C2C 를 사용한다.
  • 5.4 Ablation Studies: CPR에서 빈번한 hard negative에 penalty를 부여할 때 가장 우수한 trade-off를 달성하며, 37.7%의 최고 H.M.을 포함한다. 반면 모든 hard negative에 penalty를 부여하면 object 및 composition performance가 저하된다.이 결과는 penalty를 빈번한 confounder로 제한해야 함을 뒷받침한다.

6 결론 · 부록

이 논문은 zero-shot compositional action recognition의 핵심 실패 요인으로 object-driven shortcuts를 규명하고, 이를 완화하기 위해 RCORE를 제안한다. 부록은 본 논문을 뒷받침하는 평가, 데이터셋, 구현, 진단 및 추가 결과의 세부사항을 제공한다.

  • 6 결론: 이 연구는 compositional sparsity와 비대칭적인 verb–object 학습 난이도가 object-driven shortcuts를 유발하고, co-occurrence prior에 대한 과적합을 촉진해 unseen-composition 일반화를 저해한다고 본다.진단 metric은 기존 모델이 labeled object class에 의존해 verb 학습을 충분히 활용하지 않음을 보여준다.
  • 6 결론: RCORE는 synthesized composition으로 supervision을 확장하고 co-occurrence prior에 대해 regularization을 적용하는 CPR을 통해 이러한 shortcut을 해결한다.제시된 결론은 CPR을 RCORE의 두 구성 요소 중 하나로 소개하지만, 추가적인 구현 또는 정량적 세부사항은 제공하지 않는다.
  • 부록: 부록은 종합적인 evaluation protocol, 데이터셋, 구현 및 본문에 제시되지 않은 추가 결과의 세부사항으로 본 논문을 보완한다.부록은 별도의 연구 기여를 제시하기보다 뒷받침 자료를 제공하도록 구성되어 있다.
  • 부록: Section A는 평가 설정을 설명하고, Section B는 EK100-com 데이터셋을 상세히 다룬다.이 절들은 논문 실험에 사용된 평가 및 데이터셋 맥락을 정의한다.
  • 부록: Section C는 보고된 method와 실험을 재현하기 위한 complete implementation details를 제공한다.이 내용은 구현 문서가 부록의 독립적인 구성 요소임을 밝힌다.
  • 부록: Sections D와 E는 object-driven shortcuts의 증거와 본문에 제시된 결과를 넘어서는 additional results를 추가한다.제시된 내용은 각 절의 범위만 명시하며, 개별 발견이나 수치 결과는 보고하지 않는다.

A 평가 설정 개요

평가는 전체 verb-object composition space를 대상으로 open-world protocol을 적용하고, seen 및 unseen composition에서 composition, verb, object recognition을 측정한다.

  • 평가 프로토콜: ZS-CAR label space는 verb와 object primitive의 Cartesian product이며, test sample은 training exposure를 기준으로 seen 및 unseen composition으로 나뉜다.
  • 평가 프로토콜: Open-world evaluation은 가능한 모든 verb-object combination에 대해 logit을 계산하여 ground-truth test-label 가정을 배제하고, 가능하지만 학습에서 보지 못한 composition을 드러낸다.Closed-world evaluation은 data에 존재하는 composition으로 평가를 제한하는 반면, 채택한 open-world protocol은 실제 응용 환경을 더 잘 반영한다.
  • 평가 지표: 평가는 composition accuracy, verb@seen/unseen-comp, object@seen/unseen-comp를 보고하여 compositional recognition과 unseen composition에서의 primitive 성능 저하를 평가한다.이 metric들은 model의 composition prediction에서 도출되며, seen 및 unseen split 전반에서 composition, verb 또는 object가 올바른지 확인한다.

B EK100-com 데이터 세부사항 · C 전체 구현 세부사항 · C.1 진단 구현 세부사항

부록에서는 선별된 ZS-CAR benchmark인 EK100-com을 정의하고, C2C, 통제된 toy data, shortcut 중심 오분류 metric을 활용한 진단 protocol을 설명한다. 또한 RCORE가 EK100-com에서 co-occurrence shortcut을 억제하고 seen–unseen 성능 격차를 줄임을 보인다.

  • B EK100-com 데이터 세부사항: EK100-com은 필터링한 training 및 validation split을 사용해 EK100 을 재구성하며, 5개 초과의 sample을 가진 composition을 유지하고 validation composition이 training에 나타나도록 보장한다.필터링 후 training에는 62,790개 sample과 1,331개 composition이 포함되고, validation에는 8,657개 sample이 포함된다.
  • B EK100-com 데이터 세부사항: 이 benchmark는 training과 validation 사이에서 무작위로 선택한 composition subset을 교환한 다음, validation과 test data를 3:4 ratio로 분할한다.그 결과인 EK100-com 통계와 seen/unseen 예시는 Table 6과 Figures 9–10에 제시된다.
  • B EK100-com 데이터 세부사항: EK100-com은 명시적인 object supervision을 제공한다. EK100 video가 single-verb, single-object action을 묘사하기 때문이며, EK100의 long-tailed distribution은 이 benchmark의 구성을 뒷받침한다.이러한 특성은 비디오에 하나의 동사와 연관된 여러 객체가 포함될 수 있는 데이터셋과 구별된다.
  • C.1 진단 구현 세부사항: 진단에서는 ViT CLS token에 작동하는 분리된 linear verb 및 object classifier와 함께 C2C 를 사용한다.이 설정은 main paper에서 설명한 진단에 대한 부록의 구현 세부사항을 뒷받침한다.
  • C.1 진단 구현 세부사항: 통제된 4 × 4 Sth-Com toy set에는 네 개의 verb, 네 개의 object, 그리고 pair당 40개 sample을 가진 네 개의 diagonal training pair가 포함된다.이 toy set은 object-driven shortcut을 분석할 때 각 verb–object pair의 sample 수를 통제한다.
  • C.1 진단 구현 세부사항: FSP는 unseen sample이 seen composition으로 오분류되는 비율을 측정하고, FCP는 그중 prediction이 빈번한 training co-occurrence인 경우를 측정한다.두 ratio는 다시 verb-collapse, object-collapse, dual-collapse case로 분해된다.
  • C.1 진단 구현 세부사항: RCORE는 training 중 FCP의 증가를 억제하고, EK100-com에서 C2C [19] 대비 seen–unseen composition validation-accuracy gap을 줄인다.이러한 경향은 baseline과 RCORE의 learning curve에 보고된다.

C.2 RCORE 구현 세부 사항

RCORE는 CLIP-B/16 및 InternVideo2 backbone을 사용해 구현되며, 균일하게 샘플링한 video clip, frame-level에 특화된 InternVideo2 pooling, CPR/TORC 학습 설정을 사용한다. Inference에서는 single-view, single-crop protocol을 사용하고, seen 및 unseen composition에 대한 harmonic-mean으로 모델을 선택한다.

  • 실험 설정: RCORE는 CLIP-B/16을 visual/text backbone으로 사용하며, CLIP에는 3 × 16 × 224 × 224, InternVideo2에는 3 × 8 × 224 × 224 크기의 clip을 처리한다.실험은 8개의 NVIDIA Tesla V100 GPU에서 PyTorch를 사용해 수행한다.
  • InternVideo2 적용: InternVideo2는 각 frame의 CLS token과 spatial token에 attention pooling을 별도로 적용해 frame-level feature를 생성하도록 수정한다.기존 mechanism은 CLS token을 video token과 concatenate해 하나의 video-level representation을 생성한다.
  • CPR augmentation: CPR은 Beta(2.0, 2.0)에서 샘플링한 coefficient에 0.5를 곱해 sample을 혼합하고, 확률 paug로 batch 내에 augmentation을 적용한다.FAME은 혼합 sample을 생성하기 위해 motion이 큰 foreground region을 식별한다.
  • Loss 설정: 전체 loss는 verb 및 object component에 α = 0.2, composition loss에 β = 1.0을 설정하고, 5 to 10 epoch에 걸쳐 γ를 0.0에서 1.0으로 warm-up한다.LCPR scale δ는 Table 7에 따라 dataset과 backbone별로 달라진다.
  • Inference: Inference에서는 single-view, single-crop evaluation을 사용하고, seen- 및 unseen-composition accuracy의 harmonic mean으로 model을 선택한다.동일한 기준을 bias calibration에도 사용한다.

D 객체 주도 shortcut의 추가 증거 … E.2 다른 ZS-CAR 방법에서의 shortcut 진단

추가 분석은 객체 주도 shortcut이 여러 ZS-CAR 방법에 영향을 미치는 반면, RCORE는 미관측 조합에서 temporal sensitivity와 compositional reasoning을 향상함을 보여준다. Macro Compositional Gap 결과는 또한 데이터셋과 backbone 전반에서 RCORE의 강건성을 보여준다.

  • D 객체 주도 shortcut의 추가 증거: Top-10 failure-case analysis는 unbiased open-world inference scores를 사용해 미관측 EK100-com 조합에서 C2C 를 평가하고, 빈번하게 함께 등장하는 counterpart와 함께 prediction rates를 보고한다.이 분석은 각 오분류된 component에 대해 training set에서 가장 빈번한 counterpart와 그 co-occurrence ratio를 식별한다.
  • D 객체 주도 shortcut의 추가 증거: RCORE는 original–reversed verb-feature similarity를 −0.79까지 낮춰 ‘opening’과 ‘closing’처럼 서로 반대되는 temporal semantics를 구분한다.이 결과는 RCORE가 객체 주도 shortcut에 의존하지 않고 temporal하게 grounded된 verb representation을 학습함을 의미한다.
  • E.1 Macro Compositional Gap: Macro Compositional Gap은 각 test composition에 대해 joint composition accuracy와 verb 및 object accuracy의 곱을 비교한 뒤, composition class 전체에서 평균을 낸다.이 macro formulation은 class imbalance에 대한 강건성을 보장하도록 설계되었다.
  • E.1 Macro Compositional Gap: RCORE는 Sth-com과 EK100-com 및 다양한 backbone의 미관측 조합에서 일관되게 가장 높은 Macro Compositional Gap을 달성한다.이 metric은 class imbalance에 대한 민감도를 줄이기 위해 class별 compositional gap을 평균한다.
  • D 객체 주도 shortcut의 추가 증거: Sth-com에서 C2C 는 training 전반에 걸쳐 original verb feature와 reversed verb feature 사이의 +0.92 cosine similarity를 유지하며, 제한적인 temporal sensitivity를 보인다.Figure 13은 CLIP [34] backbone을 사용해 C2C 와 RCORE를 비교한다.
  • E.2 다른 ZS-CAR 방법에서의 shortcut 진단: CLIP backbone 을 사용한 Jung et al. 에서도 심각한 co-occurrence overfitting이 나타난다. enhanced disentangling training에도 불구하고 seen–unseen accuracy gap은 FSP/FCP와 함께 증가한다.이는 C2C 에서 관찰된 경향을 재현하며, shortcut 의존이 해당 방법에만 국한되지 않음을 보여준다.

E.3 추가 ablation 결과

Sth-com에서 수행한 추가 ablation은 attention pooling만으로는 unseen-composition 격차를 해소할 수 없으며, CPR sample 설계와 pCPR tuning이 compositional 성능에 실질적인 영향을 미친다는 것을 보여준다. 결과는 generic aggregation이나 image augmentation에 의존하기보다 명시적인 temporal-order modeling과 composition-aware input이 필요함을 뒷받침한다.

  • 서로 다른 temporal aggregation method에서 TORC의 효과: Attention pooling은 verb accuracy를 소폭 향상시키지만, TORC의 동기와 달리 unseen composition에서 compositional gap을 줄이지 못한다.이 연구는 temporal average pooling과 frame-wise attention pooling을 비교하지만, 해당 부분에서는 완성된 TORC 결과를 제시하지 않는다.
  • CPR에서 input sample의 효과: Mixup은 baseline보다 낮은 verb@unseen-comp를 보이며, 52.6% vs. 53.0%이다. 이는 concurrent verb-object blending이 temporal difference를 보존하지 못하기 때문이다.이 ablation은 기존 image-based augmentation만으로는 새롭게 생성된 unseen-composition label에 충분히 대응할 수 없다고 주장한다.
  • 추가 ablation 결과: Table 11은 Sth-com에서 CLIP-B/16을 baseline으로 사용하는 C2C를 적용해 RCORE 설계 선택지를 종합적으로 ablate하고, seen, unseen, harmonic-mean 성능을 보고한다.ablation은 temporal aggregation, CPR input sample, RCORE hyperparameter를 다룬다.
  • RCORE hyperparameter의 효과: pCPR을 1.0보다 약간 낮게, 예를 들어 0.95 또는 0.9로 설정하면 seen 성능 손실을 최소화하면서 unseen accuracy가 향상되지만, pCPR = 0.8에서는 이러한 이득이 감소한다.저자들은 seen 및 unseen accuracy의 best validation H.M.을 기준으로 dataset과 backbone별 pCPR을 tuning한다.

E.4 EK100-com에 대한 Ablation studies

EK100-com에서는 CPR과 TORC를 결합했을 때 가장 강력한 ablation 성능을 보이며, 개별 TORC loss 중에서는 Lcos가 가장 우수하고 LCPR은 harmonic mean을 0.3점 추가로 향상시킨다.

  • CPR과 TORC의 효과: CPR과 TORC를 결합하면 EK100-com에서 baseline보다 H.M.가 3.2점 높다.baseline은 CLIP-B/16 [34]과 C2C 를 사용하며, Table 12는 seen, unseen, harmonic-mean 성능을 보고한다.
  • 각 TORC loss term의 효과: TORC에서 Lcos만 사용하면 EK100-com에서 H.M.가 가장 높다.
  • CPR에서 LCPR의 효과: LCPR로 co-occurrence prior를 억제하면 H.M.가 0.3점 향상되며, 이는 Sth-com 에서의 결과와 일치한다.

E.5 validation set으로 조정한 bias calibration 결과 · E.6 대규모 video-pretrained VLM backbone을 사용한 결과 · E.7 Sth-com의 Temporal/Static split

RCORE는 validation set으로 조정한 open-world bias calibration에서도 경쟁력을 유지하고, 훨씬 큰 video-pretrained backbone으로 확장되며, Temporal/Static Sth-com split 전반에서 static cue보다 temporal dynamics에 더 의존하면서 verb recognition을 향상한다.

  • E.5 validation set으로 조정한 bias calibration 결과: 이 calibration은 unseen-composition logit에만 scalar bias를 추가해, test-time prediction 전에 학습 과정에서 최적화되지 않아 자연스럽게 더 낮은 해당 logit을 보정한다.기존 calibration과 달리 bias는 validation-set open-world logit으로 조정한 뒤 test set에 적용되므로, 실제 open-world 시나리오에도 적용할 수 있다.
  • E.6 대규모 video-pretrained VLM backbone을 사용한 결과: RCORE는 InternVideo2-1B를 사용했을 때 Sth-com 과 EK100-com에서 C2C 를 일관되게 개선하며, unseen composition accuracy, unseen ∆CG, H.M.을 높인다.개선 폭은 각각 unseen composition accuracy에서 +3.4p.와 +2.1p., unseen ∆CG에서 +0.8p.와 +1.1p., H.M.에서 +1.5p.와 +0.4p.다.
  • E.5 validation set으로 조정한 bias calibration 결과: validation set으로 조정한 open-world calibration을 적용하면, RCORE의 calibrated performance는 Sth-com 에서 원래의 unbiased performance와 일치한다.이는 CPR의 training-label-space 확장이 seen-composition co-occurrence에만 의존하지 않고 unseen composition에 의미 있는 supervision을 제공함을 시사한다.
  • E.6 대규모 video-pretrained VLM backbone을 사용한 결과: InternVideo2-1B 실험은 본 논문에서 사용한 87M-parameter encoder보다 약 11× 더 큰 1B-parameter vision encoder를 사용한다.C2C 대비 RCORE의 개선은 Sth-com 과 EK100-com 모두에서 일관되게 유지된다.
  • E.7 Sth-com의 Temporal/Static split: 확장된 temporal-modeling 평가는 Sth-com 을 Temporal split과 Static split으로 나누고, original input과 temporally shuffled input을 모두 테스트한다.이 평가는 선행 연구 를 따르며, 재구성한 split과 Sevilla et al. 이 제안한 split을 모두 포함한다.
  • E.7 Sth-com의 Temporal/Static split: 재구성한 Temporal/Static split과 Sevilla et al. 의 Temporal/Static split 모두에서 RCORE는 temporally shuffled input에서 성능이 낮아지지만 original input에서는 C2C 보다 더 우수하다.더 큰 original-versus-shuffled 차이는 static cue보다 temporal dynamics에 더 강하게 의존함을 나타내며, split 전반에서 견고한 verb 개선을 이끈다.
Loading 2601.16211v3…