Source-linked AI summary
TTE-Flash: Accelerating Reasoning-based Multimodal Representations via Think-Then-Embed Tokens
Jianpeng Cheng, Xian Wu, Jiangfan Zhang, Wentao Bao, Chaitanya Ahuja, Shlok Kumar Mishra, Hanchao Yu, Yang Gao, Fan Xia, Qi Guo, Shaodan Zhai, Xiangjun Fan, Jun Xiao
TL;DR
명시적 Chain-of-Thought는 멀티모달 임베딩을 향상시키지만 계산 비용이 크다. TTE-Flash는 이를 latent think tokens로 대체해 explicit-CoT 모델보다 MMEB-v2 성능이 높으면서 70x 더 효율적이다.
문제
명시적 Chain-of-Thought는 멀티모달 표현을 향상시키지만 실시간 계산 비용이 감당하기 어려울 정도로 커서, 효율적인 latent reasoning이 필요하다.
방법
TTE-Flash는 register-based architecture에서 decoupled latent think tokens와 embedding tokens를 사용하며, 하나의 pre-filling pass에서 reasoning과 representation learning을 함께 학습한다.
결과
TTE-Flash-2B는 MMEB-v2에서 explicit-CoT 모델을 능가하면서 70x 더 효율적이며, 15개 zero-shot 비디오 subset 전반에서 think-token scaling이 긍정적인 효과를 보인다.
시사점 및 한계
Latent think tokens는 explicit-CoT 멀티모달 임베딩을 대체하는 효율적인 reasoning-aware 대안을 제공하며, task-dependent think-token scaling은 adaptive budget allocation을 뒷받침한다.
Abstract
from arXiv · showhide
Recent research has demonstrated that Universal Multimodal Embedding (UME) benefits significantly from Chain-of-Thought (CoT) reasoning. In this paradigm, a generative model produces explicit reasoning traces for a multimodal query, with the final representation extracted from an <eos> embedding token attending to both the query and the reasoning. Despite its effectiveness, the computational overhead of generating explicit CoT traces is often prohibitive. In this work, we propose replacing explicit CoT with latent think tokens, which are interpreted as latent variables that can produce explicit CoT traces as observed variables. By optimizing think tokens using CoT generation loss and subsequent embedding tokens using contrastive loss, we produce high-performance, reasoning-aware representations at a constant inference cost. Our study investigates two key architectural designs: 1) how think and embeddings tokens should be extracted from the same LLM backbone. 2) how the tokens should be trained as two dependent tasks. We introduce TTE-Flash-2B, a reasoning-aware multimodal representation model that outperforms its explicit-CoT counterpart on the MMEB-v2 benchmark, while producing latent think tokens that are interpretable both textually and visually. Furthermore, zero-shot evaluation across 15 video datasets reveals scaling behavior as the number of think tokens increases, and motivating a pilot study of adaptive think budget allocation based on task requirements.
1 서론
TTE-Flash는 reasoning-enhanced Universal Multimodal Embedding에서 비용이 큰 명시적 Chain-of-Thought trace를 latent think tokens와 그 뒤의 embed tokens로 대체해 constant-time inference를 달성한다. TTE-Flash-2B는 70x 더 높은 효율을 유지하면서 MMEB-v2에서 explicit-CoT reasoning-based UME baseline을 능가한다.
- 아키텍처: 이 방법은 통합된 LLM backbone을 사용해 embed tokens에 앞서 think tokens를 생성하며, 명시적 CoT 생성을 latent intermediate representations로 대체한다.이 설계는 명시적 CoT trace 생성에 드는 감당하기 어려운 실시간 계산 비용을 줄이는 것을 목표로 한다.
- 아키텍처: 아키텍처 연구에서는 autoregressive하고 memory-bound인 looped latent reasoning과, one pre-filling pass에서 처리되는 register-based tokens를 비교한다.이 비교는 concurrency와 representational fidelity의 균형을 유지하면서 think 및 embed representations를 추출하는 방식을 다룬다.
- 학습: Think tokens는 명시적 CoT trace를 생성하는 latent variables로 학습되고, 이후의 embed tokens는 contrastive retrieval training을 통해 multimodal representations를 학습한다.이 information-bottleneck formulation은 think tokens를 multimodal instructions 및 ground-truth CoT traces와 정렬한다.
- 학습: think tokens와 embed tokens를 겹쳐 사용하면 reasoning과 representation 성능이 모두 저하되므로, 공유 multimodal backbone 안에서 서로 의존하지만 분리된 objectives를 사용한다.이 예비 결과는 reasoning과 representation learning을 서로 연관되지만 구별되는 tasks로 취급하는 방식을 뒷받침한다.
- 결과: TTE-Flash-2B는 70x 더 높은 효율을 유지하면서 MMEB-v2에서 explicit-CoT reasoning-based UME baseline을 능가한다.이 모델은 Think-Then-Embed tokens를 사용해 constant-time inference를 수행하도록 설계되었다.
- 해석 가능성: latent think tokens는 decoded CoT traces를 통한 textual interpretation과 연결된 image-generation head를 통한 visual interpretation을 지원한다.이러한 해석 결과는 15개 video datasets에 대한 zero-shot evaluation과 함께 보고된다.
2 관련 연구
UME는 통합 MLLM backbone과 LLM 중심 fusion을 사용해 reasoning-aware shared representation을 생성하며, CLIP-style dual tower와 대조된다. 관련 방법들은 명시적 또는 latent reasoning을 추가하고, joint contrastive-generative objective는 understanding과 generation을 통합한다.
- Universal Multimodal Embedding: UME는 통합 MLLM backbone과 LLM 중심 fusion을 통해 multimodal input을 shared space로 매핑하며, CLIP-style dual-tower architecture와 대조된다 [Radford et al., 2021; Zhai et al., 2023].LLM 중심 fusion은 풍부하고 reasoning-aware한 representation을 지원한다.
- Universal Multimodal Embedding: Reasoning-enhanced UME framework인 TTE (Cui et al., 2025), UME-R1 (Lan et al., 2025), MMEmb-R1 (Wang et al., 2026)은 representation learning 전에 명시적 CoT를 통합한다.
- Universal Multimodal Embedding: PLUME (He et al., 2026)은 UME에 latent reasoning을 도입해 MMEB-v2 (Meng et al., 2025)에서 더 우수한 accuracy-efficiency trade-off를 달성한다.
- Latent Reasoning: Latent reasoning은 명시적 reasoning token을 decoding하는 대신 중간 thought vector를 생성함으로써 CoT를 hidden-state computation으로 다룬다.Coconut (Hao et al., 2024)은 마지막 hidden state를 재귀적으로 feedback하고, CoLaR (Tan et al., 2025)은 여러 CoT token을 압축하며, LaDiR (Kang et al., 2025)은 diffusion을 적용한다.
- Joint Contrastive-Generative Models: Foundation model은 CoCA (Yu et al., 2022)와 BLIP (Li et al., 2022)가 보여주듯, unified understanding과 generation을 위해 contrastive and generative objective를 일반적으로 결합한다.CoCA는 contrastive loss와 captioning loss를 결합하고, BLIP은 contrastive 및 captioning objective에 image-text matching을 추가한다.
3 TTE-Flash
TTE-Flash는 통합 causal LLM을 사용해 multimodal 입력을 인코딩하고 latent think token을 생성하며 embedding을 추출하고, register token으로 효율적인 병렬 연산을 가능하게 한다. Think token은 압축된 CoT generation으로 학습하고, embedding은 pairwise similarity scoring을 적용한 contrastive learning으로 학습한다.
- 아키텍처: 통합 causal LLM은 think token이 multimodal 입력에 attend하고 embedding token이 입력과 thought 모두에 attend하도록 하여 explicit TTE를 모사한다.이 아키텍처는 multimodal content, thinking, representation learning을 token sequence로 처리한다.
- 아키텍처: Register token은 하나의 pre-filling stage에서 모든 think latent와 embedding을 추출하여, looped architecture에 필요한 N회의 순차 decoding을 피한다.Looped design은 memory-bounded인 반면 register는 KV cache를 한 번만 계산하고 로드하므로 compute-bounded다.
- Think Loss: Think register는 CoT generation loss만으로 최적화되어, N개의 latent vector가 L-token reasoning trace를 생성하는 데 충분한 multimodal 정보를 압축하도록 한다.이 bottleneck은 N = 1–32개의 vector로, 그렇지 않으면 약 L ≈300개의 discrete token이 필요한 정보를 표현한다.
- Embed Loss: Embed register는 원래 입력과 think latent를 조건으로 한 query 및 target embedding에 standard contrastive loss를 적용해 학습한다.Scoring function은 pairwise vector similarity를 합산하며, N = 1이면 standard single-vector retrieval로 축소된다.
- Embed Loss: Pairwise similarity는 dependent causal register pair 사이의 positional correspondence를 보존하며, prior work에서 사용한 “sum of maximum” scoring과 대조된다 (Santhanam et al., 2022; Faysse et al., 2024).Fine-tuned backbone은 한 번의 pre-filling pass를 수행하는 반면, pretrained backbone은 시각화 또는 해석을 위해 think latent를 decoding한다.
4 실험
실험 결과, TTE-Flash는 loop 기반 및 decoupled architecture, pairwise similarity, 그리고 더 많은 think token의 이점을 얻으며, explicit-CoT 및 더 큰 baseline을 넘어 MMEB-V2에서 성능 향상을 달성한다. 추가 연구에서는 adaptive budget과 think token이 textual 및 visual semantics를 인코딩하는지 여부를 검토한다.
- Architecture 비교: Loop 기반 접근법은 MMEB-V1에서 register 기반 접근법을 일관되게 능가하며, 제한된 계산 자원에서는 layer별 register가 성능 격차를 줄인다.비교는 총 token budget이 8인 20개 checkpoint의 평균을 사용하며, latency와 throughput은 Table 1에서 별도로 분석한다.
- Similarity function: Pairwise similarity의 합은 position-aware embedding이 인과적으로 의존하기 때문에 maximum similarity의 합보다 우수하다.이 연구는 maximum query-target matching과 동일 위치의 pairwise similarity aggregation을 비교한다.
- Think/embed decoupling: Think token과 embedding token을 decoupling하는 방식은 MMEB-V1 retrieval 및 CoT-generation similarity에서 두 token을 공유하는 방식보다 우수하다.Ablation에서는 8개 token을 사용하며, decoded CoT와 ground truth 간 cosine similarity와 retrieval을 함께 평가한다.
- Think-token scaling: 성능은 일반적으로 think token 수가 증가할수록 향상되며, 15개 zero-shot video dataset에서도 positive scaling이 관찰된다.Think-token ablation에서는 embedding token 수를 1로 고정하고, video evaluation에서는 image로 학습한 checkpoint를 MMEB-V2 task에 적용한다.
- 최종 benchmark 결과: Think token 32개와 embedding token 1개를 사용하는 TTE-Flash 2B는 MMEB-V2에서 explicit-CoT TTE-V1 2B variant와 7B VLM2Vec baseline을 능가한다.최종 configuration은 layer별 register, shared LoRA adapter, task-decoupled register를 사용하며, Table 2에 benchmark 비교를 요약한다.
- Adaptive thinking budget: 최대 32 token을 사용하는 Adaptive think는 image, video, visdoc에서 각각 66, 49.4, and 65.5를 기록해, fixed-32의 68.3, 50.6, and 68.1보다 낮다.Adaptive mechanism은 input-conditioned budget logit과 Gumbel-Softmax를 사용해 first-K token mask를 예측하며, GQA에 13.7개, OK-VQA에 13.0개 token을 할당하는 등 복잡한 VQA task에 더 많은 token을 배정한다.
5 결론 … A.2 Budget Regularization
TTE-Flash는 단일 causal pre-filling pass에서 latent think tokens를 사용해 효율적인 reasoning-aware embeddings를 생성하며, MMEB-V2에서 explicit-CoT TTE-2B variants와 VLM2vec 7B를 능가한다. adaptive mechanism은 budget prediction, differentiable masking, regularization을 통해 입력 난이도에 따라 더 짧거나 긴 reasoning prefixes를 할당한다.
- 5 결론: TTE-Flash-2B는 latent think tokens의 수를 확장해 MMEB-V2에서 explicit-CoT TTE-2B variants와 더 큰 VLM2vec 7B baseline을 능가한다.이 모델은 하나의 causal pre-filling pass 안에서 register tokens를 사용해 think representations와 embedding representations를 생성한다.
- 5 결론: 디코딩된 CoT traces를 think-token budgets 2, 4, 8, and 16에 걸쳐 비교한다.이 비교는 think budget이 증가할 때 latent reasoning outputs가 어떻게 달라지는지 살펴본다.
- A Adaptive Think Budget Allocation: adaptive think-budget mechanism은 쉬운 입력을 더 짧은 reasoning prefixes로, 어려운 입력을 더 많은 think tokens로 보낸다.짧은 classification queries는 쉬운 입력의 예이며, compositional VQA는 더 어려운 입력의 예다.
- A.1 Budget Predictor: 경량 predictor는 pooled input representations를 N개 candidate positions에 대한 budget logits로 매핑하고, straight-through Gumbel-Softmax를 사용해 one-hot budget을 샘플링한다.estimator는 temperature τ를 사용하며 differentiable budget selection을 가능하게 한다.
- A.1 Budget Predictor: one-hot budget은 contiguous prefix mask로 변환되며, 이 mask의 active think tokens는 embedding position보다 앞에 놓이고 mask를 통해 gradient가 흐른다.mask는 input embeddings에 곱셈 방식으로 적용되어 end-to-end training을 가능하게 한다.
- A.2 Budget Regularization: 평균 active think tokens 수에 ℓ1 penalty를 적용해 모든 budget을 켜는 자명한 해를 억제하며, λb = 0.01을 사용한다.전체 objective는 contrastive, generation, budget-regularization losses를 결합한다.
- A.2 Budget Regularization: Contrastive와 generation losses는 유용할 때 think tokens를 활성화하고, regularization은 불필요할 때 이를 끄면서 budgets를 per-sample difficulty에 맞게 조정한다.이를 통해 reasoning utility와 token economy 사이의 균형이 형성된다.
B 실험 세부사항 · B.1 데이터셋 세부사항
MMEBv2는 텍스트, 이미지, 비디오, 문서 모달리티에 걸쳐 9개 메타 태스크와 78개 태스크를 포괄하는 광범위한 멀티모달 임베딩 벤치마크다. 통합 retrieval 기반 프로토콜은 벤치마크가 규정한 training 및 evaluation split을 사용해 다양한 멀티모달 이해 능력 전반에서 모델을 일관되게 평가한다.
- B.1 데이터셋 세부사항: MMEBv2는 텍스트, 이미지, 비디오, 문서 모달리티에 걸쳐 9개 메타 태스크와 78개 개별 태스크로 구성된다.
- B.1 데이터셋 세부사항: 이미지 평가는 ImageNet-1K, HatefulMemes, OK-VQA, DocVQA, GQA를 포함해 10개 분류 태스크와 10개 visual question answering 태스크를 다룬다.
- B.1 데이터셋 세부사항: 이미지 수준 retrieval은 12개 태스크에 걸쳐 수행되며, visual grounding은 MSCOCO, RefCOCO, Visual7W-Pointing을 포함한 4개 태스크로 구성된다.
- B.1 데이터셋 세부사항: 비디오 평가는 Kinetics-700, Video-MME, MVBench, EgoSchema 등의 데이터셋을 대상으로 5개 비디오 분류 태스크와 5개 비디오 질의응답 태스크를 포함한다.
- B.1 데이터셋 세부사항: 비디오 수준 retrieval은 5개 태스크로 구성되며, moment retrieval은 QVHighlights, Charades-STA, MomentSeeker의 3개 태스크로 구성된다.
- B.1 데이터셋 세부사항: 모든 태스크는 멀티모달 질의가 candidate pool에서 정답 타깃을 retrieval하는 retrieval 기반 framework를 사용하며, MMEBv2 (Meng et al., 2025)의 training/evaluation split을 따른다.
B.2 학습 및 평가 세부 사항
모델은 MMEB-V2에서 Qwen3-VL-2B-Instruct로 학습되며, 과제 성능은 Hit@1로 측정하고 전체 점수는 계층적 가중 평균으로 계산한다.
- 학습 설정: 학습에는 MMEB-V2 training set에서 Qwen3-VL-2B-Instruct를 사용하며, 하이퍼파라미터는 Table 3에 명시되어 있다.Table 3은 학습 구성을 제시한다.
- 평가: 개별 과제는 Hit@1을 사용해 평가하며, 전체 benchmark 점수는 계층적 가중 평균이다.전체 집계는 Meng et al. (2025)을 따른다.
C 시각적 디코딩: 방법론 … C.3 DiTDH-XL: Diffusion Transformer
시각적 디코딩 방법은 frozen TTE-Flash backbone으로 latent diffusion을 조건화하고, semantic autoencoder와 DiTDH-XL transformer를 통해 thinking-token 표현을 이미지로 변환한다. 이 파이프라인은 Perceiver resampling과 per-token denoising 연산을 통해 spatial conditioning을 보존한다.
- C 시각적 디코딩: 방법론: 디코더는 frozen TTE-Flash 표현을 조건으로 하는 latent diffusion model을 학습해 free-form vision-language 입력으로부터 이미지를 생성한다.이 방법론은 의미적으로 풍부한 representation encoder가 강력한 generative capability와 함께 나타난다는 전제를 따른다.
- C.1 개요: 2단계 파이프라인은 frozen encoder로 target image를 DINOv2 semantic latent로 인코딩하고, ViT-XL decoder를 학습한 뒤, 생성된 latent를 이미지로 디코딩한다.RAE는 R768×16×16의 latent를 사용하며, decoder만 학습한다. DiTDH-XL은 thinking-token 표현으로부터 이 latent를 생성한다.
- C.2 TTE-Flash 표현을 통한 Conditioning: 시각화를 위해 frozen TTE-Flash는 2048차원 embedding을 갖는 8개의 thinking token을 생성하며, 이 토큰이 diffusion model을 조건화한다.Perceiver resampler는 256개의 학습 가능한 768차원 query와 8-head cross-attention을 사용해 이 feature를 고정된 spatial conditioning signal로 투영한다.
- C.2 TTE-Flash 표현을 통한 Conditioning: Perceiver 출력은 2048차원에서 768차원으로 선형 투영된 뒤 c ∈R768×16×16으로 reshape되어 DiT의 spatial latent 차원과 일치한다.conditioning은 LayerNorm(Q + CrossAttn(Q, Linear(Hthink), Linear(Hthink)))으로 계산된다.
- C.3 DiTDH-XL: Diffusion Transformer: DiTDH-XL은 28-layer, 1152-hidden-size encoder와 2-layer, 2048-hidden-size DDT decoder head를 결합해 spatially-aware denoising을 수행한다.decoder는 encoder 출력을 per-token conditioning으로 받고, thinking-token-conditioned scale, shift, gate 연산을 re-embedded noisy input에 적용한다.
- C.3 DiTDH-XL: Diffusion Transformer: 학습에는 Gaussian noise와 DINOv2 latent 사이의 선형 보간을 사용하는 flow matching이 적용되며, logit-normal timestep sampling 아래에서 MSE로 velocity를 예측한다.경로는 xt = (1−t) x1 +t x0이고, target velocity는 ut = x0 −x1이다.
- C.3 DiTDH-XL: Diffusion Transformer: 이미지는 50-step Euler ODE integration과 scale 4.0의 classifier-free guidance로 샘플링하며, 이는 학습 중 10% caption dropout으로 가능해진다.diffusion transformer는 effective batch size 1024와 AdamW optimization으로 243K MMEB samples에서 200 epochs 동안 학습된다.
C.4 정성적 결과 · D Think Tokens로 생성한 추가 CoT 예시
Appendix E는 세 가지 MMEB task에서 대표적인 성공 및 실패 사례를 제시하며, TTE-Flash thinking tokens가 풍부한 시각적 의미를 인코딩하는 한편 세밀한 공간 추론과 복잡한 조합적 지시 충실도의 한계를 드러냄을 보여준다.
- C.4 정성적 결과: Appendix E는 MSCOCO와 VisualNews의 text-to-image retrieval 및 CIRR의 composed retrieval을 다루며, captions 또는 image–instruction pairs를 사용해 grounded 또는 compositional images를 생성한다.MSCOCO와 VisualNews는 text captions만 제공하는 반면, CIRR은 reference image와 textual modification instruction을 결합한다.
- C.4 정성적 결과: 성공 사례는 TTE-Flash thinking tokens에 풍부한 시각적 의미가 담겨 있음을 보여주는 반면, 실패 사례는 세밀한 공간 추론과 복잡한 조합적 지시에 대한 충실도의 취약성을 드러낸다.정성적 예시는 해당 tokens가 retrieval만으로 요구되는 것 이상의 정보를 표현함을 시사한다.
Dataset: IMAGENET–1K
IMAGENET–1K 예시는 이미지 분류 representation prompt와 retrieval target, 생성된 reasoning trace를 짝짓는다. Trace는 서로 다른 CoT 길이에서 시각적 속성, label, 맥락, 기능적 특징을 활용해 객체를 식별한다.
- Classification retrieval prompt: 이 데이터셋은 이미지 representation을 “African grey, African gray, Psittacus erithacus,” “beer bottle,” “drum, membranophone, tympan,” “fire engine, fire truck.” 등을 포함한 target에 대한 classification retrieval로 구성한다.이 prompt는 각 이미지와 의도된 retrieval label을 명시적으로 짝짓는다.
- CoT-16 reasoning trace: CoT-16 trace는 plumage, label, 객체 형태, 소방 장비처럼 시각적 외양과 맥락적 또는 기능적 근거를 결합해 이미지를 분류한다.예시는 이러한 단서로 African grey parrot, beer bottle, drum, fire engine을 식별한다.
- 더 짧은 reasoning trace: 더 짧은 trace도 특징적인 시각적 또는 텍스트 단서를 활용한다. 예를 들어 “Bier” label로 beer를, 붉은색, 사다리, “FIRE DEPT” text로 fire engine을 식별한다.제공된 예시에는 이러한 분류를 위한 CoT-8 및 CoT-4 generation이 포함된다.
데이터셋: MSCOCO … 데이터셋: VIDORE_SYNTHETICDOCQA_AI
MSCOCO 예시는 객체 크롭, 이미지-텍스트 캡션 검색, 시각적 질의응답, 멀티모달 매칭 프롬프트를 아우른다. 생성된 CoT trace는 다양한 추론 길이로 두드러진 객체, 동작, 환경, 맥락 단서를 설명한다.
- 데이터셋: MSCOCO: MSCOCO에는 브로콜리, 피자, 샌드위치 이미지에서 객체를 분리하는 프롬프트가 포함된다.이 프롬프트는 라벨이 지정된 객체만 분리하도록 이미지를 명시적으로 크롭할 것을 요청한다.
- 데이터셋: MSCOCO: MSCOCO에는 객체의 외관, 재료, 동작, 주변 맥락에 초점을 맞춘 멀티모달 매칭 trace도 포함된다.피자, 브로콜리, 샌드위치 예시는 색상, 토핑, 음식 준비 과정, 주변 사람이나 표면 같은 특징을 강조한다.
- 데이터셋: MSCOCO: 추론 예시는 CoT-2부터 CoT-16까지 다양하며, 시각적 세부사항을 서로 다른 수준으로 점진적으로 설명한다.짧은 trace는 중심 객체나 활동을 식별하는 반면, 긴 trace는 더 풍부한 환경 및 속성 설명을 제공한다.
- 데이터셋: MSCOCO: 캡션 검색 예시는 들판의 얼룩말, 안뜰의 사람들, 핫도그, 식사 중인 소녀들, 오토바이, 욕실, 스키 장면을 대상으로 한다.이 예시들은 일상적인 이미지를 설명하는 캡션을 요청하며, 동물과 사람부터 장소와 활동까지 다양한 검색 대상을 제공한다.
- 데이터셋: MSCOCO: CoT-16 trace는 캡션이나 매칭 설명을 생성하기 전에 시각적 대상과 맥락을 식별한다.예시는 얼룩말과 초원, 철판 위의 샌드위치, 학교 근처의 사람들, 핫도그, 식사 중인 소녀들, 거리의 오토바이를 분석한다.
- 데이터셋: MSCOCO: 시각적 질의응답 프롬프트는 바다 이름, 건물 유형, 차량 브랜드, 계절, 날씨, 선박 유형을 포함한 의미적 속성을 묻는다.대상에는 pacific ocean, warehouse, lincoln, fall, sunny, cruise가 포함된다.
- 데이터셋: MSCOCO: 생성된 trace는 서핑 조건, 창고 구조, 가을 단풍, 차량 로고, 맑은 날씨, 선박 설계를 포함한 장면 단서를 활용해 답을 추론한다.이 추론은 보이는 객체와 환경을 요청된 의미 레이블과 연결한다.
Dataset: VISRAG_INFOVQA … Dataset: VisualNews_t2i – 실패 사례
보충 예시는 문서·캡션·뉴스 캡션 데이터셋에서 멀티모달 추론 trace, think token 조건부 이미지 생성, 성공하거나 실패한 이미지 retrieval을 보여준다. 인포그래픽 해석, 일상 장면 matching, 뉴스 이미지 retrieval, 그리고 문서화된 실패 사례를 아우른다.
- Dataset: VISRAG_INFOVQA: VISRAG_INFOVQA 예시는 문서 제목, 안전 조치, 감염 예방 행동, 사망 원인이 제시된 인포그래픽 섹션을 해석하는 CoT 생성을 보여준다.예시는 문서 이미지에서 텍스트 및 시각 정보를 식별하기 위해 CoT-16, CoT-4, CoT-2 생성을 사용한다.
- Dataset: VISRAG_INFOVQA: VISRAG_INFOVQA 예시는 개입 효과를 설명하는 인포그래픽을 통해 안면 마스크가 감염 위험을 70% 낮춘다는 사실을 식별한다.생성 결과는 “Face masks” 아래의 “Infection” 항목을 찾아 명시된 백분율을 보고한다.
- E Think Token에서 생성된 이미지: Visual decoding 예시는 텍스트 또는 이미지 수정 query를 ground-truth target 및 TTE-Flash thinking token을 조건으로 생성된 DiTDH-XL 이미지와 대응시킨다.이 예시들은 모델의 latent thinking token에서 생성된 시각적 출력을 보여준다.
- Dataset: MSCOCO_t2i – 성공 사례: MSCOCO_t2i 성공 사례는 오토바이, 생일 초, 주방, 욕실, 자전거 이용자에 대한 caption-to-image matching을 다룬다.prompt에는 기차 근처의 탑승자, 주방 도구, 욕실 설비, 거리에서 함께 자전거를 타는 사람들 등 다양한 일상 장면이 포함된다.
- Dataset: MSCOCO_t2i – 성공 사례: 추가 MSCOCO_t2i prompt는 초, 주방, 욕실, 자전거를 포함한 동일한 일상 장면을 바꿔 표현한 설명으로 제시한다.이 사례들은 기본 장면 matching task를 유지하면서 표현을 달리한다.
- Dataset: VisualNews_t2i – 성공 사례: VisualNews_t2i 성공 사례는 경찰, 운동선수, 음악가, 패션, 항공, 대학, 정치, 분쟁에 관한 뉴스 caption의 이미지를 retrieval한다.prompt에는 짧은 named-entity caption과 더 긴 사건 설명이 모두 포함된다.
- Dataset: VisualNews_t2i – 실패 사례: VisualNews_t2i 실패 사례 섹션에는 백악관에서 촬영된 Huma Abedin에 관한 retrieval prompt가 포함되며, “GT Generated”로 표시된다.이 예시는 생성 결과가 실패 사례임을 명시적으로 표시한다.
Dataset: CIRR – 성공 사례
성공적인 CIRR 사례는 물체 수, 제거, 추가, 구도, 조명, 색상, 시점 변화 등 다양한 이미지 편집 지시에 따른 검색을 보여준다. 세밀한 대상 초점과 장면 내용 수정 사례도 포함된다.
- 물체 및 수량 변화: 성공 사례는 청량음료 병 세 개, 더 적은 종이 타월, 사슴 추가와 같은 물체 수 및 수량 변화에 부합하는 이미지를 검색한다.이 사례들은 범주형 추가와 수량 기반 수정을 모두 보여준다.
- 대상과 행동: 다른 사례는 강아지와 함께 있는 같은 품종의 개, 같은 품종의 개 두 마리, 짖는 개, 카메라를 바라보는 사슴 등 대상 간 관계와 행동을 지정한다.이 사례들은 정체성 관련 설명과 행동 설명을 모두 만족하는 이미지를 검색해야 한다.
- 구도와 시점: 성공적인 검색은 보이는 표면, 흰색 배경 표현, 등을 보인 사슴의 모습, 개 머리에 초점을 맞춘 시점 등 구도와 시점 변화도 반영한다.이 프롬프트들은 장면의 주요 내용은 유지하면서 프레이밍, 시점, 배경 또는 대상 강조를 바꾼다.
- 물체 및 장면 편집: 사례에는 레몬이나 조개껍데기 제거, 나무 통나무 추가, 물 색상 변경과 같은 물체 제거 및 삽입 지시가 포함된다.요청된 편집은 물체 수준의 변화와 장면 속성 변화를 결합한다.
- 환경 및 분위기: 성공 사례에는 더 밝은 햇빛, 햇빛 추가, 초록색 물, 음식이 있는 실내 장면 등 환경 및 분위기 수정도 포함된다.이 프롬프트들은 조명, 색상, 배경, 장면 맥락을 대상으로 한다.
Dataset: CIRR – 실패 사례
CIRR 실패 사례는 입력 이미지와의 유사성을 유지하면서 동물, 인간, 환경, 구도에 통제된 변화를 요구하는 생성 retrieval prompt를 보여준다.
- CIRR – 실패 사례: 생성 사례는 종 간 대체와 인간 존재 제약을 요구하며, 인간이 없는 서로 다른 두 동물 종과 한 종이 다른 동물 한 마리와 인간을 포함한다.이 prompt들은 입력 이미지 또는 이전 이미지와 비교해 정체성과 존재 여부를 동시에 바꾸는 능력을 평가한다.
- CIRR – 실패 사례: 추가 사례는 의도한 장면 관계를 유지하면서 인간의 외형이나 동물의 유형을 바꾸며, 장비를 줄이고 환경은 보존하는 변화를 포함한다.이 prompt들은 무엇을 바꾸지 않아야 하는지 명시하면서 피사체 속성과 동물의 정체성을 변화시킨다.
- CIRR – 실패 사례: 다른 생성 사례는 개나 동물이 흙바닥 위에 서 있는 모습처럼 특정 시각적 속성을 보존하거나 바꾸도록 요구한다.이 prompt들은 동물의 전신과 지면을 포함하는 구도 및 환경 조건을 분리해 평가한다.