Source-linked AI summary
ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models
Guiming Hardy Chen, Shunian Chen, Ruifei Zhang, Junying Chen, Xiangbo Wu, Zhiyi Zhang, Zhihong Chen, Jianquan Li, Xiang Wan, Benyou Wang
TL;DR
Lite vision-language model은 더 적은 자원을 사용하지만 일반 규모 모델보다 성능이 뒤처진다. ALLaVA는 GPT-4V 기반 Caption-then-QA 파이프라인으로 1.3M개의 synthetic sample을 생성해 이 격차를 줄이며, ALLaVA model은 17개 benchmark 중 대부분에서 4B-scale system을 능가하고 여러 benchmark에서 더 큰 model과 대등한 성능을 보인다.
문제
Lite LVLM은 계산 요구량을 줄이지만 일반 규모 모델과의 performance gap은 여전히 남아 있어, high-quality data로 이를 해소할 수 있는지가 문제로 제기된다.
방법
ALLaVA는 엄선한 image에 대해 GPT-4V가 세밀한 caption, question, answer를 생성하도록 하는 Caption-then-QA framework를 사용한다.
결과
ALLaVA model은 17개 benchmark 중 대부분에서 4B-scale LVLM을 능가하며, 여러 benchmark에서 7B 또는 그 이상 규모의 model과 대등한 성능을 보인다.
시사점 및 한계
이 결과는 high-quality synthetic data를 사용해 resource-efficient LVLM의 성능을 향상할 수 있음을 뒷받침한다.
시사점 및 한계
생성된 answer가 완전히 정확하지 않으며, 현재 dataset은 소수 문화와 관련된 multilingual content를 충분히 포괄하지 못한다.
Abstract
from arXiv · showhide
Large vision-language models (LVLMs) have shown premise in a broad range of vision-language tasks with their strong reasoning and generalization capabilities. However, they require considerable computational resources for training and deployment. This study aims to bridge the performance gap between traditional-scale LVLMs and resource-friendly lite versions by adopting high-quality training data. To this end, we propose a comprehensive pipeline for generating a synthetic dataset. The key idea is to leverage strong proprietary models to generate (i) fine-grained image annotations for vision-language alignment and (ii) complex reasoning visual question-answering pairs for visual instruction fine-tuning, yielding 1.3M samples in total. We train a series of lite VLMs on the synthetic dataset and experimental results demonstrate the effectiveness of the proposed scheme, where they achieve competitive performance on 17 benchmarks among 4B LVLMs, and even perform on par with 7B/13B-scale models on various benchmarks. This work highlights the feasibility of adopting high-quality data in crafting more efficient LVLMs. We name our dataset \textit{ALLaVA}, and open-source it to research community for developing better resource-efficient LVLMs for wider usage.
1 서론
LVLMs는 폭넓은 vision-language 역량을 제공하지만 학습과 배포에 상당한 자원을 요구하므로, 성능을 일부 희생하는 lite 모델이 필요하다. ALLaVA는 고품질 synthetic data를 확장하고 1.3M samples와 대규모 LVLMs와 경쟁력 있는 성능을 보이는 4B-scale models를 공개함으로써 이 격차를 해소한다.
- 동기: Lite LVLMs는 계산 요구량을 줄이고 이식성을 높이지만, 일반적으로 normal-sized models에 비해 성능 손실이 발생한다.이러한 손실은 더 큰 LVLMs의 역량에 필적하는 능력을 제한한다.
- 동기: 이 연구는 고품질 data를 확장하면 normal-sized LVLMs와 lite LVLMs 간의 성능 격차를 해소할 수 있는지 조사한다.LAION과 Vision-FLAN에서 고품질 이미지를 선별하고 data-generation framework를 제안한다.
- 기여: ALLaVA는 GPT-4V가 생성한 fine-grained captions, complex instructions, detailed answers, high-resolution images로 구성된 1.3M개의 다양한 synthetic samples를 오픈소스로 공개한다.이미지는 LVLM 학습을 위해 다양한 출처에서 선별된다.
- 기여: ALLaVA는 synthetic dataset으로 학습한 일련의 4B-scale LVLMs를 공개하며, 이 모델들은 여러 benchmark에서 더 큰 models와 대등한 성능을 보인다.보고된 결과는 resource-efficient LVLM 개발에서 고품질 synthetic data의 효과를 뒷받침한다.
2 기존 LVLM 다시 생각하기
이 논문은 data-centric 관점에서 기존 LVLM을 재검토하며, alignment와 visual instruction tuning에 초점을 둔다. coarse-grained image-text alignment, 상대적으로 단순한 질문, 짧고 정보가 부족한 답변을 핵심 한계로 지적한다.
- Data-centric 관점: 분석은 data-quality principle에 따라 alignment와 visual instruction tuning 단계를 모두 면밀히 검토하여 LLaVA Liu et al. (2023a)를 재평가한다.alignment는 시각적 이해와 추론을 지원하는 반면, instruction tuning은 다양한 visual instruction에 대한 일반화 성능 향상을 목표로 한다.
- Image-text Alignment: 기존 caption dataset은 짧고 coarse-grained한 설명을 제공하여 noisy signal을 유발하고 vision-language alignment를 저해한다.alignment 단계는 language model이 시각적 객체를 인식하고 visual reasoning을 향상하도록 돕는 것을 목적으로 한다.
- Visual Instruction Tuning: Visual instruction tuning dataset은 기본 능력을 강조하는 경우가 많지만, WizardLM Xu et al. (2023a)과 비교하면 질문은 여전히 상대적으로 단순하다.예를 들어 Vision-FLAN Xu et al. (2023b)은 101개 dataset에 걸친 191개 VQA task를 포함하지만, 질문은 상대적으로 단순하다고 설명된다.
- Visual Instruction Tuning: Vision-FLAN의 답변은 자주 짧고 정보가 부족하거나 불완전하므로, 이를 직접 학습하면 model 성능을 저해할 수 있으며 answer polishing 또는 regeneration이 필요하다.답변은 수작업으로 주석 처리되었지만, format prompt 없이 단어나 구로만 구성된 경우가 많고 일부는 불완전한 문장이다.
3 ALLaVA 방법론
ALLaVA는 image selection, captioning, questioning, answering 단계에서 GPT-4V를 prompting하여 세밀한 caption과 복잡한 visual question-answering 데이터를 합성한다. Caption-then-Answer 전략은 직접 answering보다 answer accuracy를 높이며, LAION과 Vision-FLAN source를 결합해 다양한 synthetic dataset을 지원한다.
- 데이터 합성: ALLaVA는 하나의 session에서 각 image에 대해 세밀한 caption과 VQA pair를 생성하도록 GPT-4V를 prompting하며, captioning, questioning, answering 단계를 사용한다.Caption은 implicit image embedding과 함께 추가적인 명시적 image context를 제공하여 answer quality를 높이고 hallucination을 줄인다.
- Image selection: Image는 LAION과 Vision-FLAN에서 가져오며, 다양하고 실제 환경에 부합하는 image source를 지원하기 위해 quality control과 deduplication을 적용한다.Question은 LAION에 대해서만 생성하고, Vision-FLAN의 original instruction은 이미 다양한 instruction을 제공하므로 그대로 유지한다.
- Captioning, questioning, answering: GPT-4V는 상세하고 논리적으로 구성된 caption, 복잡하고 다양한 question, 그리고 evidence, chain-of-thought 및 관련 context를 포함하는 answer를 생성하도록 prompting된다.Question-generation prompt는 WizardLM의 original instruction evolution 대신 경량화된 complexity instruction을 사용하며, answer prompt는 context 없는 pure answer를 방지한다.
- 데이터 생성 평가: Direct Answer보다 6% 높은 accuracy를 보였지만 VFLAN gt보다 4% 낮았으며, 이는 manual inspection에서 Caption-then-Answer curation pipeline을 검증한다.Inspection에서는 100개의 VFLAN sample을 대상으로 captioning을 먼저 수행하거나 수행하지 않고 answer를 직접 생성하여 평가했다.
- Synthetic dataset: 이 pipeline은 469K개의 LAION image와 Vision-FLAN instruction으로부터 ALLaVA-Caption 및 ALLaVA-Instruct dataset을 생성하며, VFLAN question은 유지한 채 VFLAN answer를 재생성한다.LAION question은 VFLAN의 더 단순한 question을 보완하고, original VFLAN question은 전체 question diversity를 보충한다.
4 ALLaVA 탐색
Section 4에서는 ALLaVA의 규모, 이미지 출처 다양성, 주제 범위를 특성화한다. 이 데이터셋은 다양한 이미지를 포괄하는 664K개 샘플로 구성되며, 광범위한 웹 도메인 출처와 주제 클러스터를 기반으로 구축된다.
- 기본 통계: ALLaVA는 평균 이미지 해상도가 891 × 770픽셀인 664K개 샘플을 포함하며, 동일한 이미지를 공유하는 ALLaVA-Caption과 ALLaVA-Instruct subset으로 나뉜다.이 데이터셋은 샘플 수와 평균 해상도를 비롯한 여러 측면에서 다른 공개 데이터셋을 능가하는 것으로 보고된다.
- ALLaVA-LAION의 다양한 이미지 출처: ALLaVA-LAION의 469K개 이미지는 뉴스, 고해상도 템플릿, 상품, 고해상도 사진 웹사이트를 아우르는 122K개의 고유 도메인에서 수집된다.Figure 7은 상위 12개 도메인의 분포를 보여준다.
- 주제 분석: 주제 다양성은 100K개 샘플, 25개의 Mallet-LDA topic, 1K training steps, GPT-4가 생성한 클러스터 요약을 사용해 ALLaVA-Caption-LAION-4V와 ALLaVA-Caption-VFLAN-4V 전반에서 분석된다.각 클러스터에 대해 가장 관련성이 높은 10개 단어가 Appendix B.1에 설명된 prompt를 사용해 GPT-4에 제공된다.
5 실험
실험 결과, ALLaVA는 기존 lite VLM을 개선하고 17개 benchmark에서 대부분의 4B-scale VLM을 능가하는 모델을 구현하며, 더 큰 모델에 필적하는 성능을 보인다. 또한 ALLaVA 데이터가 perception, cognition, language ability를 향상시킴을 결과가 보여준다.
- 절제 실험: 두 training stage 모두에 ALLaVA 데이터를 추가하면 MobileVLM-v2와 Mipha-3B가 평가된 5개 benchmark 모두에서 향상되며, 특히 MMVP, LLaVA-Bench, TouchStone에서 두드러진다.이 benchmark들은 perception, cognition, reasoning 능력을 평가한다.
- 종합 결과: ALLaVA 모델은 17개 benchmark 중 대부분에서 4B-scale VLM을 능가하며, 7B-or-larger VLM과 대등한 성능을 보인다.비교 대상은 textual benchmark 1개와 multimodal benchmark 16개다.
- Multimodal Perception: ALLaVA 모델은 CLIP의 feature가 SigLIP보다 거칠다는 한계에도 불구하고 여러 perception benchmark에서 다른 4B-scale 모델을 능가하며, ALLaVA의 fine-grained 데이터가 이를 보완한다.저자들은 perception 성능이 vision-encoder representation과 fine-grained training annotation의 상호작용에서 비롯된다고 설명한다.
- Multimodal Cognition: ALLaVA 모델은 7개 cognition benchmark 중 6개에서 다른 4B-scale 모델을 능가하며, 특히 수학, 복잡한 reasoning, multimodal multidisciplinary knowledge에서 강점을 보인다.모델은 CLIP-ViT-L/14@336과 경량 language backbone을 사용하는 LLaVA-v1.5-style architecture를 따른다.
- Language Ability: textual benchmark에서 ALLaVA-Phi2는 49.4점을 기록해 Mipha-3B의 16.2점과 TinyLLaVA의 15.6점을 웃돌며, ALLaVA-Phi3는 세 lite 모델 중 가장 높은 성능을 보인다.결과는 visual instruction tuning 이후 강력한 language backbone과 textual 데이터의 중요성을 보여준다.
6 결론
이 논문은 고품질 캡션, 지시문, 답변을 생성하는 Caption-then-QA를 제안하고, 1.3M개 샘플로 구성된 LVLM 학습 데이터셋 ALLaVA를 공개한다. Ablation 결과, ALLaVA는 여러 벤치마크에서 lite VLM의 성능을 더 큰 VLM과 동등한 수준으로 끌어올린다.
- 6 결론: Caption-then-QA는 고품질 캡션, 지시문, 답변을 생성하는 단순하면서도 효과적인 전략으로 제안된다.
- 6 결론: ALLaVA는 보고된 LVLM 학습 데이터셋 중 가장 큰 규모로 공개되었으며, 1.3M개 샘플을 포함한다.
- 6 결론: Ablation 연구는 ALLaVA가 여러 벤치마크에서 lite VLM의 성능을 더 큰 VLM과 맞먹는 수준으로 향상함을 보여준다.
7 한계 … A.3 Vision-FLAN 증류를 위한 Prompt
이 논문은 데이터 품질과 범위에 남아 있는 한계를 밝히고, LAION 및 Vision-FLAN 데이터 증류를 위한 filtering과 prompt 설계를 기술한다. Prompt는 상세한 이미지 설명, reasoning 기반 답변, 구조화된 출력, 윤리적 safeguards를 요구한다.
- 7 한계: Caption-then-QA 전략은 응답을 직접 생성하는 것보다 정확도를 높이지만, 답변은 여전히 불완전하며 소수 문화에 대한 다국어 범위도 충분하지 않다.저자들은 답변 정확도와 문화적으로 포괄적인 다국어 데이터를 향후 개선이 필요한 영역으로 제시한다.
- A.1 LAION Samples의 Deduplication: LAION 이미지는 해상도, 잠재적으로 pornographic하거나 폭력적인 URL, semantic-caption similarity를 기준으로 filtering하여 중복을 제거한다.이 과정은 Laion-400M 이미지를 사용하고, 두 차원이 모두 512 pixels를 초과하는 이미지를 제외하며, semantic retrieval에 all-mpnet-base-v24 caption embeddings를 적용한다.
- A.2 LAION 증류를 위한 Prompt: LAION distillation prompt는 상세한 이미지 설명, 서로 다른 다섯 개의 후보 질문, 무작위로 선택한 하나의 질문, 그리고 이미지에 근거한 답변을 요구한다.또한 가치 있는 이미지 정보를 대상으로 하고 violence, advertisements, privacy invasion 또는 discomfort를 피하도록 모델에 지시한다.
- A.2 LAION 증류를 위한 Prompt: LAION prompt는 description, candidate questions, selected question, answer 필드를 포함하는 structured output을 강제한다.응답은 prompt를 언급해서는 안 되며 각 필드에 대해 명시된 시작 및 종료 delimiter를 따라야 한다.
- A.3 Vision-FLAN 증류를 위한 Prompt: Vision-FLAN prompt는 먼저 subjects, background, colors, notable features, context를 포함하는 이미지 설명을 요청한 뒤, relevant answer와 그 solving process를 요구한다.설명은 지정된 이미지 요소를 강조할 수 있으며, description과 answer 모두 professional, insightful, helpful, objective, unbiased해야 한다.
- A.3 Vision-FLAN 증류를 위한 Prompt: Vision-FLAN prompt는 gender와 race 같은 traits를 unbiased하게 명시하고 personal-information leaks 또는 discrimination과 관련된 요청은 refusal하도록 요구한다.이는 전통적으로 bias가 문제가 되어 온 시나리오와 ethical rules를 위반하는 질문을 중심으로 이러한 요구사항을 구성한다.
- A.3 Vision-FLAN 증류를 위한 Prompt: Vision-FLAN outputs는 제공된 question을 중심으로 description과 detailed answer에 명시적인 delimiter를 사용한다.Prompt는 전용 placeholder에 question을 제시하고 필요한 output format을 명시한다.
A.4 데이터 예시 · A.5 VFLAN 부분집합 수동 검사
논문은 생성된 VFLAN 예시를 제시하고, 생성 품질을 평가하기 위해 표본 데이터를 수동으로 검사한다. 검사 결과, 답변 전에 이미지를 captioning하면 hallucination이 감소하는 것으로 나타났다.
- A.4 데이터 예시: Table 5는 각 dataset에서 두 가지 예시를 제시하며, 이미지와 그 caption, question, answer를 짝지어 보여준다.이 예시들은 dataset 전반에서 생성 데이터의 구조를 드러낸다.
- A.4 데이터 예시: 제시된 예시에서는 GPT-4V-generated entry를 굵게 표시한다.이 형식은 예시 안에서 생성된 내용을 구분한다.
- A.4 데이터 예시: 이 예시들은 image descriptions, questions, and answers를 아우르는 data-generation protocol을 보여준다.각 제시 항목은 이미지와 함께 세 구성 요소를 모두 포함한다.
- A.5 VFLAN 부분집합 수동 검사: 저자들은 원래 VFLAN categories에서 100 data pieces를 균일하게 표본 추출해 상세한 수동 검사를 수행했다.이 검사는 생성 데이터의 품질을 확인하기 위해 설계되었다.
- A.5 VFLAN 부분집합 수동 검사: Table 1은 표본으로 추출한 VFLAN data 전반의 수동 검사 결과를 보고한다.이 검사는 균일 표본 추출을 통해 원래 category distribution을 따른다.
- A.5 VFLAN 부분집합 수동 검사: 답변 전에 이미지를 captioning하면 상세한 image description을 미리 제공할 수 있어 the model’s hallucinations가 감소했다.Figure 9는 사전 captioning 없이 생성된 answers와 관련해 인용되지만, 제시된 passage에는 정량적 값이 보고되지 않는다.
B Topic Analysis 세부 사항 … C Training 세부 사항
부록에서는 cluster keywords를 바탕으로 GPT-4가 topic name을 생성하는 과정과 그 결과인 topics, data examples, captioning 관련 answer 비교를 설명한다.
- B.1 Prompt for Topic Name Generation: GPT-4는 Figure 10에 제시된 prompt를 사용해 각 cluster에 제공된 10개의 keywords로부터 topic name을 생성한다.topic-analysis 절차에서는 cluster-level keyword lists를 GPT-4의 입력으로 사용한다.
- B.1 Prompt for Topic Name Generation: Table 5는 생성된 data examples를 보여주며, 굵게 표시된 항목은 data-generation protocol을 통해 GPT-4V가 생성한 내용을 나타낸다.이 examples는 논문의 synthetic-data process와 관련된 outputs를 보여준다.
- B.2 Full List of Topics: 한 topic example에서는 흐릿한 이미지에서 blur type을 식별하도록 하며, zoom, glass, motion, defocus blur를 선택지로 제시한다.이 example은 blur identification을 multiple-choice visual question으로 구성한다.
- B.2 Full List of Topics: Figure 9는 captioning 없이 생성된 answers와 captions를 사용해 생성된 answers를 비교하며, errors는 빨간색으로, correct portions는 초록색으로 표시한다.이 색상 표시는 비교 결과를 더 잘 시각화하기 위한 것이다.
- B.1 Prompt for Topic Name Generation: Figure 10은 cluster keywords로부터 topic names를 생성하는 데 사용된 prompt를 제시한다.이 visual은 부록에서 설명한 GPT-4 topic-naming 절차에 해당한다.
- B.2 Full List of Topics: Table 6은 LDA와 GPT-4가 생성한 topics의 전체 목록을 제공한다.이 표는 두 topic-generation methods로 생성된 topics를 기록한다.
C.1 학습 데이터 … D 평가
제공된 부록 발췌문은 ALLaVA의 학습 데이터셋, 하이퍼파라미터 문서화, 연산 설정을 식별하지만, 실질적인 평가 결과는 제시하지 않는다. 학습에는 텍스트에 OpenChat, 캡션에 ShareGPT4V, VQA에 llava_instruct_657K가 사용된다.
- C.1 학습 데이터: Table 7은 ALLaVA 모델 학습에 사용된 데이터셋을 요약한다.
- D 평가: 제공된 발췌문은 D 평가의 실질적인 결과를 보고하지 않는다.
- C.1 학습 데이터: ALLaVA 학습은 텍스트에 OpenChat, 이미지 캡션에 ShareGPT4V, visual question answering에 llava_instruct_657K를 결합한다.이러한 데이터셋 할당은 Table 7에 요약되어 있다.
- C.2 하이퍼파라미터: ALLaVA 모델의 학습 하이퍼파라미터는 Table 8에 문서화되어 있다.
- C.3 연산 자원: 모든 실험은 단일 8*A800 GPU 노드에서 수행된다.각 모델의 학습 시간은 Table 9에 보고되어 있다.
- C.3 연산 자원: Table 9는 각 ALLaVA 모델의 학습 시간을 보고한다.
D.1 벤치마크 세부사항 · D.2 Vicuna-80 평가 프롬프트
평가는 추론, 환각, 수학적 능력, 전문 지식, 멀티모달 역량을 아우르는 폭넓은 vision-language benchmark와 과제별 metric을 사용한다. Vicuna-80은 judge에게 두 candidate answer 중 더 나은 것을 선택하도록 prompt를 제시해 평가한다.
- D.1 벤치마크 세부사항: 이 연구의 평가 benchmark는 다양한 과제와 역량에 걸쳐 모델을 평가하는 기반으로 명시적으로 상세히 제시된다.나열된 benchmark 약어에는 Vicuna-80, GQA, HallusionBench, MME, MMVP, TouchStone, TextVQA, MathVista, MMMU, ScienceQA, LLaVA-Bench, MLLM-Bench, MMBench, SEED-Bench-v1이 포함된다.
- D.1 벤치마크 세부사항: benchmark suite는 12,578-question GQA, 254-sample HallusionBench, 2,374-question MME, CLIP-blind-pair MMVP를 포함하며, 주로 accuracy를 사용한다.GQA는 실제 세계 추론과 compositional question answering을 평가하고, HallusionBench는 hallucination을 평가하며, MME는 14개 subtask로 구성되고, MMVP는 “CLIP-blind” pair를 평가한다.
- D.1 벤치마크 세부사항: TouchStone은 5개 능력과 27개 subtask에 걸쳐 908개의 open-ended question을 포함하며, 미리 생성된 text-based GPT-4 answer와 비교해 answer를 평가하고 평균 점수를 사용한다.이 benchmark는 text-based GPT-4를 judge로 사용한다.
- D.1 벤치마크 세부사항: 이 suite에는 5,000개 question의 TextVQA, 6,141개 sample의 MathVista, 218개 multi-capability question의 MM-Vet, 900개 expert-level question의 MMMU validation, 4,201개 question의 ScienceQA도 포함된다.TextVQA, MM-Vet, MMMU, ScienceQA에는 accuracy가 사용되며, MathVista는 mathematical reasoning ability를 평가한다.
- D.1 벤치마크 세부사항: 추가 평가에는 LLaVA-Bench의 60개 open-ended question, MLLM-Bench의 420개 complex visual reasoning question, MMBench의 4,329-question dev set, SEED-Bench-v1의 14,233-question image set이 포함된다.각각 GPT-4 pairwise score ratio, LLaVA-v1.5-13B anchor를 기준으로 GPT-4V가 판단한 win rate, circular-evaluation accuracy, accuracy를 사용한다.
- D.2 Vicuna-80 평가 프롬프트: Vicuna-80에서 evaluator는 question과 두 candidate answer를 받고 어느 answer의 품질이 더 나은지 판단해야 한다.prompt는 명시적인 placeholder에 question과 두 answer를 삽입한다.
- D.2 Vicuna-80 평가 프롬프트: Vicuna-80 judge는 “Answer1” 또는 “Answer2” 중 하나만 출력해야 한다.이에 따라 평가는 제시된 response 사이의 binary preference로 제한된다.