Source-linked AI summary
A Corpus for Reasoning About Natural Language Grounded in Photographs
Alane Suhr, Stephanie Zhou, Ally Zhang, Iris Zhang, Huajun Bai, Yoav Artzi
TL;DR
기존 vision-language 리소스는 대체로 객체 속성과 제한적인 공간 관계를 강조해 조합적 추론을 충분히 다루지 못했다. 이 논문은 비교·대조 크라우드소싱으로 수집한 107,292개의 캡션–이미지 쌍 사례로 구성된 데이터셋 NLVR2를 소개하며, 강력한 visual reasoning 방법조차 이 데이터셋에서 상대적으로 낮은 성능을 보인다는 점을 확인해 상당한 난제를 제시한다.
문제
기존 언어·비전 리소스는 주로 객체 속성과 제한적인 공간 관계에 초점을 맞춰 조합적 추론을 상대적으로 적게 다룬다.
방법
NLVR2는 시각적으로 복잡한 사진 쌍에 대해 의미적으로 다양한 캡션을 크라우드소싱하고, 각 캡션이 참인지 거짓인지에 대한 레이블을 부여한다.
결과
baseline 및 state-of-the-art visual reasoning 방법의 상대적으로 낮은 성능은 NLVR2가 상당한 난제를 제시함을 보여준다.
시사점 및 한계
NLVR2는 수량, 비교, 관계를 포함해 자연어와 사진에 대한 의미적으로 풍부한 공동 추론을 연구할 수 있는 코퍼스를 제공한다.
시사점 및 한계
실제 이미지를 사용하면 콘텐츠에 대한 통제력이 떨어지고 작업자가 단순한 문장을 작성할 수 있다.
Abstract
from arXiv · showhide
We introduce a new dataset for joint reasoning about natural language and images, with a focus on semantic diversity, compositionality, and visual reasoning challenges. The data contains 107,292 examples of English sentences paired with web photographs. The task is to determine whether a natural language caption is true about a pair of photographs. We crowdsource the data using sets of visually rich images and a compare-and-contrast task to elicit linguistically diverse language. Qualitative analysis shows the data requires compositional joint reasoning, including about quantities, comparisons, and relations. Evaluation using state-of-the-art visual reasoning methods shows the data presents a strong challenge.
1 서론
NLVR2는 자연어 캡션을 실제 사진과 짝지어 이미지 쌍에 대한 참·거짓 판단을 요구함으로써 기존 시각-언어 리소스의 한계를 다룬다. 데이터 수집 과정은 의미적 다양성과 조합적 시각 추론을 겨냥하며, 현재 방법론에 도전적인 벤치마크를 산출한다.
- 동기와 과제: NLVR2는 실제 사진 쌍에 대한 자연어 캡션의 참·거짓을 판별하여 NLVR 와 CLEVR (Johnson et al., 2017a,b)에 존재하는 합성 언어와 이미지의 제한된 다양성을 다룬다.이 과제는 객체, 속성, 관계, 수량, 비교, 기수성 제약에 대한 추론을 지원하도록 설계됐다.
- 데이터 수집: 데이터 수집 절차는 시각적으로 복잡한 사진 세트와 크라우드소싱 기반의 필터링, 캡션 작성, 진위 검증 과제를 사용하며, 다양한 언어를 유도하기 위해 비교·대조 프롬프트를 활용한다.의도하지 않은 언어적 편향을 줄이고 의미적 다양성, 조합성, 시각적 추론의 난점을 강조하도록 설계됐다.
- 데이터셋: 이 데이터셋은 107,292개의 캡션–이미지 쌍 예시로 구성되며, 여기에는 29,680개의 고유 문장과 127,502개의 이미지가 포함된다.
- 분석과 평가: 정성적 분석에 따르면 다른 리소스보다 더 폭넓은 언어적 범위를 보이며, baseline 및 state-of-the-art 평가에서는 강력한 시각 추론 방법조차 NLVR2를 여전히 상당한 도전 과제로 인식한다.
2 관련 연구 및 데이터셋
기존 연구는 여러 과제 형식을 통해 이미지에 근거한 언어를 연구하고 compositional visual reasoning 방법을 개발해 왔다. 이 데이터셋의 수집 방식은 NLVR 스타일의 대조적 주석을 웹 사진에 적용하고 관련 visual question answering 자료를 활용한다.
- 언어와 이미지: 이미지에 근거한 언어는 visual question answering, caption generation, referring expression resolution, visual entailment, binary image selection을 통해 연구되어 왔다.해당 과제군마다 대표적인 연구가 인용된다.
- Compositional Visual Reasoning: Compositional visual reasoning은 FiLM, N2NMN, MAC을 비롯한 modular neural network와 attention- 또는 memory-based 방법으로 다뤄져 왔다.이 세 방법은 논문의 실증 분석에 사용된다.
- 데이터셋 수집: 데이터 수집은 웹 사진을 사용해, 작업자에게 유사한 이미지를 보여 주고 어떤 이미지에는 True이지만 다른 이미지에는 False인 문장을 이끌어 내는 NLVR의 방식을 적용한다.각 문장은 서로 다른 라벨을 가진 여러 예시에서 사용되며, 이 접근법은 이미지와 질문을 함께 고려해야 하도록 설계된 visual question answering 데이터셋과 관련된다.
3 데이터 수집
NLVR2는 자연어 문장을 이미지 쌍과 연결하고 각 문장이 True인지 False인지 판단하게 하며, 집합, 개수, 비교에 관한 다양한 추론을 이끌어내도록 설계된 수집 과정을 사용한다. 최종 데이터셋은 127,502개의 고유 이미지와 29,680개의 고유 문장에서 얻은 107,292개의 예제로 구성된다.
- 이미지 수집 및 가지치기: 수집 과정에서는 시각적으로 풍부하고 서로 유사한 이미지 집합을 가져온 뒤 품질과 흥미도를 기준으로 가지치기하고, 문장 작성을 위해 이미지 8개로 이루어진 집합을 유지한다.이미지는 124개의 ImageNet synset에 대한 확장된 질의를 사용해 검색한 다음, 유효하지 않거나 중복되거나 흥미롭지 않은 이미지를 제거하도록 필터링한다.
- 문장 작성: 작업자는 이미지 8개로 이루어진 각 집합을 네 쌍으로 나누고, 두 쌍을 선택한 다음 선택한 쌍에는 참이지만 선택하지 않은 쌍에는 거짓인 문장을 작성한다.쌍 자체를 선택하게 하면 문장 작성이 쉬워지고, 쌍을 비교하게 하면 조합적 언어 사용과 집합 추론이 촉진된다.
- 수집의 한계: 저자들은 주관적 의견, 사진의 속성, 텍스트 언급, 단순한 객체 식별을 지양하는 작성 지침을 통해 실제 이미지 콘텐츠의 변동성을 완화한다.통제된 이미지 생성과 달리 실제 사진에서는 선택된 쌍에 공통으로 포함된 단일 객체에 관한 진술처럼 단순한 문장도 가능하다.
- 검증: 각 문장은 네 이미지 쌍 모두와 연결되고 True 또는 False로 독립적으로 검증되며, 검증 라벨이 작성자가 선택한 진릿값과 일치하는 예제만 유지된다.작업자는 예제를 무의미한 것으로 표시할 수도 있었지만, 이러한 보고는 유지하지 않았다.
- 데이터셋 구축: 합의도가 낮은 항목을 제거한 후 107,292개의 예제가 남았으며, 127,502개의 고유 이미지와 29,680개의 고유 문장을 포괄한다.각 고유 문장은 평균 3.6개의 이미지 쌍과 연결된다.
4 데이터 분석
분석 결과, 필터링 후 주석자 간 일치도는 거의 완벽한 수준이며, synset 커버리지는 균형을 이루고 NLVR 및 여러 관련 benchmark보다 언어가 상당히 풍부하고 길다. NLVR2 역시 폭넓은 언어적 다양성을 보이며, 전반적으로 NLVR과 비슷하고 VQA와 GQA보다 더 폭넓다.
- 일치도: 일치도가 낮은 예시를 제거하자 Krippendorff’s α는 0.906에서 0.912로, Fleiss’ κ는 0.814에서 0.889로 상승해 거의 완벽한 일치도를 나타낸다.이 필터링으로 validation 중 보고되지 않았던 예시의 8.5%가 제거된다.
- Synset: 각 synset에는 752.9 ± 205.7개의 예시가 포함되며, 네 개의 dataset split에서 synset은 동일한 비율로 나타난다.가장 흔한 synset에는 gorilla와 bookcase가 포함되고, 가장 드문 synset에는 orange와 acorn이 포함된다.
- 언어: NLVR2에는 7,457개의 단어 유형이 있으며 문장당 평균 14.8개의 토큰을 사용한다. 이에 비해 NLVR에는 262개의 단어 유형과 11.2개의 토큰이 있다.문장 길이 분포는 NLVR과 비슷하지만 더 긴 꼬리를 가지며, VQA, GQA, CLEVR-Humans의 질문보다 문장이 더 길다.
- 언어적 현상: 800개의 development 문장을 분석한 결과, NLVR2의 언어적 다양성은 NLVR과 유사하고 VQA와 GQA보다 현상에 대한 표현 범위가 더 넓다.NLVR과 비교하면 NLVR2는 특정되지 않은 한 현상을 덜 사용하며, 이는 NLVR이 판별을 위해 정확한 counting을 장려하기 때문일 수 있다.
5 인간 성능 추정
인간 성능은 development 및 test 예시에 대한 추가 label을 바탕으로, 각 작업자의 판단을 원래 validation label과 비교해 추정한다.
- 인간 성능 추정: 작업자 성능은 원래 validation label과 일치하는 판단의 비율로 측정하며, 해당 작업자가 작성한 문장에 대한 판단은 제외한다.연구에서는 유효한 추가 판단을 100개 이상 제공한 작업자들의 성능 평균과 표준편차를 계산한다.
6 평가 시스템
평가는 NLVR2에서 예제 수준 정확도를 사용해 modality-specific, multimodal, modular visual reasoning system을 비교한다. Baseline은 데이터셋 편향을 탐색하고, 학습된 모델은 joint language–vision reasoning과 numerical object-count feature를 검증한다.
- 편향 baseline: 세 가지 baseline은 unimodal bias를 측정한다. MAJORITY는 항상 True를 예측하고, TEXT와 IMAGE는 각각 caption 또는 image pair만 사용한다.TEXT는 RNN으로 caption을 인코딩하고, IMAGE는 CNN으로 image pair를 인코딩하며, 두 모델 모두 truth prediction에 multilayer perceptron을 사용한다.
- Multimodal baseline: CNN+RNN과 MAXENT는 language와 vision을 모두 반영하며, MAXENT는 여기에 sentence, detected-object, numerical-count feature를 추가로 사용한다.Object detection은 0.5 threshold를 적용한 COCO-pretrained Mask R-CNN에서 얻으며, feature는 image별 및 joint count를 나타낸다.
- Modular system: 평가에는 formal program 없이 image와 text를 대상으로 추론하는 end-to-end neural module network와 FiLM이 포함된다.N2NMN은 input sentence에서 neural layout을 예측하고, FiLM은 featurewise linear modulation approach를 제공한다.
- Modular system: N2NMN은 supervised layout cloning, cloning 이후의 policy-search tuning, 그리고 처음부터 수행하는 reinforcement learning으로 평가된다.Cloned layout은 constituency tree로 구성된다.
7 실험 및 결과
실험에서는 accuracy와 consistency를 사용해 NLVR2를 평가하며, test 결과는 development accuracy가 가장 높은 model에서 선택한다. feature-based MAXENT system은 두 metric 모두에서 보고된 최고 성능을 달성한다.
- 평가 metric: Accuracy는 example별 정답 여부를 측정하고, consistency는 paired image 모두에 대해 정확히 예측된 unique sentence의 비율을 측정한다.Training 및 development 결과는 세 번의 trial에 대한 평균과 표준편차로 보고한다.
- 평가 protocol: Test 결과에는 development accuracy가 가장 높은 model을 사용하며, N2NMN test 결과에는 development에서 가장 높은 성능을 보인 variant를 사용한다.이 selection protocol은 test-set performance를 보고하기 전에 적용한다.
- 결과: Feature-based MAXENT는 NLVR2에서 가장 높은 성능을 보이는 system으로, accuracy와 consistency 모두에서 최고치를 달성한다.Table 6은 accuracy/consistency metric을 사용한 performance를 보고한다.
- 결과: TEXT와 IMAGE baseline은 MAJORITY와 유사한 성능을 보여, 이 task를 해결하려면 both modalities가 필요함을 나타낸다.Dataset이 balanced이므로 TEXT는 MAJORITY와 일치하며, pruning 이후 MAJORITY는 완전한 balance보다 약간 높은 수준이다.
8 결론 … NLVR2는 vision and language datasets의 bias를 피하려는 최근 시도와 어떻게 비교되는가?
NLVR2는 자연 사진 쌍에 기반한 의미적으로 다양한 언어를 활용해 compositional visual reasoning을 다루며, 수집 절차를 통해 암묵적 언어 편향을 줄인다. 관련 데이터셋과 비교하면 실제 이미지 쌍에 대한 reasoning을 강조하고, VQA와 GQA와는 상당히 다른 언어 현상을 포함한다.
- 8 결론: NLVR2는 시각적으로 복잡한 자연 사진과 사람이 작성한 caption에 대한 의미적으로 풍부한 joint reasoning에 초점을 둔다.이 corpus는 기존 corpus보다 compositional visual reasoning의 난제를 더 잘 반영하도록 설계됐다.
- 8 결론: 언어에는 수 표현, quantifier, coreference, negation이 포함되며, 이는 compositional하고 언어적으로 다양한 데이터 수집을 반영한다.이러한 현상은 복잡한 시각 자극과 수집 절차에 초점을 둔 데서 비롯된다.
- NLVR2가 연구 대상으로 삼을 수 있게 하는 언어는 어떤 응용 분야에서 활용될 것으로 예상되는가?: counting, comparisons, and sets에 대해 compositional하게 reasoning하는 능력은 자연어 지시를 따르는 robotic agent에 중요하다.논문은 도구 상자에서 가장 큰 망치 두 개를 고르는 사례 등을 통해 이 능력의 필요성을 설명한다.
- NLVR2가 연구 대상으로 삼을 수 있게 하는 언어는 어떤 응용 분야에서 활용될 것으로 예상되는가?: 이미지 쌍은 이미지들을 compare images하는 서술을 이끌어 내고, 이미지 간 조건을 부과하며, 이미지 속 객체에 대한 set reasoning을 가능하게 한다.쌍 기반 설정은 단일 이미지의 내용을 넘어 reasoning을 확장하며, NLVR의 three-box 설정과 유사하다.
- NLVR2가 연구 대상으로 삼을 수 있게 하는 언어는 어떤 응용 분야에서 활용될 것으로 예상되는가?: NLVR2는 실제 사진 쌍을 사용하는 반면 NLVR은 synthetic visual input을 사용한다. NLVR2는 더 폭넓은 이미지 내용을 다루고, NLVR은 lexical diversity와 compositionality를 분리한다.NLVR은 구조화된 이미지 표현에 대한 semantic parsing도 지원할 수 있지만, 이는 NLVR2에서는 불가능한 활용 사례다.
- NLVR2는 vision and language datasets의 bias를 피하려는 최근 시도와 어떻게 비교되는가?: NLVR2는 각 문장을 서로 다른 시각적 맥락에서 두 label 모두와 자동으로 pairing하므로 암묵적 언어 편향에 강건하다.이 설계는 대응하는 이미지를 사용하지 않고도 vision-and-language 질문에 답할 수 있게 하는 의도치 않은 편향을 다룬다.
- NLVR2는 vision and language datasets의 bias를 피하려는 최근 시도와 어떻게 비교되는가?: NLVR2에는 VQA와 GQA보다 hard 및 soft cardinality, existential 및 universal quantifier, coordination, coreference, spatial relation, comparative, negation, preposition-attachment ambiguity가 significantly more 포함된다.반대로 VQA와 GQA에는 NLVR2보다 presupposition 사례가 significantly more 포함되며, 차이는 p < 0.05를 사용하는 χ2 test로 평가된다.
B 데이터 수집 세부 사항
데이터셋 수집 파이프라인은 검색 결과에서 이미지 세트를 구성하고 이를 자동으로 정제하며, 자격을 갖춘 작업자와 인센티브를 활용해 지침을 준수하는 다양한 문장을 생성한다. 보고된 비용은 고유 문장당 $0.65, 예제당 $0.18이다.
- 이미지 수집: 이미지 세트는 검색 결과 이미지와 가장 유사한 이미지 15개를 포함하며, stock-photo 도메인은 제외하고 30개 세트 또는 결과 이미지 60개에 도달하면 중단한다.집합 명사와 수치 표현 two <synset>의 경우 한도는 상위 이미지 100개 또는 세트 60개로 늘어난다.
- 이미지 수집: 자동 정제는 손상되거나 반복되거나 크기가 너무 작거나 완전히 중복된 이미지를 제거하므로, 유지되는 세트에는 이미지가 16개 미만일 수 있다.200 × 200 픽셀보다 작은 이미지는 제거하며, 정제 후 이미지가 너무 적게 남은 세트는 폐기한다.
- 문장 작성: 개발 세트 문장 100개를 분석한 결과 13%가 작성 지침을 위반했으며, 가장 흔한 위반은 선택되지 않은 이미지에 없는 객체를 언급하는 것이었다.이러한 위반 문장은 선택되지 않은 쌍에 대해서는 쉽게 False로 라벨링할 수 있지만, 문장에 제약 조건이 추가되는 경우가 많으므로 선택된 쌍에 대해서는 여전히 compositional reasoning이 필요하다.
- 데이터 수집 관리: 작업자는 튜토리얼, 지침 검증 질문, 문장 작성 시험을 통해 자격을 얻으며, 작성된 문장은 수작업으로 검증된다.자격 심사 과정은 세트 구성과 문장 작성뿐 아니라 검증 작업자도 대상으로 한다.
- 데이터 수집 관리: 라운드 기반 보너스 시스템은 지침 준수율이 75% 이상인 경우 보상하고, 50–75%인 경우에는 더 적은 보너스를 제공해 지침을 더 잘 준수하고 언어적으로 더 다양한 문장을 작성하도록 유도한다.각 라운드 후 작업자 20명의 문장을 표본 추출해 보너스를 결정한다.
- 데이터 수집 관리: 최종 비용은 고유 문장당 $0.65, 예제당 $0.18이다.이 비용과 작업별 작업자 수는 Table 9에 보고되어 있다.
C 추가 데이터 분석
추가 분석은 NLVR2의 폭넓은 언어적 범위와 paired-image 형식이 유도하는 추론 패턴을 특성화한다. 데이터셋에는 다양한 synset 분포와 두 이미지 전체, 각 이미지 내부, 이미지 간 속성을 요구하는 문장이 포함된다.
- Synset: Figure 4는 각 synset에 연결된 training 및 development 예제 수를 보고한다.synset은 각 synset의 예제 수에 따라 정렬된다.
- 언어 및 비전 비교: NLVR2는 비교된 데이터셋 중 널리 나타나는 언어 현상을 가장 폭넓게 표현한다.Table 7은 각 데이터셋에서 예제의 10% 이상에 나타나는 현상의 수를 센다.
- 이미지 쌍 추론: 문장의 39.5%는 단순히 속성을 진술하는 반면, 26.5%는 해당 속성이 왼쪽 또는 오른쪽 이미지에 구체적으로 나타나야 하며 19%는 적어도 한 이미지에 나타나야 한다.pair 구조는 두 이미지 모두에서 성립해야 하는 속성도 지원하며, 이는 문장의 11%에서 나타난다.
- 이미지 쌍 추론: 문장의 6%는 두 이미지의 속성을 비교해야 하며, 이는 paired 형식이 명시적인 이미지 간 비교를 지원함을 보여준다.이 비교 분석은 Table 5에서 분석된 문장 중 200문장 subset을 사용한다.
D NLVR 결과 … E.4 MAC
NLVR에서는 이 과제에 특화되어 개발된 방법이 전이된 CLEVR 시스템보다 우수하며, 구현 세부사항은 공유 MLP baseline과 모델별 image-text processing pipeline을 명시한다.
- E.1 단일 Modality: TEXT는 300차원 Common Crawl GloVe vector와 4096-unit LSTM으로 caption을 인코딩하는 반면, IMAGE는 각 image에서 추출한 feature를 concatenate한 뒤 MLP prediction을 수행한다.생성된 representation을 처리해 caption의 truth value를 prediction한다.
- D NLVR 결과: CNN-BIATT와 CMM은 NLVR에서 NMN, N2NMN, FiLM보다 우수하며, human performance는 split별로 계산되고 100이라는 threshold가 모든 annotator를 포괄한다.Table 11은 기존에 출판된 system과 CLEVR용으로 개발된 system을 포함해 accuracy/consistency 결과를 보고한다.
- E.2 Image 및 Text Baseline: CNN+RNN은 MLP prediction 전에 caption과 image-pair representation을 concatenate하는 반면, MAXENT는 maximum-entropy classifier와 함께 2- to 6-gram feature를 사용한다.CNN+RNN component는 Appendix E.1에서 설명한 single-modality encoder를 따른다.
- E.3 Module Network: End-to-End Neural Module Network는 공개적으로 이용 가능한 implementation과 task-specific parameter를 재사용하며, NLVR2에는 GloVe embedding을, NLVR에는 CLEVR-style configuration을 사용한다.NLVR configuration에는 learned word embedding과 ImageNet-pretrained VGG-16 image feature가 포함된다.
- E.3 Module Network: Paired-image module-network input의 경우, image를 resize하고 padding한 뒤 horizontal concatenation하고 다시 resize한 다음 ResNet-152 embedding을 수행한다. 업데이트된 parameter는 유의미한 accuracy 차이 없이 더 빠르게 compute하고 메모리를 덜 사용한다.이 preprocessing은 ResNet-152의 res5c layer로 embedding되는 단일 448 × 448 image를 생성한다.
- E.3 Module Network: FiLM은 NLVR2에 pretrained ResNet feature를, NLVR에 raw 224 × 224 pixel을 사용하며, 공개적으로 이용 가능한 implementation과 task-specific preprocessing을 따른다.NLVR2에서는 paired image를 padding하고 concatenate한 뒤 224 × 224로 resize하고 ResNet-101 conv4 feature를 통해 처리한다.
- E.4 MAC: MAC 실험은 online implementation을 사용하고, padding, horizontal concatenation, resizing을 통해 NLVR2 image processing을 조정하며, repository의 NLVR configuration을 사용한다.NLVR2 image featurization은 Hudson and Manning (2018)을 따른다.
E.5 학습 · F 추가 예시 · G 라이선스 정보
학습에는 지정된 최적화 및 초기화 절차가 사용되며, 부록에서는 추가 NLVR2 예시, 코드 접근 방법, 이미지 라이선스 및 저작자 표시 정보를 제공한다.
- E.5 학습: NLVR2 TEXT, IMAGE, CNN+RNN 모델은 learning rate 0.0001, [−0.1, 0.1]에서의 uniform initialization, 학습되는 bias를 사용한다.MAC은 Hudson and Manning (2018)을 따르며, 다른 실험에서는 patience를 적용한 early stopping을 사용한다.
- E.5 학습: MAC 학습은 development set 성능에 기반한 early stopping을 포함하여 Hudson and Manning (2018)을 따른다.
- G 라이선스 정보: 논문의 모든 이미지는 Wikimedia를 비롯해 저작권이 없는 이미지를 호스팅하는 것으로 알려진 웹사이트에서 샘플링했다.
- F 추가 예시: 논문은 명시된 GitHub repository를 통해 MAC implementation을 제공한다.
- G 라이선스 정보: Tables 13–16은 Figures 1 및 2와 Tables 2 및 3의 이미지에 대한 license and attribution information을 제공한다.
- F 추가 예시: Table 12는 training set과 development set에서 샘플링한 additional NLVR2 examples를 제시하며, 각 사진 쌍에 대한 label과 license information을 함께 제공한다.