Source-linked AI summary

LayoutGPT: Compositional Visual Planning and Generation with Large Language Models

Weixi Feng, Wanrong Zhu, Tsu-jui Fu, Varun Jampani, Arjun Akula, Xuehai He, Sugato Basu, Xin Eric Wang, William Yang Wang

arXiv:2305.15393v2cs.CVcs.AI

TL;DR

세밀한 layout은 visual control을 향상시키지만 사용자에게 부담을 주며, 기존 LLM 기반 시스템은 language만으로 compositional layout을 안정적으로 생성하지 못한다. LayoutGPT는 CSS-style in-context demonstration을 사용해 layout을 계획하고, 2D image composition을 개선하며, 3D indoor scene synthesis에서 supervised method와 대등한 성능을 보인다.

  • 문제

    기존 visual generator는 지정된 개수, 위치, 속성 및 room-scale furniture arrangement를 구현하는 데 어려움을 겪으며, layout 기반 control은 사용자에게 세밀한 입력이라는 부담을 준다.

  • 방법

    LayoutGPT는 CSS-style structured program과 검색된 demonstration을 활용하는 training-free in-context learning으로 2D 및 3D domain 전반에서 text-conditioned layout을 생성한다.

  • 결과

    LayoutGPT는 2D image generation에서 counting 및 spatial faithfulness를 향상시키고, 3D indoor scene synthesis에서 supervised method와 대등한 성능을 달성한다.

  • 시사점 및 한계

    LLM은 image-space 및 3D indoor-scene task 전반에서 compositional layout generation을 위한 visual planner로 기능할 수 있다.

  • 시사점 및 한계

    제한된 in-context demonstration으로 인해 LayoutGPT가 다루는 furniture distribution의 범위가 제한되며, 그 결과 드물게 관찰된 object를 회피한다.

Abstract

from arXiv · show

Attaining a high degree of user controllability in visual generation often requires intricate, fine-grained inputs like layouts. However, such inputs impose a substantial burden on users when compared to simple text inputs. To address the issue, we study how Large Language Models (LLMs) can serve as visual planners by generating layouts from text conditions, and thus collaborate with visual generative models. We propose LayoutGPT, a method to compose in-context visual demonstrations in style sheet language to enhance the visual planning skills of LLMs. LayoutGPT can generate plausible layouts in multiple domains, ranging from 2D images to 3D indoor scenes. LayoutGPT also shows superior performance in converting challenging language concepts like numerical and spatial relations to layout arrangements for faithful text-to-image generation. When combined with a downstream image generation model, LayoutGPT outperforms text-to-image models/systems by 20-40% and achieves comparable performance as human users in designing visual layouts for numerical and spatial correctness. Lastly, LayoutGPT achieves comparable performance to supervised methods in 3D indoor scene synthesis, demonstrating its effectiveness and potential in multiple visual domains.

1 서론

LayoutGPT는 in-context demonstration을 사용해 LLM이 2D 이미지와 3D 실내 장면 전반에서 텍스트로부터 시각적 레이아웃을 계획하도록 하는 training-free, program-guided 방법이다. 기존 text-to-image 및 scene-synthesis 시스템의 구성적 실패를 해결하는 동시에 수치적·공간적 충실도를 높이고 강력한 3D 성능을 달성한다.

  • 동기: 기존 text-to-image 모델은 지정된 객체 수, 위치 및 속성을 처리하는 데 어려움을 겪는 반면, 3D scene synthesis 모델은 미리 정의된 방 크기 안에 가구를 유지하는 데 어려움을 겪는다 [10] [24] [30].
  • 동기: 시각적 레이아웃은 시각적 구성에 대한 기호적 표현을 제공하지만, 기존 레이아웃 모델은 이산 범주에 제한되거나 복잡한 텍스트 조건을 추론하지 못한다 [33] [45] [34].
  • LayoutGPT: LayoutGPT는 in-context demonstration을 통해 시각적 상식성을 LLM에 주입하는 training-free 접근법으로, 이미지 데이터 학습 없이도 텍스트로부터 바람직한 레이아웃을 생성한다.이 방법은 이미지 레이아웃을 LLM과 호환되는 style sheet language 형식으로 표현한다.
  • 3D 확장: LayoutGPT는 2D 레이아웃 계획을 넘어 3D 실내 장면 합성으로 확장되어, 방 유형 전반에서 깊이, 가구 크기 및 일관된 배치를 처리하며, 최신 supervised 방법과 comparable한 성능을 보인다.
  • 기여: LayoutGPT는 2D 이미지 생성에서 계수 및 공간 관계 충실도를 향상시키고 강력한 3D 실내 장면 합성 성능을 달성한다. NSR-1K benchmark는 계수 및 위치 관계를 평가한다 [10, 24].이 benchmark에는 text-to-image 생성을 위한 수치 및 위치 관계를 기술하는 프롬프트가 포함된다.

2 관련 연구

기존 연구는 layout generation, compositional image generation, indoor scene synthesis, 그리고 LLM을 vision-language task에 적용하는 문제를 다룬다. 이러한 연구 방향에는 학습된 layout model, compositional failure를 보정하는 방법, 3D furniture synthesis, multimodal LLM adaptation이 포함된다.

  • Image Layout Generation: Layout generation method는 indoor scene [40], document layout [15], graphical user interface 를 대상으로 하며, 흔히 처음부터 학습한 model을 사용한다.LayoutGAN 은 고정된 수의 scene element에 대해 wireframe box의 class label과 geometric label을 생성한다.
  • Compositional Image Generation: Text-to-image model은 object 누락, 잘못된 spatial relation, 잘못된 attribute를 포함한 compositional failure를 보인다 [24] [2].StructureDiffusion [10]은 linguistic structure를 사용해 text embedding을 조정하고, Attend-and-Excite [4]는 object가 서로 분리된 영역을 차지하도록 attention region을 최적화한다.
  • Indoor Scene Synthesis: Indoor scene synthesis는 기능적인 3D furniture layout을 목표로 하며, supervised visual-map prediction [40]에서 transformer 기반 scene generation [47] [38]으로 발전해 왔다.SceneFormer [47]는 transformer로 furniture를 추가하고, ATISS [38]는 하나의 transformer를 사용해 여러 object attribute를 생성한다.
  • LLM for Vision: LLM은 vision-language task에서 중요한 역할을 하게 되었으며 [11] [28] [14], 이는 multimodal task를 위한 adaptation을 촉진했다 [31] [55].Multimodal chain-of-thought [58]는 question answering의 추론 근거로 visual input을 포함하고, 는 visual embedding과 language embedding 사이의 translation parameter를 학습한다.

3 방법

LayoutGPT는 2D 이미지 계획과 3D 장면 합성을 위해 레이아웃 생성을 객체 튜플 예측으로 정식화하며, 과제 지시문, 정규화된 값, 검색된 in-context exemplar를 포함한 구조화된 CSS 기반 프롬프트를 사용한다. 생성된 레이아웃은 downstream model과 검색된 객체를 통해 이미지 또는 렌더링된 3D 장면으로 변환된다.

  • 레이아웃 생성: LayoutGPT는 2D 이미지 계획에서는 텍스트를, 3D 장면 합성에서는 방 사양을 조건으로 객체-레이아웃 튜플을 예측한다.이미지의 각 튜플은 객체 범주, 2D 위치, 2D 크기를 포함하며, 3D 튜플은 범주, 위치, 방향, 크기를 포함한다.
  • 과제 지시 및 정규화: LayoutGPT 프롬프트는 과제 지시문, 256px로 제한된 정규화 값, in-context CSS exemplar를 결합한다.지시문은 과제 목표, 표준 형식, 단위를 지정하며, 속성 값은 재스케일링 전에 고정 scalar를 사용해 정규화한다.
  • CSS 구조: 이 framework는 레이아웃을 CSS와 유사한 표현으로 구조화하여, language model이 공간 값의 물리적 의미를 해석하도록 하며 충분히 지정되지 않은 값의 나열로 해석하지 않게 한다.이 방법은 (c1, x1, y1, w1, h1, c2, x2, ...)와 같은 단순 autoregressive sequence를 CSS 구조에서 착안한 형식으로 대체한다.
  • Demonstration 검색: in-context learning을 위해 이 방법은 테스트 조건과 demonstration 조건 사이의 거리를 측정하여 지원 demonstration을 검색한다.2D 텍스트 조건부 레이아웃에서는 cosine similarity를 통해 테스트 caption과 demonstration image를 비교할 때 CLIP feature를 사용한다.
  • Downstream 생성: 생성된 2D 레이아웃은 layout-to-image model에 입력되고, 예측된 3D 레이아웃은 객체 검색과 직접적인 장면 렌더링을 유도한다.3D pipeline은 장면을 렌더링하기 전에 예측된 범주, 위치, 방향, 크기에 따라 객체를 검색한다.

4 텍스트 조건 이미지 합성을 위한 LayoutGPT

LayoutGPT는 end-to-end 및 layout-guided baseline과 비교해 2D text-to-image 합성 성능을 평가받았으며, 다양한 생성 시나리오를 지원하면서 수치, 공간, 이미지 수준, 속성 정확도에서 더 우수한 성능을 보인다. CSS 스타일 prompting은 공간 추론을 향상시키며, 생성된 layout은 downstream image-generation model 전반에서 효과를 유지한다.

  • Dataset 및 Benchmark: NSR-1K benchmark는 MSCOCO [29]에서 도출한 template 기반 및 자연어 prompt를 사용해 지정된 객체 수와 공간 위치를 평가한다.Layout 평가는 객체 수와 공간 위치에 대한 precision, recall, accuracy를 보고하며, image 평가는 GLIP [26] detection과 average accuracy를 사용한다.
  • 정량적 결과: GLIP 기반 accuracy가 20-40% 높고 CLIP similarity가 1-6% 높아 LayoutGPT는 end-to-end text-to-image model을 능가한다.LayoutGPT 변형 중 GPT-3.5는 수치 추론에서, GPT-4는 공간 위치 정확도에서 가장 우수하며, LayoutGPT는 LayoutTransformer도 큰 차이로 능가한다.
  • 정성적 결과: LayoutGPT는 visual commonsense, 복잡한 다중 객체 관계, 밀집 장면, 지역별 설명, counterfactual prompt를 처리하면서 human design과 유사한 layout을 생성한다.희소한 prompt에서 수많은 장면 객체를 예측하고, 객체에 세밀한 지역별 detail을 추가하며, counterfactual 관계에 대해 합리적인 layout을 생성한다.
  • 정량적 결과: HRS color prompt에서 100% attribute-binding accuracy를 달성함으로써, GLIGEN/ReCo와 결합한 LayoutGPT는 Stable Diffusion보다 다중 객체 색상 정확도를 향상시킨다.최종 image의 attribute correctness 평가는 HRS-Bench prompt와 hue 기반 classifier를 사용한다.
  • Component 분석: Task instruction과 CSS 형식의 in-context demonstration은 spatial layout accuracy를 향상시키며, CSS style이 가장 핵심적인 component로 확인된다.Normalization만 적용하면 accuracy가 저하되지만, 다른 component와 결합하면 성능이 소폭 향상된다.
  • Model-Agnostic 특성: LayoutGPT는 model-agnostic하다. 생성한 layout은 Layout-Guidance와 함께 작동하며, GLIP-accuracy 차이는 작고 ground-truth layout과 CLIP similarity는 comparable하다.비교에서는 동일한 LayoutGPT 생성 layout을 Layout-Guidance와 함께 사용하고 image-level metric을 평가한다.

5 실내 장면 합성을 위한 LayoutGPT

LayoutGPT는 침실과 거실 합성에서 공간적 유효성과 렌더링된 장면의 품질 면에서 ATISS를 능가하는 반면, ATISS는 가구 카테고리 분포를 더 잘 일치시킨다. 정성적 결과와 조건부 생성 결과는 LayoutGPT가 3D 상식을 포착하고, 열거된 가구 캡션을 따르며, 부분 장면을 일관되게 완성함을 보여준다.

  • 정량적 결과: 43.26% vs. 49.88% 및 64.16% vs. 83.02%의 경계 이탈률과 28.37 vs. 30.02 및 76.34 vs. 85.40의 FID 점수는 침실과 거실에서 LayoutGPT가 ATISS를 능가함을 보여준다.이 결과는 더 강한 공간 추론과 더 높은 렌더링 장면 품질을 확인하며, 거실 분할에는 평균적으로 더 많은 객체가 포함된다.
  • 정성적 결과: LayoutGPT는 천장에 매달린 펜던트 램프, 헤드보드 옆의 협탁, 방 전체에 걸친 기능적 가구 배치와 같은 3D 관계를 이해한다.또한 한쪽에는 식탁용 가구를, 다른 쪽에는 좌석 및 엔터테인먼트 가구를 배치하는 거실-식당 장면을 계획한다.
  • 정량적 결과: ATISS는 더 낮은 KL divergence를 달성하는 반면, LayoutGPT는 제한된 demonstration이 가구 분포를 완전히 나타내지 못하기 때문에 극히 드문 가구를 피한다.분포 불일치는 in-context demonstration의 제한된 크기에서 비롯된 것으로 설명된다.
  • 텍스트 유도 합성: LayoutGPT는 전체 가구 목록을 열거한 캡션을 따르며 0에 가까운 KL divergence 값을 달성한다.이는 3D 장면에서 텍스트로 유도된 가구 배치를 보여준다.
  • 부분 장면 완성: LayoutGPT는 demonstration에서 대칭성, 위치 관계, 방 기능에 대한 상식을 학습하면서 부분 장면을 자기회귀적으로 일관되게 완성한다.예로는 대칭적으로 배치된 협탁, 침대 끝의 스툴, 식사 공간의 책상과 의자가 있다.

6 결론

LayoutGPT는 in-context learning과 CSS-style prompt를 통해 LLM을 visual planner로 전환하고, image space와 3D indoor scene 전반에서 visual generative model과의 협업을 가능하게 한다. plausible한 visual arrangement를 생성하며, 정확한 layout generation을 통해 image composition을 개선할 수 있다.

  • 결론: LayoutGPT는 in-context learning과 CSS-style prompt를 사용해 LLM을 visual planner로 전환하고 visual generative model과 협업하게 한다.이 접근법은 image space와 3D indoor scene 모두에서 plausible한 visual arrangement를 생성하며, 정확한 layout generation을 통해 image composition을 개선할 수 있다.

A 구현 세부사항 … B.3 GPT-3.5/4 프롬프팅

이 논문은 CSS로 구조화된 지시, 과제별 데이터 구성, 표준화된 metric을 포함해 2D 및 3D layout planning을 위한 LayoutGPT의 prompting과 evaluation 설정을 제시한다. 또한 prompt 구성 요소, exemplar 선택, 도전적인 scene layout을 위한 domain-specific 지시를 검토한다.

  • A 구현 세부사항: LayoutGPT의 과제 지시는 구두 설명과 formal CSS definitions를 결합하며, indoor synthesis에서는 furniture category와 정규화된 빈도도 추가로 제공하지만 generation에 미치는 관찰된 효과는 미미하다.제공된 문단에 따르면 해당 frequency distribution은 KL divergence를 거의 변화시키지 않는다.
  • A 구현 세부사항: 구현에서는 Codex, GPT-3.5, GPT-3.5-chat, GPT-4를 base LLM으로 평가하며, conversational model에는 in-context exemplar를 여러 turn으로 제공한다.제공된 문단은 네 가지 model variant와 각각의 training 또는 optimization 특성을 식별한다.
  • A 구현 세부사항: 모든 LLM은 next-token penalty 없이 temperature 0.7을 사용한다. image-layout evaluation에서는 numerical reasoning에 16개 exemplar, spatial reasoning에 8개 exemplar를 사용하며, exemplar 수의 차이는 유의하지 않다.제공된 hyperparameter 설명에 따르면 prompt마다 서로 다른 5개의 layout/image를 생성한다.
  • B.1 NSR-1K Benchmark Construction: NSR-1K는 MSCOCO caption과 bounding-box annotation으로 구성되며, 1부터 5까지의 numerical count와 left, right, above, below를 포함한 spatial relation을 평가한다.Numerical prompt는 object combination을 sampling하고, spatial prompt는 template 기반 prompt와 자연어 COCO prompt를 포함한다.
  • B.1 NSR-1K Benchmark Construction: Numerical layout planning은 precision, recall, accuracy로 평가하며, accuracy는 comparison task를 제외하면 category-count가 정확히 일치해야 충족된다. comparison task에서는 예측된 relation을 평가한다.Figure 9는 automatic numerical-reasoning evaluation 절차를 보여준다.
  • B.1 NSR-1K Benchmark Construction: Spatial accuracy는 COCO로 fine-tuning한 GLIP model을 사용해 생성 이미지에서 검출한 결과로 계산하며, 모든 benchmark는 cosine 기반 CLIP similarity도 측정한다.동일한 spatial-relation 정의를 LLM이 생성한 layout과 GLIP 기반 layout에 적용한다.
  • B LayoutGPT for 2D Layout Planning: 2D layout planning에서는 structured prompt가 instruction의 상세도, bounding-box attribute의 CSS formatting, normalization을 달리하며, supporting-example format은 Tables 7 and 8에 정리되어 있다.Ablation은 height, width, top, left attribute를 제시하는 instruction, structure, normalization 설정을 대상으로 한다.
  • B.3 GPT-3.5/4 프롬프팅: Prompting은 겹치거나 언급되지 않았지만 존재할 가능성이 높은 object가 있는 dense Panoptic scene에 맞게 조정하며, GPT-4는 MSCOCO category 간 드문 spatial relation을 설명하는 counterfactual prompt를 생성한다.제공된 예시는 원숭이가 새 위에 올라타고 있는 장면이다.

B.4 추가 실험 · B.5 실패 사례 · C 3D 장면 합성을 위한 LayoutGPT

추가 실험은 exemplar 수와 수치 과제의 구조가 LayoutGPT의 추론에 영향을 미치며, 제한된 이미지 공간에 많은 객체를 배치해야 할 때 실패가 발생함을 보여준다. 3D 합성에서 LayoutGPT는 floor-plan 이미지에서 변환한 방 유형 및 방 크기 사양을 사용한다.

  • B.4 추가 실험: 고정된 random in-context exemplar는 training support set에서 샘플링되며, 각 test condition과 관련이 없음에도 여러 test condition에 걸쳐 재사용된다.이는 Section 3에서 설명한 retrieval-augmented exemplar selection과 대조된다.
  • B.4 추가 실험: in-context exemplar 수가 증가할수록 counting accuracy가 높아지며, 추가 few-shot example이 어려운 수치 예측을 향상함을 시사한다.이 문단은 어려운 사례의 예로 comparison prompt를 구체적으로 언급한다.
  • B.4 추가 실험: 86%: LayoutGPT는 template-based Single Category 수치 추론에서 약 86%의 precision, recall, accuracy를 달성하는 반면, Two Category accuracy는 66%로 하락한다.이 문단은 Two Category 과제에서 precision과 recall의 변화는 미미하지만 accuracy는 더 낮다고 보고한다.
  • B.4 추가 실험: 자연스러운 MSCOCO prompt는 높은 recall과 낮은 precision을 보이는데, 80-class ground-truth annotation에 없는 object class를 prompt에서 언급할 수 있기 때문이다.annotation되지 않은 class에 대한 예측은 precision을 낮추지만, 이 문단에서 설명한 의도된 동작과 일치한다.
  • B.4 추가 실험: LayoutGPT는 HRS size-comparison benchmark [2]에서 평가되며, 이 benchmark의 prompt에는 무작위로 샘플링된 일반 객체 사이의 반사실적 관계가 포함된다.이 문단은 이러한 크기 관계가 일반적인 예시에서는 거의 나타나지 않는다고 설명한다.
  • B.5 실패 사례: 두 객체의 수치 및 비교 prompt는 더 어려운데, LayoutGPT가 더 작은 bounding box를 예측하여 GLIGEN이 해당 영역 안에서 이미지를 생성하기 어려워지기 때문이다.이러한 실패는 수치 및 공간 관계에 대해 Figure 12에 예시로 제시된다.
  • C 3D 장면 합성을 위한 LayoutGPT: 3D 합성의 condition은 room type과 room size를 사용한다. LLM은 ATISS [38]과 달리 이미지 입력을 받지 못하므로, floor-plan 이미지는 size specification으로 변환된다.예시 condition은 최대 길이와 너비가 256px인 bedroom을 지정한다.

C.1 Exemplar Selection · C.2 Failure Cases

LayoutGPT는 실내 장면 합성에서 기하학적으로 유사한 in-context exemplar에 크게 의존하지만, 여전히 전형적인 공간 오류를 생성한다. Exemplar를 무작위로 선택하면 경계 위반이 크게 악화되며, 장면 경계를 벗어나거나 서로 겹치는 가구와 비현실적인 객체 배치 등의 실패가 발생한다.

  • C.1 Exemplar Selection: 무작위로 선택한 8개의 bedroom exemplar를 사용했을 때의 경계 밖 비율 85.58%와 Table 5의 43.26%라는 차이는 LayoutGPT가 유사한 floor plan에 의존함을 보여준다.이 차이는 유사한 exemplar room이 생성된 객체를 장면 경계 안에 유지하는 데 도움을 준다는 것을 나타낸다.
  • C.1 Exemplar Selection: LayoutGPT의 exemplar 분석은 minimum scene difference를 사용해 각 생성된 bedroom을 8개의 in-context exemplar와 비교하며, 거리는 미터 단위로 계산한다.이 방법은 객체 category, 위치, 크기, orientation을 사용해 생성 장면과 training 장면을 비교한다.
  • C.1 Exemplar Selection: 1.0 미만의 scene difference는 중복 가능성이 높음을, 6.0 미만의 값은 중간 정도의 객체 변화를, 6.0 초과의 값은 새로운 객체 또는 큰 차이를 나타낸다.이 임계값은 Fig. 13에 도시된 423개의 bedroom testing sample 전체에 적용된다.
  • C.1 Exemplar Selection: Scene-difference 분석은 423개의 bedroom testing sample에 걸쳐 생성된 layout이 in-context exemplar를 재현하거나 수정하는지를 검증한다.분석에서는 보고된 임계값을 사용해 중복, 수정, 상당한 장면 변화를 구분한다.
  • C.2 Failure Cases: ATISS와 비슷한 결과를 보였음에도 LayoutGPT는 경계 밖 가구와 겹친 객체를 포함한 전형적인 실패를 생성한다.이러한 실패 사례는 Fig. 14에 제시되어 있다.
  • C.2 Failure Cases: LayoutGPT는 양쪽 headboard의 반대편에 배치하는 대신 두 nightstand를 모두 침대의 같은 쪽에 배치할 수 있다.논문은 3D 이해를 향상하기 위한 잠재적 향후 방법으로 더 정교한 in-context learning 또는 fine-tuning을 제시한다.

D 2D Keypoint Planning을 위한 LayoutGPT · E 윤리 성명

LayoutGPT를 GLIGEN 기반 image generation을 위해 MSCOCO2017 호환 human keypoint를 예측하는 2D keypoint planner로 탐구한 결과, 유망한 action control 가능성을 보였지만 layouts보다 planning 난도가 상당히 높았다. 또한 비교 baseline으로 human-planned bounding-box layouts를 설명한다.

  • D 2D Keypoint Planning을 위한 LayoutGPT: LayoutGPT는 text로부터 17 MSCOCO2017 [29] human keypoint distributions를 예측하고, GLIGEN [27]은 이를 keypoint-to-image generation에 사용한다.이는 LayoutGPT를 2D 및 3D layout planning을 넘어 text-conditioned image generation으로 확장한다.
  • D 2D Keypoint Planning을 위한 LayoutGPT: 예비 사례는 LayoutGPT가 planning한 keypoint를 통해 특정 movements 또는 actions를 제어할 유망한 가능성을 보여준다.이 사례들은 LayoutGPT-conditioned images를 StableDiffusion-v2.1 및 Attend-and-Excite [4]와 비교한다.
  • D 2D Keypoint Planning을 위한 LayoutGPT: Keypoint planning은 네 가지 2D layout aspects 또는 일곱 가지 3D layout aspects가 아니라 17개 node positions를 예측하므로 bounding-box planning보다 상당히 어렵다.예측해야 하는 node 수가 많아지면서 planning complexity가 증가한다.
  • D 2D Keypoint Planning을 위한 LayoutGPT: MSCOCO의 body movements 사이에 존재하는 광범위한 spatial relations는 reliable keypoint planning을 더욱 어렵게 하므로, 저자들은 이 방향을 future research로 남겨둔다.이 section은 keypoint distributions와 body-motion relations를 아직 해결되지 않은 reliability challenges로 규정한다.
  • E 윤리 성명: Human-planned layouts는 GPT-3.5/4가 예측한 layouts와 함께 자연스러운 comparative baseline으로 사용된다.Annotators에게 빈 square canvas와 prompt의 noun words 또는 phrases를 제공한 뒤, 각 대응 element에 bounding box를 그리게 한다.
  • E 윤리 성명: Human-baseline interface는 annotators에게 prompt elements의 bounding boxes를 그리게 하면서 추가 제약은 의도적으로 피하도록 한다.제공된 passage는 추가 제약이 부과되지 않았다고 밝히지만, 그 이상의 ethical procedures는 명시하지 않는다.

F 한계 · G 광범위한 영향

LayoutGPT의 시각적 계획은 제어 메커니즘과 과제 범위 측면에서 여전히 제한적이지만, LLM을 활용하면 설계 부담을 줄이고 세밀한 제어를 향상하며 향후 더 폭넓은 응용을 지원할 수 있다. 이 연구는 architecture, virtual reality, computer-aided design과 같은 여러 도메인에 걸친 시각적 계획을 향한 초기 단계로 제시된다.

  • F 한계: 주요 한계는 2D 및 3D bounding-box layout에 의존한다는 점과 keypoint 기반 공간 제어를 예비적으로만 탐색했다는 점이다.Figure 15는 text-conditioned image generation 이전에 GPT-4와 함께 LayoutGPT가 생성한 그럴듯한 keypoint 분포를 보여준다.
  • F 한계: 향후 연구에서는 segmentation mask와 depth map을 비롯한 대안적 시각 제어를 LLM과 통합하여 시각적 계획 역량을 확장할 수 있다.
  • F 한계: 이 framework는 주로 visual generation을 대상으로 하며, classification이나 visual understanding과 같은 과제에 대한 통합 접근법은 아직 제공하지 않는다.
  • G 광범위한 영향: LLM은 인간 디자이너의 부담을 줄이고 생산성을 향상하며, 대규모 compositional 2D 또는 3D planning task를 확장 가능하게 처리하도록 지원할 수 있다.
  • G 광범위한 영향: 텍스트 입력을 조건으로 사용함으로써 LLM은 compositional generation에서 세밀한 시각적 제어를 가능하게 한다.
  • G 광범위한 영향: LLM 기반 시각적 계획의 초기 단계로서, 이 연구는 architecture, virtual reality, computer-aided design에서의 향후 응용 가능성을 시사한다.

H 추가 정성적 예시

추가 시각적 사례는 2D 수치 추론, 2D 공간 추론, 3D 침실 장면 합성에서 LayoutGPT의 능력을 보여 주며, 여러 도메인에서의 효과와 범용성을 부각한다.

  • H 추가 정성적 예시: Figure 16은 2D 수치 추론 프롬프트에 대한 LayoutGPT 변형들의 정성적 예시를 제시한다.
  • H 추가 정성적 예시: Figure 17은 2D 공간 추론 프롬프트에 대한 LayoutGPT 변형들의 정성적 예시를 보여 준다.
  • H 추가 정성적 예시: Figure 18은 침실 장면 합성에서 LayoutGPT 변형들의 추가 정성적 예시를 보여 준다.
Loading 2305.15393v2…