Source-linked AI summary
Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition
Yin, Shengming, Zhang, Zekai, Tang, Zecheng, Gao, Kaiyuan, Xu, Xiao, Yan, Kun, Li, Jiahao, Chen, Yilei, Chen, Yuxiang, Shum, Heung-Yeung, Ni, Lionel M., Zhou, Jingren, Lin, Junyang, Wu, Chenfei
TL;DR
Raster image는 시각 요소가 서로 얽혀 있어 image editing 시 편집하지 않은 콘텐츠도 자주 바뀐다. Qwen-Image-Layered는 RGB image를 의미적으로 disentangled된 RGBA layer로 분해하며, 실험에서 기존 접근법보다 분해 품질과 일관성 보존 편집 성능이 크게 우수함을 보인다.
문제
Image editing은 편집하지 않은 영역을 보존하는 데 어려움을 겪으며, 고품질 multilayer training image도 여전히 부족하다.
방법
Qwen-Image-Layered는 shared RGBA latent, variable-layer decomposition, multistage training을 사용하는 end-to-end diffusion model로 독립적으로 편집 가능한 layer를 생성한다.
결과
실험에서 Qwen-Image-Layered는 decomposition quality와 일관성 보존 image editing 성능에서 기존 접근법을 크게 능가한다.
핵심 시사점 및 한계
Layered RGBA representation은 편집을 대상 layer에만 격리하고 다른 콘텐츠는 변경하지 않음으로써 inherent editability를 제공한다.
Abstract
from arXiv · showhide
Recent visual generative models often struggle with consistency during image editing due to the entangled nature of raster images, where all visual content is fused into a single canvas. In contrast, professional design tools employ layered representations, allowing isolated edits while preserving consistency. Motivated by this, we propose \textbf{Qwen-Image-Layered}, an end-to-end diffusion model that decomposes a single RGB image into multiple semantically disentangled RGBA layers, enabling \textbf{inherent editability}, where each RGBA layer can be independently manipulated without affecting other content. To support variable-length decomposition, we introduce three key components: (1) an RGBA-VAE to unify the latent representations of RGB and RGBA images; (2) a VLD-MMDiT (Variable Layers Decomposition MMDiT) architecture capable of decomposing a variable number of image layers; and (3) a Multi-stage Training strategy to adapt a pretrained image generation model into a multilayer image decomposer. Furthermore, to address the scarcity of high-quality multilayer training images, we build a pipeline to extract and annotate multilayer images from Photoshop documents (PSD). Experiments demonstrate that our method significantly surpasses existing approaches in decomposition quality and establishes a new paradigm for consistent image editing. Our code and models are released on \href{https://github.com/QwenLM/Qwen-Image-Layered}{https://github.com/QwenLM/Qwen-Image-Layered}
1. 서론
Qwen-Image-Layered는 얽힌 raster 표현을 의미적으로 분해된 RGBA 레이어로 대체해, 편집하지 않은 콘텐츠를 보존하면서 분리된 편집을 가능하게 함으로써 일관되지 않은 이미지 편집 문제를 해결한다. 공유 RGB/RGBA latent, variable-layer architecture, multi-stage adaptation, PSD에서 추출한 training data를 갖춘 end-to-end decomposer를 도입한다.
- 서론: 얽힌 raster image는 시각적 콘텐츠를 하나의 canvas에 융합하므로, 결합된 semantic과 geometry를 통해 편집이 전파되고 편집하지 않은 영역에서 불일치가 발생한다.기존 global method는 일관성을 보장할 수 없으며, mask-guided local method는 occlusion이 포함된 복잡한 장면에서 어려움을 겪는다.
- 서론: Qwen-Image-Layered는 단일 RGB image를 여러 개의 semantically disentangled RGBA layers로 분해해, 다른 콘텐츠를 보존하면서 독립적인 조작을 가능하게 한다.Layered representation은 편집을 target layer에 물리적으로 격리해 semantic drift와 geometric misalignment 문제를 해결한다.
- 서론: PSD-based pipeline은 실제 Photoshop document에서 multilayer image를 필터링하고 주석을 추가해, 고품질 multilayer training data의 부족 문제를 해결한다.이 pipeline은 제안된 decomposer를 학습하기 위한 multilayer image data를 제공한다.
- 서론: 이 model은 공유 RGB/RGBA latent representation을 위한 RGBA-VAE, variable-layer decomposition을 위한 VLD-MMDiT, pretrained generator를 adapt하기 위한 multi-stage training을 결합한다.이 구성 요소들은 variable number of layers로 분해하면서 기존 image generation model을 multilayer decomposer로 adapt할 수 있도록 지원한다.
2. 관련 연구
기존 연구는 전역 또는 mask-guided image editing, 점점 더 구조화된 layer로의 image decomposition, multilayer image synthesis로 나뉜다. 이러한 접근법은 더 정밀하게 제어할 수 있는 image manipulation과 generation을 위해 layered representation을 활용한다.
- Image Editing: Image editing은 대체로 전역 재생성 또는 mask-guided local editing을 따르며, 전역 방법은 표정 편집과 style transfer 같은 전체적인 변경을 지원한다 [9] [21] [26] [39] [42] [43].Qwen-Image-Edit [42]는 Qwen-VL [3]의 semantic feature와 VAE [19]의 reconstructive feature를 결합한다.
- Image Decomposition: Image decomposition은 color-space segmentation [37]에서 object-level natural-scene decomposition [28] [30]을 거쳐 multiple RGBA-layer representation [18]으로 발전해 왔다.PCNet 은 self-supervised learning을 통해 fractional object mask와 content를 복원한다.
- Multilayer Image Synthesis: Multilayer image synthesis에는 Text2Layer [50]와 같은 two-layer autoencoder 및 diffusion pipeline과, LayerDiffusion [49]의 transparent-latent VAE 및 shared-attention LoRA generation이 포함된다.Text2Layer [50]는 latent representation에서 diffusion을 학습하는 반면, LayerDiffusion [49]은 foreground와 background layer를 생성한다.
3. 방법
Qwen-Image-Layered는 RGB 이미지를 의미적으로 분리된 가변 개수의 RGBA layer로 직접 분해하고, 순차적 alpha blending을 통해 입력을 재구성한다. 이 방법은 shared RGBA-VAE, Layer3D RoPE를 적용한 VLD-MMDiT, 그리고 pretrained image generator를 multilayer decomposition에 맞게 조정하는 progressive multi-stage training을 결합한다.
- 전체 프레임워크: 모델은 RGB 이미지를 N개의 RGBA layer로 매핑하며, 각 layer는 RGB 값과 alpha matte를 포함하고 순차적 alpha blending을 통해 원본 이미지를 재구성한다.각 layer에 대해 Ci = αi · RGBi + (1 − αi) · Ci−1이며, 최종 composite는 I = CN을 만족한다.
- RGBA-VAE: RGBA-VAE는 RGB 이미지와 RGBA 이미지를 shared latent space에서 인코딩하여 input-output distribution gap을 줄이고, layer-dimension compression 없이 각 layer를 독립적으로 표현한다.VAE는 pretrained three-channel encoder와 decoder를 four channels로 확장하고, alpha를 1로 설정한 RGB 이미지로 학습하며, reconstruction, perceptual, regularization loss를 사용한다.
- VLD-MMDiT: VLD-MMDiT는 multimodal attention을 위해 image sequence와 layer sequence를 연결하고 Layer3D RoPE를 통해 layer dimension을 추가함으로써, 하나의 모델에서 가변 개수의 layer를 분해한다.이 architecture는 background와 foreground layer를 재귀적으로 분해하는 대신 inter-layer 및 intra-layer relationship을 직접 모델링한다.
- 학습 objective: 분해 objective는 Flow Matching을 사용한다. target RGBA latent를 Gaussian noise와 pair로 구성하고, RGB latent와 text representation을 조건으로 predicted velocity와 ground-truth velocity 사이의 mean squared error를 사용해 학습한다.입력 이미지는 RGBA-VAE로 인코딩하며, Qwen2.5-VL [3]은 text conditioning에 사용할 image caption을 자동으로 생성할 수 있다.
- Multi-stage training: Multi-stage training은 text-to-RGB/RGBA에서 text-to-multiple-RGBA로, 마지막으로 image-to-multiple-RGBA decomposition으로 진행된다.두 번째 stage에서는 composite image와 transparent layer를 jointly predict하며, 세 번째 stage에서는 RGB image input을 추가하고 Qwen-Image-Layered-I2L을 생성한다.
4. 실험 · 4.1. 데이터 수집 및 주석
저자들은 실제 Photoshop PSD 파일에서 레이어를 추출하고 주석을 부여하는 pipeline을 구축해 고품질 multilayer image의 부족 문제를 해결한다. 이 pipeline은 이상 레이어와 기여하지 않는 레이어를 필터링하고, 지나치게 깊은 레이어 구조를 병합해 데이터 품질과 decomposition 효율을 높인다.
- 4.1. 데이터 수집 및 주석: 이 dataset pipeline은 기존 연구들이 주로 synthetic data나 단순한 graphic-design dataset으로 다뤄 온 고품질 multilayer image의 부족 문제를 겨냥한다.이러한 source는 대체로 복잡한 layout이나 반투명 layer를 포함하지 않는다.
- 4.1. 데이터 수집 및 주석: 저자들은 실제 PSD 파일에서 multilayer image를 도출하고, 이를 구성하는 layer를 필터링하고 주석 처리한다.이 pipeline은 기존 data source의 한계를 보완하기 위한 것이다.
- 4.1. 데이터 수집 및 주석: 저자들은 대규모 PSD corpus를 수집하고, Adobe Photoshop 문서를 파싱하는 open-source Python library인 psd-tools를 사용해 모든 layer를 추출한다.이 추출 과정은 주석 처리를 위한 raw multilayer representation을 제공한다.
- 4.1. 데이터 수집 및 주석: 데이터 품질을 보장하기 위해 pipeline은 흐릿한 얼굴과 같은 이상 요소를 포함한 layer를 제거한다.이 filtering 단계는 training data를 구축하기 전에 문제가 있는 layer content를 제외한다.
- 4.1. 데이터 수집 및 주석: 저자들은 최종 composite image에 영향을 주지 않는 비기여 layer를 제거해 decomposition 성능을 높인다.composite에 영향을 주는 layer만 의미 있는 decomposition target으로 유지한다.
- 4.1. 데이터 수집 및 주석: 일부 PSD 파일에는 수백 개의 layer가 포함되므로, pipeline은 model complexity를 줄이기 위해 layer를 병합한다.Figure 5는 병합 전후의 layer 수 분포와 최종 dataset의 category 분포를 요약한다.
4.2. 구현 세부 사항
Qwen-Image-Layered는 Qwen-Image [42]를 기반으로 개발되었으며 Adam [1]을 사용해 세 단계로 학습되었다. 학습에는 text-based RGB/RGBA generation과 multilayer generation을 위한 별도 데이터셋이 사용되었고, decomposition은 최대 20 layers로 제한되었다.
- 4.2. 구현 세부 사항: 모델은 Adam [1]을 사용해 1 × 10−5의 learning rate로 500K, 400K, 400K의 세 단계에 걸쳐 학습되었다.
- 4.2. 구현 세부 사항: Text-to-RGB 및 Text-to-RGBA generation에는 내부 데이터셋이 사용된 반면, Text-to-Multi-RGBA와 Image-to-Multi-RGBA에는 최대 20 layers를 포함하는 제안 multilayer image dataset이 사용되었다.
4.3. 정량적 결과
Crello에서 Qwen-Image-Layered는 특히 Alpha soft IoU에서 가장 높은 decomposition accuracy를 달성하며, RGBA-VAE는 네 가지 AIM-500 metric 전반에서 가장 우수한 reconstruction 성능을 보인다. 평가는 LayerD의 alignment protocol을 사용하며, ablation은 multi-stage training과 RGBA-VAE의 유효성을 검증한다.
- 평가는 order-aware Dynamic Time Warping으로 variable-length layer sequence를 정렬하고, 모호한 decomposition을 수용하기 위해 인접 layer 병합을 허용한다.protocol은 ground-truth alpha로 가중한 RGB L1과 predicted 및 ground-truth alpha channel 간 Alpha soft IoU를 보고한다.
- Qwen-Image-Layered는 Crello에서 가장 높은 decomposition accuracy를 달성하며, 눈에 띄게 높은 Alpha soft IoU는 더 높은 fidelity의 alpha channel을 나타낸다.비교는 LayerD evaluation protocol에 따라 RGB L1과 Alpha soft IoU를 보고한다.
- Ablation 결과, multi-stage training은 decomposition quality를 향상시키고 RGBA-VAE는 representation-distribution gap을 줄인다.이 연구는 Layer3D RoPE 대신 pretrained text-to-image initialization, RGB VAE encoding, standard 2D RoPE를 사용하는 variant를 비교한다.
- RGBA-VAE는 AIM-500의 RGBA reconstruction에서 PSNR, SSIM, rFID, LPIPS 모두 가장 높은 score를 달성한다.reconstruction 평가는 출력을 단색 background 위에 blend하고, RGBA-VAE를 LayerDiffuse [49] 및 AlphaVAE [40]와 비교한다.
4.4. 정성적 결과
정성적 비교에서 Qwen-Image-Layered는 일관되고 의미적으로 타당한 decomposition을 생성하며, 정밀하고 일관성을 보존하는 editing을 지원한다. 또한 multilayer generation 설정을 raster-first decomposition 및 의미적 일관성에 어려움을 겪는 기존 방법들과 비교한다.
- Image Decomposition: Qwen-Image-Layered는 부정확한 segmentation과 inpainting artifact로 인해 editing에 적합하지 않은 layer를 생성하는 LayerD보다 더 일관되고 의미적으로 타당한 decomposition을 산출한다.비교 결과는 Fig. 6에 제시되며, Qwen-Image-Layered는 external module 없이 end-to-end로 decomposition을 수행한다.
- Consistency-Preserving Editing: Qwen-Image-Layered는 high-fidelity layout modification, resizing, repositioning을 지원하는 반면, Qwen-Image-Edit-2509는 이러한 작업에서 어려움을 겪고 pixel-level shift를 도입한다.개별 RGBA layer를 editing해도 다른 layer는 정확히 변경되지 않으므로, 일관성을 보존하는 editing이 가능하다.
- Text-to-Multi-RGBA Generation: text-to-multilayer synthesis에서는 Qwen-Image-T2I에 이어 Qwen-Image-Layered-I2L을 적용하는 raster-first 방식과 Qwen-Image-Layered-T2L을 비교하며, ART는 bats와 cats가 누락되는 경우처럼 의미적으로 일관된 output을 생성하는 데 어려움을 겪는다.정성적 비교는 Fig. 8에 제시된다.
5. 결론
Qwen-Image-Layered는 RGB 이미지를 의미적으로 분리된 여러 RGBA layer로 분해하는 end-to-end diffusion model이다. 이러한 layer 표현은 다른 콘텐츠를 변경하지 않고 독립적인 편집을 가능하게 하며, 실험에서 기존 접근법보다 우수한 성능을 보였다.
- 결론: Qwen-Image-Layered는 하나의 RGB 이미지를 의미적으로 분리된 여러 RGBA layer로 분해한다.이 모델은 end-to-end 방식이다.
- 결론: 이미지를 layer stack으로 표현하면 다른 콘텐츠를 변경하지 않고 각 layer를 독립적으로 조작할 수 있다.이 설계는 편집 전반에서 일관성을 근본적으로 보장한다.
- 결론: 광범위한 실험을 통해 Qwen-Image-Layered가 기존 접근법보다 유의미하게 우수함을 입증했다.