Source-linked AI summary

Representation Fréchet Loss for Visual Generation

Jiawei Yang, Zhengyang Geng, Xuan Ju, Yonglong Tian, Yue Wang

arXiv:2604.28190v1cs.CV

TL;DR

FD는 신뢰할 수 있는 추정에 실제 학습 배치보다 훨씬 큰 모집단이 필요하기 때문에 전통적으로 생성 모델 평가에 사용되어 왔다. 이 논문은 모집단 크기와 gradient batch size를 분리해 FD-loss를 도입하고, 시각적 품질을 일관되게 향상시키며 one-step generator에서 ImageNet 256 × 256 기준 0.72 FID를 달성한다.

  • 문제

    FD를 직접 최적화하려면 계산량은 감당 가능한 학습 배치 규모로 유지하면서 큰 유효 모집단이 필요하다.

  • 방법

    FD-loss는 queued features 또는 feature moments의 exponential moving averages를 사용해 모집단 크기와 gradient batch size를 분리한다.

  • 결과

    FD-loss는 generator 계열, 크기, 해상도, representation space 전반에서 시각적 품질을 일관되게 향상시키며, ImageNet 256 × 256에서 0.72 FID를 달성한다.

  • 시사점 및 한계

    FD-loss는 학습과 평가를 연결한다. generator를 개선하는 동시에 단일 representation FID의 맹점을 드러내며, multi-representation metric인 FDr^k를 제안하게 한다.

  • 시사점 및 한계

    FDr^k는 선택한 representation에 의존하며 Fréchet Distance의 Gaussian moment-matching 가정을 그대로 물려받는다.

Abstract

from arXiv · show

We show that Fréchet Distance (FD), long considered impractical as a training objective, can in fact be effectively optimized in the representation space. Our idea is simple: decouple the population size for FD estimation (e.g., 50k) from the batch size for gradient computation (e.g., 1024). We term this approach FD-loss. Optimizing FD-loss reveals several surprising findings. First, post-training a base generator with FD-loss in different representation spaces consistently improves visual quality. Under the Inception feature space, a one-step generator achieves0.72 FID on ImageNet 256x256. Second, the same FD-loss repurposes multi-step generators into strong one-step generators without teacher distillation, adversarial training or per-sample targets. Third, FID can misrank visual quality: modern representations can yield better samples despite worse Inception FID. This motivates FDr$^k$, a multi-representation metric. We hope this work will encourage further exploration of distributional distances in diverse representation spaces as both training objectives and evaluation metrics for generative models.

1 서론

이 연구는 추정에 사용하는 모집단 크기와 gradient batch size를 분리해 Fréchet Distance를 실용적인 training loss로 만들고, single-representation FID의 한계를 드러내면서 generator를 개선한다. FD-loss는 강력한 post-training 결과를 달성하고, multi-step generator를 one-step model로 전환하며, multi-representation 평가를 제안한다.

  • 동기: FD는 미분 가능하지만, 신뢰할 수 있는 통계를 얻으려면 50k와 같은 규모의 모집단이 필요하고 모든 sample을 통한 gradient 계산이 감당하기 어려워 직접 최적화는 실용적이지 않다고 여겨졌다.역사적으로 FID [17]는 특히 ImageNet 과 같은 benchmark에서 training loss가 아니라 evaluator로 기능했다.
  • 방법: FD-loss는 신뢰할 수 있는 FD 추정에 필요한 큰 모집단과 gradient 계산에 사용하는 작은 batch를 분리한다.online feature queue 또는 exponential moving average로 구현되며, 현재 batch에 대해서만 backpropagation을 수행하면서 50k와 같은 모집단에 대해 FD를 추정할 수 있다.
  • 결과: Inception feature를 사용해 FD-loss로 fine-tuning한 one-step generator가 ImageNet 256 × 256에서 0.72 FID를 달성한다.pixel-space 및 latent-space generator 계열, model size, resolution 전반에서 FD-loss는 사전 계산된 real-data feature 통계를 사용해 visual quality를 일관되게 개선한다.
  • 결과: 약 300 FID에서 0.72까지, FD-loss는 teacher distillation, adversarial training, per-sample target 없이 사전 학습된 multi-step generator를 one-step generator로 전환한다.이는 FD가 evaluation metric에만 해당하는 것이 아니라 distribution-level objective로도 기능함을 보여주며, 이 접근법은 class-conditioned model에서도 검증된다.
  • 결과: FD-loss post-training 후 1.89 FDr6를 달성하며, modern representation으로 최적화한 model은 Inception FID가 더 나쁘더라도 더 좋아 보일 수 있다.이러한 결과는 단일 FD에 의존하기보다 여러 representation space에서 generator를 평가할 필요성을 제기한다.
  • 결론: FD-loss는 generator를 개선하면서 단일 FD representation이 perceptual quality를 잘못 판단할 수 있음을 보여주어 training과 evaluation을 연결한다.저자들은 generative-modeling pipeline의 양쪽에서 FD가 유용하다고 본다.

2 관련 연구

선행 연구는 Fréchet Distance를 널리 사용되지만 불완전한 평가 metric으로 정립하고, distributional matching을 training objective로 탐구해 왔다. 본 연구는 batchwise FD optimization의 statistical-scale 한계를 다루고 이를 one-step generator 개선에 적용한다.

  • 평가 metric으로서의 Fréchet Distance: FID [17]가 image-generation 평가를 지배하지만, 문서화된 한계 [21] [19]로 인해 precision–recall [21], CKA, MMD [19]가 제안되었다.이 논문은 FID의 신뢰성을 검증하고 FDr^k를 동기화하기 위해 FD를 직접 최적화 가능하게 만든다.
  • training loss로서의 Fréchet Distance: 기존 training objective로는 adversarial, MMD-based [25] [6], sliced-Wasserstein [7], feature-moment, feature-space FD matching [34] [8]이 있다.기존 FD optimization 방법은 단일 batch 내에서 계산한 estimate를 최소화하므로 statistical scale이 제한된다.
  • 더 넓은 sample window에서의 최적화: 본 연구는 memory bank, feature queue [16], EMA population statistics [18]에서 발전한 large-effective-sample optimization 아이디어를 queue 위에서 FD를 계산하는 방식으로 확장한다.이 queue는 단일 batch보다 더 넓은 sample window를 제공하도록 설계되었다.
  • one-step generator와 post-training: one-step generation에서 capable representation space의 FD optimization은 straightening ODE [26], consistency model, score distillation, identity-based method [11] [30], drifting model [6]을 보완한다.더 넓은 맥락에서 보면, 최신 high-quality generator는 대체로 multi-step denoising [9] [24]에 의존한다.

3 방법

FD-loss는 대규모 모집단 통계와 소규모 배치 gradient를 분리해 generator post-training에서 Fréchet Distance를 실용적으로 만든다. 이 방법은 queue 또는 EMA 기반 추정, multi-representation objective를 지원하며 multi-step generator를 one-step generator로 전환한다.

  • 3.1 Challenges and FD-loss: FD-loss는 안정적인 분포 통계를 위한 큰 유효 모집단과 gradient 계산에 사용하는 현재 배치를 분리한다.신뢰할 수 있는 추정에는 대략 50k개의 sample이 필요할 수 있지만, 일반적인 training batch에는 64–1024개의 sample이 포함된다. 작은 batch는 고차원 covariance에서 특히 불안정하다.
  • 3.2 Estimators: Queue estimator는 N개의 sample에 걸쳐 feature를 집계하면서 B-sample current batch를 통해서만 back-propagation하며, B ≪ N이다.대표적인 설정은 N = 100,000 및 B = 1,024를 사용한다. Queue에 저장된 feature는 통계 및 gradient 계산에서 detach된다.
  • 3.2 추정량: EMA estimator는 feature storage를 지수 평활된 일차 및 이차 모멘트로 대체해, 더 확장 가능하고 최근 샘플에 가중치를 부여하는 대안을 제공한다.running moments로부터 covariance를 계산하고 현재 batch를 통해서만 역전파한다. 보고된 post-training 설정에서 이 방법은 0.81 FID를 달성한다.
  • 3.3 Multi-representation FD-loss: Multi-representation FD-loss는 각 representation별 FD를 stop-gradient magnitude와 stability constant의 합으로 정규화한 뒤, unit-scale 항을 동일한 가중치로 결합한다.이를 통해 raw FD 값이 자릿수 단위로 다른 feature space가 objective를 지배하는 것을 방지한다.
  • 3.4 Post-training settings: FD-loss는 기존 one-step generator를 post-training하며, terminal timestep에서 한 번 평가함으로써 multi-step generator를 one-step generator로 전환할 수 있다.이 방법은 pixel-space 및 latent-space one-step generator에 대해 시연되며, multi-step model은 terminal output을 clean-image prediction으로 사용한다.
  • 3.5 Evaluation metric: FDr^K는 K개 representation model에서 정규화된 FD ratio를 평균내어 model별 해석 가능성을 유지하면서 single-representation FID의 blind spot을 줄인다.Validation image의 score는 정의상 1.0이며, 이 metric은 human evaluation을 대체하기보다 더 robust한 automatic measure로 제시된다.

4 실험

ImageNet 실험은 FD-loss가 generator family, model size, resolution, representation space 전반에서 확장 가능하며, multi-step generator를 효과적인 one-step model로 변환할 수 있음을 보여준다. 결과는 충분히 크면서도 오래되지 않은 population estimate와 multi-representation training이 FID와 전반적인 품질을 모두 개선하는 데 핵심임을 보여준다.

  • Representation model: Inception을 최적화하면 FID가 3.31→0.81이 되는 반면, ConvNeXt는 FID를 3.31→1.64로 만들지만 FDr6를 13.70→8.46으로 개선하며, 이는 FID가 시각적 품질의 순위를 잘못 매길 수 있음을 보여준다.최신 ViT representation은 FID를 악화시키지만 FDr6를 더 크게 개선하며, 더 높은 FID에도 불구하고 시각적 비교에서는 object structure가 더 우수한 것으로 나타난다.
  • Multiple representation models: Representation model을 결합하면 일반적으로 더 효과적이다. SigLIP을 Inception과 결합하면 FID가 0.89로 회복되고, MAE를 추가하면 FID 손실은 무시할 수 있는 수준으로 유지하면서 FDr6가 더 개선된다.이렇게 얻은 FD-SIM configuration을 이후 실험의 기본 설정으로 사용한다.
  • One-step repurposing: FD-loss는 multi-step JiT-L/16 model을 타당한 1-NFE generator로 전환하며, FD-SIM은 FDr6 3.29와 FID 0.85를 달성한다.이 변환에는 distillation, adversarial loss, per-sample regression target이 필요하지 않지만, 변환된 model에서는 artifact가 나타날 수 있다.
  • Scalability: 동일한 hyperparameter를 사용했을 때, FID-Inception은 generator family, model size, resolution 전반에서 0.72–0.79에 도달하고 FD-SIM은 FDr6 1.81–5.56을 달성한다.결과는 ImageNet 256×256에서의 pMF, iMF, JiT와 512×512에서의 pMF를 아우르며, model별 tuning을 적용하면 더 개선될 수 있다.
  • Text-to-image extension: FD-loss는 SD3.5 Medium으로도 확장되어, 2.5B-parameter multi-step latent denoiser를 prompt content를 식별 가능한 형태로 보존하는 1-NFE text-to-image generator로 변환한다.NFE를 56× 줄였음에도 model은 reference distribution의 양식화된 외관을 이어받으며, 이는 class-conditioned ImageNet generation을 넘어 확장될 수 있음을 보여준다.

5 결론 · Representation Fréchet Loss for Visual Generation 부록

이 연구는 distributional distance를 대규모로 최적화하면 실용적인 training objective가 될 수 있으며, 이를 정의하는 representation space에 주목하게 된다고 주장한다. 또한 image generation을 넘어 다른 modality와 제한된 데이터 환경을 포함하도록 distribution-level post-training을 확장하는 것을 목표로 한다.

  • 5 결론: Fréchet Distance를 포함한 distributional distance는 신뢰할 수 있는 추정에 training batch보다 훨씬 큰 population이 필요하기 때문에 주로 평가 지표로 사용되어 왔다.sample-level training loss와 distributional evaluation의 분리는 원리적인 구분이라기보다 실용적인 구분으로 설명된다. Fréchet Distance는 미분 가능하기 때문이다.
  • 5 결론: 이 논문은 scalable distributional optimization을 통해 generative-model training을 generation의 본질적으로 distributional한 성격과 다시 연결할 수 있다고 본다.이 결론은 distributional problem인 generation과 sample-level objective가 지배하는 training 사이의 대비에서 도출된다.
  • 5 결론: 이 연구는 distributional distance를 대규모로 최적화할 수 있게 함으로써 distribution-level post-training을 폭넓게 적용할 수 있도록 한다.이 목표는 논문에서 다룬 구체적인 image-generation 설정을 넘어선다.
  • 5 결론: 제안하는 방향은 다른 modality, 실제 데이터에 대한 접근이 부족하거나 제한된 환경, 그리고 image generation을 넘어서는 paradigm에서의 적용을 대상으로 한다.이는 제공된 본문에서 입증된 결과라기보다 폭넓은 적용 가능성을 위한 의도된 영역으로 제시된다.
  • 5 결론: distributional distance를 대규모로 최적화할 수 있게 되면, 핵심 설계 문제는 이를 정의할 representation space를 무엇으로 선택할지로 바뀐다.결론은 최적화의 실용성 문제가 해결된 뒤 representation 선택이 핵심 후속 문제라고 규정한다.
  • 5 결론: 이 연구는 기존에 존재하는 여러 representation을 탐색함으로써 representation 선택 문제를 다루기 시작한다.본문은 이 탐색을 설계 문제를 완전히 해결한 것이 아니라 초기 시도로 규정한다.

A 추가 설계 시도와 관찰 … B.2 구성

부록은 좁은 representation 기반 objective를 최적화해도 지각 품질이 향상되지 않은 채 과도하게 최적화될 수 있음을 보이며, 다양한 representation과 사람의 검증이 필요함을 제시한다. 또한 평가에 사용한 고정 feature extraction 설정과 ImageNet post-training 구성을 명시한다.

  • A 추가 설계 시도와 관찰: 이러한 탐색적 실패는 FD-loss의 부정적 결과가 아니라, 지나치게 좁은 representation이나 objective를 피하기 위한 inverse gradients로 제시된다.부록은 Goodhart’s law 와 RLHF에서의 관련 reward-model 과최적화 [4]를 통해 proxy misalignment를 설명한다.
  • A 추가 설계 시도와 관찰: Inception FD를 최적화하면 pMF-B/16이 0.81 FID까지 향상되지만, 추가 최적화는 FID가 약 1.0–1.5인 generator들과 지각적으로 일치하지 않은 채 representation의 blind spot을 공략할 수 있다.이 proxy는 base generator를 개선하지만 visual quality의 척도로서는 불완전하다.
  • A 추가 설계 시도와 관찰: FDr6는 supervised, self-supervised, reconstructive, vision-language objective를 아우르는 six feature spaces를 결합하지만, representation coverage는 여전히 열린 지각 문제로 남는다.여섯 representation은 Inception이 놓치는 간극을 드러내지만 모든 image imperfection을 포착할 가능성은 낮다.
  • A 추가 설계 시도와 관찰: 660 IS와 2.09 FID는 artifact 및 FDr6의 50.66으로의 저하와 함께 나타나며, 100× 더 큰 learning rate를 사용했을 때 metric gaming이 드러난다.Figure A.1은 Inception 기반 metric을 의도적으로 과최적화하는 stress test를 제시한다.
  • A 추가 설계 시도와 관찰: FDr^k는 single-model bias를 줄이지만 여전히 잠정적이므로, human preference study를 통해 RAE와 같은 강력한 multi-step system을 능가하는 향상이 실제 visual superiority를 반영하는지 검증한다.여러 representation을 사용하더라도 더 넓은 metric은 여전히 공략될 수 있다.
  • B.1 FDr6의 Representation Model: FDr6는 CNN 및 ViT architecture 전반에서 supervised, self-supervised, vision-language model을 사용한다.Table B.1은 평가에 사용한 representation-model family를 요약한다.
  • B 구현 및 평가 세부사항: CNN feature는 final spatial pooling 이후에 추출하고, ViT feature는 final-layer CLS token에서 추출하며, 모든 representation model은 training 중 remain frozen 상태로 유지된다.이 선택들이 FDr6의 feature extraction procedure를 정의한다.
  • B.2 구성: Table B.2는 pMF, iMF, 및 JiT generator family에 대한 ImageNet class-conditional post-training configuration을 요약한다.이 configuration은 부록에서 평가한 세 generator family를 포괄한다.

B.3 학습 세부사항

학습은 생성 샘플에서 FD 통계를 초기화해 첫 단계부터 추정값이 의미를 갖도록 하며, 고유값 분해를 통해 covariance square-root 항을 효율적으로 계산한다.

  • 초기화: EMA variant는 학습 전에 50k개 이미지를 생성해 feature statistics를 초기화하고, queue variant는 N개 이미지를 생성해 feature queue를 채운다.두 절차 모두 FD 추정을 위한 warm start를 제공한다.
  • Configuration: ImageNet class-conditional post-training에서는 별도 언급이 없는 한 ablation과 final run에 동일한 configuration을 사용하며, base model은 공개된 그대로 사용하고 post-training만 변경한다.이 설정은 Table B.2에 요약되어 있다.
  • Matrix square root: 구현에서는 Σ_r^1/2를 미리 계산하고, 각 학습 단계마다 matrix square root를 명시적으로 계산하지 않도록 symmetric product에 torch.linalg.eigvalsh를 사용한다.초기 탐색에서 유사한 성능을 보이면서 eigvals보다 훨씬 빨랐기 때문에 eigvalsh를 채택했다.

B.4 Text-to-Image Post-Training · B.5 Evaluation Protocol

이 연구는 SIM representation set에서 FD-loss를 사용해 Stable Diffusion 3.5 Medium을 one-step 256×256 text-to-image 생성에 맞게 post-training한다. 동일한 training 설정에서 두 caption-image source를 비교하고, 균일하게 샘플링한 이미지와 고정된 ImageNet reference statistics를 사용해 official checkpoint를 평가한다.

  • B.4 Text-to-Image Post-Training: SD3.5 Medium의 2.5B-parameter MMDiT를 FD-loss로 post-training해 one-step 256×256 generation을 수행하며, 변경하지 않은 SD3.5 VAE tokenizer와 SIM representations를 사용한다.SIM은 SigLIP2, Inception, MAE features를 결합한다.
  • B.4 Text-to-Image Post-Training: Reference statistics는 각 set의 모든 real images에서 사전 계산한다. variant (i)는 3M images, variant (ii)는 60k를 사용한다.구성은 Table B.3에 요약되어 있다.
  • B.4 Text-to-Image Post-Training: Training은 global batch size 1024, peak lr=10^-5, 2,500 warmup steps와 cosine schedule로 15,000 steps 동안 수행한다.EMA feature statistics는 50k base-model images로 warm-start한다.
  • B.4 Text-to-Image Post-Training: 각 training step은 classifier-free guidance 없이 one denoising step을 사용해 caption당 image 하나를 생성하며, CFG=1로 설정한다.EMA statistics에는 β=0.999를 사용하고, matrix square root는 eigvalsh로 계산한다.
  • B.4 Text-to-Image Post-Training: 두 variant는 data source만 다르다. BLIP3o-Pretrain-Long-3M [3]은 무작위로 샘플링한 3M web pairs를 사용하고, BLIP3o-GPT4o-60k [3]은 선별한 60k GPT-4o-distilled images를 사용한다.전자는 photographic이고 후자는 stylized하며 illustration-leaning aesthetic을 보인다. 그 밖의 모든 hyperparameters는 동일하다.
  • B.5 Evaluation Protocol: Evaluation은 각 official checkpoint에서 official code를 사용해 50,000 images를 샘플링하고, 정확성을 수동으로 검증한 뒤 샘플 이미지에서 평가를 수행한다.이 protocol은 주로 Claude Code 와 Codex 같은 coding agents를 사용해 각 codebase의 지침을 따른다.
  • B.5 Evaluation Protocol: Class-conditional models의 경우 evaluation은 전체 1,000 ImageNet classes에서 균일하게 샘플링하며, class당 50 images를 사용한다.Reference statistics는 전체 ImageNet training set에서 한 번만 계산한다.

C 인간 선호도 연구

이 연구는 3×3 이미지 격자에 대한 익명화된 쌍별 비교를 사용해 인간의 시각적 충실도 선호를 측정하며, 무작위 제시와 모델 정체성 비공개를 적용한다. 17명의 참가자로부터 얻은 2,929개의 유효 투표를 무승부 보정 선호도 점수로 집계한다.

  • 인간 선호도 연구: 각 trial에서는 익명화된 3×3 격자를 비교하고, 좌우 순서를 무작위화하며, 모델 정체성을 숨긴 뒤, 투표자가 더 높은 충실도 또는 무승부를 선택하게 한다.Post-trained와 Base 비교에서는 직접적인 시각 비교를 위해 초기 noise를 일치시킨다.
  • 인간 선호도 연구: 17명의 참가자로부터 얻은 2,929개의 유효 투표를 선호도 점수로 집계하며, 각 무승부를 승리의 절반으로 계산한다.FD-loss의 경우 선호도 점수는 W + T/2이며, W, T, L은 각각 승리율, 무승부율, 패배율이다. Figure 6에 집계 결과를 제시한다.
  • 인터페이스: 인터페이스는 동일한 ImageNet class에서 선별되지 않은 side-by-side 격자를 제시하며, Left, Tie, Right, Skip, Back 및 이미지 확대/축소 control을 제공한다.Class는 전체 1000개 ImageNet class에서 균등하게 샘플링하며, voting page는 Figure C.1에 제시한다.
  • 샘플링: 각 모델은 50,000개의 sample, 즉 class당 50개의 image를 제공하며, 격자를 균등하게 구성할 수 없을 때는 replacement를 사용한다.Generator는 best-FID inference setting을 사용하며, trial은 지정된 model pair 전체에서 균등하게 샘플링한다.

D 한계와 광범위한 영향

이 연구는 주로 ImageNet에서의 이미지 생성에 한정되며, FD-loss는 representation space와 reference statistics에 의존한다. 품질 향상에는 이중 용도 위험이 따르고, 진단 결과는 FID에만 의존하는 관행에 문제를 제기한다.

  • 한계: FD-loss는 주로 ImageNet에서의 이미지 생성을 대상으로 평가되며, text-conditioned generation은 추가적인 시연으로 다뤄진다.
  • 한계: FD-loss의 거동은 선택한 representation space와 reference statistics에 따라 달라지므로, 서로 다른 도메인에는 각기 다른 feature set이나 weighting scheme이 필요할 수 있다.
  • 광범위한 영향: 더 높은 품질의 이미지 생성기는 허위정보나 기만적 콘텐츠 제작에 악용되는 등 이중 용도 위험을 수반한다.
  • 광범위한 영향: FID alone으로는 충분하지 않다는 이 연구의 진단 결과는 생성 모델에 대한 분야의 평가와 이해를 향상시킬 수 있다.

E 추가 정성적 샘플

비큐레이션 paired ImageNet 256×256 샘플을 동일한 초기 noise에서 base generator와 FD-loss post-trained 버전 간 비교한다. 비교 대상은 pMF-H/16과 JiT-H/16의 200 NFE에서 1 NFE로의 변환이다.

  • pMF-H/16: pMF-H/16 [30] 샘플은 동일한 초기 noise에서 one-step base model과 FD-loss (SIM) post-trained counterpart를 비교한다.paired 샘플은 비큐레이션되었으며 Figures E.1–E.3에 걸쳐 제시된다. SIM은 SigLIP+Inception+MAE를 뜻한다.
  • JiT-H/16: JiT-H/16 [23] 샘플은 동일한 초기 noise에서 200-NFE base model과 1 NFE에서 FD-loss (SIM) post-training을 비교한다.base configuration은 50 steps × 2 (Heun) × 2 (CFG)를 사용하며, 모든 샘플은 비큐레이션되었다.

F 상세 결과 · G Text-to-Image 프롬프트

부록에서는 representation, population size, generator repurposing, system comparison 전반에 걸친 FD-loss 평가를 상세히 다루고, text-to-image 정성적 비교를 확장하며 모든 프롬프트를 수록한다. 또한 normalized 및 raw Fréchet metric을 모두 보고하고, one-step model과 multi-step baseline을 비교한다.

  • F 상세 결과: Representation별 결과는 여섯 공간에서 normalized FDr, raw FD, FDr6를 보고하고, held-out FDr-CLIP 평가도 제시한다.FDr6는 Inception, ConvNeXt, DINOv2, MAE, SigLIP, CLIP representation에서 FDr을 평균한 값이다.
  • F 상세 결과: 상세 표에서는 population-size 및 representation-model ablation을 다루며, FD-Inception과 SigLIP, Inception, MAE의 조합인 SIM을 포함한다.이 표들은 ablation에 대해 representation별 FDr 및 raw FD breakdown을 제공한다.
  • F 상세 결과: 추가 표에서는 representation별 FDr 및 raw FD 값을 사용해 JiT-L repurposing과 system-level comparison을 분석한다.system-level 표에서는 FD-loss post-trained model을 음영 행으로 표시하고, JiT-L 표에서는 다른 representation과 함께 SIM을 사용한다.
  • F 상세 결과: 확장 metric에서는 모든 FD-loss post-trained model을 다루며, 각 base generator를 1 NFE를 사용하는 FD-Inception 및 FD-SIM variant와 짝지어 비교한다.확장 표에는 base generator와 post-trained variant가 포함되며, SIM은 SigLIP+Inception+MAE로 정의된다.
  • G Text-to-Image 프롬프트: 정성적 text-to-image 비교에서는 사실적 사진 및 stylized reference distribution에 대해 SD3.5 Medium [9]을 post-train하고, 56× NFE reduction 이후에도 prompt content를 식별할 수 있음을 시사한다.reference distribution은 BLIP3o-Pretrain-Long-3M [3]과 BLIP3o-GPT4o-60k [3]이며, 비교에는 56-NFE baseline과 1-NFE FD-loss model이 포함된다.
Loading 2604.28190v1…