Source-linked AI summary
Alias-Free Generative Adversarial Networks
Tero Karras, Miika Aittala, Samuli Laine, Erik Härkönen, Janne Hellsten, Jaakko Lehtinen, Timo Aila
TL;DR
일반적인 GAN은 세부 묘사를 객체 표면이 아니라 고정된 픽셀 좌표에 부착할 수 있다. 이 논문은 생성기의 신호 처리를 재설계해 aliasing을 억제하고, 더 자연스러운 움직임과 서로 다른 내부 표현을 생성하면서 StyleGAN2의 FID를 맞춘다.
문제
일반적인 GAN은 세부 묘사가 정밀하게 위치를 지정하는 coarse feature가 아니라 픽셀 좌표에 고정되는 경우가 많아, 자연스러운 계층적 refinement를 통해 이미지를 합성하지 못한다.
방법
이 논문은 네트워크 신호를 연속적으로 해석하고, aliasing을 억제하며 subpixel translation과 선택적 rotation equivariance를 보장하도록 신호 처리를 재설계한다.
결과
StyleGAN3 생성기는 FID에서 StyleGAN2와 일치하고, texture sticking을 해결하며, 더 자연스러운 움직임을 생성한다.
시사점 및 한계
결과적으로 얻은 좌표계는 세부 묘사를 객체 표면에 부착하며, 이미지 및 비디오 편집에 도움이 될 수 있다.
시사점 및 한계
이 아키텍처는 학습 데이터에 심한 aliasing이 없다고 가정하며, 이 가정을 위반하면 학습에 어려움이 생길 수 있다.
Abstract
from arXiv · showhide
We observe that despite their hierarchical convolutional nature, the synthesis process of typical generative adversarial networks depends on absolute pixel coordinates in an unhealthy manner. This manifests itself as, e.g., detail appearing to be glued to image coordinates instead of the surfaces of depicted objects. We trace the root cause to careless signal processing that causes aliasing in the generator network. Interpreting all signals in the network as continuous, we derive generally applicable, small architectural changes that guarantee that unwanted information cannot leak into the hierarchical synthesis process. The resulting networks match the FID of StyleGAN2 but differ dramatically in their internal representations, and they are fully equivariant to translation and rotation even at subpixel scales. Our results pave the way for generative models better suited for video and animation.
1 서론
서론은 aliasing을 객체와 함께 계층적으로 변환되지 않고 세부 정보가 이미지 좌표에 고정되게 만드는 위치 부가 정보의 핵심 원인으로 지목한다. aliasing을 억제하기 위해 연속 영역의 bandlimited signal processing을 제안하며, 이를 통해 내부 표현이 달라지고 StyleGAN2 수준의 FID를 갖는 StyleGAN3를 얻는다.
- 문제: StyleGAN2에서는 생성된 콘텐츠와 일관되게 이동하지 않고 고정된 픽셀 좌표에서 세부 정보가 선명하게 유지되는 “texture sticking”이 나타난다.인접한 latent sample들을 평균하면 균일하게 흐릿한 이미지가 생성되어야 하지만, StyleGAN2는 털과 같은 선명한 세부 정보를 유지한다. latent interpolation에서도 좌표에 고정된 세부 정보가 드러난다.
- 문제: Aliasing은 GAN generator가 유출된 픽셀 그리드 정보에 접근하게 하여, 자연스러운 계층적 이미지 합성을 우회하는 위치 참조를 제공한다.서론은 비이상적 upsampling과 비선형성을 두 가지 aliasing 원인으로 지목하며, border, per-pixel noise, positional encoding도 함께 언급한다.
- 접근법: 제안하는 해법은 네트워크 신호를 이산 그리드에 표현된 연속 bandlimited function으로 다루고, signal processing 기반의 architectural change를 통해 aliasing을 억제한다.이 framework를 사용해 원치 않는 위치 부가 정보를 제거하고 더 자연스러운 계층적 정제를 회복한다.
- 결과: StyleGAN3는 FID에서 StyleGAN2와 일치하면서 세부 정보를 underlying surface에 부착하는 좌표계를 생성하며, video와 animation에 더 적합할 가능성을 보인다.결과 generator는 계산량이 약간 더 많고, aliasing을 억제한 뒤 내부 표현이 크게 달라진다.
2 연속 신호 해석을 통한 등변성
이 절에서는 이산적으로 샘플링된 feature map을 기저 bandlimited 연속 신호의 부호화로 재해석하여, 공간 등변성을 연속 영역에서의 교환 관계로 정식화한다. 또한 translation 및 rotation 등변성을 보존하기 위한 주파수 제약과 연산별 조건을 도출하며, 비선형성에는 새로 생성되는 주파수에 대한 명시적 제어가 필요함을 보인다.
- 연속 신호 해석: 픽셀 격자 값이 아니라 bandlimited 연속 신호를 실제 feature map으로 취급하고, 이산 배열은 그 부호화로만 사용한다.표현에는 Nyquist–Shannon framework 에 따른 이상적 보간과 샘플링을 사용한다.
- 등변성 조건: 연산은 연속 영역에서 공간 변환과 교환될 때 등변성을 가지며, 충실한 이산 표현을 위해 출력은 출력 bandlimit 안에 머물러야 한다.rotation에는 추가로 두 차원 모두에서 반지름 s/2의 원판형 spectral limit가 필요하다.
- Convolution: Convolution은 새로운 주파수를 도입하지 않으며 translation 등변성을 갖는다. rotation 등변성을 위해서는 실행 가능한 1×1 kernel을 포함해 방사 대칭인 이산 kernel이 추가로 필요하다.이러한 성질은 연속 convolution과 bandlimit 보존 해석에서 따른다.
- Upsampling과 downsampling: 이상적 upsampling은 샘플링 레이트를 높이면서 연속 신호를 보존하는 반면, downsampling은 충실한 표현을 보존하기 위해 더 성긴 이산화 전에 low-pass filter를 적용해야 한다.두 연산 모두에서 translation 등변성은 자동으로 성립한다. rotation 등변 downsampling에는 방사 대칭의 원판형 frequency response가 필요하다.
- 비선형성: 비선형성은 새로운 주파수를 생성하는 유일한 primitive operation이므로, 더 낮은 cutoff를 갖는 reconstruction filter로 각 generator layer가 도입하는 새 정보를 정밀하게 제어할 수 있다.이 filtering은 최종 이산화 전에 추가되는 주파수 범위를 명시적으로 제어한다.
3 Generator network에 대한 실제 적용
StyleGAN2 generator를 Fourier-feature 입력, signal-processing 변경, 제어된 layer 수정으로 translation- 및 rotation-equivariant architecture로 변환한다. 이러한 변경으로 equivariance가 향상되지만, boundary 및 upsampling 개선은 config E에서 16% FID 절충을 초래한다.
- 3 Generator network에 대한 실제 적용: 실제 목표는 모든 synthesis layer가 continuous translation과 rotation에 equivariant하도록 만들어, 더 미세한 detail이 더 거친 local feature와 함께 변환되도록 하는 것이며, discriminator는 변경하지 않는다.Figure 3의 configuration을 통해 generator를 단계별로 평가한다.
- Input representation: StyleGAN2의 학습된 4×4 constant를 고정된 Fourier feature로 대체하면 정확한 continuous input transformation이 가능해지고 FID가 소폭 향상된다.주파수는 circular band fc = 2 안에서 균일하게 sampling되며 spatially infinite map을 정의한다.
- Input representation: Per-pixel noise를 제거하면 자연스러운 transformation hierarchy를 지원하지만 FID에는 거의 영향을 주지 않으며, 이것만으로는 equivariance를 향상시키지 않는다.의도한 hierarchy를 위해서는 각 feature의 정확한 sub-pixel position이 underlying coarse feature에서 계승되어야 한다.
- Normalization and simplification: Config D는 각 convolution 전에 normalization을 적용하고 여러 StyleGAN2 component를 제거하여 translation equivariance를 소폭 향상시키면서 FID를 기존 StyleGAN2 수준으로 회복한다.또한 mapping-network depth를 줄이고 mixing과 path-length regularization을 비활성화하며 output skip connection을 제거한다.
- Boundaries and upsampling: Config E는 10-pixel canvas margin을 추가하고 bilinear upsampling을 windowed sinc filter로 대체한 뒤 translation equivariance를 향상시키지만 FID를 16% 절충한다.더 작은 resampling filter는 equivariance를 저해하는 반면, 더 큰 filter는 주로 training time을 증가시킨다.
- Alias-free generator architecture: 최종 alias-free generator는 Fourier feature, normalization, modulated convolution, filtered nonlinearity를 결합하며, 새로운 layer specification이 translation equivariance를 추가로 향상시킨다.Config T는 남은 artifact를 제거하며, output resolution에 따라 layer 수를 고정할 수 있다. Figure 4는 architecture를 묘사한다.
4 결과
여섯 데이터셋에서 StyleGAN3-T와 StyleGAN3-R은 FID에서 StyleGAN2에 필적하는 결과를 내며, FID 기준으로 동등한 성능을 보인다. 또한 동반 영상은 texture sticking 문제가 해결되었음을 보여준다. 결과는 alias-free network가 surface detail 합성에 중요한 phase-encoding feature map과 positional pattern을 학습한다는 점도 보여준다.
- 결과: StyleGAN3-T와 StyleGAN3-R은 여섯 데이터셋의 FID에서 StyleGAN2에 여전히 필적하며, 해당 metric 기준으로 동등한 성능을 보인다.평가에는 standard 및 unaligned FFHQ와 METFACES, 적절히 resampling된 AFHQ, 그리고 BEACHES가 포함되며, Figure 5에 데이터셋 결과가 제시된다.
- 결과: 동반 영상은 StyleGAN3가 texture sticking을 해결하고, 일관된 3D 장면이라는 환상을 더 잘 유지하는 자연스러운 motion을 생성함을 보여준다.
- Ablation 및 비교: noise input을 다시 활성화하거나 StyleGAN2의 original layer specification을 사용하면 equivariance가 크게 저하되지만, mixing regularization은 부작용 없이 다시 활성화할 수 있다.명시적인 mixing regularization 없이도 style을 안정적으로 mixing할 수 있다.
- Ablation 및 비교: Lanczos filtering은 FID에서 여전히 경쟁력 있지만 rotation equivariance를 저하시키고, Gaussian filtering은 명확히 더 나쁜 FID를 내며, feature capacity를 두 배로 늘리면 training time이 almost 4×가 되는 대신 FID가 개선된다.Capacity를 절반으로 줄이면 high-level equivariance는 유지되지만 FID가 크게 저하된다.
- Internal representation: StyleGAN3에서는 일부 internal feature map이 signal magnitude가 아니라 phase를 encode하며, StyleGAN3-R은 surface detail을 합성하기 위한 더 명확한 emergent positional encoding pattern을 보인다.이러한 representation은 object surface에 detail을 합성하는 데 필요한 coordinate system을 제공한다.
5 한계, 논의 및 향후 연구
alias-free generator는 discriminator의 equivariance와 training data에 관한 가정에 얽힌 한계를 가지며, 여러 확장 방향이 아직 미해결 상태로 남아 있다. 또한 video artifact를 제거하면 생성 콘텐츠가 더 설득력 있거나 기만적으로 보일 수 있어 사회적 위험도 제기된다.
- 한계: Discriminator non-equivariance는 motion consistency를 제한할 수 있다. FFHQ의 치아가 머리가 회전할 때 제대로 움직이지 않는데, 이는 pixel location이 선호되기 때문일 가능성이 있다 [59].저자들은 generator에만 equivariant modification을 적용했으며, 이 실패의 원인이 discriminator에 있다고 추정한다.
- 한계: Badly aliased training data는 alias-free generator가 training data의 성격에 대해 암묵적인 가정을 하기 때문에 문제를 일으킬 수 있다.Point-sampled black-and-white cartoon은 대부분 black-or-white pixel과 톱니 모양의 edge를 생성하며, 이는 일반적으로 GAN이 학습하기 어려운 조건이다.
- 향후 연구: Future work에서는 hierarchical-synthesis-consistent noise를 다시 도입하고, path-length regularization을 개선하며, equivariance를 scaling, anisotropic scaling 또는 arbitrary homeomorphism으로 확장할 수 있다.제안된 path-length regularization은 인접한 feature가 함께 움직이도록 유도해야 하며, 이들의 움직임 자체를 완전히 억제해서는 안 된다.
- 향후 연구: Attention layer를 equivariant하게 만들려면 일시적으로 resolution을 높여야 할 수 있지만, attention complexity는 해결하기 어렵고 VQGAN과 같은 tokenizing transformer는 equivariance와 충돌할 수 있다 [68] [18].Tokenizing-transformer GAN을 equivariant하게 만들 수 있는지는 여전히 미해결 문제다.
- 사회적 영향: Alias-free video generation은 disinformation을 more convincing or deceptive하게 만들어 사회적 피해를 심화할 수 있으며, 여기에는 fake portrait와 propaganda video가 포함된다.가능한 완화책으로는 model watermarking과 주요 social media site에서의 대규모 authenticity assessment가 제안된다 [67].
부록 · A 추가 결과
추가 결과는 테스트한 데이터셋 전반에서 StyleGAN3가 StyleGAN2의 FID를 유지하면서 motion-consistent detail을 크게 개선하고 유사한 training dynamics를 보존함을 보여준다. Supplementary videos와 analyses는 practical equivariance quality, semantic style mixing, 그리고 noise inputs 제거와 관련 있을 가능성이 있는 BEACHES 특화 한계 [34]도 입증한다.
- A 추가 결과: StyleGAN2와 StyleGAN3-T/R은 truncation 없이 FFHQ-U, METFACES-U, AFHQV2, BEACHES 네 데이터셋에서 유사한 FID를 달성한다.네 데이터셋 모두의 uncurated sample sets는 Figures 7–10에 제시되어 있다.
- A 추가 결과: BEACHES에서는 StyleGAN3의 가능한 한계가 나타난다. generators가 scene layouts를 제대로 생성하는 경우가 더 적어 보이며, 이는 noise inputs 제거로 capacity가 random-number generation에 집중되기 때문일 가능성이 있다 [34].이 설명은 의심되는 가능성으로 제시되며, 저자들은 equivariance를 깨뜨리지 않고 noise를 다시 도입하는 일을 향후 과제로 남긴다.
- A 추가 결과: Interpolation videos는 METFACES와 AFHQV2에서 StyleGAN2의 detail이 pixel coordinates에 고정된 채 남는 경우가 많은 것과 달리, StyleGAN3의 detail이 묘사된 objects와 함께 움직임을 보여준다.예시에는 brushstrokes, cracked paint, fur motion이 포함된다.
- A 추가 결과: FFHQ cinemagraphs에서 StyleGAN3는 StyleGAN2보다 눈에 띄게 더 coherent한 facial motion을 생성한다. StyleGAN2에서는 facial hair와 skin texture가 불쾌하게 고정되는 현상이 나타난다.이 cinemagraphs는 latent walks와 StyleCLIP global directions [25] [52] [46]를 사용해 작은 규모의 head movement와 facial animation을 모사한다.
- A 추가 결과: EQ-T videos는 ∼50 dB를 넘는 PSNR 값이 high-quality로 보이는 반면, ∼40 dB 안팎의 EQ-R 값은 양호해 보임을 보여준다.이 videos는 Figures 3과 5에 보고된 equivariance PSNR measurements의 practical relevance를 보여준다.
- A 추가 결과: Style mixing regularization은 StyleGAN3에서도 유사하게 계속 작동한다. coarse layers는 주로 pose와 shape를 제어하고, fine layers는 주로 coloring과 더 세밀한 facial features를 제어한다.Hand-picked examples는 불완전하지만 인식 가능한 layer-specific inheritance를 보여준다. 해당 examples에는 mixing regularization을 사용하지 않았다 [34].
- A 추가 결과: StyleGAN3의 translation과 rotation equivariance는 training dynamics를 크게 변화시키지 않는 것으로 보이며, convergence curves는 Karras et al. [34] [32]의 결과와 유사하게 유지된다.Figure 12는 기존 결과와 함께 주요 translation- 및 rotation-equivariant configurations T와 R을 비교한다.
- A 추가 결과: Supplementary analyses에는 border-induced FFT artifacts를 줄이기 위한 windowed, whitened average power spectra와 generator nonlinearity의 animated visualization이 포함된다.power-spectrum procedure는 axis-aligned cross artifact를 생성하는 sharp image-border step을 제거한다.
B 데이터셋 … C.4 2차원 필터
이 논문은 alias-free 학습에 맞춘 비정렬 및 재구축 데이터셋을 소개한 뒤, generator resampling을 위한 Kaiser 기반 1차원 및 2차원 필터를 제시한다. 이 필터는 sampling geometry를 보존하고 attenuation을 제어하며, rotation equivariance에 필요한 경우 radial symmetry를 사용한다.
- B.1 FFHQ-U와 MetFaces-U: FFHQ-U와 MetFaces-U는 축 정렬된 무작위 이동 crop rectangle을 통해 자연스러운 카메라 및 머리 기울기 변화를 보존하는 재구축 비정렬 변형이다.변경된 데이터셋은 원본 raw image와 facial-landmark metadata를 사용하고, 원래 image 수와 사양을 보존하며, public release에 재현성 코드를 포함한다.
- B.2 AFHQv2: AFHQv2는 Lanczos resampling으로 데이터셋을 재구축해 pixel-level downsampling artifact를 수정하며, 경미한 기술적 제외 후 15803 images가 남는다.원래 artifact는 sharp stair-step aliasing을 직접 pixel grid에 접근하지 않고 재현하기 어려워 convergence 문제를 일으켰다.
- B.3 Beaches: BEACHES에는 20155개의 라이선스된 512×512 해변 사진이 포함되지만, 전체 training data와 pretrained model은 재배포할 수 없다.Training image는 Getty Images가 제공했으며, 데이터셋은 proprietary하다.
- B.4 License: 데이터셋에는 source-specific license가 적용된다. FFHQ는 명시된 image license와 함께 Creative Commons BY-NC-SA 4.0을 사용하고, METFACES는 CC0 image와 함께 Creative Commons BY-NC 2.0을 사용하며, original AFHQ는 Creative Commons BY-NC 4.0을 사용한다.이 license는 명시된 경우 각각 NVIDIA Corporation, the Metropolitan Museum of Art, NAVER Corporation에 귀속된다.
- C Filter details; C.1 Kaiser low-pass filters; C.2 Selecting window parameters: Filter-details 절에서는 Kaiser window를 사용해 ideal response로부터 실용적인 low-pass filter를 구성하며, spatial extent와 transition-band 선택은 stopband attenuation과 상충한다.Discretization 후 tap을 명시적으로 합이 1이 되도록 정규화해 연속된 layer에서 누적되는 scaling error를 줄인다.
- C.3 Upsampling and downsampling: Factor m으로 upsampling할 때 tap 수를 비례해 늘려 input-relative spatial extent를 보존하고 감소한 transition-band attenuation을 보상한다.짝수 tap 수는 sample location을 1/(2s′)만큼 의도적으로 이동시켜 각 output group을 하나의 input interval을 세분하는 것으로 해석하는 방식과 일치시킨다. Downsampling은 filtering 후 각 group에서 m−1개 sample을 버리는 방식으로 수행된다.
- C.4 Two-dimensional filters: 2차원 구성은 일반적인 filtering에서는 separable이지만, rotation-equivariant 동작이 필요할 때는 비-radial symmetric response를 jinc 기반 radial low-pass filter로 대체한다.Radial filter는 jinc function을 사용하면서도 spectral property를 보존하기 위해 separable windowing scheme을 유지한다.
- C.4 Two-dimensional filters: 최종 filter design은 효율적인 upsampling과 대부분의 downsampling에 separable 2차원 filter를 사용하며, config R에서는 rotation-equivariant cutoff 동작을 보존하기 위해 radially symmetric 대안을 사용한다.Separable filter는 square frequency response를 가지며 모든 upsampling filter와 configs A–T의 downsampling에 사용된다. 반면 config R은 마지막 두 critically sampled layer를 제외하고 radial filter를 사용한다.
C.5 대안 필터 … D.2 일반적인 업샘플링 배율을 위한 최적화
이 논문은 대안적인 reconstruction filter를 평가하고, fused CUDA kernel, 특화된 gradient, 일반적인 sampling factor를 위한 최적화를 통해 filtered nonlinearity를 효율적으로 구현한다. Kaiser-filter 비교에서는 일치하는 cutoff 가정을 사용하며, CUDA 설계는 메모리 트래픽과 중복 계산을 줄인다.
- C.5 대안 필터: Kaiser filter는 Lanczos 및 Gaussian 대안과 비교되며, 비교 가능한 평가를 위해 암묵적 cutoff frequency 0.5와 impulse-response scaling을 사용한다.prototype kernel에는 명시적인 cutoff-frequency 제어가 없다.
- C.5 대안 필터: 비교에서는 Lanczos extent를 a = 2로, Gaussian standard deviation을 σ = 0.4로 설정하며, 이는 테스트한 값 전반에서 합리적으로 잘 작동하는 선택이다.계산량을 제한하기 위해 Gaussian support는 |x| > 8/s에서 잘라내지만, response가 이미 0에 가까워 실제 영향은 무시할 수 있다.
- C.5 대안 필터: Gaussian filter는 radially symmetric하므로 rotation equivariance에 적합한 반면, Lanczos 대안은 rotation-equivariant configuration R에서 동일한 separable filter를 사용한다.Lanczos에는 널리 인정되는 radially symmetric counterpart가 없다.
- D filtered nonlinearity를 위한 Custom CUDA kernel: custom CUDA kernel은 input, upsampling, nonlinearity, downsampling을 하나로 융합하고, intermediate computation을 on-chip shared memory에 유지한 뒤 최종 output만 기록한다.kernel은 CUDA thread block에 걸쳐 output feature map을 tile 단위로 처리한다. separable filter는 순차적인 1D convolution을 사용하고, non-separable filter는 단일 2D convolution을 사용한다.
- D.1 Gradient computation: Gradient computation은 phase를 반전하고 upsampling 및 downsampling parameter와 filter를 서로 교환함으로써 연산의 near self-adjoint structure를 활용한다.남은 과제는 upsampled resolution에서 평가되는 nonlinearity다.
- D.1 Gradient computation: Leaky ReLU gradient는 input-sign information만 저장하여 메모리를 절약하며, 16-bit execution에서는 clamping도 추가로 기록하여 clamped output이 zero gradient를 받도록 한다.이 특화 방식은 naïve한 일반 해법에 필요한 full high-resolution nonlinear input의 저장을 피한다.
- D.2 일반적인 업샘플링 배율을 위한 최적화: Figure 14는 sampling-factor 조합과 separable 또는 non-separable filter 전반에서 optimized kernel을 native PyTorch와 비교하며, forward 및 gradient-related case를 포함한다.테스트한 configuration에는 NVIDIA Titan V GPU에서의 2×/2×, 4×/2×, 2×/4× upsampling/downsampling 조합이 포함된다.
- D.2 일반적인 업샘플링 배율을 위한 최적화: 2× 및 4× upsampling에서는 인접한 여러 output을 함께 계산하여 redundant shared-memory load를 제거하고, instruction count를 각각 거의 25% 및 최대 37.5% 줄인다.이 최적화는 separable 및 non-separable filter 모두에 적용된다.
E 등변성 지표 … E.3 회전
이 논문은 정수 및 분수 평행이동과 임의 회전에 대한 PSNR 기반 등변성 지표를 정의하고, 각 지표의 샘플링 절차와 subpixel 및 회전 resampling에서 발생하는 한계를 제시한다. 회전 지표는 연속 회전 전후에 filtering을 적용해 이방성 이산 이미지 bandlimit 문제를 다루며, 실용적인 유한 지지 근사를 사용한다.
- E.1 정수 평행이동: EQ-T는 평행이동한 generator 출력과 입력 Fourier feature를 평행이동한 뒤 다시 생성한 출력 사이의 PSNR 일치도를 측정하며, 50,000개의 무작위 latent-code 및 정수 offset 샘플에 대해 평균을 낸다.각 이미지 차원에서 offset은 [-s_N/8, s_N/8] 구간에서 균일하게 샘플링하며, 비교는 서로 유효한 영역으로 제한한다.
- E.2 분수 평행이동: 완벽하게 정수 평행이동 등변적인 generator에서는 EQ-T가 ∞dB로 수렴할 수 있지만, subpixel 동작을 무시하므로 aliasing과 관련된 실패를 놓칠 수 있다.이 한계는 정수 평행이동에는 완벽하게 등변적이지만 적절한 bandlimit을 갖지 않는 generator에도 적용된다.
- E.2 분수 평행이동: EQ-Tfrac는 연속적인 offset을 사용해 평행이동 테스트를 확장하며, Lanczos로 resampling한 reference image와 filter의 공간적 범위를 고려해 축소한 유효 영역을 사용한다.이 지표는 동일한 범위에서 offset을 균일하게 샘플링하고, partition of unity를 보장하도록 이산화한 Lanczos filter를 정규화한다.
- E.2 분수 평행이동: EQ-T와 EQ-Tfrac는 약 40 dB까지 합리적으로 일치하지만, 그 이후에는 subpixel resampling이 aliasing, ringing, 고주파 보존 사이의 균형을 요구하기 때문에 EQ-Tfrac가 50 dB 미만에서 포화된다.저자들은 이러한 결과로부터 G–R 구성이 필수적이라고 결론내린다…
- E.3 회전: 회전 resampling이 모호하고 이산 이미지의 bandlimit이 방사 대칭이 아니므로, 임의 회전에 대한 등변성은 약 40 dB를 넘어 완벽하게 측정할 수 없다.45° 회전은 직사각형 입력 bandlimit을 마름모 형태의 spectrum으로 바꾸어, 초과 주파수와 누락된 대각선 주파수를 모두 만든다.
- E.3 회전: EQ-R는 연속 Fourier feature 회전과 고품질 reference image 회전 및 pseudo-rotation을 비교하며, 0°에서 360°까지의 각도를 균일하게 샘플링한다.pseudo-rotation은 실제로 이미지를 회전시키지 않고 회전한 것처럼 frequency content를 변형하며, 비교에는 두 filter footprint가 함께 제한하는 유효 영역을 사용한다.
- E.3 회전: 이상적인 회전 연산자는 연속 이미지를 복원하고, 이를 회전한 다음, 출력 bandlimiting을 적용하고 resampling한다. 이때 회전 filter는 입력 spectrum과 회전된 직사각형 spectrum의 다각형 교집합이다.aliasing을 제거하려면 회전 전후에 filtering이 필요하지만, 결과에는 여전히 표현 가능한 최고 대각선 주파수가 포함되지 않는다.
- E.3 회전: 실용적인 회전 근사는 이상적인 filter를 유한 지지 Lanczos filter로 대체하고, m = 4배 upsampling한 뒤 bilinear lookup으로 회전된 sampling을 근사한다.pseudo-rotation은 관련된 이산 filter와의 convolution으로 구현된다.
F 구현 세부 사항
Alias-free generator는 대부분의 training 및 architecture 세부 사항을 유지하면서 StyleGAN2-ADA를 수정해 구현했다. 실험은 명시된 DGX-1 설정에서 수행했으며, 공식 Inception 기반 FID 평가를 사용했고 code와 pretrained model을 공개했다.
- F 구현 세부 사항: 구현은 공식 PyTorch StyleGAN2-ADA codebase를 기반으로 하며 discriminator architecture [34], weight demodulation [34], equalized learning rates [31], minibatch standard deviation [31], exponential moving averages [31], mixed-precision training [32]을 유지한다.
- F 구현 세부 사항: 실험은 PyTorch 1.7.1, CUDA 11.0, cuDNN 8.0.5를 사용해 8 Tesla V100 GPUs가 장착된 NVIDIA DGX-1에서 수행했다.FID는 공식 pretrained Inception network를 사용해 50k generated images와 모든 training images 사이에서 계산했다.
- F 구현 세부 사항: 구현과 pretrained models는 공식 StyleGAN3 repository에서 publicly available하다.
F.1 Generator 아키텍처
Generator 아키텍처는 신호 크기를 안정화하고 Fourier feature의 이미지별 회전 및 평행이동을 가능하게 하며, 샘플링 해상도에 따라 layer filter parameter를 유연하게 배치한다. 이러한 변경은 해당 연속 기하 변환을 해석적으로 보존하고, critically sampled layer를 통해 주파수 콘텐츠를 제한한다.
- 정규화: 아키텍처는 입력 신호 크기의 장기 exponential moving average를 추적하여 StyleGAN2 [34]의 output skip connection을 제거한 뒤 layerwise drift를 없앤다.이 보정이 없으면 신호 크기가 drift하여 실행마다 변동성이 커지고, 때때로 mixed-precision 수치 문제가 발생한다.
- 변환된 Fourier feature: 추가 affine layer는 w를 t = (r_c, r_s, t_x, t_y)로 매핑하여 각 이미지가 입력 Fourier feature에 학습된 회전 및 평행이동을 적용할 수 있게 한다.변환은 t = (1, 0, 0, 0)으로 초기화되며, 이후 정규화된 성분이 canvas 중심을 기준으로 한 회전과 그에 이은 평행이동을 정의한다.
- 변환된 Fourier feature: 이렇게 얻은 기하 변환은 Fourier-feature phase와 2차원 frequency를 수정하여 해석적으로 구현되며, 이는 z_0의 연속 표현을 변환하는 것과 동등하다.처음 두 성분으로 정규화하면 weight modulation 및 demodulation [34]과 유사하게 w의 크기와 무관한 변환이 된다.
- 유연한 layer specification: 유연한 configuration은 첫 번째 critically sampled layer까지 geometric progression으로 cutoff 및 stopband frequency를 정의한 다음, 이를 바탕으로 sampling rate와 transition band를 도출한다.N = 14 layer와 N_crit = 2인 경우, sampling rate는 출력 해상도를 초과하지 않으면서 s[i] ≥ 2f_t[i]를 만족하도록 2의 거듭제곱으로 올림한다.
F.2 하이퍼파라미터 및 학습 설정 · F.3 G-CNN 비교
학습에는 baseline에서 도출한 하이퍼파라미터와 데이터셋별 augmentation, transfer learning, 용량 조정이 사용되었으며, config R에서는 초기 blur를 점진적으로 제거했다. G-CNN 비교에서는 config T를 p4-대칭 convolution으로 확장해, 임의의 각도가 아닌 직각 회전에 대해서만 equivariance를 제공했다.
- F.2 하이퍼파라미터 및 학습 설정: 모든 실험은 8 GPUs를 사용했으며, discriminator가 scratch 학습에서는 25M real images, transfer learning에서는 5M을 관측할 때까지 학습했다.Baseline 실험에서는 고해상도 데이터셋에 StyleGAN2 config F [34]를, ablation에는 ADA 256×256 baseline config [32]를 사용했다.
- F.2 하이퍼파라미터 및 학습 설정: 대부분의 하이퍼파라미터는 baseline 설정에서 변경 없이 상속했지만, configs C와 D에서는 noise, path-length, mixing regularization을 비활성화했다.Config D에서는 StyleGAN2-ADA 권고에 따라 mapping-network 깊이도 2로 줄이고 minibatch standard-deviation group size를 4로 설정했다.
- F.2 하이퍼파라미터 및 학습 설정: 모든 실험에서 horizontal-flip augmentation을 활성화했으며, ADA는 FFHQ와 FFHQ-U를 제외하면 default settings를 사용했다. METFACES 데이터셋에는 대응하는 최상의 FFHQ snapshot에서 transfer learning을 적용했다.이러한 augmentation 선택은 수평 대칭성을 반영했으며 discriminator의 과적합을 줄이는 것을 목표로 했다.
- F.2 하이퍼파라미터 및 학습 설정: Generator capacity는 StyleGAN2의 inverse-resolution feature-map 규칙을 따랐으며, baseline 설정에서는 출력 해상도에 따라 Cmax = 512와 Cbase = 214 또는 215를 사용했다.Capacity 파라미터는 해상도 전반에서 generator의 전체 width를 제어했다.
- F.2 하이퍼파라미터 및 학습 설정: R1 regularization weight γ는 baseline 및 transfer 설정에 대해 데이터셋별 grid search로 선택했으며, 저해상도 ablation에서는 γ = 1로 고정했다.Baseline config B에서는 γ ∈ {1, 2, 5, 10, 20}을, configs T와 R에서는 γ = γ0 · N/M 조건에서 γ0 ∈ {0.0002, 0.0005, 0.0010, 0.0020, 0.0050}을 탐색했다.
- F.2 하이퍼파라미터 및 학습 설정: Config R에서는 σ = 10 pixels에서 시작해 첫 200k images 동안 0으로 ramping하는 Gaussian noise로 discriminator 입력을 blur 처리했다.이 blur는 ADA 이전에 적용해 초기의 고주파 과도 집중을 억제했으며, generator의 고주파 학습을 지연시킬 수 있었다.
- F.3 G-CNN 비교: Config R은 p4-symmetric group convolutions를 추가한 config T와 비교했으며, 이는 0°, 90°, 180°, 270° 회전에 대해서는 equivariance를 제공하지만 임의의 각도에는 제공하지 않는다.구현에서는 중간 synthesis activation에 size-4 group dimension을 추가하고 convolution weight에 대응하는 redundancy를 도입했다.
G 에너지 소비
프로젝트의 계산량과 전력 소비량은 각각 GPU-years와 megawatt hours로 측정했다. 총 약 225 MWh를 소비했으며, 이 중 약 70%는 탐색적 실행에 사용했다.
- G 에너지 소비: 프로젝트의 계산량과 전력 소비량을 single-GPU years와 전력 사용량으로 세분해 추적했다.계산 단위는 단일 NVIDIA V100 GPU에서의 GPU-years였으며, Green500 전력 측정 지침 을 따랐다.
- G 에너지 소비: 프로젝트의 계산량을 재현하려면 단일 NVIDIA V100 GPU에서 약 92년간 실행해야 했다.프로젝트는 단계별로 서로 다른 수의 NVIDIA DGX-1 시스템을 사용했다.
- G 에너지 소비: 프로젝트 전체에서 전력 225 MWh를 소비했으며, 약 70%는 탐색적 실행 중에 사용했다.탐색에는 새로운 구성, 중간 단계의 StyleGAN2-to-generator 구성, 주요 파라미터 ablation 개발이 포함됐다.