Source-linked AI summary
NAS-Driven Hardware Accelerator Exploration for Edge AI and Quantization Effects on the Pareto Space
Eleftherios Mylonas, Angelos Kouprizas, Michael Birbas, Alexios Birbas
TL;DR
검색 후 양자화가 NAS로 발견된 Pareto 구조에 미치는 영향은 특히 하드웨어 배포 측면에서 아직 충분히 규명되지 않았다. 이 논문은 Pareto-aware INT4 양자화와 하드웨어 매핑 탐색을 결합하고, FP32 zero-shot surrogate가 전용 INT4-trained surrogate보다 Pareto 공간 커버리지에서 우수함을 보인다.
문제
전체 NAS 탐색 공간 규모에서 post-training quantization이 상대적 아키텍처 순위와 Pareto 구조에 미치는 영향은 아직 규명되지 않았다.
방법
3단계 workflow는 하드웨어 비종속 NAS, feedback filtering을 적용한 Pareto-aware INT4 양자화, 그리고 evolutionary CGRA hardware design-space exploration을 수행한다.
결과
INT4 PTQ는 Pareto 구조를 재편하는 반면, FP32 zero-shot surrogate는 두 가지 search strategy에서 전용 INT4-trained surrogate보다 Pareto 공간 커버리지에서 우수하다.
시사점 및 한계
이 결과는 상당한 INT4 유발 Pareto 공간 재편에도 불구하고 FP32 surrogate 순위가 서로 다른 precision regime 간에 효과적으로 전이될 수 있음을 시사한다.
시사점 및 한계
이 실증 연구는 INT4 PTQ로 제한되며, 더 복잡한 mixed-precision scheme으로의 확장은 향후 과제로 남는다.
Abstract
from arXiv · showhide
Edge AI deployment demands neural architectures that are simultaneously accurate, computationally efficient, and hardware-deployable - a challenge addressed by hardware-aware Neural Architecture Search (NAS). While recent works incorporate quantization directly into the NAS loop, these approaches expand search complexity and tightly couple architecture and quantization design. The simpler post-search quantization strategy has received little analytical attention: the effects of Post-Training Quantization (PTQ) on the NAS-discovered Pareto structure remain uncharacterised, and no framework combines quantized architecture mapping onto reconfigurable accelerators with automated hardware exploration. This paper addresses both gaps. First, a three-stage pipeline is proposed: a hardware-agnostic Pareto rank surrogate frontend on NAS-Bench-201, a quantization bridge with Pareto-aware filtering and feedback control, and an evolutionary Domain Space Exploration (DSE) backend on CGRA4ML for optimal hardware mapping. Second, an empirical study characterises how INT4 PTQ perturbs the NAS-Bench-201 Pareto space through formal stability metrics on ground-truth data for all 15,625 architectures, and demonstrates that an FP32 zero-shot surrogate outperforms a dedicated INT4-trained surrogate in Pareto space coverage across two standard search strategies.
I. 서론
Edge AI는 연산, 메모리, 전력 제약 아래에서 정확하고 효율적이며 배포 가능한 모델을 요구하며, 이는 hardware-aware Neural Architecture Search (NAS)의 필요성을 높인다. 본 연구는 NAS-Bench-201 아키텍처 선택, INT4 post-training quantization 분석, 진화적 CGRA 하드웨어 매핑을 결합한 3단계 워크플로를 제안한다.
- 동기: Edge AI로의 전환은 연산, 메모리, 전력 효율에 대한 요구를 높이는 동시에 프라이버시, 낮은 추론 지연시간, 자율 동작을 요구한다.이는 배포 환경이 중앙집중형 cloud AI에서 자원 제약이 있는 edge device로 이동하면서 발생하는 제약이다.
- 동기와 문제 정의: 본 연구는 주로 FP32 정확도에 초점을 맞춘 기존 연구를 넘어 하드웨어 성능을 고려함으로써 제한적인 NAS benchmark 범위를 보완한다.서론은 제한적인 task 범위와 하드웨어 성능 metric의 간과를 Edge AI 배포의 미해결 문제로 규정한다.
- 제안 워크플로: 제안하는 3단계 hardware-aware NAS 절차는 full-precision 후보를 선택하고, quantization 이후 아키텍처를 필터링하며, 살아남은 후보에 대해 진화적 CGRA 매핑을 탐색한다.frontend는 NAS-Bench-201 [3]과 CIFAR-10 으로 학습하고, backend는 각 생존 아키텍처에 맞는 CGRA 아키텍처를 최적화한다.
- Quantization 연구: 본 연구는 형식적 Pareto 안정성 metric과 quantization-aware surrogate transferability 분석을 사용해 15,625개의 NAS-Bench-201 아키텍처 전체에 INT4 Post Training Quantization을 적용해 평가한다.분석에는 ground-truth quantized data를 사용하며, quantization으로 유발된 distribution shift에서 FP32 Pareto-rank 예측을 조사한다.
- 하드웨어 탐색: CGRA4ML [5] 하드웨어 DSE 환경은 analytical performance oracle과 normalized scalar fitness를 사용해 Pareto 필터링을 통과한 quantized architecture의 최적 매핑을 탐색한다.fitness function은 하드웨어 탐색을 위해 세 개의 normalized term을 결합한다.
II. 이론적 배경 · A. NAS
Neural Architecture Search (NAS)는 search space, search strategy, performance estimation을 결합해 neural network 설계를 자동화한다. NAS-Bench-201 [3] 및 NAS-Bench-360 과 같은 NAS benchmark는 사전 계산된 architecture metric을 통해 재현 가능한 평가를 지원한다.
- A. NAS: NAS는 정의된 candidate search space 내에서 neural network architecture 설계를 자동화한다.Search space는 고정된 operation과 connectivity pattern을 사용하는 cell-based architecture로 구성할 수 있다.
- A. NAS: 일반적인 NAS 절차는 search space, architecture를 sampling하는 전략, performance estimation strategy를 결합한다.Search strategy에는 evolutionary algorithm과 reinforcement learning이 포함된다.
- A. NAS: NAS는 search space 전반에서 validation accuracy를 최대화하는 architecture와 이에 대응하는 weight를 찾는다.최적화에서는 candidate architecture와 weight parameter를 모두 고려한다.
- A. NAS: NAS benchmark는 정의된 search space에서 사전 학습된 architecture와 관련 metric의 모음을 제공한다.모든 candidate를 처음부터 학습하는 데 드는 감당하기 어려운 비용 없이 재현 가능한 비교를 지원한다.
- A. NAS: NAS-Bench-201 [3]과 NAS-Bench-360 은 architecture-search 평가에 널리 사용되는 benchmark다.이 benchmark들은 특정 search space 내 비교를 위해 architecture와 그 metric을 정리한다.
- A. NAS: Benchmark lookup table을 사용하면 NAS method가 사전 계산된 결과를 조회해 candidate architecture를 평가할 수 있다.이를 통해 각 architecture를 재학습하지 않고도 성능을 비교할 수 있다.
B. Hardware-aware NAS
Hardware-aware NAS는 하드웨어 성능 지표에 대한 다목적 최적화로 아키텍처 탐색을 정식화하며, 계산 제약을 둘 수도 있다. [7], 과 같이 Pareto rank surrogate를 사용해 후보 성능을 추정하면서 비지배 Pareto-front 아키텍처를 찾는다.
- B. Hardware-aware NAS: Hardware-aware NAS는 n개의 하드웨어 성능 지표에 대한 다목적 최적화로 아키텍처 탐색을 다룬다.NAS benchmark에서 후보마다 가중치를 고정하면, 이 정식화는 각 지표에 대해 각 아키텍처를 평가하는 문제로 축소된다.
- B. Hardware-aware NAS: 다목적 정식화에는 사용자가 지정한 계산 예산과 원하는 성능 지표를 제약 조건으로 포함할 수 있다.
- B. Hardware-aware NAS: Pareto front는 다른 어떤 해도 해당 해를 지배하지 않으므로 더 이상 최적화할 수 없는 해들의 집합이다 [7],.아키텍처가 다른 아키텍처를 지배하려면 요구되는 목적 조건이 충족되어야 한다.
- B. Hardware-aware NAS: Pareto rank predictor 또는 Pareto rank surrogate는 Pareto-front 아키텍처를 탐색하는 NAS 전략의 성능을 추정한다.이 논문은 Pareto rank surrogate와 적절한 아키텍처 인코딩을 다룬 선행 연구에 기반한다.
C. 최신 기술 및 관련 연구
기존 연구는 전용 benchmark와 quantization-search 공동 최적화 방법을 통해 hardware-aware NAS를 발전시켰지만, search 이후 quantization이 Pareto ranking과 구조에 미치는 영향은 충분히 규명하지 못했다.
- Hardware-aware NAS benchmark: HW-NAS-Bench는 6개 hardware platform에서 latency와 energy를 측정해 NAS-Bench-201을 확장하며, search 중 실제 hardware에 접근하지 않고도 hardware-aware architecture 비교를 가능하게 한다.해당 metric은 FP32에서 수집되므로 quantization과 이것이 Pareto ranking에 미치는 영향은 연구되지 않았다.
- Quantization-aware NAS: HAQ, APQ, SimQ-NAS [11]는 layer bit-width, architecture, quantization policy를 탐색함으로써 quantization을 NAS에 직접 통합한다.이러한 접근법은 search 이후 quantization이 아니라 search 중 quantization을 다룬다.
- Research gap: 기존 연구는 PTQ가 NAS로 발견된 FP32 architecture의 Pareto 구조를 어떻게 교란하는지 규명하지 않았으며, 이러한 교란에 대한 formal stability metric도 제시하지 않았다.Quantization-NAS 공동 최적화 방법은 search 이후 quantization을 사용하지 않고, hardware-aware benchmark는 이를 무시하며, deployment 중심 연구는 상대적인 architecture ranking을 분석하지 않은 채 PTQ를 적용한다.
III. 시스템 개요 · A. Stage I: Hardware-Agnostic Frontend · B. Stage II: Quantization Bridge
제안하는 NAS 시스템은 NAS와 하드웨어 가속기 최적화를 분리하는 3단계 NAS-then-quantized 파이프라인을 사용한다. Frontend는 하드웨어와 무관하게 Pareto 순위를 예측하고, Quantization Bridge는 후보 아키텍처를 양자화하고 재순위화한 뒤 필터링한다.
- III. 시스템 개요: 전체 시스템은 3단계로 구성되며 배포 지향 설계를 위해 NAS-then-quantized 접근법을 따른다.이 선택은 모델 최적화와 하드웨어 가속기 최적화를 분리하고, NAS와 하드웨어 탐색을 위한 해법을 각각 구성할 수 있게 한다.
- III. 시스템 개요: 이 파이프라인은 NAS와 하드웨어 설계 탐색을 분리하여 전용 frontend와 backend 해법을 구성할 수 있게 한다.이러한 분리는 두 최적화 문제를 분리하면서 배포를 단순화하기 위한 것이다.
- A. Stage I: Hardware-Agnostic Frontend: Stage I인 Hardware-Agnostic Frontend는 주요 neural architecture search 절차를 수행한다.이는 NAS-Bench-201 search space를 대상으로 HW-PR-NAS 를 재설계한 것에 기반한다.
- A. Stage I: Hardware-Agnostic Frontend: Frontend는 NAS-Bench-201만을 대상으로 architecture encoding module을 학습하고, Pool output layer를 추가하여 LSTM predictor를 개선한다.이러한 변경은 예측된 Pareto 점수와 실제 아키텍처 순위 사이의 Kendall’s Tau 상관을 높이기 위한 것이다.
- B. Stage II: Quantization Bridge: Stage II인 Quantization Bridge는 하드웨어와 무관한 NAS와 하드웨어 인식 시스템 구성요소 사이를 중개한다.후보 아키텍처의 양자화에는 오픈소스 AMD-Xilinx Brevitas 도구를 사용한다.
- B. Stage II: Quantization Bridge: Bridge는 양자화된 후보의 순위를 다시 매기고, 양자화 이후 Pareto space의 이동으로 지배되거나 바람직하지 않게 된 아키텍처를 필터링한다.따라서 Bridge의 역할에는 양자화, Pareto 재순위화, 최종 후보 필터링이 포함된다.
C. Stage III: Hardware-Aware Backend
Stage III에서는 CGRA4ML을 사용해 살아남은 quantized model을 맞춤형 CGRA accelerator architecture에 매핑한다. QONNX-to-QKeras translation layer가 호환성을 지원하며, evolutionary search가 analytical performance estimate를 바탕으로 configuration을 선택한다.
- Hardware-Aware Backend: Backend는 CGRA4ML을 통해 survivor model을 맞춤형 deployment-ready CGRA design으로 매핑하며, QONNX-to-QKeras translation layer가 Brevitas quantized model 을 지원한다.CGRA4ML은 QKeras model을 유연한 CGRA design으로 compile하기 위한 Python 및 SystemVerilog script로 구성된다.
- Hardware-Aware Backend: Evolutionary algorithm은 CGRA4ML의 analytical oracle을 사용해 normalized latency, PE idle ratio, array area를 최소화한다. 이 oracle은 RTL generation이나 synthesis 없이 clock cycle과 PE utilization을 예측한다.Oracle은 각 candidate configuration에 대한 idle PE ratio도 반환한다.
- Hardware-Aware Backend: Search는 tournament selection, constraint-preserving mutation, elite carryover를 사용하며, fitness improvement가 8 generations 동안 10^-4 미만으로 유지되면 중단한 뒤 winning configuration을 export한다.Fitness weight는 α=0.2 및 β=0.1이며, λ가 hard constraint penalty를 적용한다. Export된 design은 FPGA 또는 ASIC flow에 투입할 수 있다.
IV. 실험 결과 · A. Quantization Scheme Selection
평가는 architecture size와 complexity를 사용해 복잡도에 강건한 post-training quantization 구성을 선택하며, 유망한 scheme 대부분이 8-bit activation quantization을 사용함을 확인한다. 통계 분석은 INT8 PTQ를 우선 전략으로 추가 지지한다.
- IV. 실험 결과: 연구는 제안한 three-stage hardware-aware NAS system의 설계를 제시한 뒤 이를 평가한다.이 평가는 quantization-strategy selection 실험의 맥락을 제공한다.
- A. Quantization Scheme Selection: architecture size와 complexity를 selection criteria로 사용해, no-finetuning 테스트 325건에서 유망한 PTQ configuration 6개를 선택했다.이 configuration들은 Table I에 요약되어 있으며, 기여도가 동일하게 중요하다고 식별된 Brevitas PTQ feature 6개를 사용한다.
- A. Quantization Scheme Selection: 선택된 scheme 대부분은 8-bit activation quantization을 사용하며, 이는 테스트한 전략 중 INT8 PTQ가 우수함을 보여준다.INT8에 대한 선호는 서로 다른 INT8 PTQ 실행에 대한 통계 분석으로도 뒷받침된다.
B. 모델 복잡도에 따른 Quantization Error · C. Pareto Front 및 Surrogate Performance에 대한 Quantization의 영향
INT4 quantization은 복잡도가 낮은 NAS-Bench-201 모델에서 가장 큰 손상을 유발하며, convolutional structure는 quantization noise를 완화할 수 있다. INT4가 efficient frontier를 재구성하더라도 FP32 Pareto structure와 surrogate ranking은 zero-shot transfer가 INT4-specific surrogate보다 search hypervolume에서 우수할 만큼 충분한 상관성을 유지한다.
- B. 모델 복잡도에 따른 Quantization Error: 7–15 MFLOPs 모델은 median INT4 accuracy가 약 5% 하락하며, 50%를 초과하는 degradation outlier도 다수 나타난다. 복잡도가 증가할수록 sensitivity는 점진적으로 감소한다.보고된 low-complexity 범위는 7–47 MFLOPs이며, 가장 큰 median degradation은 7–15 MFLOPs에 집중된다.
- B. 모델 복잡도에 따른 Quantization Error: NAS-Bench-201의 거의 균일한 primitive-operation distribution은 heterogeneous cell을 형성하며, 이 안에서 none과 skip connect는 quantization error를 증폭시키는 반면 convolution은 high-frequency noise를 완화한다.이 lowpass effect는 nor conv 3x3 operation에서 가장 두드러진다.
- C. Pareto Front 및 Surrogate Performance에 대한 Quantization의 영향: migrated FP32 Pareto front는 ground-truth INT4 front와 밀접하게 정렬되며, 이는 FP32 Pareto structure가 zero-shot INT4-aware search에서 상당 부분 보존됨을 나타낸다.분석에서는 true FP32 및 INT4 front, approximated front, 그리고 INT4에서 재평가한 migrated FP32 front를 비교한다.
- C. Pareto Front 및 Surrogate Performance에 대한 Quantization의 영향: surrogate의 KT correlation은 FP32에서 0.8352였으나 zero-shot transfer 후 INT4에서 0.7219로 감소하며, retraining 없이도 유의미한 predictive structure가 존재함을 나타낸다.해당 passage에서는 quantized fully-trained data를 사용한 fine-tuning도 평가했다고 서술하지만, 제공된 텍스트에는 그 결과가 제시되지 않는다.
- C. Pareto Front 및 Surrogate Performance에 대한 Quantization의 영향: FP32 zero-shot surrogate는 RS와 MOEA 두 search 모두에서 INT4-trained surrogate보다 normalized global hypervolume이 각각 12.26% 및 6.77% 더 높았다.비교에는 0.625–10 MFLOPs budget, 50 independent run, 300 sample을 사용한 RS, 250 query와 population 150을 사용한 MOEA가 적용되었다.
- C. Pareto Front 및 Surrogate Performance에 대한 Quantization의 영향: 0% front survival, 21.73% dominance-flip rate, 그리고 0.6655의 ground-truth KT는 INT4가 FP32 efficient frontier를 완전히 재구성하는 동시에 중간 수준의 ranking correlation은 보존함을 보여준다.dominance-flip rate는 FP32 dominance relationship의 대략 5개 중 1개가 INT4에서 변경됨을 의미한다.
D. 하드웨어 DSE 결과
Stage III DSE는 세 Pareto-front architecture를 동일한 최적 CGRA4ML configuration에 매핑한다. 이는 세 architecture가 반복되는 operator 구조를 공유하기 때문이다. Architecture 8592는 첫 번째 3×3 convolution 하나 때문에 clock count가 더 높다.
- D. 하드웨어 DSE 결과: 세 Pareto-front architecture는 Stage III DSE에서 동일한 최적 CGRA4ML configuration으로 수렴한다.이 결과는 Table IV에서 세 Pareto-front architecture에 대해 보고된다.
- D. 하드웨어 DSE 결과: 이 configuration은 15 cell recurrence에 걸쳐 반복되는 normal 1×1 convolution과 skip connection을 반영한다.이러한 공통 구조적 특징 때문에 세 architecture가 동일한 hardware configuration을 선택한다.
- D. 하드웨어 DSE 결과: Architecture 8592는 첫 번째 cell node에 단일 normal 3×3 convolution이 포함되어 있어 clock count가 더 높으며, 이 convolution의 workload는 recurrence 전반에서 kernel area에 비례해 증가한다.3×3과 1×1의 kernel area 비율이 workload의 비례적 증가를 유발한다.
V. 결론
이 논문은 CGRA 기반 accelerator에서 edge AI 배포를 위한 3단계 hardware-aware NAS pipeline을 제시하고, INT4 PTQ가 NAS-Bench-201 Pareto space에 미치는 영향을 실증적으로 분석한다. INT4 PTQ는 Pareto structure를 완전히 재편하지만, FP32 zero-shot surrogate는 전용 INT4-trained surrogate보다 더 높은 Pareto space coverage를 달성한다.
- V. 결론: 제안하는 기여는 CGRA 기반 accelerator에서 edge AI 배포를 위한 3단계 hardware-aware NAS pipeline이다.
- V. 결론: INT4 PTQ는 NAS-Bench-201 Pareto structure를 완전히 재편한다.
- V. 결론: FP32 zero-shot surrogate는 Pareto space coverage에서 전용 INT4-trained surrogate보다 우수하다.이 결과는 더 정제된 FP32 training signal이 precision 전반에 걸쳐 효과적으로 전이됨을 시사한다.