Source-linked AI summary

FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

Gongwei Lee, Ji Liu, Juncheng Jia, Ji Wu

arXiv:2608.24945v1cs.LGcs.AIcs.DC

TL;DR

자원 제약 디바이스에 LLM을 배포하려면 quantization이 필요하지만, 기존 방법은 uniform bit width나 불충분한 sensitivity measure를 사용한다. FAMPWQ는 perturbation 기반 Fisher sensitivity와 PPO 기반 adaptive allocation을 결합해 7개 model과 5개 benchmark에서 7개 baseline을 능가하며, PPL이 최대 3.39 낮다.

  • 문제

    LLM quantization에는 compression constraint에서 accuracy degradation을 최소화하는 bit-width allocation이 필요하지만, 기존 sensitivity metric은 quantization-specific perturbation을 포착하지 못한다.

  • 방법

    FAMPWQ는 perturbation 기반 Fisher Information을 사용해 layer-wise quantization sensitivity를 측정하고, storage budget하에서 adaptive bit-width allocation을 생성하도록 PPO를 사용한다.

  • 결과

    FAMPWQ는 7개 model과 5개 benchmark에서 PPL, accuracy, LLM-as-a-judge comparison 기준으로 7개 baseline을 능가하며, PPL이 최대 3.39 낮다.

  • 시사점 및 한계

    FAMPWQ는 memory-constrained LLM deployment를 위한 3-bit compression frontier에서 특히 강한 이점을 보인다.

  • 시사점 및 한계

    Mixed-precision quantization은 heterogeneous bit width가 optimized uniform-precision kernel과의 호환성이 낮기 때문에 inference throughput을 줄일 수 있다.

Abstract

from arXiv · show

Recent years have witnessed remarkable achievements of Large Language Models (LLMs) in multiple domains, while the excessive resource requirements of LLMs hinder the deployment on resource-constrained devices. Although model quantization stands out as an effective approach, conventional quantization approaches typically incur severe performance degradation due to uniform bit-width or simple heuristic sensitivity evaluation. In this paper, we propose a novel Fisher information-based Adaptive Mixed Precision Weight Quantization approach, i.e., FAMPWQ, which performs layer-adaptive weight quantization for effective LLM inference on commodity GPUs. First, we propose a system model with a novel Fisher information metric to measure the layer-wise sensitivity to quantization. Second, we propose a reinforcement learning-based bit-width allocator in FAMPWQ, which generates an adaptive bit-width allocation strategy based on the Fisher information sensitivity metric. Extensive experiments on 7 models and 5 benchmarks demonstrate that FAMPWQ significantly outperforms 7 baseline approaches in terms of PPL (up to 3.39 smaller), accuracy (up to 6.87% higher), and LLM-as-a-judge comparison (up to 76% win rate).

1 서론

FAMPWQ는 quantization-specific Fisher sensitivity를 사용해 layer-adaptive mixed-precision weight quantization을 유도함으로써 자원 집약적인 LLM 배포 문제를 다룬다. 이 metric을 PPO 기반 bit-width allocation과 결합하며, 7개 model과 5개 benchmark에서 7개 baseline을 능가한다.

  • 선행 연구의 한계: Uniform bit-width 방법은 layer-wise sensitivity를 간과하며, weight magnitude나 raw gradient norm에 기반한 mixed-precision heuristic은 quantization으로 유발되는 성능 저하를 반영하지 못할 수 있다.기존 metric도 first-order statistic이나 perturbation이 가해지지 않은 weight에서의 curvature에 의존하기 때문에, bit-width-specific perturbation 하에서의 loss-surface geometry를 포착하지 못한다.
  • 동기: LLM layer는 heterogeneous quantization sensitivity를 보인다. attention value projection과 MLP down-projection은 redundant layer보다 민감도가 몇 자릿수 더 클 수 있다.소수의 민감한 layer를 공격적으로 quantization하면 model quality가 불균형적으로 저하되는 반면, 많은 layer는 영향이 거의 없이 극단적인 compression을 견딘다.
  • 방법: FAMPWQ는 fixed-memory LLM deployment를 위한 weight-only mixed-precision PTQ framework로, quantization-perturbation Fisher sensitivity를 사용해 layer별 성능 저하를 추정한다.이 framework는 저비용 proxy optimizer를 사용해 storage budget 내에서 layer bit-width를 할당한다.
  • Sensitivity metric: Fisher metric은 quantization을 모사하는 perturbation을 주입하고 그 결과로 나타나는 Fisher shift를 측정해, quantization loss에 대한 layer-wise sensitivity를 포착한다.이는 magnitude나 gradient proxy가 아니라 quantization-specific loss geometry를 대상으로 한다.
  • Bit-width allocation: PPO는 각 layer의 quantization-perturbation Fisher sensitivity를 사용해 storage constraint 하에서 adaptive layer-wise bit-width allocation을 유도한다.이 allocator는 layer-wise LLM quantization을 위한 mixed-precision strategy를 탐색한다.
  • 실험: 7개 model과 5개 benchmark에서 PPL은 최대 3.39 작았고, accuracy는 최대 6.87% 높았으며, LLM-as-a-judge win rate는 최대 76%였다.FAMPWQ는 GPTQ와 AWQ 같은 방법과의 호환성을 유지하면서 7개 baseline approach를 크게 능가했다.

2 관련 연구

관련 연구는 오류 감소, 이상치 보정, calibration, adaptive clipping, bit balancing을 통해 post-training quantization을 개선하며, mixed-precision 방법은 sensitivity- 또는 hardware-aware bit-width allocation을 추구한다. 이러한 접근법은 low-bit LLM quantization을 위한 adaptive allocation 전략의 동기를 제공한다.

  • 관련 연구: Post-training quantization 방법은 weight-activation redistribution, calibration, adaptive clipping, bit-balance 전략을 통해 압축 오차를 줄인다.예로는 SmoothQuant (Xiao et al., 2023), GPTAQ (Li et al., 2025), OmniQuant (Shao et al., 2024), ABQ-LLM 이 있다.
  • 관련 연구: Mixed-precision 및 search-based 방법은 expert granularity, activation guidance, reinforcement learning, combinatorial optimization을 활용해 bit-width를 할당한다.DeepSeek-V4 models 은 expert-aware FP4/FP8 quantization을 사용하며, AMQ (Lee et al., 2025), HAQ (Wang et al., 2019), COPAL (Malla et al., 2024), BitWeaver 는 adaptive allocation을 탐구한다.

4 FAMPWQ 방법론

FAMPWQ는 정확한 b-bit rounding perturbation으로 인해 발생하는 Fisher-information 변화로 각 layer의 quantization sensitivity를 측정한 뒤, compression target에 따라 PPO를 사용해 layer별 bit-width를 적응적으로 할당한다.

  • Fisher-information sensitivity: perturbation은 b-bit quantization으로 생성되므로 θ_l + δθ_l = Q_b(θ_l)가 성립하며, 임의의 noise가 아니라 정확한 additive rounding noise가 된다.이는 uniform 또는 magnitude-proportional perturbation과 달리 선택한 bit-width에서 발생하는 구체적인 quantization noise를 대상으로 한다.
  • Fisher-information sensitivity: FAMPWQ는 quantization perturbation 전후에 계산한 diagonal Fisher information vector 간 Euclidean-norm variation으로 layer sensitivity를 측정한다.perturbation은 하나의 target layer에만 적용하고 다른 모든 layer는 원래 parameter를 유지하며, diagonal FIM은 full matrix를 근사한다.
  • Adaptive bit-width allocation: FAMPWQ는 target compression rate 달성 여부에 연계된 penalty와 reward를 포함한 loss minimization으로 bit-width allocation을 정식화한다.원래의 combinatorial optimization problem은 단일 loss function으로 변환되며, compression target을 충족하지 못하거나 초과하는 경우를 위한 constant term이 포함된다.
  • Adaptive bit-width allocation: PPO는 layer별로 bit-width를 할당한다. actor는 strategy를 제안하고, critic과 reward-based environment는 안정적인 policy improvement를 위한 feedback을 제공한다.actor는 clipped surrogate objective를 사용하고, critic은 squared temporal-difference advantage를 사용해 학습된다.
  • Inference procedure: inference 중 allocation은 선택 가능한 가장 높은 bit-width에서 시작하며, actor가 각 layer의 bit-width를 순차적으로 생성해 최종 quantization strategy를 구성한다.L steps 이후 생성된 strategy Q_L를 사용해 LLM을 quantize한다.

5 실험

7개 모델과 5개 benchmark에서 FAMPWQ는 7개 baseline보다 perplexity, zero-shot accuracy, LLM-as-a-judge 승률을 일관되게 향상시키면서 throughput과 preprocessing 이점도 제공한다. Ablation 결과, Fisher 기반 sensitivity와 reinforcement learning 기반 allocation은 quantization 품질을 실질적으로 향상시키며 hyperparameter 선택에도 강건하다.

  • PPL 평가: FAMPWQ는 PPL에서 모든 baseline을 능가하며, 3-bit quantization의 LLaMA-7B에서 GPTQ 대비 평균 PPL을 최대 2.37, AWQ 대비 0.40 낮춘다.PPL 결과는 서로 독립적인 3회의 calibration-sampling 실행에 대한 평균이며, FAMPWQ는 4 average bits의 LLaMA-7B에서 WikiText-2 5.81, PTB 10.34도 달성한다.
  • Zero-shot accuracy: Qwen2.5-7B에 3-bit quantization을 적용했을 때 FAMPWQ는 평균 zero-shot accuracy에서 RTN과 GPTQ를 각각 6.87%와 6.69%만큼 능가한다.Figure 5는 5개 reasoning task 전반에서 일관된 향상을 보이며, 공격적인 compression에서도 일반적인 reasoning 능력을 더 잘 보존함을 나타낸다.
  • LLM-as-a-judge 비교: FAMPWQ의 승률은 RTN 대비 76%, OWQ 대비 69%, GPTQ 대비 64%, GPTQv2 대비 72%, AWQ 대비 61%, OmniQuant 대비 54%다.비교에는 GPT-3.5-turbo, 80개 질문, 양방향 비교, 비교당 160회 trial이 사용되며, 무승부는 제외된다.
  • Inference 효율: FAMPWQ는 FP16 대비 throughput을 최대 42%, OWQ 대비 최대 69%, AMQ 대비 최대 28% 향상시키지만, uniform low-bit AWQ보다 느리다.AWQ는 uniform 4-bit kernel을 활용하기 때문에 7B에서 2.44×, 13B에서 2.10×로 절대 throughput이 가장 높다.
  • Allocation 및 효율성 ablation: RL 기반 allocator는 Greedy 대비 최대 1.50, Bayesian optimization 대비 1.33, simulated annealing 대비 1.90, genetic search 대비 0.45만큼 평균 PPL을 낮춘다.b=4 perturbation form은 δ1 대비 최대 0.56, δ2 대비 최대 0.23만큼 추가로 우수하며, preprocessing은 1 GPU-hour 미만으로 유지되고 RL search는 5분 이내에 완료된다.
  • Sensitivity 분석: FIM 기반 sensitivity metric은 Oracle sensitivity와 r=0.91 및 r=0.88의 상관을 보이며, 3.5-bit average에서 ΔPPL 증가를 weight magnitude의 +0.85 및 random allocation의 +1.19 대비 +0.42로 제한한다.상관은 LLaMA-7B와 Qwen2.5-7B에서 보고되며, 각각 p < 10^-14 및 p < 10^-17이다.

6 결론

FAMPWQ는 layer-wise quantization sensitivity를 포착하고 bit-width를 adaptive하게 할당하는 Fisher information-based adaptive mixed-precision weight quantization 접근법이다. 7개 모델과 5개 benchmark에서 PPL, accuracy, LLM-as-a-judge comparison 기준으로 7개 baseline을 능가한다.

  • 6 결론: 제안 방법은 효과적인 LLM inference를 위한 novel Fisher information-based Adaptive Mixed Precision Weight Quantization 접근법이다.
  • 6 결론: 7개 모델과 5개 benchmark에서 7개 baseline 대비 3.39 smaller PPL, 6.87% higher accuracy, 76% win rate를 달성한 결과는 FAMPWQ의 효과를 입증한다.win rate는 LLM-as-a-judge comparison을 의미한다.
  • 6 결론: FAMPWQ는 layer-wise quantization-specific sensitivity를 위한 perturbation-based Fisher Information metric과 adaptive bit-width allocation을 위한 PPO-based method를 결합한다.allocation method는 adaptive bit-width strategy를 효율적으로 생성한다.

한계

FAMPWQ는 추론 처리량, 양자화 범위, 모델 적용 범위에 한계가 있다. Mixed-precision 실행은 최고 tokens-per-second보다는 메모리 제약 환경의 배포를 목표로 하며, weight-activation quantization과 더 다양한 모델 유형은 현재 범위에 포함되지 않는다.

  • 한계: Mixed-precision quantization은 서로 다른 bit-width가 최적화된 uniform-precision kernel과 호환되기 어려워 추론 처리량을 감소시킬 수 있다.따라서 FAMPWQ는 최고 tokens-per-second보다는 메모리 제약 환경의 배포에 초점을 둔다.
  • 한계: FAMPWQ는 현재 weight-only quantization (WxA16)을 대상으로 하며, weight-activation quantization을 함께 수행하는 방식은 향후 과제로 남겨 둔다.
  • 한계: 실험은 dense Transformer 모델에 초점을 맞추므로 보고된 평가 범위가 제한적이다.

A 부록 · A.1 기호 설명

부록 A.1에서는 논문에 사용된 기호의 의미를 Table A.1에 정리했다고 밝힌다.

  • A.1 기호 설명: Table A.1은 논문 전반에서 사용된 기호의 의미를 정리한다.

A.2 사전 지식

이 절에서는 양자화의 사전 지식을 설명하고 Fisher information 계산 방법을 소개한다.

  • A.2 사전 지식: 이 절에서는 양화의 사전 지식을 정립한다.
  • A.2 사전 지식: Fisher information의 계산 방법을 소개한다.

A.2.1 양자화 기초

이 절에서는 LLM weight에 대한 uniform 및 non-uniform quantization을 소개하고, quantization, dequantization, global-loss optimization을 형식화한다. FAMPWQ는 zero-point를 0으로 고정한 symmetric uniform quantization을 사용한다.

  • 양자화 기초: Quantization은 동일한 간격의 유한 구간을 사용하는 uniform quantization과, 간격과 길이가 달라질 수 있는 구간을 사용하는 non-uniform quantization으로 분류된다.b-bit integer 표현에서 uniform quantization은 2^b개의 구간을 사용한다.
  • 양자화 기초: Quantization 과정은 LLM weight tensor W를 quantized tensor WQ로 매핑하고, dequantization을 통해 fW로 복원한다.Uniform quantization은 bit-width, scale, zero-point, clipping parameter를 사용해 스케일링된 입력에 nearest rounding 연산을 적용한다.
  • 양자화 기초: FAMPWQ는 zero-point 또는 offset 값을 0으로 제한하는 symmetric uniform quantization을 사용한다.Uniform quantization은 mapping space의 부호에 따라 symmetric 또는 asymmetric일 수 있다.
  • 양자화 기초: Quantization 방식은 해당 LLM layer의 입력 X와 관련된 global loss를 최적화한다.Global-loss objective는 layer의 입력에 대해 정의된다.

A.2.2 Fisher Information

Fisher information은 출력 민감도와 likelihood function을 통해 parameter influence를 측정하여, 정확도를 보존하는 LLM compression을 위한 layer-wise importance 추정을 가능하게 한다. FAMPWQ는 이 분석을 실용화하기 위해 empirical FIM과 그 diagonal representation을 사용한다.

  • A.2.2 Fisher Information: Fisher information은 model output이 parameter noise에 얼마나 민감한지를 측정하여 parameter importance를 정량화한다.Fisher Information Matrix는 score vector의 expected outer product로 정의된다.
  • A.2.2 Fisher Information: empirical FIM은 validation dataset D의 samples를 사용하여 expected FIM을 근사한다.이 근사는 N validation samples를 사용하여 정의된다 (Kunstner et al., 2019).
  • A.2.2 Fisher Information: Larger FIM values는 inference와 compression 과정에서 보존해야 할 영향력이 더 큰 parameters를 식별한다.FIM은 LLM을 compression하면서 accuracy를 보존하기 위한 layer-wise parameter importance evaluation을 지원한다 (Singh and Alistarh, 2020; Liu et al., 2021).
  • A.2.2 Fisher Information: 대규모 gradient matrices에서 full FIM computation은 비용이 많이 들기 때문에, 이 방법은 FIM을 diagonal vector로 표현한다.diagonal representation은 identity matrix와 element-wise multiplication을 사용하여 gradient-matrix dimensions에 맞춘다.

A.3 Pearson 상관 분석 … A.7.13 3-bit 정성적 생성 예시

보충 분석 전반에서 FAMPWQ는 Fisher 기반 sensitivity, adaptive bit allocation, 안정적인 low-bit 성능, deployment 이점을 검증하며, aggressive compression 상황에서도 uniform baseline보다 generation quality를 더 잘 보존한다. 이러한 결과는 correlation, ablation, robustness, efficiency, memory, modeling assumptions, qualitative evaluation을 아우른다.

  • A.3 Pearson 상관 분석; A.5 Sensitivity 시각화; A.7.2 다양한 Quantization Bit-width에서의 PPL: FIM은 quantization sensitivity를 안정적으로 추적하고 substantial layer diversity를 드러내므로, FAMPWQ는 민감한 input/output 인접 layer를 보존하는 동시에 덜 민감한 layer를 더 공격적으로 압축할 수 있다.Pearson analysis에서는 R > 0.5 및 P < 0.0001이 확인되며, layer-wise PPL test에서는 MLP down-projection의 PPL이 최대 0.115 감소하고 attention value projection은 최대 0.047 감소한다.
  • A.4 Perturbation Strategy Ablation; A.6 Reinforcement Learning (RL)-based Network Training: b=4에서 canonical quantization perturbation δ3은 magnitude-proportional 및 Bernoulli-masked 대안보다 우수하며, RL allocator는 actor–critic update를 통해 layer-wise bit-width strategy를 생성한다.대안들은 δ3에 의해 지배된다. Training에서는 모든 layer를 maximum bit-width로 초기화하고, layer별 action을 생성하며, loss와 reward를 계산한 뒤 actor 및 critic network를 업데이트한다.
  • A.7.1 Calibration-Size Robustness: 단 32개의 calibration sequence만 사용해도 Fisher ranking은 0.996 Spearman correlation과 256-sequence reference 대비 97.1%의 top-10% overlap을 유지하며, assignment 중 2.68%만 변경된다.Main experiment에서 사용한 128-sequence setting에서는 allocation difference가 1.34%로 감소해, 안정적인 sensitivity ranking과 budget-constrained allocation을 보여준다.
  • A.7.3 Diverse Average Quantization Bit-width; A.7.12 Accuracy-per-Byte Analysis: FAMPWQ는 3.1부터 4.5까지의 average bit-width를 지원하며 PPL이 감소하고, 4-bit에서 AWQ보다 +0.65 percentage points, 3-bit에서 +1.55 points만큼 accuracy-per-byte를 향상한다.이에 해당하는 4-bit 및 3-bit storage cost는 각각 5,197 MB와 4,414 MB다.
  • A.7.4 Time Consumption 비교; A.7.6 Storage reduction: FAMPWQ의 quantization time은 경쟁력 있고, 14B model의 preprocessing은 70분 미만으로 유지되며, 추가 metadata 없이 OWQ 대비 storage를 줄인다.FAMPWQ는 GPTQ보다 최대 37%, GPTQv2보다 61%, OWQ보다 35%, OmniQuant보다 66% 빠를 수 있으며, OWQ 대비 storage saving은 original model size의 1%–3%다.
  • A.7.5 LLaMA2, Qwen2.5 및 Mistral-7B-v0.1 model 결과: FAMPWQ는 3개의 LLM과 3개의 benchmark에서 best 4-bit PPL을 달성하며, Qwen2.5 및 LLaMA2-chat model에서도 leading zero-shot accuracy를 보인다.Qwen2.5-7B에서 average PPL은 10.81로 RTN보다 최대 2.86 낮고, Qwen2.5-14B에서는 9.15로 RTN보다 1.41 낮다. Accuracy gain은 Qwen2.5에서 4.55%, LLaMA2-13B-chat에서 RTN 대비 2.87%에 이른다.
  • A.7.8 Packed-Deployment Memory Accounting; A.7.9 Bit-width Allocation Visualization: Packed Llama-2-7B inference에서 3-bit packing은 tensor-accounted memory를 최소 9.605 GiB 절약하며, FIM-based allocation은 weight-only metric과 구조적으로 달라 loss-sensitive module에 더 높은 precision을 할당한다.이 추정치는 측정된 runtime peak가 아닌 analytical estimate이며 activation, framework, allocator 및 fragmentation effect를 제외한다.
Loading 2608.24945v1…