1 분 소요

FQ-ViT는 Vision Transformer(ViT) 기반 모델에 대해 PTQ (Post-Training Quantization) 기반의 완전 정수 양자화를 적용하여, 정확도 손실 없이 경량화된 추론이 가능하도록 한 연구입니다.

FQ-ViT는 당시 MEGVII Technology의 연구원인 Yang Lin이 제1저자로 주도하였으며, 2022년 IJCAI에 발표되었습니다.

제안 기법

  • PTF (Power-of-Two Factor)
    • LayerNorm 입력의 채널 간 분포 차이를 보정하기 위한 기법입니다.
    • 각 채널에 2의 거듭제곱 계수를 곱해 스케일링합니다.
  • LIS (Log-Int-Softmax)
    • 소프트맥스 함수의 출력이 대부분 0에 가까운 작은 값에 집중되어 있고 일부 값만 1에 근접하는 비균일한 분포를 가지고 있습니다.
    • 로그 기반 양자화 기법을 적용합니다.

LayerNorm의 채널별 값 범위 및 채널별 최소/최대 값

  • 일반적으로 LayerNorm의 양자화는 전체 텐서에 동일한 스케일을 적용합니다.
  • 채널 간 분포가 크게 다르면, 하나의 스케일로는 모든 채널의 특성을 제대로 반영하지 못해 심각한 양자화 오차가 발생합니다.
  • PTF는 단일 스케일 구조를 유지하면서도, 각 채널에 대해 별도의 2의 거듭제곱 계수를 곱해 보정함으로써, 채널별 분포 차이를 반영하고 연산 효율도 유지합니다.
\[\hat{\text{X}}_\text{Q} = (\text{X}_\text{Q} - zp) << \alpha\] \[\mu(\text{X}) \approx \mu(2^\alpha \cdot (\text{X}_\text{Q} - zp)) = s \cdot \mu(\hat{\text{X}}_\text{Q})\] \[\sigma(\text{X}) \approx \sigma(2^\alpha \cdot (\text{X}_\text{Q} - zp)) = s \cdot \sigma(\hat{\text{X}}_\text{Q})\]

소프트맥스 이후 어텐션 스코어 분포

  • Log2 양자화는 값이 작을수록 더 조밀하게 bin을 배치합니다.
  • 따라서 Softmax처럼 작은 값이 대부분인 분포에서는, Log2 양자화가 균일 양자화보다 훨씬 정밀하게 값을 표현할 수 있습니다.
\[\exp(s \cdot \text{X}_\text{Q}) \approx s' \cdot \text{i-exp}(\text{X}_\text{Q})\] \[\text{Log-Int-Softmax}(s \cdot \text{X}_\text{Q}) = \text{N} - \log_2 \left\lfloor \frac{\sum \text{i-exp}(\text{X}_\text{Q})}{\text{i-exp}(\text{X}_\text{Q})} \right\rceil\]

카테고리:

업데이트: