Autoregressive 모델과 KV Cache
Autoregressive 모델 및 KV-Cache에 대해 다룬다.
Autoregressive 모델 및 KV-Cache에 대해 다룬다.
gitlab-ci.yml 파일을 바탕으로 GitLab에서 사용하는 경우 주로 CI/CD 파이프라인을 정의하는 방법에 대해 다룹니다.
FlashAttention-2의 수식 오류 정리
트랜스포머 기반 모델의 구조가 어떻게 발전해왔는지에 대해 다룬다.
LLM.int8()는 대규모 언어 모델(LLM)의 추론 과정을 가속화하고 메모리 사용량을 줄이기 위해, PTQ(Post-Training Quantization) 기반의 8비트(weight-only) 양자화를 적용하여 정확도 손실 없이 추론이 가능하도록 한 연구입니다.