Category

코딩

CI/CD 파이프라인을 정의 (gitlab)

최대 1 분 소요

gitlab-ci.yml 파일을 바탕으로 GitLab에서 사용하는 경우 주로 CI/CD 파이프라인을 정의하는 방법에 대해 다룹니다.

FlashAttenion의 Logsumexp 분석

1 분 소요

Triton Tutorials의 Fused Attention 예제의 _attn_fwd 를 확인할 경우 다음과 같은 코드를 확인할 수 있습니다.

Triton에 대한 전반적 이해

최대 1 분 소요

Triton은 MIT Julia LAB 에서 시작된 프로젝트입니다. 핵심 개발자인 Pilippe Tillet은 다음과 같은 비전을 가지고 Triton을 설계했습니다.

Hailo with RaspberryPi

2 분 소요

Hailo AI Processor는 엣지(Edge) AI 컴퓨팅에 최적화된 고성능 NPU(Neural Processing Unit)로, 이스라엘의 AI 반도체 스타트업 Hailo에서 개발하였습니다.

텐서 코어와 쿠다 코어

4 분 소요

CUDA Core는 NVIDIA GPU의 가장 기본적인 연산 유닛입니다. Tensor Core 는 매트릭스 연산에 특화된 고속 연산 유닛입니다. 이번 포스팅은 쿠다 코어와 텐서 코어에 대해 다룹니다.

행렬 곱의 연산 방식

2 분 소요

행렬곱은 대규모 AI 모델에서 계산 비용의 주요 병목 지점으로, 이를 효율적으로 처리하기 위해 병렬화가 필수적입니다. 이번 포스팅에서는 블록 단위로 행렬곱을 수행하는 두 가지 방식을 살펴봅니다. 일반적은 행렬 곱은 다음과 같습니다.

맨 위로 이동 ↑

논문

[논문 리뷰] LLM.int8()

1 분 소요

LLM.int8()는 대규모 언어 모델(LLM)의 추론 과정을 가속화하고 메모리 사용량을 줄이기 위해, PTQ(Post-Training Quantization) 기반의 8비트(weight-only) 양자화를 적용하여 정확도 손실 없이 추론이 가능하도록 한 연구입니다.

[논문 리뷰] QPTQ

2 분 소요

GPTQ는 Transformer 기반 대규모 언어 모델(LLM)에 대해 Post-Training Quantization (PTQ)을 적용하여, 매우 빠르고 효율적인 완전 정수 양자화를 가능하게 한 연구입니다.

[논문 리뷰] FQ-ViT

1 분 소요

FQ-ViT는 Vision Transformer(ViT) 기반 모델에 대해 PTQ (Post-Training Quantization) 기반의 완전 정수 양자화를 적용하여, 정확도 손실 없이 경량화된 추론이 가능하도록 한 연구입니다.

[논문 리뷰] I-BERT

최대 1 분 소요

I-BERT는 트랜스포머 기반의 언어 모델인 BERT에 정수 기반 연산을 도입하여, 부동소수점 연산 없이도 정확도를 유지하며 추론할 수 있도록 한 연구입니다.

[논문 리뷰] I-ViT

최대 1 분 소요

I-ViT는 I-BERT에서 영감을 받아, Vision Transformer (ViT)에 정수 기반 연산을 도입한 연구입니다.

맨 위로 이동 ↑

일상

The Bitter Lesson

4 분 소요

Rich Sutton의 「The Bitter Lesson」 에 대해 다루고 있습니다.

첫 포스팅

최대 1 분 소요

github.io 첫 포스팅을 하였습니다. 꾸준히 하는 것이 목표입니다.

맨 위로 이동 ↑