FlashAttenion의 Logsumexp 분석
Triton Tutorials의 Fused Attention 예제의 _attn_fwd 를 확인할 경우 다음과 같은 코드를 확인할 수 있습니다.
Triton Tutorials의 Fused Attention 예제의 _attn_fwd 를 확인할 경우 다음과 같은 코드를 확인할 수 있습니다.
Rich Sutton의 「The Bitter Lesson」 에 대해 다루고 있습니다.
Triton은 MIT Julia LAB 에서 시작된 프로젝트입니다. 핵심 개발자인 Pilippe Tillet은 다음과 같은 비전을 가지고 Triton을 설계했습니다.
Hailo AI Processor는 엣지(Edge) AI 컴퓨팅에 최적화된 고성능 NPU(Neural Processing Unit)로, 이스라엘의 AI 반도체 스타트업 Hailo에서 개발하였습니다.
CUDA Core는 NVIDIA GPU의 가장 기본적인 연산 유닛입니다. Tensor Core 는 매트릭스 연산에 특화된 고속 연산 유닛입니다. 이번 포스팅은 쿠다 코어와 텐서 코어에 대해 다룹니다.