최근 포스트

FlashAttenion의 Logsumexp 분석

1 분 소요

Triton Tutorials의 Fused Attention 예제의 _attn_fwd 를 확인할 경우 다음과 같은 코드를 확인할 수 있습니다.

The Bitter Lesson

4 분 소요

Rich Sutton의 「The Bitter Lesson」 에 대해 다루고 있습니다.

Triton에 대한 전반적 이해

최대 1 분 소요

Triton은 MIT Julia LAB 에서 시작된 프로젝트입니다. 핵심 개발자인 Pilippe Tillet은 다음과 같은 비전을 가지고 Triton을 설계했습니다.

Hailo with RaspberryPi

2 분 소요

Hailo AI Processor는 엣지(Edge) AI 컴퓨팅에 최적화된 고성능 NPU(Neural Processing Unit)로, 이스라엘의 AI 반도체 스타트업 Hailo에서 개발하였습니다.

텐서 코어와 쿠다 코어

4 분 소요

CUDA Core는 NVIDIA GPU의 가장 기본적인 연산 유닛입니다. Tensor Core 는 매트릭스 연산에 특화된 고속 연산 유닛입니다. 이번 포스팅은 쿠다 코어와 텐서 코어에 대해 다룹니다.