Hello, mini-llm
본 프로젝트는 mini-llm 서비스를 만드는 과정을 다루는 블로그입니다. 오픈소스는 사용하지 않고 기능들을 구축하기에 실제 성능을 내는 것보다는 학습용으로 봐주시면 감사하겠습니다.
Hello, mini-llm
본 프로젝트는 mini-llm 서비스를 만드는 과정을 다루는 블로그입니다. 오픈소스는 사용하지 않고 기능들을 구축하기에 실제 성능을 내는 것보다는 학습용으로 봐주시면 감사하겠습니다.
크게 다음 과정들로 구성되어 있습니다.
- GEMM 및 flashattention 최적화
먼저 flashattention에서 사용하는 GEMM을 최적화하는 과정을 통해 roofline 기반 분석 및 CUDA 최적화 기법들을 다룰 예정입니다. 이러한 GEMM을 바탕으로 flashattention을 구축할 예정입니다.
- gpt2 model 및 vllm 구현
1번에서 구현한 flashattention을 바탕으로 gpt2 model을 구현합니다. 또한 llm 서비스 중 하나인 vllm을 직접 구현함으로써 실제 사용 가능한 서비스를 만듭니다.
- epoll 기반 HTTP 서버 구축
2번에서 구현한 vllm을 바탕으로 epoll HTTP 서버를 구축해 외부 클라이언트에서 호출할 수 있도록 구현합니다.
메타데이터
- post_id
- 8ffaf37afe86
- slug
- hello-mini-llm-8ffaf37afe86
- url
- https://medium.com/@taeju456/hello-mini-llm-8ffaf37afe86
- canonical_url
- https://medium.com/@taeju456/hello-mini-llm-8ffaf37afe86
- author_url
- https://medium.com/@taeju456
- status
- ok
- fetched_at
- 2026-06-09 15:37:30