← Back to list

Hello, mini-llm

본 프로젝트는 mini-llm 서비스를 만드는 과정을 다루는 블로그입니다. 오픈소스는 사용하지 않고 기능들을 구축하기에 실제 성능을 내는 것보다는 학습용으로 봐주시면 감사하겠습니다.

Taeju · 2026-05-24 07:06 · 0 claps · 0.8 min read
#llm #cuda #epoll #vllm-serving
Open on Medium ↗
Wiki topics: LLM · Large Language Models OPS · LLMOps & Inference

Hello, mini-llm

본 프로젝트는 mini-llm 서비스를 만드는 과정을 다루는 블로그입니다. 오픈소스는 사용하지 않고 기능들을 구축하기에 실제 성능을 내는 것보다는 학습용으로 봐주시면 감사하겠습니다.

크게 다음 과정들로 구성되어 있습니다.

  1. GEMM 및 flashattention 최적화

먼저 flashattention에서 사용하는 GEMM을 최적화하는 과정을 통해 roofline 기반 분석 및 CUDA 최적화 기법들을 다룰 예정입니다. 이러한 GEMM을 바탕으로 flashattention을 구축할 예정입니다.

  1. gpt2 model 및 vllm 구현

1번에서 구현한 flashattention을 바탕으로 gpt2 model을 구현합니다. 또한 llm 서비스 중 하나인 vllm을 직접 구현함으로써 실제 사용 가능한 서비스를 만듭니다.

  1. epoll 기반 HTTP 서버 구축

2번에서 구현한 vllm을 바탕으로 epoll HTTP 서버를 구축해 외부 클라이언트에서 호출할 수 있도록 구현합니다.


메타데이터
post_id
8ffaf37afe86
slug
hello-mini-llm-8ffaf37afe86
url
https://medium.com/@taeju456/hello-mini-llm-8ffaf37afe86
canonical_url
https://medium.com/@taeju456/hello-mini-llm-8ffaf37afe86
author_url
https://medium.com/@taeju456
status
ok
fetched_at
2026-06-09 15:37:30