MDA AI SCI AT Atul Vaish · The GPU Inference Architect Floating Point Fabrication: The Math Tricks Inside vLLM’s 4-Bit Dequantizer for Marlin In high-performance LLM inference, the bottleneck is rarely compute; it’s memory bandwidth. Reading 16-bit weights across the GPU bus is…
SPT HUM AI TCH BR Bruce-Lee-LY Nvidia Tensor Core-Getting Started with MMA PTX Programming How to program using MMA PTX?
SPT HUM AI TCH BR Bruce-Lee-LY Nvidia Tensor Core-Getting Started with WMMA API Programming How to program using WMMA API?
HUM AI BR Bruce-Lee-LY Nvidia Tensor Core-CUDA HGEMM Advanced Optimization How to extremely optimize CUDA HGEMM with Tensor Core?
AI DA daewoo kim GPU TensorCore를 최대한 이용하기 위한 Mixed Precision Training 어떻게 training하느냐에 따라 모델의 성능이 달라진다….