<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>GEMM Optimization on Yunsheng Ni</title><link>https://niyunsheng.github.io/series/gemm-optimization/</link><description>Recent content in GEMM Optimization on Yunsheng Ni</description><generator>Hugo -- 0.154.5</generator><language>en-us</language><copyright>Content is licensed under CC BY-NC-SA 4.0.</copyright><lastBuildDate>Sun, 22 Mar 2026 08:00:00 +0800</lastBuildDate><atom:link href="https://niyunsheng.github.io/series/gemm-optimization/index.xml" rel="self" type="application/rss+xml"/><item><title>Progressive CUDA GEMM Optimization: From Memory-Bound to Swizzling</title><link>https://niyunsheng.github.io/cuda-gemm-bank-conflict-swizzling/</link><pubDate>Sun, 22 Mar 2026 08:00:00 +0800</pubDate><guid>https://niyunsheng.github.io/cuda-gemm-bank-conflict-swizzling/</guid><description>A step-by-step guide to optimizing FP32 CUDA GEMM kernels. Learn how to overcome warp-level memory coalescing bottlenecks, eliminate 32-way shared memory bank conflicts using memory padding, and implement zero-waste XOR address swizzling.</description></item><item><title>Deep Dive into Triton GEMM Optimization: From Naive Tiling to Hopper TMA</title><link>https://niyunsheng.github.io/triton-gemm-tiling-tma/</link><pubDate>Wed, 11 Feb 2026 00:39:00 +0800</pubDate><guid>https://niyunsheng.github.io/triton-gemm-tiling-tma/</guid><description>A step-by-step guide to optimizing GEMM in Triton, covering Tiling, Autotuning, L2 Cache Optimizations, and Hopper TMA.</description></item></channel></rss>