嗨,我是 Tanmo

日常在做大模型推理(LLM Serving)相关的工程与研究:Prefill/Decode 分离部署、KV cache 调度、异构加速器(GPU / PPU)上的 kernel 优化、投机解码等。

这个博客用来沉淀读过的论文、写过的实验、踩过的坑,也顺便建立一点点公共的知识索引,欢迎交流。

站点技术栈:Hugo + PaperMod + GitHub Pages + GitHub Actions,源码开源在 博客仓库