嗨,我是 Tanmo。
日常在做大模型推理(LLM Serving)相关的工程与研究:Prefill/Decode 分离部署、KV cache 调度、异构加速器(GPU / PPU)上的 kernel 优化、投机解码等。
这个博客用来沉淀读过的论文、写过的实验、踩过的坑,也顺便建立一点点公共的知识索引,欢迎交流。
- GitHub: https://github.com/Tanmo-ai
- Email:
you@example.com
站点技术栈:Hugo + PaperMod + GitHub Pages + GitHub Actions,源码开源在 博客仓库。