把复杂的大模型系统,做得更快、更稳、更可信。
我是冯浩然,香港中文大学(深圳)集成电路与系统硕士在读。我的工程工作覆盖 MoE-RL 训推一致性、CUDA Graph / 通信 Kernel 排障、异步推理解码、量化 Runtime 与 H200 Grouped GEMM 性能工程。
M.Sc. in Integrated Circuits & Systems
inference systems
GPU performance engineering
从电子与计算机基础,走向大模型系统的性能深水区。
本科阶段,我同时接受了电子科学与计算机科学训练;之后从 C/C++ 工程、国产 GPU 框架适配与算子优化切入,逐步进入 vLLM、DeepGEMM、veRL、Megatron-LM 与 MoE 系统。现在,我更关注一个问题:如何让训练侧、推理侧和底层 Kernel 形成可验证的性能闭环。
我习惯用工程证据而不是技术名词证明能力:明确问题、设置对照、统一指标、复现实验,再把结论转化为代码、文档和可公开的技术叙事。
查看完整教育与工作时间线 →用可复现的项目,呈现真实的工程能力。
FlashInfer CUDA Graph Hang:FTZ / Sentinel 根因闭环
从 sample_tokens timeout 反向定位 GPU 首因,完成位级修复、SASS 对照与 graph replay 回归。
R3 Router Replay:MoE 训推一致性
打通 [token, layer, top-k] route 采集、observe/replay 与 response-mask 指标闭环。
OE Async:GPU Token History 与 Triton Fused Hash
消除异步 decode 热路径中的 CPU 往返,并覆盖 mixed、恢复、slot reuse 与多卡状态。
H200 MoE Grouped GEMM Profiling 与调优
纠正 expanded / compact rows 口径,构造 1,024 条 range 回放并扩展 SM90 候选。
不是零散技术栈,而是一条逐步下沉的系统路线。
从大型 C/C++ 工程,到国产 GPU 框架后端,再到 H200 上的大模型训练推理系统与 GPU 性能优化。
LLM Post-training & Inference Infrastructure
企业 AI Infra 项目 · 脱敏展示围绕 veRL、Megatron-LM、vLLM/SGLang、Router Replay、CUDA Graph 与 H200 MoE 热路径,完成训推一致性诊断、实验设计和算子级性能分析。
算子与编译器优化实习生
摩尔线程 · TensorFlow MUSA Extension参与 TensorFlow on MUSA 的算子支持、插件集成、图优化与稳定性修复,形成从框架语义、Host/Device 路径到 Device Kernel 的完整理解。
通用软件工程师实习生
华为 · 大型 C/C++ 工程维护静态分析工具链,进行规则重构、日志定位与 Python 自动化开发,建立大型工程代码阅读、测试验证和持续交付基础。
把一次实验,沉淀成长期可复用的技术资产。
这是这个网站区别于普通线上简历的核心:每个项目都要能够解释问题、数据、边界与工程决策。
把系统问题讲清楚,也把失败路径留下来。
持续补齐从 Kernel 到系统的完整能力。
NOW
- 整理 Router Replay 实验与公开叙事
- 补齐 vLLM / DeepGEMM 端到端性能案例
- 沉淀 H200/B200 架构迁移知识
NEXT
- 发布首篇完整实验复盘
- 建立可复现 Benchmark 模板
- 增加 CUDA / CuTe Kernel 公开项目
LATER
- 深入 MoE 系统与通信优化
- 持续贡献推理引擎或算子仓库
- 形成个人 AI Infra 知识体系
欢迎交流 AI Infra、推理优化与 GPU 性能工程。
无论是技术讨论、实习与校招机会,还是开源协作,都可以通过邮件或 GitHub 联系我。