冯浩然 Haoran Feng

AI Infra / LLM Systems / GPU Performance Engineering

225010160@link.cuhk.edu.cn github.com/XFDG Shenzhen / Beijing · Expected 2027

Profile

香港中文大学(深圳)集成电路与系统硕士在读,具备电子科学与计算机科学交叉背景。工程经历覆盖大型 C/C++ 软件、TensorFlow 国产 GPU 后端、大模型量化推理 Runtime,以及 8×H200 上的 veRL / Megatron-LM / vLLM MoE-RL 训练推理系统。关注训推一致性、GPU Kernel、推理优化与可复现实验。

Education

香港中文大学(深圳)

集成电路与系统 · 硕士
2025.09 — 2027.06(预计)

山东大学

电子科学与技术 · 本科;计算机科学与技术 · 辅修
2021.09 — 2025.06
  • 学业奖学金(前 20%)、特长奖学金(竞赛创新);电子与计算机交叉课程基础。

Experience

LLM Post-training & Inference Infrastructure

企业 AI Infra / 大模型系统与高性能计算 · 脱敏展示
2026.04 — 至今
  • FlashInfer CUDA Graph|将 TP=2 FULL graph rollout hang 从下游 timeout 收敛到 FTZ 对 Lamport sentinel 的误判,回移位级修复并完成两卡最小复现、SASS 与模型级 graph replay 回归。
  • R3 Router Replay|实现 [token, MoE-layer, top-k] route 采集、observe/replay 和 response-mask 指标闭环;8×H200 20-step 对照中 route mismatch 由约 17%-19% 降至 0,f_tau_2 降低约 36-145×、KL 降低约 4-7×。
  • OE Async|在 GPU 侧维护 recent-token history 并以 Triton fused-hash 构造输入;TP1 严格矩阵较同步路径提升约 5.0%,TP2/TP4 安全路径 0 mismatch,decode 吞吐约 +4.6%/+3.0%。

摩尔线程 · 算子与编译器优化实习生

TensorFlow MUSA Extension
2026.02 — 2026.05
  • 完成 muDNN GELU 接入、Fusion 链路修复与 benchmark 建设,推动整网 11 个 GELU 全部融合,真实 shape testcase 性能提升约 36.6%。
  • 定位 shape tensor 错误进入 device path 的根因并重构 HostMemory 路径,修复长跑 OOM / 随机崩溃;相关长时验证保持稳定。
  • 设计 Kernel Timing 宏与调试机制并合入公开 PR #57;优化 Logical_Or scalar broadcast 路径,使平均耗时由 21.2 μs 降至 10.7 μs。

华为 · 通用软件工程师实习生

大型 C/C++ 工程与静态分析工具链
2024.08 — 2024.12
  • 通过日志分析与规则重构,将 CI 核心场景误报率降低约 35%;开发 Python 自动化代码生成工具,将规则开发与验证周期缩短约 40%,支持 60+ 条规则迭代。

Selected Projects

高性能 LLM 量化推理 Runtime

PyTorch Extension · CUTLASS · W8A8 / FP8 / AWQ
2025.12 — 进行中
  • 设计轻量推理 Runtime,基于 CUTLASS 实现 W8A8 GEMM,探索量化数据结构、内存布局、Decode GEMV 与端到端正确性/性能验证。

Technical Stack

Systems: veRL, Megatron-LM, vLLM, SGLang, TensorFlow, PyTorch Extension · GPU: CUDA, CUTLASS, CuTe, DeepGEMM, Nsight Systems/Compute, MUSA · Engineering: C++, Python, Linux, Docker, Git, Benchmark & Ablation.