AI Infrastructure · LLM Systems · GPU Performance

把复杂的大模型系统,做得更快、更稳、更可信。

我是冯浩然,香港中文大学(深圳)集成电路与系统硕士在读。我的工程工作覆盖 MoE-RL 训推一致性、CUDA Graph / 通信 Kernel 排障、异步推理解码、量化 Runtime 与 H200 Grouped GEMM 性能工程。

2027 届 · 面向 AI Infra / 推理优化机会 深圳 / 北京
haoran@ai-infra:~
whoami
Haoran Feng / 冯浩然
M.Sc. in Integrated Circuits & Systems
focus --current
LLM post-training infra
inference systems
GPU performance engineering
stack --show
veRLMegatron-LMvLLMSGLangCUDACUTLASSDeepGEMMTensorFlow MUSA
methodology
problem → hypothesis → experiment → data → decision
8×H200MoE-RL 主实验环境
18Router Replay CPU 契约测试
1,024线上 GEMM forward ranges
2027硕士预计毕业
About / 关于我

从电子与计算机基础,走向大模型系统的性能深水区。

本科阶段,我同时接受了电子科学与计算机科学训练;之后从 C/C++ 工程、国产 GPU 框架适配与算子优化切入,逐步进入 vLLM、DeepGEMM、veRL、Megatron-LM 与 MoE 系统。现在,我更关注一个问题:如何让训练侧、推理侧和底层 Kernel 形成可验证的性能闭环。

我习惯用工程证据而不是技术名词证明能力:明确问题、设置对照、统一指标、复现实验,再把结论转化为代码、文档和可公开的技术叙事。

查看完整教育与工作时间线
01LLM Post-training InfrastructureACTIVE
02Inference Systems & RuntimeACTIVE
03GPU Kernels & PerformanceDEEPENING
04Heterogeneous ComputingFOUNDATION
Experience / 经历主线

不是零散技术栈,而是一条逐步下沉的系统路线。

从大型 C/C++ 工程,到国产 GPU 框架后端,再到 H200 上的大模型训练推理系统与 GPU 性能优化。

LLM Post-training & Inference Infrastructure

企业 AI Infra 项目 · 脱敏展示
2026.05 — 2026.07

围绕 veRL、Megatron-LM、vLLM/SGLang、Router Replay、CUDA Graph 与 H200 MoE 热路径,完成训推一致性诊断、实验设计和算子级性能分析。

veRLMegatron-LMvLLMH200MoE

算子与编译器优化实习生

摩尔线程 · TensorFlow MUSA Extension
2026.02 — 2026.05

参与 TensorFlow on MUSA 的算子支持、插件集成、图优化与稳定性修复,形成从框架语义、Host/Device 路径到 Device Kernel 的完整理解。

TensorFlowMUSAC++FusionProfiling

通用软件工程师实习生

华为 · 大型 C/C++ 工程
2024.08 — 2024.12

维护静态分析工具链,进行规则重构、日志定位与 Python 自动化开发,建立大型工程代码阅读、测试验证和持续交付基础。

C/C++PythonStatic AnalysisCI
Evidence Loop / 能力证据闭环

把一次实验,沉淀成长期可复用的技术资产。

这是这个网站区别于普通线上简历的核心:每个项目都要能够解释问题、数据、边界与工程决策。

01问题
02假设
03实验
04数据
05结论
06决策
07叙事
Roadmap / 项目规划

持续补齐从 Kernel 到系统的完整能力。

查看完整 Roadmap

NOW

  • 整理 Router Replay 实验与公开叙事
  • 补齐 vLLM / DeepGEMM 端到端性能案例
  • 沉淀 H200/B200 架构迁移知识

NEXT

  • 发布首篇完整实验复盘
  • 建立可复现 Benchmark 模板
  • 增加 CUDA / CuTe Kernel 公开项目

LATER

  • 深入 MoE 系统与通信优化
  • 持续贡献推理引擎或算子仓库
  • 形成个人 AI Infra 知识体系
Contact / 联系

欢迎交流 AI Infra、推理优化与 GPU 性能工程。

无论是技术讨论、实习与校招机会,还是开源协作,都可以通过邮件或 GitHub 联系我。