Experience & Education

从软硬件交叉基础,走到大模型系统与 GPU 性能。

这不是一份把岗位名称按时间堆叠的简历,而是一条能力逐步下沉的路线:大型工程 → 异构框架后端 → 推理 Runtime → RL Post-training Infra → GPU Kernel 与系统协同。

Education / 教育背景

电子、计算机与集成电路的交叉训练。

这样的背景让我能够在模型、框架、运行时、体系结构和 Kernel 之间建立更完整的因果链。

香港中文大学(深圳)

集成电路与系统 · 硕士
2025.09 — 2027.06(预计)

研究与学习重点逐步转向数字系统、计算机体系结构、GPU 计算与 AI Infra,持续围绕大模型训练推理系统开展工程实践。

Integrated CircuitsComputer ArchitectureAI InfraMatrix Analysis

山东大学

电子科学与技术 · 本科;计算机科学与技术 · 辅修
2021.09 — 2025.06

建立模数电、微机、FPGA、嵌入式和 DSP 基础,同时系统学习数据结构、计算机网络、数据库、离散数学与面向对象程序设计。获得学业奖学金与竞赛创新类特长奖学金。

ElectronicsC/C++FPGAEmbedded SystemsComputer Science
Work / 工作经历

每一段经历,都补上了系统链路中的一块拼图。

当前企业项目采用脱敏表达;公开开源贡献保留可验证链接,内部地址、代码仓和敏感绝对数据不展示。

LLM Post-training & Inference Infrastructure

企业 AI Infra / 大模型系统与高性能计算 · 脱敏展示
2026.04 — 至今

围绕 H200 上的大模型训练推理链路,完成 CUDA Graph 稳定性根因定位、MoE Router Replay、异步 GPU 状态算子、Grouped GEMM workload 重建与离线推理交付。

  • FlashInfer CUDA Graph|将 TP=2 FULL graph rollout hang 从下游 timeout 收敛到 FTZ 对 Lamport sentinel 的误判,回移位级修复并完成两卡最小复现、SASS 与模型级 graph replay 回归。
  • R3 Router Replay|实现 [token, MoE-layer, top-k] route 采集、observe/replay 和 response-mask 指标闭环;8×H200 20-step 对照中 route mismatch 由约 17%-19% 降至 0,f_tau_2 降低约 36-145×、KL 降低约 4-7×。
  • OE Async|在 GPU 侧维护 recent-token history 并以 Triton fused-hash 构造输入;TP1 严格矩阵较同步路径提升约 5.0%,TP2/TP4 安全路径 0 mismatch,decode 吞吐约 +4.6%/+3.0%。
  • H200 Grouped GEMM|纠正 T×top-k 与 compact rows 混用造成的 4×-6× 误判;以 1,024 条 range 构造回放,扩展 SM90 候选后目标 shape 约 +5.3%,完整矩阵聚合约 +1.84%。
veRLMegatron-LMvLLMSGLangH200MoECUDA GraphNsight

算子与编译器优化实习生

摩尔线程 · TensorFlow MUSA Extension
2026.02 — 2026.05

参与国产 GPU 上 TensorFlow 后端的算子支持、插件集成、图优化、稳定性修复和性能工具建设,直接处理框架语义与 Device Kernel 之间的问题。

  • 完成 muDNN GELU 接入、Fusion 链路修复与 benchmark 建设,推动整网 11 个 GELU 全部融合。
  • 定位 shape tensor 错误进入 device path 的根因,重构 HostMemory 配置并修复长跑 OOM / 随机崩溃。
  • 设计 Kernel Timing 宏与轻量调试机制,公开 PR #57 已合入主仓库。
  • 优化 Logical_Or scalar broadcast 热点路径,并参与 AddV2 等热点算子与训练算子结果对齐。
TensorFlowMUSAC++muDNNFusionHostMemoryBenchmark

通用软件工程师实习生

华为 · 大型 C/C++ 工程与静态分析工具链
2024.08 — 2024.12

维护大规模 C/C++ 代码库静态分析工具链,通过日志分析、规则重构和 Python 自动化开发支持规则快速迭代,建立大型工程中的代码阅读、测试、CI 与协作基础。

  • 通过日志分析与规则重构,将核心场景误报率降低约 35%。
  • 开发 Python 自动化代码生成工具,将规则开发与验证周期缩短约 40%,支持 60+ 条核心规则迭代。
C/C++PythonStatic AnalysisCI/CDNetwork Software
Capabilities / 能力矩阵

围绕“系统为什么慢、为什么不一致、怎样验证”组织技能。

技能不按熟悉度百分比打分,而按能够拿出什么工程证据进行归类。

训练与推理系统

veRLMegatron-LMvLLMSGLangMoEPPO / GRPOCUDA Graph

GPU 与算子性能

CUDACUTLASSCuTeDeepGEMMGrouped GEMMNsight SystemsNsight Compute

框架后端与异构适配

TensorFlow ExtensionPyTorch ExtensionMUSAOperator RegistrationGraph FusionHost / Device Semantics

工程与实验方法

C++PythonLinuxDockerGitBenchmarkAblationReproducibility
Next / 下一步

继续把经历转化为可验证、可讨论的公开作品。

核心项目页面已经呈现 Router Replay、MoE GEMM Profiling、TensorFlow MUSA 与量化 Runtime;后续将持续补充实验曲线、代码与文章。