Education / Experience

经历

从 GPU 后端到基础模型的训练与推理系统。

教育经历

香港中文大学(深圳)集成电路与系统 · 硕士在读,预计 2027.06 毕业
山东大学电子科学与技术 · 本科;计算机科学与技术 · 辅修

山东大学学业奖学金(前 20%);特长奖学金(竞赛创新)。

实习经历

九坤投资—至知创新研究院

大模型与高性能计算实习生

IQuest-Q1 · 参与已发布的 IQuest-Q1(320B-A15B)MoE 模型的训练、推理与 RL rollout 基础设施开发。

  • FA3 确定性 SWA backward · 定位 dQ semaphore 依赖链,实现 contributor-relative ticket 并对齐 reverse scheduler;代表 packed shape 完整 backward 6.755 → 1.699 ms(3.98×),3,601 项回归与 1,000 次逐位确定性测试,交付 wheel。
  • FC1 计算与通信 · 4×H200 双 stream 代理,联合控制 NCCL CTA / DeepGEMM SM budget;121 组粗扫、89 组细扫与复验;AllGatherV 代理联合耗时 −12.80%,固定通信设置下控核贡献 7.58%。
  • 确定性 Router GEMM · 接入三级后端、Graph preflight、cache / fallback 与 workspace 管理;48 层测试工作负载中位耗时 −73.39%,135/135 kernel 与 20/20 模型场景逐位一致;prefix-cache hit 下 TP1 / TP2 整请求处理性能 +3.81% / +4.36%。
  • OE 异步状态 · GPU token history 与 Triton fused-hash;TP1 28/28 case,吞吐 +4.99%;TP2 / TP4 安全路径各 84/84、0 mismatch,decode 吞吐 +4.6% / +3.0%。
  • R3 Router Replay · 打通 vLLM / Megatron 路由采集、传输、回放与监控。8×H200、Qwen3-30B-A3B、20-step 对照:mismatch 17–19% → 0,fτ² / KL 降低 36–145× / 4–7×;另完成 128 卡、300B 级研发模型的 200-step rollout。
  • CUDA Graph 稳定性 · 两卡最小复现定位 Lamport sentinel 的 FTZ 误判,回移上游位级判断修复;模型级重复 Graph replay 未再观察到 hang / timeout。

摩尔线程

算子与编译器优化实习生

TensorFlow MUSA Extension

  • 接入 muDNN 与 GELU 图融合,整网 11/11 GELU 融合;真实 shape 算子耗时 −36.6%。Logical_Or 21.2 → 10.7 μs;补充 Adam / AdaMax / GradientDescent 实现或修复及测试。
  • 重构 HostMemory 并修复资源变量及 Session 生命周期;稳定性从 500 轮约 30% 成功率提升至 1,000 轮 100%,通过 4 万 / 40 万 / 80 万轮长跑验证。

研究

AAAI 2027 · 已投稿

共同作者;负责模型训练、超参调优与 vLLM TP=4 评测。

公开工程记录

查看 PR →
项目来源已合入
Mooncake社区贡献7
TensorFlow MUSA实习期间10
Ray社区贡献1
FlashInfer社区贡献1
Mirage社区贡献1

20 个已合入 PR,覆盖 5 个 AI Infra 项目;含 10 个摩尔线程实习 PR。状态核验:2026-09-29。