Résumé

冯浩然

大模型系统与 GPU 性能工程

教育经历

香港中文大学(深圳)集成电路与系统 · 硕士在读,预计 2027.06 毕业
山东大学电子科学与技术 · 本科;计算机科学与技术 · 辅修

山东大学学业奖学金(前 20%)、特长奖学金(竞赛创新)。

实习经历

九坤投资—至知创新研究院

大模型与高性能计算实习生

IQuest-Q1 · 参与已发布的 IQuest-Q1(320B-A15B)MoE 模型的训练、推理与 RL rollout 基础设施开发。

  • FA3 确定性 SWA backward · 定位 dQ semaphore 依赖链,实现 contributor-relative ticket 并对齐 reverse scheduler;代表 packed shape 完整 backward 6.755 → 1.699 ms(3.98×),3,601 项回归与 1,000 次逐位确定性测试,交付 wheel。
  • FC1 计算与通信 · 4×H200 双 stream 代理,联合控制 NCCL CTA / DeepGEMM SM budget;121 组粗扫、89 组细扫与复验;AllGatherV 代理联合耗时 −12.80%,固定通信设置下控核贡献 7.58%。
  • 确定性 Router GEMM · 接入三级后端、Graph preflight、cache / fallback 与 workspace 管理;48 层测试工作负载中位耗时 −73.39%,135/135 kernel 与 20/20 模型场景逐位一致;prefix-cache hit 下 TP1 / TP2 整请求处理性能 +3.81% / +4.36%。
  • OE 异步状态 · GPU token history 与 Triton fused-hash;TP1 28/28 case,吞吐 +4.99%;TP2 / TP4 安全路径各 84/84、0 mismatch,decode 吞吐 +4.6% / +3.0%。
  • R3 Router Replay · 打通 vLLM / Megatron 路由采集、传输、回放与监控。8×H200、Qwen3-30B-A3B、20-step 对照:mismatch 17–19% → 0,fτ² / KL 降低 36–145× / 4–7×;另完成 128 卡、300B 级研发模型的 200-step rollout。
  • CUDA Graph 稳定性 · 两卡最小复现定位 Lamport sentinel 的 FTZ 误判,回移上游位级判断修复;模型级重复 Graph replay 未再观察到 hang / timeout。

摩尔线程

算子与编译器优化实习生

TensorFlow MUSA Extension

  • 接入 muDNN 与 GELU 图融合,整网 11/11 GELU 融合;真实 shape 算子耗时 −36.6%。Logical_Or 21.2 → 10.7 μs;补充 Adam / AdaMax / GradientDescent 实现或修复及测试。
  • 重构 HostMemory 并修复资源变量及 Session 生命周期;稳定性从 500 轮约 30% 成功率提升至 1,000 轮 100%,通过 4 万 / 40 万 / 80 万轮长跑验证。

开源贡献

全部 PR 链接
项目来源已合入
Mooncake社区贡献7
TensorFlow MUSA实习期间10
Ray社区贡献1
FlashInfer社区贡献1
Mirage社区贡献1

20 个已合入 PR,覆盖 5 个 AI Infra 项目;含 10 个摩尔线程实习 PR。状态核验:2026-09-29。

项目与科研

  • 负责 W4A16 / W8A8 / FP8 后端适配,接入 FlashAttention-2/4、GQA、softcap 与 SDPA。使用 Compute Sanitizer 定位 gemv_kernel_g128 尾组越界并补充保护;实现 Qwen2 packed-AWQ TP=2 列 / 行切分及 NCCL all-reduce。
  • Qwen2.5-Coder-32B W4A16 对照部署:checkpoint / 峰值显存 −70.5% / −66.8%,端到端输出吞吐 +76.8%;代表 shape 四类 Sanitizer 0 error / 0 hazard,通过数值、跨 rank token 与交互验收。
AAAI 2027 · 已投稿

From Structure to Preference: Token Weighting for Chain-of-Thought Distillation in Large Language Models

Shankui Han, Zhaoyu Li, Weiwen Yuan, Yuyuan Yang, Haoran Feng, Jinke Ren

共同作者。负责模型训练、超参调优与 vLLM TP=4 评测,完成 LoRA / DPO 训练及对照评测。

参与“结构恢复、关键 Token 加权监督、偏好优化”三阶段框架。通过逐 token 扰动教师推理后参考答案生成似然的下降量估计重要性,并将权重用于 SFT 与辅助损失。

Student / comparisonGSM8KSVAMP
Qwen2.5-7B-Instruct94.01%94.00%
较最强基线提升+5.51 pp+10.10 pp

OpenReview ↗ · 结果来自在投稿件;当前仅按已投稿展示,不表示已录用。

技能

C/C++、Python、CUDA、Triton、PyTorch Extension;Nsys、NCU、Compute Sanitizer;Attention、MoE、量化 GEMM、Tensor Parallel、CUDA Graph。

IELTS 6.5 · CET-6 · HCIA-AI