Now / Next / Later

把职业规划拆成可以交付的技术成果。

Roadmap 不写“深入学习 CUDA”这种无法验收的目标,而是把每个方向落到具体产物:项目详情页、实验报告、公开仓库、Benchmark、PR 或深度文章。

NOW · 2026 Q3

  • 完成个人网站 v1 信息架构与视觉原型
  • 整理 Router Replay 的正确性与 drift 证据
  • 补齐 Router Replay 性能 / 长程 reward 的可公开结论
  • 将 H200 MoE GEMM profile 形成结构化项目页
  • 梳理 B200 编程模型与 H→B 迁移检查清单

NEXT · 2026 Q4

  • 发布第一篇完整实验复盘
  • 完善量化 Runtime 的 E2E latency / throughput / memory 对照
  • 建立 CUDA / CuTe Kernel 公开 Benchmark 仓库
  • 补充 H200、B200 与国产 GPU 的可迁移性能方法
  • 参与至少一个推理引擎或算子仓库的有效贡献

LATER · 2027 H1

  • 形成 MoE 训练推理系统专题知识图谱
  • 完成一个跨 Kernel / Runtime / Serving 的端到端优化项目
  • 建立公开实验数据页与自动化回归看板
  • 让网站成为秋招、技术交流与长期作品集的统一入口
  • 持续沉淀海外工作 / 博士申请可使用的英文材料
Capability Tracks / 能力主线

四条主线同步推进,但每个阶段只交付少数关键成果。

避免“全栈”变成浅尝辄止:训练推理系统作为主轴,GPU Kernel 与异构后端提供深度,实验与表达保证成果可被看见。

LLM Post-training Infra

veRL、Megatron、Rollout、Router Replay、KL / Logprob、训练稳定性与多卡系统。

Inference Systems

vLLM、SGLang、KV Cache、CUDA Graph、Speculative Decoding、量化与 Serving。

GPU Kernels

CUDA、CUTLASS、CuTe、GEMM、Grouped GEMM、Attention、Roofline 与 Profile。

Evidence & Writing

可复现实验、公开 PR、技术文章、英文叙事、个人网站与面试案例。

Definition of Done / 完成标准

一个目标只有在形成外部可见产物后,才算真正完成。

例如“学习 B200”不是完成;能够写出架构差异、迁移风险、编程模型变化、Benchmark 结果与 Kernel 优化建议,才是完成。

01有明确问题与实验假设QUESTION
02有代码、配置与可复现环境REPRO
03有数据、失败路径与结论边界EVIDENCE
04有项目页、文章或公开贡献OUTPUT
Publishing Cadence / 更新节奏

以质量为先的轻量发布节奏。

网站不需要为了“周更”制造内容;更合理的节奏是每月完成一个可验证成果,并持续更新现有项目。

1 / 月脱敏实验或深度复盘
1 / 季公开代码或有效 PR
持续更新项目数据与失败路径
双语核心项目摘要逐步中英双语
Current Priority

当前第一优先级:把 Router Replay 做成完整的旗舰案例。

它同时覆盖 RL、MoE、训练推理一致性、多卡系统、CUDA Graph、指标设计和实验方法,最能代表现阶段的技术定位。