LLM Post-training Infra
veRL、Megatron、Rollout、Router Replay、KL / Logprob、训练稳定性与多卡系统。
Roadmap 不写“深入学习 CUDA”这种无法验收的目标,而是把每个方向落到具体产物:项目详情页、实验报告、公开仓库、Benchmark、PR 或深度文章。
避免“全栈”变成浅尝辄止:训练推理系统作为主轴,GPU Kernel 与异构后端提供深度,实验与表达保证成果可被看见。
veRL、Megatron、Rollout、Router Replay、KL / Logprob、训练稳定性与多卡系统。
vLLM、SGLang、KV Cache、CUDA Graph、Speculative Decoding、量化与 Serving。
CUDA、CUTLASS、CuTe、GEMM、Grouped GEMM、Attention、Roofline 与 Profile。
可复现实验、公开 PR、技术文章、英文叙事、个人网站与面试案例。
例如“学习 B200”不是完成;能够写出架构差异、迁移风险、编程模型变化、Benchmark 结果与 Kernel 优化建议,才是完成。
网站不需要为了“周更”制造内容;更合理的节奏是每月完成一个可验证成果,并持续更新现有项目。
它同时覆盖 RL、MoE、训练推理一致性、多卡系统、CUDA Graph、指标设计和实验方法,最能代表现阶段的技术定位。