Writing & Technical Notes

把复杂系统讲清楚,把工程判断留下来。

本站负责沉淀项目档案、实验摘要与长期写作目录;完整工程长文适合整理为 CSDN 工程版,机制解释与观点内容适合整理为知乎版本。文章仍围绕系统背景、执行路径、指标、实验和结论边界组织。

Public Evidence Notes / 脱敏长文

项目页面已经整理成可公开分享的工程长文,并配有脱敏图表。

跨平台发布状态

当前 GitHub 连接可以更新个人网站,但没有 CSDN / 知乎写入权限,因此本次没有伪装成“已同步发布”。网站保留完整脱敏稿与图表;后续人工发布时,CSDN 采用工程复现结构,知乎采用机制与决策结构。

Draft 01 / Systems

Router Replay:从 token-layer-topk 到训推一致性

这篇文章会先解释 MoE 模型中 token 如何经过 router 选择 top-k experts,再区分 rollout 侧与训练侧在执行路径、数值精度、Kernel 实现和随机状态上的差异。核心不是“Replay 能不能开”,而是怎样证明 replay 的对象、mask 和层/token 对齐是正确的。

  1. 问题定义:同一个 response token 在 rollout 与 training 阶段是否经过相同 expert?
  2. 指标设计:exact match、top-k overlap、mismatch、valid token-layer count 与概率漂移分别回答什么问题。
  3. 实验结构:Baseline、R2 Record、R3 Replay 与 CUDA Graph on/off 如何形成最小对照。
  4. 结论边界:路由一致并不自动等于最终 reward 更好,还必须验证性能、KL 与长期训练稳定性。
先查看对应项目详情
Planned 02 / Kernel

为什么 Batch-Invariant GEMM 更确定,却可能更慢

文章会使用固定问题形状 A[M,2048] × B[2048,128] → C[M,128],对比 Split-K 并行归约与 Full-K Tiling。重点解释浮点加法不满足结合律,为什么不同 partial sum 合并顺序会让输出随 batch / 调度变化,以及不跨 CTA 拆 K 后为何会损失并行度。

预期输出

一张 Global GEMM → CTA Tile → Warp Tile → Thread Tile 的层级图,加上 decode 场景 M=1/2/4/8/12 的性能讨论。

Notes 03 / Performance

H200 上如何正确 Profile MoE Grouped GEMM

MoE 的 grouped GEMM 很容易因为 rows 定义不同得到完全错误的性能判断。文章会区分全展开的 T × topk、经过 mask 后的有效 token、DeepEP compact rows 和每个 expert 的真实分布,再说明如何从线上 NVTX range 抽取代表性 shape 做离线 replay。

Rows先统一统计语义DO NOT MIX
Distribution保留 expert 负载形态SHAPE ≠ WORKLOAD
Replay验证线上/离线差异CONTROL VARIABLES
查看对应项目详情
Planned 04 / Systems

vLLM、SGLang 与 TensorRT-LLM:不要只看“都能推理”

计划从系统边界而非营销特性比较:请求调度、Paged KV Cache、Prefix Cache、编译/Kernel 体系、Serving API、分布式能力、模型适配成本和最适合的部署场景。

Planned 05 / Performance

CUDA Graph 在 RL Rollout 中到底改变了什么

文章将从 CPU launch overhead 讲到 capture 限制,并结合采样器、动态 shape、静态地址与 NCCL/通信行为,分析为什么“开 Graph 更快”并不是总成立,以及调试时怎样用 eager 模式隔离变量。

Queue 06 / Paper Notes

论文阅读:从机制摘要走向可复现实验

每篇论文将按统一模板整理:它解决的系统瓶颈、关键机制、实现依赖、与已有系统的差异、可能失效的场景,以及一个可以在现有硬件上执行的最小复现实验。

Publishing Plan

先完成一篇真正有数据的文章,再追求数量。

首篇优先选择 Router Replay 或 MoE GEMM Profiling,因为它们最能体现系统理解、实验设计和工程判断。