把复杂系统讲清楚,把工程判断留下来。
本站负责沉淀项目档案、实验摘要与长期写作目录;完整工程长文适合整理为 CSDN 工程版,机制解释与观点内容适合整理为知乎版本。文章仍围绕系统背景、执行路径、指标、实验和结论边界组织。
网站负责归档,外部平台负责完整分发。
项目页面已经整理成可公开分享的工程长文,并配有脱敏图表。
从 sample_tokens timeout 到 FTZ / Sentinel 根因
适合 CSDN 的复现与排障版,也适合知乎的机制解释版。
异步 Decode 中的 GPU Token History
解释为什么跨 step 状态、mixed batch 与多卡确定性必须一起验证。
MoE Grouped GEMM:先纠正工作量,再谈调优
包含 rows 口径、稳态 Profile、线上回放和 SM90 config tuning。
当前 GitHub 连接可以更新个人网站,但没有 CSDN / 知乎写入权限,因此本次没有伪装成“已同步发布”。网站保留完整脱敏稿与图表;后续人工发布时,CSDN 采用工程复现结构,知乎采用机制与决策结构。
Router Replay:从 token-layer-topk 到训推一致性
为什么 rollout 与 training 可能选择不同 expert?怎样定义 mismatch、overlap 与 logprob drift?
为什么 Batch-Invariant GEMM 更确定,却可能更慢
从 Split-K、跨 CTA Reduction、固定 K 累加顺序与 decode shape 出发理解确定性代价。
H200 上如何正确 Profile MoE Grouped GEMM
rows 口径、expert 分布、compact token、线上 range 与离线 replay 如何共同影响结论。
vLLM、SGLang 与 TensorRT-LLM:不要只看“都能推理”
从调度、KV Cache、Kernel、部署边界和扩展方式比较三类推理系统。
CUDA Graph 在 RL Rollout 中到底改变了什么
解释 capture、静态地址、采样路径、编译 sampler 与正确性/稳定性问题之间的关系。
论文阅读:从机制摘要走向可复现实验
围绕 DeepSeek-V3.2、DSpark 与 speculative decoding,建立“论文机制—代码路径—工程价值”模板。
Router Replay:从 token-layer-topk 到训推一致性
这篇文章会先解释 MoE 模型中 token 如何经过 router 选择 top-k experts,再区分 rollout 侧与训练侧在执行路径、数值精度、Kernel 实现和随机状态上的差异。核心不是“Replay 能不能开”,而是怎样证明 replay 的对象、mask 和层/token 对齐是正确的。
- 问题定义:同一个 response token 在 rollout 与 training 阶段是否经过相同 expert?
- 指标设计:exact match、top-k overlap、mismatch、valid token-layer count 与概率漂移分别回答什么问题。
- 实验结构:Baseline、R2 Record、R3 Replay 与 CUDA Graph on/off 如何形成最小对照。
- 结论边界:路由一致并不自动等于最终 reward 更好,还必须验证性能、KL 与长期训练稳定性。
为什么 Batch-Invariant GEMM 更确定,却可能更慢
文章会使用固定问题形状 A[M,2048] × B[2048,128] → C[M,128],对比 Split-K 并行归约与 Full-K Tiling。重点解释浮点加法不满足结合律,为什么不同 partial sum 合并顺序会让输出随 batch / 调度变化,以及不跨 CTA 拆 K 后为何会损失并行度。
一张 Global GEMM → CTA Tile → Warp Tile → Thread Tile 的层级图,加上 decode 场景 M=1/2/4/8/12 的性能讨论。
H200 上如何正确 Profile MoE Grouped GEMM
MoE 的 grouped GEMM 很容易因为 rows 定义不同得到完全错误的性能判断。文章会区分全展开的 T × topk、经过 mask 后的有效 token、DeepEP compact rows 和每个 expert 的真实分布,再说明如何从线上 NVTX range 抽取代表性 shape 做离线 replay。
vLLM、SGLang 与 TensorRT-LLM:不要只看“都能推理”
计划从系统边界而非营销特性比较:请求调度、Paged KV Cache、Prefix Cache、编译/Kernel 体系、Serving API、分布式能力、模型适配成本和最适合的部署场景。
CUDA Graph 在 RL Rollout 中到底改变了什么
文章将从 CPU launch overhead 讲到 capture 限制,并结合采样器、动态 shape、静态地址与 NCCL/通信行为,分析为什么“开 Graph 更快”并不是总成立,以及调试时怎样用 eager 模式隔离变量。
论文阅读:从机制摘要走向可复现实验
每篇论文将按统一模板整理:它解决的系统瓶颈、关键机制、实现依赖、与已有系统的差异、可能失效的场景,以及一个可以在现有硬件上执行的最小复现实验。
先完成一篇真正有数据的文章,再追求数量。
首篇优先选择 Router Replay 或 MoE GEMM Profiling,因为它们最能体现系统理解、实验设计和工程判断。