Projects & Experiments

项目不是技术名词列表,而是工程证据。

每个项目尽量回答四个问题:真实问题是什么、怎样建立对照、数据说明了什么、结论的适用边界在哪里。企业项目采用脱敏方式,只展示可公开的方法与结果。

01 · 2026GPU DEBUG

FlashInfer CUDA Graph Hang:FTZ / Sentinel 根因闭环

从 sample_tokens timeout 反向定位 GPU 首因,完成位级修复、SASS 对照与 graph replay 回归。

0/3→2/2FULL graph
8→0FTZ predicates
PR #3304等价修复
02 · 2026RL INFRA

R3 Router Replay:MoE 训推一致性

打通 [token, layer, top-k] route 采集、observe/replay 与 response-mask 指标闭环。

17–19%→0mismatch
36–145×f_tau_2
4–7×KL
03 · 2026ASYNC OP

OE Async:GPU Token History 与 Triton Fused Hash

消除异步 decode 热路径中的 CPU 往返,并覆盖 mixed、恢复、slot reuse 与多卡状态。

+5.0%TP1 vs sync
+4.6%TP2
+3.0%TP4
04 · 2026GPU PERF

H200 MoE Grouped GEMM Profiling 与调优

纠正 expanded / compact rows 口径,构造 1,024 条 range 回放并扩展 SM90 候选。

195,976→29,446rows
+5.3%target
+1.84%aggregate
05 · 2026DELIVERY

DeepGEMM 离线 Cubin 与 Wheel 交付

将 JIT 产物转化为可校验 bundle,覆盖单卡与 TP=2 的 cold compile 清零验证。

109→359kernels
8 modelscold=0
≈7.7×cold load
06 · 2026OPEN SOURCE

TensorFlow MUSA Extension

处理算子、Fusion、HostMemory、长跑稳定性与 Kernel Timing,形成公开合入记录。

PR #57merged
11/11GELU fused
21.2→10.7μshot path
07 · 2025–2026RUNTIME

LLMQRT 量化推理 Runtime

贯通 W4A16、W8A8、FP8、Attention 后端、KV Cache 与 H200 kernel 适配。

W4A16AWQ
W8A8 / FP8CUTLASS
TPvalidation
08 · 2026ML SYSTEMS

ICS6201 无人机检测实验流水线

统一 171K 样本、六模型实验设计、多 GPU 调度与可恢复验证;严格区分完整设计和已完成核心任务。

171,568samples
14/14smoke
6core runs
Method / 项目模板

所有核心项目采用同一套证据结构。

统一结构能够让项目同时服务于简历、面试、技术文章、复现实验和团队知识沉淀。

01背景与问题
02核心假设
03实验环境
04对照与指标
05结果与异常
06个人贡献
07边界与下一步
Archive / 早期项目

保留技术起点,但不抢占主线。

大型 C/C++ 静态分析规则工具链

围绕日志定位、规则重构、自动代码生成与 CI 验证,建立第一段真实大型工程经验。

智能车与嵌入式系统实践

覆盖 MCU、传感器、控制算法与软硬件协同,是从电子系统走向系统软件的技术起点。

公开 CUDA / CuTe Kernel Benchmark

计划补充可直接运行的 Kernel 项目,包含 shape、roofline、profile、正确性和跨架构对照。

Build in Public

项目页面会随着真实实验持续更新。

未验证的数据不会写成结论;未公开的内部信息不会为了“显得厉害”而泄露。这个网站首先是一份可信的工程记录。