Writing/Research
Research · Chain-of-Thought Distillation

From Structure to Preference: Token Weighting for Chain-of-Thought Distillation in Large Language Models

AAAI 2027 submission · revised manuscript posted on OpenReview · currently under review.

3 stagesStructure → Weighting → Preference
94.01%Qwen2.5-7B · GSM8K
94.00%Qwen2.5-7B · SVAMP
Under reviewAAAI 2027

Authors: Shankui Han, Zhaoyu Li, Weiwen Yuan, Yuyuan Yang, Haoran Feng, Jinke Ren

现有 CoT 蒸馏通常对所有推理 token 采用近似相同的监督强度,难以区分关键计算与冗余解释。本文使用干预式 token 重要性估计:扰动某个推理 token,并测量教师模型生成参考答案的似然下降,以此识别对正确答案最关键的位置。

Method

Three-stage framework
Structure recovery从打乱或遮蔽输入中恢复 Decomposition、Solving、Verification、Summary 四段式推理结构。
Token-weighted SFT根据干预式重要性分数提高答案关键 token 的监督权重,并对高重要性位置加入辅助损失。
Preference optimization从学生模型输出构造正确 / 错误偏好对,通过 DPO 偏向正确且结构完整的回答。

Reported results

GSM8K / SVAMP
Student modelGSM8KSVAMPInterpretation
Qwen2.5-7B-Instruct94.01%94.00%相对最强 baseline 提升 5.51 / 10.10 个百分点
Qwen2.5-0.5B-Instruct38.51%50.33%结果表明收益受到学生模型容量影响

Status boundary. 该论文目前处于 AAAI 2027 审稿流程中;以上数字来自在投稿件,不应表述为已录用或已完成同行评审的结论。