LLM TRAINING 2025.08 — 2026.04
大模型蒸馏目标设计与规模化验证
训练目标设计 · 实验归因
分析 Mid-training 退火阶段中 Forward KL 与 NTP 的领域能力权衡,并将领域条件监督策略从代理实验扩展到目标模型。
SELECTED WORK
这里展示代表性的研究、工程和数据项目,重点说明问题、个人贡献与可量化结果。
训练目标设计 · 实验归因
分析 Mid-training 退火阶段中 Forward KL 与 NTP 的领域能力权衡,并将领域条件监督策略从代理实验扩展到目标模型。
数据策略 · 质量评测
构建数学与代码训练数据的生产和质量闭环,通过等 Token 对照实验拆分数据规模与质量收益。
数据构造 · 能力拆解
结合离线检索、实体图与 LLM 合成多跳搜索轨迹,并围绕查询改写、证据定位等能力进行课程式训练。