百度 · 搜索策略部
大模型预训练 / 中训练算法
参与 100B 级 MoE 搜索大模型预训练与中训练,负责数学/代码数据策略、训练目标设计、评测归因与搜索 Agent 数据合成。
- 蒸馏目标:完成裁剪后模型的离线 Forward KL 恢复训练,在代表性评测上保留 Teacher 约 92% 的能力;系统分析 Forward KL 与 NTP 的领域差异,并设计动态目标路由方案。
- 数学与代码数据:搭建合成、过滤、沙箱校验、投票与评测闭环,产出约 70B 有效 Token;等 Token 实验中,MATH 中等难度提升约 1 个百分点,Pass@128 从 0.77 提升至 0.83。
- 搜索 Agent:基于 Wikipedia、BM25、向量召回、重排与实体图构建多跳推理数据,围绕查询改写、证据定位等能力进行课程式训练与评测。