简历

CURRICULUM VITAE · UPDATED 2026

袁江岸 Ben Yuan

大模型算法工程师 · LLM Training / Distillation / Data

网页版本默认不展示手机号与年龄;PDF 为 2026-07-20 完整版本。

01

工作经历

百度 · 搜索策略部

大模型预训练 / 中训练算法

参与 100B 级 MoE 搜索大模型预训练与中训练,负责数学/代码数据策略、训练目标设计、评测归因与搜索 Agent 数据合成。

  • 蒸馏目标:完成裁剪后模型的离线 Forward KL 恢复训练,在代表性评测上保留 Teacher 约 92% 的能力;系统分析 Forward KL 与 NTP 的领域差异,并设计动态目标路由方案。
  • 数学与代码数据:搭建合成、过滤、沙箱校验、投票与评测闭环,产出约 70B 有效 Token;等 Token 实验中,MATH 中等难度提升约 1 个百分点,Pass@128 从 0.77 提升至 0.83。
  • 搜索 Agent:基于 Wikipedia、BM25、向量召回、重排与实体图构建多跳推理数据,围绕查询改写、证据定位等能力进行课程式训练与评测。

字节跳动 · 飞书搜索团队

企业知识问答模型训练与优化

围绕企业知识问答场景开展 SFT 训练与效果优化,并关注模型推理效率与工程可用性。

02

教育经历

香港中文大学(深圳)

数据科学 · 硕士(全日制)

华南理工大学

工业工程 · 本科(全日制)

03

代表成果

≈ 92% 裁剪后模型保留的 Teacher 评测能力
≈ 70B 数学与代码高质量有效训练 Token
0.77 → 0.83 等 Token 质量实验中的 Pass@128

PREPRINT · 2026

Let the Data Decide: Supervision Analysis, Capability Trade-offs, and Adaptive Objective Routing in Continued Pre-Training via Off-Policy Distillation

主导研究思路、实验设计、实现与评估,分析持续预训练中不同监督信号的能力权衡与自适应选择。

查看 arXiv
04

专业能力

模型训练

LLM Pre-training Mid-training Knowledge Distillation Forward KL NTP

数据与评测

Data Synthesis Quality Filtering Benchmark Attribution Curriculum Learning

检索与 Agent

BM25 Embedding / Reranking Entity Graph Multi-hop Reasoning

训练系统

Distributed Training CUDA Triton Kernel Fusion