阿里巴巴 · Qwen(通义千问)

Qwen 后训练合版/OPD 方向日常实习生· 2026-07-29

国内大厂 北京 / 杭州 / 上海 实习

Qwen 后训练团队招募合版/OPD 方向日常实习生,方向为以 SFT 和 On-Policy Distillation(OPD)为核心的模型合版算法研究与训练框架建设。

1. 合版算法研究:探究以 SFT 和 On-Policy Distillation(OPD)为核心的合版策略,持续优化合版训练效果,改善专项冲突问题,提升合版流程的稳定性与合版结果的可预测性; 2. 合版反馈链路建设:分析合版训练监控指标,定位冲突专项与原因,为专项模型的数据迭代和 SFT、RL 训练流程提供反馈,帮助专项在改进性能的同时减小合版冲突风险; 3. 合版训练框架建设:参与 OPD 等合版训练框架的迭代,与 infra 和工程团队协作,探究、开发面向多专项、超长程任务的合版算法与框架,提升合版训练框架的效率与稳定性; 4. 合版前沿技术追踪:持续追踪前沿的合版技术,在内部模型研发中快速测试与验证。 投递方式:简历发送至 [email protected](pdf,需注明联系方式)。

1. 计算机科学、机器学习、人工智能相关专业背景,硕士以上学历; 2. 熟悉 LLM 后训练、合版、OPD/RL 训练流程与算法,有大规模模型交付和迭代流程经验的优先; 3. 具备优秀的工程能力,熟悉 Megatron、FSDP 等训练框架和 SGLang、vLLM 等推理框架,熟悉 veRL、slime 等 RL 训练框架,有 100B 以上 MoE 模型及千卡训练经历的优先; 4. 在 NeurIPS、ICLR、ACL 等国际顶级会议/期刊上发表过高影响力论文,或具有知名开源项目贡献经历; 5. 有基模团队工作/实习经历的优先。

在 Offer岛 浏览更多 AI 岗位 →