后训练算法研究员(27 校招)· 2026-09-10
阶跃星辰 27 校招:后训练算法研究员,做通用推理大模型 / 多模态大模型的对齐(Alignment)与 long-horizon agent 训练。实习 / 社招同步开启,28 届及以后同学可投实习岗。
岗位职责: 1. 参与通用推理大模型 / 多模态大模型对齐(Alignment)方向的研发工作,涵盖数据循环体系的构建,以及在监督微调(SFT)与强化学习(RL)阶段中对数据使用策略的系统性探究; 2. 深入探索对齐阶段的数据与算法在大规模训练中的可扩展性与优化路径,覆盖文本、多模态理解以及 Agent(Working Agent / Code Agent / Search 等)任务场景; 3. 参与 long-horizon agent 任务的大规模数据构建与训练算法的探索,包括但不限于 frontier coding task 和 enterprise working task; 4. 参与构建世界领先的高性能通用推理大模型与多模态大模型,在多项客观评测指标中保持行业领先。
1. 预计毕业时间介于 2026 年 9 月至 2027 年 8 月的国内外计算机、数学、人工智能等相关专业的优秀应届毕业生; 2. 对数据有一定的敏感度,熟知开源社区各数据渠道源,有数据处理的经验和认知; 3. 对大模型相关研究前沿进展比较熟悉,如 Reasoning RL、Agent RL、多模态理解、Tool / Search Agent 等,具有大模型 / 多模态研发经验者优先; 4. 有一定的相关研究经历,发表过顶级会议论文者优先,如 ICLR、NeurIPS、ICML、CVPR 等; 5. 具备扎实的编程基础,有优秀的工程能力,具有 NOI、ACM/ICPC 等编程竞赛金牌获奖者优先; 6. 具备良好的团队协作能力和沟通能力。 实习 / 社招同步开启,28 届及以后的同学可以投递实习岗位。