阶跃星辰 · Code Agent 研究团队

Code Agent 研究员(日常实习)· 2026-07-22

独角兽 北京 / 上海 实习

做真正落地的 Agent RL:构建面向真实复杂任务的 Code Agent / 多模态 Agent。适合 27/28 届及以后,优秀同学有留用/转正机会。

我们正在构建面向真实复杂任务的 Code Agent / 多模态 Agent,不只局限于写代码,也包括搜索、浏览器、terminal、图片分析创作等工具调用,探索长短期规划、深度思考和 multi-agent 协同完成复杂任务。 1. 用强化学习提升 Agent 的规划、反思、工具调用能力。 2. 探索人机协同的高质量数据挖掘与合成,提升 Agent 的规划和工具使用能力。 3. 构建 Code Agent 基础能力,包括 planning、测例、代码生成等。 4. 构建多模态 Agent,提升多模态大模型 RLHF 中的训练效果。 5. 搭建 Code Agent 自动化评测和 Docker 环境生成能力。 适合 27/28 届及以后的同学投递,base 北京/上海,优秀同学有留用/转正机会。

希望你具备: 1. 了解 Alignment 领域常用方法,包括 SFT、DPO、PPO、RFT、Self-Rewarding、Self-Critic 等。 2. 机器学习基础扎实,编码能力强,能熟练使用 PyTorch,熟悉 Megatron 等大规模训练框架更好。 3. 在 NLP / CV / RL 至少一个方向有深入研究经历,或通过机器学习算法解决过复杂问题,特别欢迎跨界研究者。 4. 实验分析与问题解决能力强,有创新思维,沟通协作顺畅。 加分项: 1. 有编程竞赛经历或软件工程背景。 2. 计算机、电子、物理、数学等专业硕博背景优先。 3. 有 ICML / ICLR / NeurIPS / ACL / CVPR 等顶会研究成果。 4. ACM / ICPC / NOI / IOI / Kaggle 等竞赛获奖经历优先。 5. 主导或参与过有影响力的 AI 开源 / 闭源项目。

在 Offer岛 浏览更多 AI 岗位 →