字节跳动 · 即梦
Agent 强化学习算法工程师 / 研究员(Agentic RL / 大模型强化学习方向)· 2026-09-16
介绍
字节即梦团队招 Agentic RL / 大模型强化学习方向算法工程师 & 研究员,实习 / 校招 / 社招均可,做国内顶尖的 AIGC 创作 Agent。
描述
负责创作 Agent 强化学习能力建设: - 攻坚长链路任务规划、工具调用、多轮复杂创作任务 - 落地 GRPO / PPO / DPO / Reward Model 等后训练技术 - 搭建训练‑评测‑实验完整闭环 - 把前沿 Agent RL 研究真正落地到视频、图片 AIGC 真实业务 字节即梦,做国内顶尖的 AIGC 创作 Agent。团队技术氛围浓厚,大量真实业务场景,实验资源充足,期待大佬加入。
要求
- 扎实的机器学习、深度学习、强化学习理论基础 - 熟悉 LLM 后训练:SFT、DPO、GRPO、RLHF、奖励建模 - 会 PyTorch,具备完整实验设计、调优、问题归因能力 - 对 Agent、Function‑call、长 horizon 任务有实战理解 加分项:RL 训练框架、Infra 经验、Reward System 设计、RL 相关论文