阶跃星辰 · 基模算法团队

强化学习研究员· 2026-08-27

独角兽 北京 / 上海 正式

寻找对 RL 有极致信仰的你!薪资对标头部大厂,宽松自由的极客氛围,算力管够,鼓励开源,与国内顶尖 AI 团队并肩。

职责一:RLHF 的「终极形态」——研究语言及多模态大模型在 RLHF 阶段的广义强化算法,探索大模型自我进化的路径,让 AI 自己学会成长。 职责二:智能体「指挥官」——深入研究大模型驱动的智能体算法,包括但不限于 ReAct、Voyager、WebGPT、AutoGPT,让 AI 从「聊天机器」进化为能「规划 + 执行」的自主智能体。 团队提供:薪资对标头部大厂;宽松自由的极客氛围,算力管够,鼓励开源;与国内顶尖 AI 团队并肩,每一行代码都在定义下一代智能体的行为逻辑。

在 Offer岛 浏览更多 AI 岗位 →