小红书 · Dots Post-train 组

Agent 后训练算法工程师· 2026-09-04

国内大厂 北京 实习 校招 社招

小红书 dots 团队招 Agent 后训练方向,聚焦 Long-horizon Agent 与 RSI(递归自我改进),实习优先,也开放校招社招。

1)Long-horizon Agent:探索以 Coding Agent 的方式解决真实生活场景中的复杂长程任务,重点关注 3D 建模、装修设计、视频剪辑等需要长程规划与复杂工具调用的任务。 2)RSI(Recursive Self-Improvement):探索模型如何参与并改进自身的数据生成、训练、评测与 Agent 执行链路,形成持续迭代、自我改进的能力闭环。

学历要求:本科及以上。 【任职资格】 · 基础能力:扎实的机器学习与深度学习基础,对大模型训练全流程(pretrain / mid-train / post-train)有深入理解; · 解决问题:具备严密的分析能力,能够从复杂现象中抽象出底层问题,并通过实验快速验证关键假设; · 专业能力:深刻理解 RL 训练中的核心问题,包括 Reward Hacking、训推一致性等真实挑战; · 算法与数据能力:具备优秀的算法实现能力和数据敏锐度,能够从实验结果与失败 case 中提炼推动模型效果提升的 insight。 【加分项】 · 研究成果:在 NeurIPS、ICLR、ICML 等顶级会议发表过高水平成果,或主导过有影响力的开源项目者优先;具有其他大模型团队实习或研发经历者优先。 · 工程和研究品味:熟悉数据合成、训练、Rollout、Sandbox、评测等完整链路,能够独立定位和解决系统问题;不迷信 Benchmark、训练 schema 或既有 pipeline,能够主动质疑并通过实验重新验证。 欢迎带简历来聊~

在 Offer岛 浏览更多 AI 岗位 →