小红书 · dots

Agentic Reasoning 后训练· 2026-09-10

国内大厂 上海 / 北京 实习 校招 社招

dots 团队 Agentic Reasoning 后训练招聘。在 2026 年 7 月的 IMO2026 中,我们在有限时间内取得了官方认证的满分金牌成绩。接下来还将继续探索 AI For Math 的前沿能力,并将范式推广到竞赛编程 / 科学研究等更广阔的推理场景,欢迎有实习意愿的同学投递简历。工作地点上海优先,其次北京;工作类型实习优先 / 校招社招。

工作职责: 1. Frontier-level Math Agent:探索数学推理能力边界,推进 AI for Math 领域的发展; 2. Competitive Coding Agent:提升竞赛编程能力,探索超长程高难度推理能力的边界; 3. RSI(Recursive Self-Improvement):探索模型如何参与并改进自身的数据生成、训练、评测与 Agent 执行链路,形成持续迭代、自我改进的能力闭环。

学历要求:本科及以上。 任职资格: · 基础能力:扎实的机器学习与深度学习基础,对大模型训练全流程(pretrain / mid-train / post-train)有深入理解; · 解决问题:具备严密的分析能力,能够从复杂现象中抽象出底层问题,并通过实验快速验证关键假设; · 专业能力:深刻理解 RL 训练中的核心问题,包括 Reward Hacking、训推一致性等真实挑战; · 算法与数据能力:具备优秀的算法实现能力和数据敏锐度,能够从实验结果与失败 case 中提炼推动模型效果提升的 insight。 加分项: · 有数学竞赛(IMO/CMO/...)奖项者优先; · 有竞赛编程(ACM/ICPC/Codeforces)名次 / 奖项者优先; · 研究成果:在 NeurIPS、ICLR、ICML 等顶级会议发表过高水平成果,或主导过有影响力的开源项目者优先;具有其他大模型团队实习或研发经历者优先; · 工程和研究品味:熟悉数据合成、训练、Rollout、Sandbox、评测等完整链路,能够独立定位和解决系统问题;不迷信 Benchmark、训练 schema 或既有 pipeline,能够主动质疑并通过实验重新验证。 欢迎带简历来聊~

在 Offer岛 浏览更多 AI 岗位 →