LLM 后训练算法工程师(日常实习)· 2026-08-27

国内大厂 员工内推 杭州 / 北京 / 上海 实习

小红书招 LLM 后训练算法日常实习,方向覆盖 SFT/RL 对齐、Reasoning、Agentic RL 与合成数据,H800 资源充足,Leader 亲自带队。

【岗位定位】 本岗位侧重于提升大语言模型的「核心大脑」能力。你将通过先进的 Post-training 技术,让模型在 Reasoning、Agentic 以及人类意图对齐上达到业界顶尖水平,通过提升 AI 智能水平的上限,支撑小红书所有业务场景,包括且不限于搜索、广告、推荐、电商、客服及智能发布等核心场景。 【工作内容】 1. 大规模对齐与强化学习:研发并优化 SFT、RL(如 GRPO 等)算法,构建高精度的 Reward Model,解决模型在复杂指令下的对齐问题。 2. 推理模型(Reasoning)优化:探索长链推理(CoT)、强化学习驱动的自反思与自进化机制,提升模型的 System 2 思维能力。 3. Agentic RL 与 Agency:研发面向 Search Agent、Code Agent 和 Tool-use Agent 的强化学习方案,提升模型在开放环境中的任务拆解、工具调用及闭环执行能力。 4. 合成数据与模型进化:探索高质量合成数据的生成与过滤技术,实现模型能力的自我循环与持续进化。 【福利】 · 顶配资源:充足的 H800 计算资源,支持任何前沿想法的验证。 · 数据高地:亿级 UGC 图文/视频数据,独一无二的真实业务反馈闭环。 · 技术导向:团队大牛云集,Leader 亲自带队,撰写高质量技术报告与论文,打造行业影响力。 · 快速成长:处于 AGI 落地爆发期,你的算法将直接改变亿级用户的搜索与创作体验。 【投递方式】 邮件主题格式:姓名-学校-实习-最早入职时间(for 实习)-实习时长。如果超过两周没有回复邮件,也可以私信原帖作者。

· 工作经验:在读学生;学历要求:硕士及以上。 · 背景:计算机、数学等相关专业硕士/博士在读;深入理解 Transformer 架构及大模型训练全流程。 · 专业深耕:在 Search(搜索)、Code(代码生成/工程)、tool-use、alignment 或 RL(强化学习)领域有深厚积累。 · 工程能力:熟练使用 PyTorch,有 DeepSpeed、Megatron-LM 或 Ray 等大规模分布式训练实战经验。 · 加分项:在 NeurIPS、ICML、ICLR、ACL 等顶会发表过高质量论文;在 LLM 大家关注的 Benchmark 榜单有深入研究或优异表现;有大规模集群调优经验或知名开源 LLM 项目核心贡献者。

在 Offer岛 浏览更多 AI 岗位 →