大模型后训练实习生· 2026-09-08
美团 LongCat Interaction 团队招大模型后训练方向实习生,做 Agentic RL、Post-training、评测体系与 SKILL 自进化,充足 GPU 算力 + 一对一北斗导师带教。
🌟 团队亮点 · 充足 GPU 算力保障 · 一对一北斗导师带教 · 科研与工程并重,学术氛围浓厚,欢迎各种交流学习 · 硕士、博士均可,仅接受 28 届及以后 · 需具备 Agentic RL / Rubrics Generator / Harness Engineering 相关项目或论文经历 · 工作地点:北京 / 上海可选 · 希望充满好奇心、乐于探索新事物 💼 工作内容(可选) 01|Agentic RL 训练框架建设与调优 负责交互场景下 Agentic RL 训练框架的搭建、配置与持续迭代,支撑多轮交互场景的策略优化与训练实验。 02|大模型后训练与持续优化 负责领域大模型后训练(Post-training)技术研发,不限于 SFT、RL、OPD / OPSD、Self-Evolving 等方向,持续提升模型在复杂交互场景下的表现。 03|大模型评测体系建设 构建自动化评测体系,设计多维细粒度评估方案,重点探索多轮交互场景下 Skill 遵循度、交互体验等维度的评估策略,以数据飞轮驱动模型持续迭代优化。 04|SKILL 自进化 构建「模型 + SKILL + Harness」三位一体的训推协同方案,实现模型能力与 Harness 框架的持续增强闭环。 🐱 团队介绍 LongCat Interaction 团队负责智能交互系统的研发与落地。团队依托 LLM 与多智能体架构,打造了 WOWService 平台,为美团 App 数亿用户提供高效、个性化、7×24 小时的智能客服服务。在这里,我们专注于大模型训练与推理优化,让机器能够理解复杂用户意图、遵守业务规则、主动协作解决问题;建设自动化评测体系,用数据飞轮驱动模型持续进化;构建 Multi-Agent 协同框架,实现跨场景、跨部门的复杂任务处理。我们的使命:用大模型的能力,让每一位用户都能获得即时、准确、温暖的解决方案。 📮 投递方式 简历请发送至 [email protected] 或 [email protected] 邮件标题格式:LongCat 实习 - 姓名 - 学校 - 毕业届次 - Agentic RL/OPD/Harness(选填擅长方向)
✅ 任职要求 · 28 届及以后(2028 年及之后毕业)的硕士 / 博士研究生 · 工作地点北京 / 上海,请确认可接受后再投递 · 具备大模型强化学习(RLHF / PPO / GRPO / Agentic RL)、On-Policy Distillation(OPD / OPSD)、Agentic Workflow 或 Harness Engineering 相关项目或论文经历,不要求实习经历 · 工程实现能力强,能熟练使用 Claude Code、OpenCode 等 Coding Agent 工具提升工程效率 · 能独立完成训练框架配置、实验迭代与问题排查 ⭐ 优先考虑 · 在 ICLR / ICML / NeurIPS / ACL / EMNLP / KDD / SIGIR 等顶会有论文(已发表或在投) · 熟悉 verl / AReaL / OpenRLHF 等开源 RL 训练框架