蚂蚁集团 · 百灵大模型 · 多模态交互团队

Agent 方向研究型实习生· 2026-08-26

杭州 实习

推动百灵大模型从对话式 AI 向 Agentic AI 深度演进,核心方向是增强长程规划与执行能力(Long-horizon Planning),并基于 RL 训练(OPD 方向)持续优化 Agent 决策质量。

🔬 研究方向 1) Long-horizon Agent 架构:任务分解、子目标管理、执行轨迹优化、复杂多步骤任务的规划与容错 2) RL 训练与 OPD:基于人类/AI 反馈进行偏好蒸馏(Online/Offline Preference Distillation),探索 DPO、PPO、GRPO 等方法在 Agent 长程任务中的训练稳定性与策略收敛 3) Agent-User 交互范式:人机协作协议、Human-in-the-loop 意图对齐与干预机制 4) 多模态 Agent:融合文本/图像/语音,提升复杂环境感知与行动决策 5) 工具调用与 API 编排:动态工具选择、链式调用与可扩展框架 🛠 技术栈 LLM-based Planning / ReAct / CoT / ToT / RLHF / RLAIF / OPD / DPO / PPO / Function Calling / Multi-agent Collaboration 💡 你能获得 - 直接参与蚂蚁核心大模型 Agent 化落地,包括 RL 训练 pipeline 构建 - 算法 × 工程 × 产品深度协作,research 到 production 完整闭环 - 充足 GPU 算力与数据资源,支持前沿 RL 与 OPD 探索 - 表现优异可转正

- 计算机/AI 相关专业,硕士及以上优先 - 扎实的 NLP/ML 基础,熟悉 LLM 原理与主流 Agent 框架 - 有 RL 训练经验,了解 DPO/PPO/GRPO,对 OPD 在 LLM/Agent 中的应用有实践或研究 - 工程能力强,熟练掌握 Python,有大规模 RL 训练或分布式开发经验加分 - 能实习 3 个月以上,base 杭州 - 有顶会投稿(ICML/NeurIPS/ICLR/ACL 等)或开源贡献者优先 📮 投递方式 简历发至 [email protected] 邮件标题:【百灵Agent实习】姓名-学校-方向-到岗时间

在 Offer岛 浏览更多 AI 岗位 →