Agent Coding 方向算法工程师(27届蚂蚁星)· 2026-09-01
蚂蚁星 27 届校招 · 训练自研 Coding Agent 模型,以真实研发场景与百万行级工业代码库为训练场
【团队介绍】 软件研发正在经历从「人写代码、AI 补全」到「AI 自主研发、人定义方向」的范式转移。我们正在构建 Agent 驱动的新一代研发体系,并训练自己的 Coding Agent 模型——以真实研发场景为训练场,以百万行级工业代码库为土壤,让模型在真实需求、真实验证、真实交付中持续进化。 【你将参与】 • 研发 Coding Agent 自研模型的算法体系,面向代码生成、缺陷修复、重构与评审等场景,设计 SFT、DPO 与 RLVR 训练方案,并探索长轨迹信用分配、过程奖励建模、On-policy Distillation 等 Agentic RL 前沿问题; • 深耕 Agentic RL:设计 Verifier 与 Reward 体系(测试验证、过程奖励、反投机惩罚),让每一次沙箱执行都产出干净、可信、可复用的训练信号; • 主导多 Runtime 混合训练:让自研模型在多套业界主流 Coding Agent 运行环境中完成 rollout,习得通用的编码能力,而非单一工具的偏好; • 建设任务工厂与数据飞轮:从真实仓库的 commit / PR / test diff 中持续合成可训练任务,让每一次真实交付都转化为训练与评测资产; • 突破仓库级代码理解与长链路任务规划:融合 AST、代码图谱(Code Graph)与混合检索,让 Agent 在复杂依赖拓扑中精准获取上下文,面对模糊需求时像资深工程师一样拆解、执行、验证与自我纠错; • 探索多 Agent 协同范式,建设架构师 Agent 驱动的动态 Workflow,支撑跨系统、多仓库、多接口的复杂需求端到端交付。 与我们一起,定义软件工程的下一代范式。
• 具备扎实的算法功底与优秀的工程实现能力,熟悉 Python,代码即作品; • 深入理解 LLM Post-training(SFT / DPO / RL),有代码大模型训练或 Agent 强化学习(RLVR)实践经验者优先; • 熟悉大规模 RL 训练系统,有 Agentic RL、Reward 建模或 Verifier 设计实战经验者优先; • 深入理解 ReAct、Reflexion、Plan-and-Execute 等 Agent 范式,对主流 Coding Agent 产品与开源生态有重度使用或贡献者优先; • 在 SWE-bench 等代码 Benchmark 上打出过成绩,或有训练任务构造、硬核开源项目、竞赛经历者优先; • 对「让机器自己写软件」有真正的信念,愿意为一个数量级的研发效能跃迁死磕到底。