Astribot(星辰智能) · RL 后训练团队
RL 后训练算法工程师· 2026-09-08
介绍
让大模型在机器人上「边干边学」:训练模型、写代码,赋予机器人持续学习、提升自我的能力。社招校招同步热招,孙鹏博士亲自面。
描述
【我们到底在做什么】 一句话:让大模型在机器人上“边干边学”。训练模型、写代码,赋予机器人持续学习、提升自我的能力。 【5 个关键词拆解岗位职责】 1. 大规模训练 后训练有自己的 scale-up 节奏。适配代码框架,把生产性训练的吞吐和效率拉满。 关键词:多机多卡多核 scaling 2. 真机强化学习 机器人在模拟器的学习如何带到真实世界?又怎样在真实物理世界直接试错、提升? 关键词:真机,sim2real 3. Harness 错误恢复?Steerable?快慢思考?一机多脑?技能沉淀和复用?——模型这个引擎更要配上优秀的内饰,加一起才是好车。 关键词:harness-engineering 4. AutoResearch 大模型监督真机或模拟器的后训练,调研、改进、实验、评测,科研全链路自动化、人类零干预。 关键词:“困”在数字世界的超级智能自我尝试在物理世界长出手脚 5. 模拟器与评测 Isaac / Genesis-World / MuJoCo / … 模拟真实场景,真机行不行,模拟器里的表现先说了算。 关键词:模拟器场景开发,评测体系 【怎么投递】 · 简历发到:[email protected] · 邮件主题:「RL后训练+姓名+现所在公司/学校」 · 走内推 / 官网投递同样欢迎 · 孙鹏博士亲自面,欢迎各路 RL 豪杰来交流