D-Robotics

具身智能算法实习生· 2026-09-09

北京 实习

VLA × 世界模型 × 强化学习,让机器人在复杂环境中自主 loco-manipulation。线下实习 3 个月以上,工作地点北京海淀。

【端到端基础模型:VLA 与世界模型】 参与人形机器人 loco-manipulation 的端到端模型研发,探索 VLA、世界模型、in-context learning 等前沿方向,统一建模语言指令、视觉感知与全身动作序列,突破人形机器人全身移动操作能力。 【RL 后训练与策略闭环】 将预训练模型与 online、offline-to-online 训练深度结合,统一优化全身协调、接触丰富操作、负载扰动与失败恢复,提升端到端策略从仿真到真机的鲁棒性与可部署性。 【顶会论文产出】 参与实验设计、结果整理与方法论总结,目标投递 CoRL、RSS、CVPR、ICLR 等机器人与人工智能顶会。 【我们会提供】 · 充足计算资源:300+ A800/H20,人均可支配 GPU 算力 · 研究讨论指导:明确的科研方向,以及系统性问题拆解 · 真实机器人硬件:多台宇树 G1 人形机器人,遥操设备以及数据采集外包

机器人操作或强化学习研究,双修更佳。 · 机器人操作方向:有 loco-manipulation / 全身控制经验,熟悉 manipulation policy(VLA、WAM、ACT)等主流方法,具有预训练经验更佳。 · RL 后训练:具备 online 或 offline-to-online 微调的实际经验,能处理分布偏移、奖励设计、价值估计不稳定、探索与安全约束等问题。 · 完整科研经历:有 NeurIPS、ICML、ICLR、CVPR、ICRA、CoRL、RSS 等顶会投稿或中稿记录,完整走过“实验、写作、投稿”流程。 · 线下长期投入:能够在北京线下实习,持续 3 个月以上。 · 热爱人形机器人研究:相信具身智能终将走进物理世界,人形 loco-manipulation 正是这场变革中最核心的能力——在真实环境中统一移动与操作,让智能真正作用于物理世界。

在 Offer岛 浏览更多 AI 岗位 →