月之暗面(Moonshot AI)

Kimi Agent 评测 PMO 实习生· 2026-07-20

北京 实习

基于真实高价值生产场景设计 Agent benchmark,搭建评测与数据质量体系,端到端统筹评测与数据项目。

- 基于真实高价值生产场景,设计并构建各种 harness 下 benchmark,定义模型能力的衡量边界 - 跟踪 Agent / 多模态前沿进展,系统梳理重点评测集与评测方法论,沉淀可复用、可迭代的评测标准与数据规范 - 搭建评测与训练数据的质量体系,制定标注规范与质检、交叉复核机制,把控数据的准确性与一致性,沉淀可复用的高质量数据资产 - 端到端统筹评测与数据项目,拆解里程碑、协调算法 / 工程 / 标注多方资源、跟进排期与交付质量,推动项目落地并复盘迭代

- 硕士在读;理工科专业,不限计算机相关专业,但需具备扎实的理工科基础与逻辑思维 - 具备基础的编程/数据处理能力(能读懂并简单使用 Python / 表格 / SQL 处理数据即可,不要求科班背景) - 【必备】认真、细心、负责,对数据和结论有较真精神,能把琐碎的事情做到准确无误 - 【必备】充分的好奇心与反思能力:不仅想着怎么做好,更会思考为什么做、做的价值在哪 - 【必备】强悍的学习能力,能快速上手陌生领域;能流利阅读英文论文与技术文档 - 【必备】有 vibe coding 实践经验,至少实际使用过 Claude Code、Codex 等 AI 编程工具完成过项目或任务,对 Agentic 编程产品的能力与边界有切身体感 - 良好的沟通与项目推进能力,能在多方协作中把任务跟踪、对齐、落地 - 尽快到岗,每周北京线下工作 4 天以上,至少实习三个月 加分项: - 重度使用 Codex / Cursor / Claude Code / Kimi Code 等多种 Agent / Coding 工具,并形成自己的使用方法论 - 在头部 AI 团队有过 Agent 或 LLM 相关的产品、评测、训练、工程实习经验 - 对多模态、Agent 评测方法论有自己的理解和思考

在 Offer岛 浏览更多 AI 岗位 →