Agent 算法研究员· 2026-09-11

上海 正式

Ailoha 正在构建一种面向人类关系的新智能:捕捉容易消失的细节,理解人与人之间的共同背景,并在合适的时刻呈现真正重要的信息。招聘一位研究员,把这个愿景转化为可以被严格验证的问题:什么叫一个 Agent 理解了「人」以及「人与人之间的处境」?我们如何可靠地测试它?

方向:Human Understanding & Relationship Intelligence 如果一个 AI 记住了两个人说过的所有话,它就真的理解这段关系了吗?它可能记住了事实,却没有理解什么真正重要;可能给出听起来深刻的洞察,却缺乏证据;也可能只是在顺着用户说,却把认同误认为理解。 你将负责(第一阶段重点是 Agent Eval 与 Agent Harness 设计,暂时不以模型训练为主要工作): - 定义关系理解的评估维度:关系信号提取、记忆保真、洞察深度、共同背景重建、反谄媚 - 构建 benchmark、rubric、场景集、自动 judge 和回归测试 - 设计 Agent Harness,使 trajectory、工具调用、记忆更新、环境状态与失败过程可观测、可复现 - 构建模拟与真实关系场景,评估 Agent 在多轮、长周期交互中的行为 - 系统分析信号遗漏、记忆漂移、浅层复述、过度推断、谄媚与过早建议等失败模式 - 把真实产品反馈转化为结构化评估案例和可测量的 Agent 行为 - 为未来的 reward 设计、偏好学习和强化学习建立评估基础 这不是一个运行现成评测集的岗位。测量什么、怎样测试,由你参与决定。 你可能研究的问题: - 关系理解与事实记忆之间的区别是什么? - 如何评估一条完整 trajectory,而不只是最后一次回复? - Harness 应如何表示记忆、工具、环境状态和用户反馈? - 如何区分有价值的洞察与听起来可信的幻觉? - 同理心在什么时候会变成谄媚? - 离线场景能否预测 Agent 在真实长期交互中的行为? - 哪些评估信号未来可以转化为 reward,同时避免模型钻指标的空子? 为什么加入 Ailoha:大多数团队评估的是 Agent 有没有完成任务,Ailoha 想追问的是——Agent 是否充分理解了人的处境,从而做出了合适的行动?你将从第一性原理定义这个问题的 Harness、评估语言和失败模式,并与创始人、产品和工程团队一起,把研究直接带进真实产品。 工作方式:全职 · 上海徐汇滨江 · 线下办公

我们希望你具备: - Agent、LLM Eval、Agent Harness、模型行为分析或 benchmark 构建经验 - 扎实的 Python 能力,能独立搭建可靠的研究与评估基础设施 - 熟悉主流 LLM 推理框架、tool use、memory system 和多步骤 Agent workflow - 对强化学习有扎实理解:environment、trajectory、reward design、credit assignment - 能独立提出假设、设计实验、分析失败并清晰表达结论 - 对「人如何理解人」有超出工作要求的真实好奇心 我们欢迎来自计算机、心理学、认知科学、语言学、社会学和哲学等不同领域的候选人。相比专业名称和学历标签,我们更看重你能否把模糊的人类问题转化为严谨、可运行、可证伪的技术系统。 申请时,我们更想看到:除简历外,欢迎附上一页以内的回答——请描述一个「模型看起来很有帮助,但其实没有理解这段关系」的例子。你会如何证明它没有理解?又会如何把这个判断转化为评估或训练信号?不要求完整方案,我们更想看到你如何定义问题。 投递方式:邮件标题格式为「应聘岗位 + 姓名 + 可到岗时间」

在 Offer岛 浏览更多 AI 岗位 →