小米 · HyperAI

端侧全模态 Omni / TTS 大模型算法实习生· 2026-09-03

国内大厂 北京 实习

小米 HyperAI 团队长期招募:不是只跑 Benchmark 的模型,而是真正跑在手机上——接麦克风、摄像头、扬声器、屏幕与系统能力,实时地听、看、理解、说话和执行。工作地点小米科技园。

你会做什么: - Audio Encoder / Speech Tokenizer / LLM / Speech Decoder 等模块设计与实验 - 语音、文本、视觉等不同模态之间的对齐与融合 - Speech-to-Text、Speech-to-Speech、Audio Understanding 等能力训练 - 探索流式语音、低首包延迟、打断、全双工等实时交互能力 - 参与模型量化、推理优化与手机端真机验证 技术链路:麦克风 → Audio Encoder(听)、摄像头 → Vision Encoder(看)→ Omni Model(理解 · 决策)→ Speech Token → Decoder(说) / Text · System Call(执行);关键词:流式、低首包延迟、可打断、全双工。

基本要求: - 熟悉 Python / PyTorch,有较好的模型训练与实验能力 - 对 Audio / TTS / VLM / Omni 至少一个方向有实际经验 - 能读论文、复现方法,并独立分析实验结果 - 实习 3 个月以上、每周 4 天+,长期优先 强加分项: - Audio LLM / TTS / Speech Generation 模型训练经验 - 多模态 SFT、DPO、GRPO、RL 等后训练经验 - 熟悉 vLLM、SGLang、DeepSpeed、Megatron 等框架 - 大规模语音数据构建、清洗、合成、质量筛选或配比经验

在 Offer岛 浏览更多 AI 岗位 →