百度 · 文心大模型

大模型预训练 Infra 工程师(Attention 方向)· 2026-08-22

北京 正式 实习

百度文心大模型预训练 Infra 团队负责 Attention 方向的训练优化工作,在算子优化、分布式并行、模型架构三个层面持续创新,目标是让大模型训练跑得更快、更长、支持 1M 上下文。

工作方向: 方向一:Attention Kernel 优化 - 高性能 Attention Kernel 开发与调优(FlashAttention、FlashMLA、FlashLinearAttention 等) - 前向/反向 Kernel 的显存与计算效率优化 - Sparse Attention、Linear Attention 等新型注意力机制的高效实现 方向二:长文本分布式训练优化 - 长序列分布式并行方案设计(Context Parallelism、Sequence Parallelism、Ulysses 等) - 激活重计算、通信调度、负载均衡等系统级优化 - 3D/4D 并行策略下的长文本训练效率提升 方向三:长文本模型结构探索 - 超长上下文架构设计(高效位置编码、分层注意力、稀疏 Attention 等) - 长文本训练范式探索(数据策略等) - 前沿论文复现与验证 基本信息: - 地点:北京 - 实习时长:≥ 3 个月,每周 ≥ 4 天 - 优秀实习生有转正机会 投递方式:简历发送至 [email protected],邮件标题格式「Attention方向实习-姓名-学校」,也欢迎先私信沟通方向匹配度。

基本要求: - CS/AI 相关专业在读硕士或博士 - 熟悉 C++/CUDA/Triton/TileLang/CuteDSL 等(Kernel 方向刚需) - 熟悉 PyTorch / PaddlePaddle,了解 Megatron-LM / DeepSpeed / FSDP 至少一种 - 对 Transformer 架构理解深入 - 自驱、动手能力强、对前沿技术有热情 加分项: - 有大模型预训练经验 - 顶会论文发表 - 开源社区贡献

在 Offer岛 浏览更多 AI 岗位 →