大模型训练性能优化工程师(训练算子)(深圳/北京/上海/杭州)
岗位信息
| 招聘单位 | 腾讯 |
|---|---|
| 部门/事业群 | TEG |
| 所属产品 | 公共 |
| 工作地点 | 北京 |
| 经验要求 | 两年以上工作经验 |
| 官方更新时间 | 2026年08月05日 |
职位描述
1.负责深度学习训练相关算子的设计、实现与优化( CUDA/CUTLASS/Triton );
2.面向大模型训练场景,对算子进行端到端性能分析与调优,持续挖掘吞吐、延迟、显存利用率等指标的优化空间;
3.参与或主导 3D 并行(Data / Tensor / Pipeline Parallel 等)训练体系下的算子与通信方案设计与优化;
4.与分布式训练、系统、模型算法团队密切协作,共同提升大规模训练任务的整体效率与稳定性;
5.跟踪业界前沿的硬件架构与系统软件(GPU 架构、网络、编译器、库等),将最新技术转化为实际性能收益。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。