AI Infrastructure Engineer(J10621)
岗位信息
| 招聘单位 | 黑芝麻智能 |
|---|---|
| 工作地点 | 上海市、武汉市 |
| 官方更新时间 | 2025-02-19T15:20:10 |
职位描述
1、优化深度学习训练代码:分析和优化现有PyTorch代码,减少计算冗余,提高GPU利用率。
2、提升GPU训练效率:调整混合精度(FP16/BF16)、张量并行、流水线并行等策略,优化内存占用和计算速度。
3、加速分布式训练:使用NCCL、Horovod、DeepSpeed、Megatron-LM等技术优化通信开销,减少节点间的同步瓶颈。
4、构建高性能计算集群:管理和优化Kubernetes、Slurm、Ray等计算资源调度,提升训练任务的吞吐量。
5、数据加载和存储优化:优化TFRecord、Parquet、LMDB等数据格式,加速数据预处理和I/O,减少CPU/GPU等待时间。
6、Profiling和监控:使用nvprof、Nsight、PyTorch Profiler等工具分析训练瓶颈,并提出优化方案。
7、搭建与维护评估基础设施:构建自动化评测管线、指标分析与可视化工具,为大规模模型训练结果提供快速而准确的评估反馈。
8、将评估流程与训练管线或持续集成/持续交付(CI/CD)体系结合,实现评估自动化和高效迭代。
9、优化评估的运行速度和资源占用,提升评估的吞吐量和可扩展性。
10、支持AI研究团队:帮助研究员优化代码、调整超参数,确保模型训练高效稳定。
任职要求
1、计算机科学、软件工程或相关专业硕士/博士,3年以上工作经验。
2、精通GPU计算优化(CUDA、cuDNN、TensorRT),能深入理解和优化训练代码。
3、具备良好的工程能力,熟练使用Python或C++优化深度学习代码,具备调优大规模AI模型的经验。
4、熟练掌握分布式计算,理解NCCL、Horovod、DeepSpeed等优化技术。
5、熟悉混合精度训练(FP16/BF16)、张量并行、ZeRO优化等前沿训练策略。
6、熟悉CI/CD、云计算和容器化(Kubernetes、Docker、Ray),能够管理大规模计算任务。
7、具备搭建评估系统或相关自动化工具的经验,对模型指标监控、对比测试、可视化工具(TensorBoard、MLflow 等)和可视化等有深入理解。
加分项
1、有优化PyTorch/TensorFlow核心代码或提交过深度学习框架开源贡献的经验。
2、熟悉多种评估方法(如自动指标、人工评测、用户反馈等)的落地场景。
3、参与或搭建过 ML 数据管理、模型监控、模型可解释性工具的经验。
4、有云平台上构建深度学习评估管线的经验。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。