招聘公告 · 职位检索 · 央国企/事业单位/名企

AI Infrastructure Engineer(J10621)

单位:黑芝麻智能类型:社招地点:上海市、武汉市更新:2026-09-24

岗位信息

招聘单位黑芝麻智能
工作地点上海市、武汉市
官方更新时间2025-02-19T15:20:10

职位描述

1、优化深度学习训练代码:分析和优化现有PyTorch代码,减少计算冗余,提高GPU利用率。

2、提升GPU训练效率:调整混合精度(FP16/BF16)、张量并行、流水线并行等策略,优化内存占用和计算速度。

3、加速分布式训练:使用NCCL、Horovod、DeepSpeed、Megatron-LM等技术优化通信开销,减少节点间的同步瓶颈。

4、构建高性能计算集群:管理和优化Kubernetes、Slurm、Ray等计算资源调度,提升训练任务的吞吐量。

5、数据加载和存储优化:优化TFRecord、Parquet、LMDB等数据格式,加速数据预处理和I/O,减少CPU/GPU等待时间。

6、Profiling和监控:使用nvprof、Nsight、PyTorch Profiler等工具分析训练瓶颈,并提出优化方案。

7、搭建与维护评估基础设施:构建自动化评测管线、指标分析与可视化工具,为大规模模型训练结果提供快速而准确的评估反馈。

8、将评估流程与训练管线或持续集成/持续交付(CI/CD)体系结合,实现评估自动化和高效迭代。

9、优化评估的运行速度和资源占用,提升评估的吞吐量和可扩展性。

10、支持AI研究团队:帮助研究员优化代码、调整超参数,确保模型训练高效稳定。

任职要求

1、计算机科学、软件工程或相关专业硕士/博士,3年以上工作经验。

2、精通GPU计算优化(CUDA、cuDNN、TensorRT),能深入理解和优化训练代码。

3、具备良好的工程能力,熟练使用Python或C++优化深度学习代码,具备调优大规模AI模型的经验。

4、熟练掌握分布式计算,理解NCCL、Horovod、DeepSpeed等优化技术。

5、熟悉混合精度训练(FP16/BF16)、张量并行、ZeRO优化等前沿训练策略。

6、熟悉CI/CD、云计算和容器化(Kubernetes、Docker、Ray),能够管理大规模计算任务。

7、具备搭建评估系统或相关自动化工具的经验,对模型指标监控、对比测试、可视化工具(TensorBoard、MLflow 等)和可视化等有深入理解。

加分项

1、有优化PyTorch/TensorFlow核心代码或提交过深度学习框架开源贡献的经验。

2、熟悉多种评估方法(如自动指标、人工评测、用户反馈等)的落地场景。

3、参与或搭建过 ML 数据管理、模型监控、模型可解释性工具的经验。

4、有云平台上构建深度学习评估管线的经验。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。