超算平台研发工程师(J20393)
岗位信息
| 招聘单位 | 哈啰出行 |
|---|---|
| 工作地点 | 北京市、上海市 |
| 官方更新时间 | 2025-09-09T13:34:15 |
职位描述
● AI Coding 优先:团队默认用 Cursor 等工具做日常开发;每人每月 $1,000–$3,000 USD AI 工具额度(以公司当期政策为准),鼓励用 AI 辅助 Profiling 解读、实验记录与报告沉淀,把精力集中在瓶颈突破与方法论。
● L4 真实场景:海量多模态与时序数据下的训推效率直接决定迭代速度,优化成果可量化、可复用。
● 人才画像:看重 产品力(能把优化经验沉淀为平台默认策略与「可自助」的工具,而不是一次性脚本)与 自驱性(主动建指标、拉实验、推动跨团队落地)。
岗位概述
聚焦 L4 算法在 海量多模态与时序数据 下的 训推效率与规模化:提升 GPU 利用率、缩短实验迭代周期、优化推理 延迟 / 吞吐,以 Profiling 与可复现实验驱动优化,并沉淀为 平台默认策略与规范。
岗位职责
● 建立 性能指标体系(利用率、MFU、吞吐、延迟、数据加载占比、排队时长等),与监控及 Profiling 工具链打通,支撑版本对比与回归。
● 定位并优化瓶颈:多机通信(NCCL)、I/O 与数据管线、Checkpoint、CPU–GPU 流水、小 batch、调度碎片化;推动存储 / 网络 / 框架默认配置协同。
● 数据加载与 PyTorch DataLoader:结合 Profiling 优化 CPU 解码与 Dataset 实现;调参 num_workers / prefetch_factor / persistent_workers / pin_memory 与 non_blocking H2D 重叠;推动 海量小文件场景下的打包格式与顺序读(如 WebDataset、LMDB、Parquet/Arrow 等选型与落地),缓解 数据等待占比。
● 结合 仿真回灌、大规模离线评测、实车 / 台架约束,输出环境与并行策略最佳实践,并与平台研发固化到模板与诊断能力。
● 跟踪 CUDA、通信库、新硬件 在典型智驾 workload 上的收益与风险。
任职要求
任职要求
扎实的 性能分析与实验设计 能力(如 PyTorch Profiler、Nsight Systems/Compute、perf、分布式 Trace 等至少深入一类)。
● 熟悉 GPU 训练 / 推理 范式;理解 数据并行、张量并行、流水线并行 及典型通信模式。
● Python 熟练;能阅读 C++ / CUDA 或愿意深入;Linux 网络 / 存储 基础扎实。
● 产品力与自驱性:能定义「团队看得懂、用得上」的性能看板与 playbook,并主动推动采纳。
加分项
● BEV / 时序多相机、点云或端到端 等 workload 上的实际调优案例。
● 熟悉 DeepSpeed / Megatron、vLLM / Triton 等之一在业务中的落地与取舍。
● 有 DataLoader / 多模态读路径 / DALI、TorchData 等高效数据管线实践,能量化 数据加载占比 与优化前后吞吐。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。