中交信科集团云计算平台架构师(J45810)
岗位信息
| 招聘单位 | 上海振华重工 |
|---|---|
| 工作地点 | 北京市、全国 |
| 官方更新时间 | 2025-12-05T11:47:23 |
职位描述
负责智能算力事业部算力纳管平台的设计开发工作,牵头组织搭建开发团队。
主要职责
1、主导异构算力平台的整体架构设计、搭建和持续优化;
2、 设计并实现多种异构计算资源(GPU、FPGA、NPU、MLU等)的统一接入和管理框架;
3、研发高性能、可扩展的资源调度系统,优化复杂场景下的算力分配策略;
4、 架构先进的租赁管理系统,支持灵活多变的租赁模式和精细化配置;
5、开发高精度、高可靠的计量计费系统,支持多维度的计费模型;
6、制定平台技术标准和开发规范,确保系统的可靠性、安全性和可扩展性;
7、协助团队攻克技术难点,并推动平台技术创新;
任职要求
1.本科及以上学历;计算机、自动化、机电等相关专业优先;
5年以上相关工作经验 ,3年以上管理工作经验。具有相关行业、业务领域5年以上从业经历。具备3年以上云计算平台或大规模分布式系统开发经验;主持或参与过算力纳管平台的设计、开发工作
2、精通Go或Java语言,具备使用这些语言设计和开发复杂系统的丰富经验
3、 深入理解容器技术(如Docker、Kubernetes)生态,熟悉其内部原理和资源调度机制
4、熟练掌握异构芯片加速库和工具链(如CUDA、ROCm、OneAPI等)的开发和优化方法
5、精通分布式系统设计原则,有解决高并发、高可用、大规模分布式系统挑战的实战经验
6、 具备复杂计量计费系统的设计和开发经验
7、 卓越的问题分析和解决能力,能够有效推动跨团队协作组织事业部的技术总结与交流相关活动
专业技能或能力:
1、具有较强的计划统筹能力,具备较好的信息处理、风险管理和决策能力
深入理解 GPU/TPU 等 AI 加速硬件的体系结构,熟悉算力调度与硬件配置优化。
2、精通 Linux 系统优化(驱动、网络、存储、调度),熟悉 Docker/K8s 等容器化与集群管理。
3、熟悉 CUDA 编程、cuDNN、NCCL 等 GPU 加速库,具备多机多卡分布式训练环境搭建经验。
4、有 AI 基础应用栈的实战经验(分布式训练、参数服务器、调度器等),能独立优化性能瓶颈。
5、掌握 PyTorch 或 TensorFlow,了解大模型(LLM/多模态)训练与推理流程。
6、良好的问题分析与解决能力,能够在硬件、系统和模型三个层面综合定位与优化问题。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。