招聘公告 · 职位检索 · 央国企/事业单位/名企

资深HPC&云原生基础架构工程师(芯片研发)(J10570)

单位:星宸科技类型:社招地点:深圳市、上海市更新:2026-09-24

岗位信息

招聘单位星宸科技
工作地点深圳市、上海市
官方更新时间2026-07-27T16:02:49

职位描述

1. 负责芯片研发 HPC 平台的规划、建设、升级、运维和性能优化。

2. 负责 HPC集群管理及调度策略优化,包括队列、资源、Fairshare、抢占、回填调度、项目配额和高可用管理。

3. 分析芯片研发计算环境中的性能瓶颈,覆盖计算、内存、存储、网络、调度和 EDA License 等维度。

4. 根据芯片研发项目和 Tape-out 周期进行容量规划、资源预测和架构扩展。

5. 负责传统基础架构及研发服务向 Kubernetes 云原生架构迁移。

6. 负责生产级 Kubernetes 集群的部署、升级、运维、监控和故障处理。

7. 建立公司级资源监控平台,对公司各集群持续优化和效率提升。

8. 与芯片研发、EDA、存储、网络及供应商协作,推动基础架构问题闭环和架构持续演进。

任职要求

1. 具备8年以上的芯片研发、EDA 或半导体行业 HPC 平台建设和运维经验。

2. 精通至少一种主流的HPC调度器,能够独立完成集群部署、升级、调度优化、性能分析和故障处理。

3. 具备生产级 Kubernetes 运维及传统架构向云原生架构迁移经验。

4. 熟悉 Linux 系统、NFS/并行文件系统、高性能网络及性能调优。

5. 能够从计算、存储、网络、调度和 License 等维度综合分析 HPC 性能瓶颈。

6. 熟悉 Python、Shell、Ansible 等自动化技术。

7. 具备大型集群容量规划、架构设计和跨团队项目推动能力。

8. 熟悉主流 EDA 工具、FlexLM、GPFS、Lustre、Slurm 或 GPU 集群者优先。

三、加分项

1. 具备 Cadence、Synopsys、Siemens EDA 等工具运行环境支持经验。

2. 熟悉 FlexNet/FlexLM、RLM 等许可证管理系统。

3. 熟悉 IBM LSF License Scheduler。

4. 熟悉 Slurm、PBS Pro、OpenPBS、SGE 等其他 HPC 调度平台。

5. 具备 GPFS/Spectrum Scale、Lustre、BeeGFS、Ceph、JuiceFS 等文件系统经验。

6. 具备 GPU 集群、CUDA、NVIDIA GPU Operator 或 AI/HPC 融合平台经验。

7. 具备 Kubernetes Operator、Helm、Argo CD、GitOps 或 Jenkins CI/CD 经验。

8. 具备 Prometheus、Grafana、ELK、Datadog 等监控平台建设经验。

9. 具备大规模集群容量规划、成本分析或资源计费系统建设经验。

10. 具备英文技术文档阅读、原厂支持沟通及跨团队项目推动能力。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。