技术总监
岗位信息
| 招聘单位 | 朗坤科技 |
|---|---|
| 工作地点 | 深圳市 |
| 官方更新时间 | 2026-06-23T14:22:17 |
职位描述
一、前期策划与方案设计
1、参与绿电+算力融合方案设计——对接生物质发电侧,在15MW级供电容量下进行GPU集群规模规划、电力匹配方案与调度策略设计
2、主导技术可行性研究与选型论证——GPU型号选型(B300/H200/昇腾910B)、供配电架构设计、冷却方案比选、网络架构规划
3、参与投资测算的技术假设输入——功率密度、PUE、建设周期、设备折旧等技术参数
二、建设交付与运维体系
1、千卡级GPU集群全链路交付(上架·组网·测试·验收)
2、7×24运维体系从0搭建(值班·监控·告警·故障处理·变更管理)
3、GPU硬件故障定位与IB/RoCE高速网络运维
三、客户保障与业务支撑
1、牵头制定客户SLA保障体系——面向腾讯/字节/阿里等大客户的验收标准制定(可用性≥99.9%、故障响应、赔偿机制)
2、搭建算力租赁业务的计量计费技术支撑能力——按卡·小时/按任务/按FP16算力等计量模型与计费系统架构
3、持续优化PUE与算力利用效率,对交付质量和客户满意度负责
任职要求
1、40岁以下 2、5年以上算力/IDC技术经验,含至少1次千卡级集群全链路操盘 3、本科及以上,计算机/电子/通信/自动化相关专业;研究生加分 4、深圳优先;可接受广州/东莞候选人(深圳通勤可接受)
5、硬性条件:亲自参与或主导过≥500张GPU(H100/A100/4090级别)的集群部署与稳定运行,可还原具体故障处理案例;能独立完成GPU/CPU/内存/网卡/PCIe等硬件故障定位、替换和固件升级,有实际操作经验而非纯管理;有InfiniBand或RoCE高性能网络组网、调测、NCCL测试经验;非纯软件或纯监控背景;建立过算力集群的标准化交付流程(包括验收、环境开通、资源隔离、性能基准测试);有建立过运维值班制度、监控告警体系(GPU利用率/温度/故障告警)、SLA指标体系的实际经验;能参与生物质发电侧对接,在15MW级供电容量下进行GPU集群规模规划、电力匹配与调度方案设计;非纯运维执行者;能牵头制定面向腾讯/字节/阿里等大客户的SLA验收标准,包括可用性指标(≥99.9%)、故障响应时间、赔偿机制等;具备算力SaaS化计量计费的技术架构能力(按卡·小时/按任务/按FP16算力等),能支撑算力租赁业务的技术运营
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。