具身智能 - 机器学习平台 SRE
岗位信息
| 招聘单位 | 千寻智能 |
|---|---|
| 工作地点 | 北京 |
| 官方更新时间 | 2025-08-19 19:24:30 |
职位描述
1、保障平台稳定运行:负责具身智能端到端 AI 平台的日常运维,搭建监控体系,实时监测并解决故障,确保平台稳定运行。
2、信息安全防护:制定并执行安全策略,通过漏洞扫描、入侵检测等手段,保障平台与数据的安全及完整性。
3、优化系统性能:分析运行数据,识别瓶颈并实施优化,提升系统在高并发、大规模数据处理场景下的性能与可靠性。
4、应急与灾备管理:制定应急预案,快速响应并处理重大故障;建立灾备体系,定期演练确保数据与服务可恢复。
5、跨团队协作:与多团队协作,参与系统设计、开发及部署,从运维角度提供建议,协助解决技术问题。
任职要求
1、专业背景:计算机、信息技术、网络安全等相关专业本科及以上学历,3 年以上大型分布式系统或互联网平台 SRE、运维经验。
2、技术能力:
- 熟悉分布式系统架构,具备高并发、高可用系统的运维经验,了解容器化技术(如 Docker、Kubernetes)及微服务架构的运维模式。
- 掌握至少一种主流编程语言(如 Python、Golang 等),能够编写脚本进行自动化运维和故障排查。
- 熟悉监控工具(如 Prometheus、Grafana 等)、日志分析工具(如 ELK 栈)的使用与配置,能够搭建完善的监控和告警体系。
- 具备网络、服务器、存储等基础设施的运维知识,熟悉主流操作系统(如 Linux)的配置与管理。
- 了解信息安全相关技术和标准,具备网络安全、数据安全防护经验,有相关安全认证(如 CISSP、CEH 等)者优先。
- 有数据采集系统、MLOps 平台或机器人相关系统运维经验者优先。
3、综合素养:
- 具备强烈的责任心和故障解决能力,能够在压力下快速响应并处理问题。
- 拥有良好的分析和判断能力,能准确识别系统潜在风险并采取预防措施。
- 具备优秀的沟通和协作能力,能与跨职能团队高效合作,推动问题解决。
- 对具身智能领域有一定兴趣,愿意持续学习和探索相关技术。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。