招聘公告 · 职位检索 · 央国企/事业单位/名企

多模态大模型推理服务研发工程师-Data AML(北京/上海/杭州/深圳)

单位:字节跳动类别:基础架构类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位字节跳动
工作地点北京
官方更新时间2026-05-28 13:54:09

职位描述

1、在线推理服务开发:负责Seedance、Seedream、Seed3D等SOTA模型在线Serving系统的设计与开发,构建高并发、低延迟、高可用的推理服务,支撑多模态、视频生成等模型的线上实时推理;

2、推理框架研发:参与推理框架功能开发,包括请求调度、模型并行(TP/PP)、多模型混合部署等能力建设;

3、服务架构演进:设计并落地推理服务的核心架构,涵盖流量调度、负载均衡、弹性扩缩容等,保障大规模GPU集群上的服务稳定性;

4、性能与效率优化:针对端到端推理链路进行系统级优化,提升GPU利用率、提升服务吞吐;

5、工程质量与稳定性:主导推理服务的可观测性建设(监控、告警、链路追踪),参与线上问题诊断与专项治理,持续提升系统稳定性和运维效率。

任职要求

1、计算机相关专业本科及以上学历,精通Go/Python/C++中至少一门,具备良好的系统设计与编码能力;

2、扎实的后端开发基础:熟悉高并发服务架构设计,有RPC框架、异步并发、连接池、限流熔断等实战经验;

3、熟悉分布式系统核心概念:负载均衡、服务发现、消息队列、分布式缓存等,能独立设计和落地高可用服务;

4、具备性能分析与调优意识:熟悉Profiling工具,有系统级性能瓶颈定位和优化经验;

5、对大模型推理服务有浓厚兴趣,具备较强的自驱力、学习能力和跨团队协作能力。

加分项:

1、有大模型在线推理服务实战经验;

2、了解主流模型架构(Transformer/DiT/MoE)及推理优化技术;

3、有在线服务研发经验,处理过GPU集群调度问题;

4、有推理框架插件开发或模型Serving工具链建设经验。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。