资深大模型算法工程师(J11975)
岗位信息
| 招聘单位 | 中康科技 |
|---|---|
| 工作地点 | 广州市 |
| 官方更新时间 | 2026-08-26T11:17:52 |
职位描述
1、整体架构设计: 负责大模型全链路算法架构设计,制定从数据构建、预训练/增量预训练、SFT(指令微调)到 RLHF/DPO(对齐)的技术路线图,平衡模型效果与训练成本。
2、垂类模型优化: 针对医疗领域的专业性,优化Qwen系列开源模型,解决模型在医学知识推理、病历理解等方面的准确性问题;探索长文本(Long Context)技术以处理复杂病历。
3、应用架构攻坚: 参与设计“检索增强生成(RAG)+ 大模型”的混合架构,解决模型幻觉问题;参与Agent(智能体)框架设计工作,赋予模型调用医疗工具、查询知识库及多轮对话的能力。
4、性能与工程化: 负责训练及推理侧的效率优化。利用 DeepSpeed/Megatron 进行分布式训练加速;通过量化(Quantization)、vLLM/TensorRT 等技术优化推理服务,降低线上部署成本。
5、前沿探索与团队引领: 跟踪 mHC、MoE、多模态(Multimodal)、思维链(CoT)等前沿技术,结合业务场景进行创新;主导关键技术难题攻关,提升团队整体技术深度。
任职要求
1、学历背景: 计算机、人工智能、数学等相关专业硕士及以上学历,有医疗/生物信息+AI交叉背景者优先。
2、核心经验:5年以上算法工作经验,3年以上大模型(LLM)或大规模NLP预训练相关经验。具备完整的垂直领域大模型落地经验(从数据清洗 -> SFT -> 评测 -> 部署)。
3、深度学习与框架:精通 PyTorch,对 Transformer 架构(Attention机制、位置编码等)有深刻理解。熟悉主流开源模型(Llama, Qwen, Baichuan等)的源码及模型结构差异。
4、训练与调优能力:熟练掌握 SFT、RLHF、DPO 等训练流程。懂分布式训练底层原理,熟悉 DeepSpeed, Megatron-LM 等框架,了解 ZeRO, Tensor Parallelism 等并行策略。
5、数据敏感度:对高质量数据构建有深刻理解,熟悉医疗数据的清洗、合成(Data Synthesis)及隐私处理方法。
6、综合素质: 具备架构师思维,能平衡“模型效果”与“工程成本”;具备优秀的跨部门沟通能力,能与非技术人员(如医生)顺畅协作。
7、加分项:医疗行业Expertise: 有电子病历处理、医学知识图谱构建、医疗问答系统开发经验者极佳。
8、学术/开源影响力: 在 ACL/EMNLP/NeurIPS 等顶会发表论文,或在 HuggingFace/GitHub 有高Star 开源项目者。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。