数据采集(爬虫)工程师(J10700)
岗位信息
| 招聘单位 | 麦科田医疗 |
|---|---|
| 工作地点 | 深圳市 |
| 官方更新时间 | 2026-07-30T08:37:29.3402695 |
职位描述
1. 需求驱动的数据采集:根据算法 / 业务需求,设计并实现针对性爬虫,采集公开医学文献、诊疗指南、临床试验、专利、招投标、竞品与政策法规等数据。
2. 科研类数据专项:熟悉 PubMed、临床试验登记库、学术期刊 / 学位论文、专利库等学术来源的检索与抓取,处理文献元数据与医学术语。
3. 数据清洗与结构化:对 HTML / PDF / JSON 等多格式做解析、去重、清洗、标准化,产出可入库、可用于模型训练的结构化数据。
4. 反爬与稳定性:应对反爬(代理池、限速、验证码、登录态、动态渲染),保障采集稳定、增量、可调度、可监控。
5. 采集流水线:构建可复用、可调度的采集任务(定时 / 增量 / 分布式),对接数据中台与信息抓取平台。
6. 合规把控:评估数据来源的合法性与使用边界,遵守 robots / 服务条款,规避法律与隐私风险。
任职要求
1.本科及以上,计算机 / 软件相关专业;2 年以上爬虫 / 数据采集经验。
2. 精通 Python 或 Go(至少其一):熟悉 requests / Scrapy / aiohttp,或 colly / goquery 等采集框架。
3.熟悉 HTML / CSS 选择器 / XPath / 正则解析;熟悉 Playwright / Selenium 等动态渲染抓取。
4.熟练 SQL,掌握至少一种数据库落地(MySQL / PostgreSQL / MongoDB / Elasticsearch)。
5.具备扎实的数据清洗、去重、结构化能力;熟悉增量采集与任务调度(Airflow / DolphinScheduler / cron)。
6. 熟悉反爬对抗(代理、UA 轮换、限速、验证码、登录态、浏览器指纹)与分布式爬虫。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。