高级数据采集工程师(J11979)
岗位信息
| 招聘单位 | 中康科技 |
|---|---|
| 工作地点 | 广州市 |
| 官方更新时间 | 2026-08-26T14:03:06 |
职位描述
1.核心爬虫系统设计与落地:
针对目标网站/App设计高效、稳定的数据采集方案,解决复杂反爬策略(如动态加密、签名校验、验证码对抗、IP限制等),保障数据采集的时效性与完整性。
2.网页逆向深度攻坚:
主导网页逆向工程,熟练运用抓包工具(Charles/Fiddler/Wireshark)、浏览器调试(DevTools/JS断点)及逆向工具(如AST分析、反混淆),破解前端加密(AES/RSA/自定义算法)、反调试机制,还原真实请求逻辑。
3.App逆向基础突破:
负责移动端App(Android/iOS)的基础逆向分析,使用IDA/Apktool/Jadx等工具解析APK/IPA包,处理签名校验、反调试、内存dump等问题,获取关键接口数据;熟悉常见加固方案(如360加固、爱加密)的初步绕过。
4.爬虫框架与分布式优化:
基于Scrapy/Feapder等主流框架开发高并发爬虫,结合Redis/Kafka实现分布式任务调度,优化异步请求(aiohttp)、去重策略(布隆过滤器)及断点续爬能力,提升系统吞吐量。
5.AI技术与爬虫融合探索:
关注AI在爬虫场景的应用潜力,尝试通过OCR(PaddleOCR/Tesseract)识别复杂验证码、NLP解析非结构化数据,借用AI工具,推动调试&采集效率。
任职要求
1.硬性技能(需至少满足3年以上相关经验)
2. 网页逆向(中高级):
深入理解HTTP/HTTPS协议、前端渲染机制(SPA/Vue/React),能独立分析复杂页面动态加载逻辑(XHR/Fetch/WebSocket); 熟练使用抓包工具定位加密参数(如token/sign/cookie),掌握JS逆向(Hook/断点调试)、CSS反爬、字体反爬等常见反制手段的破解方法;有成功对抗过高级反爬系统(如某团/某东/某资讯平台)的经验优先。
3.App逆向(初级):
掌握Android逆向基础:能反编译APK(Apktool/Jadx),分析Java层逻辑,处理签名校验、反调试(Xposed/Frida对抗);了解iOS逆向基础(如class-dump/LLDB),能处理简单IPA包的接口分析;熟悉常见加固方案的识别与初步绕过(无需精通so库逆向)。
4. 爬虫框架与工程能力:
熟练使用Python/Go语言,精通Scrapy/PySpider框架,熟悉分布式架构(Scrapy-Redis/Gecco);掌握异步编程(aiohttp/httpx)、并发控制、代理池搭建(阿布云/自建代理)及IP轮换策略;具备良好的代码规范与文档习惯,能编写高可维护的爬虫脚本。
5.AI探索兴趣:
对机器学习/AI技术有基础认知,了解OCR、NLP或模型训练的基本流程;有尝试用AI工具优化爬虫场景(如自动识别验证码、分类反爬类型)的实践案例优先。
6.软性素质:
对技术有强好奇心,能主动研究新型反爬手段(如WebAssembly/浏览器指纹)及应对方案; 具备优秀的逻辑分析与问题拆解能力,能从日志/报错中快速定位瓶颈;良好的团队协作意识,能与数据、后端团队高效配合,输出技术方案;
【加分项】
• 有舆情平台爬虫实战经验;
• 掌握C/C++/Rust等语言,能直接操作底层(如浏览器扩展开发、Hook框架);
• 有AI项目落地经验(如用TensorFlow/PyTorch训练验证码识别模型)。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。