新增一个远程岗位需求,远程爬虫,底薪15-20k; 任职要求 1.熟练掌握 Python 编程语言,有使用 Scrapy、Requests、BeautifulSoup、Selenium、Playwright 等爬虫相关库的实战经验; 2.熟悉 HTTP 协议、浏览器行为、Cookie / Session 等机制,有对抗网站反爬的经验; 3.熟悉常见数据格式与处理方式(如 JSON、XML、正则、XPath、CSS Selector); 4.熟悉数据库(如 MongoDB / MySQL / Redis)进行数据存储与管理; 5.有分布式爬虫、异步爬虫或大规模采集系统开发经验优先;工作认真负责,具备良好的沟通能力与团队协作精神; 6.熟悉 JS 动态渲染机制或有处理 JavaScript 加密数据的经验者优先。 岗位职责 1.负责目标网站的数据采集程序开发,设计高效、稳定的爬虫系统; 2.研究网站结构、反爬机制,制定相应的反反爬策略; 3.参与数据清洗与结构化处理,确保采集数据的完整性与可用性;与产品、运营、数据分析等团队协作,根据业务需求调整爬取逻辑;持续监控与优化爬虫系统的性能,保障系统稳定运行; 4.研究并引入新技术,如分布式爬虫(Scrapy Cluster、Frameless)、动态渲染(Selenium、Playwright)等。 加分项:有处理多语言站点 / 海外内容采集经验;熟悉代理池管理、验证码识别、OCR 相关技术;有参与过色情、小说、电商、招聘、社交等高反爬类型网站的数据采集项目;有 DevOps、容器化部署(Docker)经验者优先。 需要接受测试 详情咨询:@xiaoji2222 @Emmi_51
3July 9, 2025 1.7K 1