职位编号 J20260820101941130428
数据采集工程师
70-130万北京市本科3-5年招聘 1 人预计佣金 168.5K1天前刷新/8月20日 13:51发布
职位信息项目手册职位进展做单须知佣金规则发单顾问
寻访须知
必要条件:必备能力 精通Python及Scrapy框架,深入理解HTTP协议与动态页面渲染机制 熟悉java 或 c++, 对计算机底层原理有较深入了解 掌握主流数据库(MySQL/MongoDB/Redis/HBase)和消息队列(Kafka/Pulsar) 具备分布式爬虫开发经验,熟悉任务调度与性能优化策略 熟悉Spark进行大规模数据清洗,了解Ray/Dask等分布式计算框架
优先条件:1年以上爬虫开发经验,主导过至少1个中大型爬虫项目落地 有复杂反爬机制破解案例 有Spark/Ray等大数据组件在爬虫任务中的实际应用经验 加分项 掌握JS逆向分析及浏览器自动化工具(如Selenium/Puppeteer) 熟悉容器化部署(Docker/Kubernetes) 在专有领域有数据采集经验 职位信息
目标公司/行业:AI互联网大厂
必问问题:
待发单方补充
JD基本信息
岗位职责
职位描述
岗位职责
设计并实现大规模网页数据的抓取、清洗及结构化、存储流程,保障数据质量与时效性.
熟悉反爬机制及应对策略,开发高可用的数据采集与清洗方案.
构建基于分布式框架(如scrapy-redis、celery)的爬虫系统,提升并发性能与容错能力.
融合大数据组件(如spark/pyspark)优化数据处理效率,支持实时、批量清洗与转换任务.
协同数据团队完成数据交付,驱动下游分析与应用.
任职要求
必备能力
精通python及scrapy框架,深入理解http协议与动态页面渲染机制
熟悉java 或 c++, 对计算机底层原理有较深入了解
掌握主流数据库(mysql/mongodb/redis/hbase)和消息队列(kafka/pulsar)
具备分布式爬虫开发经验,熟悉任务调度与性能优化策略
熟悉spark进行大规模数据清洗,了解ray/dask等分布式计算框架
2年以上工作经验,1年以上爬虫开发经验,主导过至少1个中大型爬虫项目落地
有复杂反爬机制破解案例
有spark/ray等大数据组件在爬虫任务中的实际应用经验
加分项
掌握js逆向分析及浏览器自动化工具(如selenium/puppeteer)
在专有领域有数据采集经验
职位信息
工作地点
-
所属行业:互联网、人工智能/大模型/算力、计算机软件
职能分类:数据采集
工作城市:
北京,招聘1人,详细地址:北京市
职位要求
学历要求:本科·统招·985/211
工作年限:3-5年
薪资福利
年薪范围:70-130万 15薪
薪资福利:-
面试信息
面试轮次:3轮
视频面试:可以接受
面试流程:-