**********************
大模型数据采集工程师/专家
  • 收藏职位
  • 分享职位
40-120万 北京 本科 5-8年 招聘 3 人 预计佣金 124.4K 10:18刷新/一周前发布
JD基本信息
岗位职责
岗位职责 设计并实现大规模网页数据的抓取、清洗及结构化、存储流程,保障数据质量与时效性。 熟悉反爬机制及应对策略,开发高可用的数据采集与清洗方案。 构建基于分布式框架(如Scrapy-Redis、Celery)的爬虫系统,提升并发性能与容错能力。 融合大数据组件(如Spark/PySpark)优化数据处理效率,支持实时、批量清洗与转换任务。 协同数据团队完成数据交付,驱动下游分析与应用。
任职要求
任职要求 必备能力 精通Python及Scrapy框架,深入理解HTTP协议与动态页面渲染机制 熟悉java 或 c++, 对计算机底层原理有较深入了解 掌握主流数据库(MySQL/MongoDB/Redis/HBase)和消息队列(Kafka/Pulsar) 具备分布式爬虫开发经验,熟悉任务调度与性能优化策略 熟悉Spark进行大规模数据清洗,了解Ray/Dask等分布式计算框架
所属行业:
互联网、人工智能/大模型/算力、计算机软件
职能分类:
数据采集
工作城市:
北京,招聘3人,详细地址:海淀区清华科技园
职位要求
学历要求:
本科·统招·985/211
工作年限:
5-8年
技能/证书:
-
薪资福利
年薪范围:
40-120万*16薪
薪资福利:
-
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
3轮
面试流程:
-
视频面试:
可以接受
为你推荐