**********************
多模态理解(数据/算法)研究员
  • 收藏职位
  • 分享职位
150-250万 北京、杭... 本科 3-5年 招聘 2 人 预计佣金 340K 16:00发布
72小时新发
JD基本信息
岗位职责
【工作职责】 负责多模态基座模型的迭代. 探索视觉编码器和 vlm 的结构、训练策略和评测方式,针对多模态场景持续验证和迭代预训练与后训练(sft / rl / opd)算法. 负责多模态理解数据体系构建. 定义图文/视频数据集的采集方式、质量标准和筛选方法,多部门协作建设大规模自动化清洗、质量筛选与数据合成管线,从数据侧提高模型表现. 针对通用问答、文档/图表解析、多模态推理等基础多模态场景,进行针对性的数据收集、模型训练和精细化调优. 推动 gui、白领办公、多模态搜索等场景的多模态 agent 核心能力建设与落地. 搭建面向"用户真实体验"的多维度多模态评测体系. 从定义评测维度、收集真实数据、数据标注到模型反馈,定位模型短板,指引模型迭代. 【核心要求】(满足其一即可):
任职要求
我们的使命,是为 ai 注入"看懂并理解世界"的多模态灵魂,让模型在面对复杂的真实世界时,依然能展现出精准的感知与推理能力. 在这里,你将会挑战多模态领域的本质难题: 深入理解主流视觉编码器(如 clip, siglip 等)的模型结构,熟悉其训练与评测方法. 熟悉主流多模态模型的架构,具备大规模多模态预训练或后训练(sft/rl/opd)实战经验. 具备极强的数据直觉,有大规模图文/视频数据清洗、质量标注及数据合成的实战经验. 具备一定的工程代码能力. 主导和交付过多模态某个垂直领域(包括但不限于 ocr、image caption、空间理解、通用 qa、用户意图理解或 agent 场景)的模型训练与数据迭代. 深入研究过多模态模型评测体系建设,不满足于依赖公开榜单,有独立设计人工评测或自动评测流程的经历. 即使没有上述特定经验,只要基础特别扎实、代码能力极强、对多模态有极致渴望,我们也欢迎. 【加分项】 有行业影响力的高引论文或知名项目贡献. 对模型自身真实能力的提升有极致追求,反感且不愿意通过"刷榜"来换取指标的虚假繁荣. 对多模态模型的技术发展趋势和应用场景有深刻洞察.
所属行业:
互联网、人工智能/大模型/算力
职能分类:
数据分析师
工作城市:
杭州,招聘1人,详细地址:杭州市北京,招聘1人,详细地址:海淀
职位要求
学历要求:
本科·985/211
工作年限:
3-5年
技能/证书:
-
薪资福利
年薪范围:
150-250万*15薪
薪资福利:
-
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
3轮
面试流程:
两轮笔试+技术面试
视频面试:
可以接受
为你推荐