JD基本信息
岗位职责
职位描述
1. 原生多模态端到端交互系统研发:主导/参与 any-to-any / omni-to-omni 原生多模态交互大模型的架构设计与核心策略研发.
打破级联拼接死锁,在统一网络中实现流式音频、高频 3d 视觉空间特征与语言文本的高维流式对齐,打造视听结合的多模态交互体验.
2. 全双工流式交互体验提升:深度优化流式全双工交互机制,构建高敏捷的流式判停、无感插话、自然打断与拒识算法.
攻克全双工并发与自回归解码的顺序死锁,实现百毫秒级语义接管,支持在不阻塞当前全双工业务流的前提下,异步高频调用底层技能.
3. 交互驱动型任务闭环:以全双工交互为核心入口,结合流式多模态感知与agentic os ,打通机器人在复杂物理现场中长程任务的自主规划、执行与动态自进化闭环,提升任务完成成功率
构建模糊和突发事件的主动追问澄清,多模态长程任务中的必要人机信息同步,交互模型与底层本体原子技能的高效协同等.
4. 交互沙盒演进系统:负责全双工交互的仿真练兵场(沙盒体系)构建.
配合端侧"影子模式",设计高频多模态异常数据(如长尾卡壳、打断失败片段)的"错误切片大回流"链路,并将其注入仿真沙盒进行千倍速的高烈度对抗
主导建立一套包含全双工流式评测、技能协同评测在内的多模态一致性仿真评测体系,全面加速模型交互智商的自进化.
任职要求
职位要求
1. 背景与资历:计算机、人工智能、自动化、声学或相关专业硕士及以上学历
具备 3 年以上(或博士毕业后 2 年以上)在一线科技大厂、头部 ai 研究机构或前沿具身智能企业多模态/语音大模型研发的实际工程落地经验.
具备极扎实的深度学习理论基础,深刻理解原生多模态大模型(speech2speech / omni-to-omni)的序列建模原理、流式架构.
2. 具备极强的编程与工程架构能力,精通 python,掌握 pytorch 及主流大模型分布式训练与推理调优工具(如 megatron-lm、deepspeed、vllm 等),能通过模型、架构、链路调优解决业务痛点.
熟练使用ai辅助工作提效,深度使用claude/codex,并有自己见解.
3. 对具身智能有极大的技术热忱,具备优秀的跨团队协作与软硬一体化协同思维
4. 作为核心成员完整参与过国内外主流原生多模态/全双工大模型底层训推、对齐及全双工状态重构者优先.
5. 在 icml、neurips、iclr、icassp、interspeech 等国际顶ai 或语音学术会议/期刊上以第一作者发表过重磅多模态/全双工交互相关论文,或在知名语音/多模态 ai 竞赛中获得过 top 名次者优先.
工作城市:
上海,招聘2人,详细地址:杨浦区 复旦大学旁边