小米科技有限责任公司

顶尖应届-语音理解大模型算法工程师-大模型

北京集团技术委员会校园招聘顶尖应届集团技术委员会官网 · HTML
分享这个机会转给正在找工作的朋友

SHARE POSTER

职位分享海报

长按图片可保存;二维码直达职位详情,并标记匿名分享渠道。


职位说明

1、研发语音理解大模型核心技术,在模型结构、对齐策略、指令微调、偏好对齐、多阶段渐进式学习训练策略、推理能力增强(关系推理、因果推理、常识推理)等方面做出创新突破,达到业内一流。 2、优化语音拾音大模型的上下文感知能力,通过送入交互历史信息提升语音识别准确率;优化语音识别大模型的热词感知能力,通过送入相关热词提升语音识别准确率;优化语音多模态理解大模型的SpeechEncoder,提升语音理解大模型的语音理解能力和声音理解能力,包括语音内容、情感、性别、声音事件、音乐风格等;在用户跟智能体对话的过程中,检测用户的表达完整性,从而加快系统响应速度且不带来更多的误截断;在语音对话模型中,检测用户交互的对象,从而提升打断的有效性和系统交互的响应速度。 3、优化语音理解大模型的效果,提升语音、声音、环境信息的感知和理解能力,提升语音理解大模型的时间戳感知能力,提升语音理解大模型对特定异响声音的鉴别能力。 4、 优化空间音频理解的效果,提升多通道端到端语音理解能力,提升鸡尾酒会场景的语音识别和语音理解能力,提升说话人日志的效果。 5. 优化语音安全的能力,提升语音理解大模型对说话人感知的能力,提升语音理解大模型对合成音频的鉴别能力。 6. 提升端到端语音理解能力,建立比较广泛的业界影响力。 7. 推动语音理解算法落地,在小米核心业务场景提升核心产品竞争力和用户智能体验,包括手机(OS/小爱)、汽车、生态链等。 1、博士学历,计算机、人工智能、机器学习、电子信息、自动化、数学等相关专业,多模态大模型、语音理解等相关方向; 2、具备丰富的多模态大模型、或语音理解经验,对多模态大模型、语音理解、全模态理解等有深入理解; 3、具备优秀的编程能力,熟练掌握PyTorch等至少一门深度学习框架,熟练掌握Python或C++等至少一门编程语言; 4、在Interspeech/ICASSP/AAAI/NeurIPS / ICLR / ICML等顶会发表过多模态大模型或深度强化学习方向高水平论文,或以主力身份参加相关领域主流算法竞赛且取得优秀成绩者,优先; 5、在ACM/ICPC、CodeForces、IOI/NOI/NOIP/CSP等编程算法竞赛中获得优秀成绩者,优先; 6、具备良好的团队合作精神;

该职位来自企业官方集团招聘门户。当前归入品牌招聘入口展示,具体用人法律主体、签约主体和劳动关系请以投递页及录用材料为准。