搜索
登录注册

职位详情

团队介绍:我们是阿里巴巴通义实验室语音团队(原达摩院语音实验室),长期致力于音频AI领域的技术创新与实际应用推进。我们的核心贡献涵盖:

1. ModelScope平台语音/音频模块关键算法研发团队
2. FunASR、KAN-TTS、3D-Speaker等开源项目发起方及主要维护团队
3. 通义听悟(tingwu.aliyun.com)系统中音频处理与语义分析技术支撑团队
4. 阿里云智能语音交互服务及灵积语音模型背后的核心算法支持力量

岗位职责:

1. 主导音频理解与生成方向的先进算法研究,并推动其在产业场景中的落地应用,以语音为核心,拓展至音乐、环境声等多类型音频模态

2. 音频理解方向:
• 研究语音识别、语音翻译和音频内容分析等相关理解技术
• 构建融合语音、文本与视觉信息的跨模态语义理解系统

3. 音频生成方向:
• 推动TTS、语音克隆、音色转换、音乐与环境声合成等技术演进
• 探索少样本/零样本生成、可调控音频生成以及数字人语音驱动等前沿课题

4. 研发多模态语音交互系统,实现语音驱动虚拟形象、智能配音、实时语音到语音翻译(S2TT/S2ST)等创新功能

5. 参与音频大模型架构设计,协同通义千问大模型团队共建多模态认知智能体系

6. 推进技术成果落地转化:通过ModelScope开源生态释放科研价值,或依托阿里云产品体系实现商业化输出

7. 持续关注国际前沿动态(如ICASSP/Interspeech/NeurIPS/ICLR等会议),积极参与学术交流,与全球领先研究团队开展合作

职位要求:
1. 硕士及以上学历,专业方向包括计算机科学、信号处理、语音处理、人工智能等相关领域

2. 具备2年以上音频AI相关研发经验,涉及方向包括但不限于音频识别与理解、音频生成、数字人构建、多模态交互系统等

3. 具有扎实的深度学习理论基础,熟练使用PyTorch或TensorFlow等主流框架

4. 编程能力突出(Python/C++优先),拥有处理大规模音频数据的实际经验

5. 具备良好的协作沟通素养,对技术成果落地抱有高度热情

加分项:
1. 在音频、多模态或机器学习领域顶级会议或期刊发表过研究成果
2. 对生成式语音AI在不同业务场景中的落地难点有深入理解
3. 拥有多模态(语音+视觉+文本)交互系统的设计与实施经验
2026-07-26 13:24
IP属地:北京

职位福利

硕士3-5年
企业发布信息图
阿里云计算有限公司
不需要融资 · 10000人以上
鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >
下载鱼泡直聘APP

附近适合您的职位

通义-技术专家-语音引擎系统研发-北/杭
2.5-5万元/月
语音算法5-10年本科语音识别工作经验计算机相关专业
北京 朝阳区
语音算法研发工程师
2.5-3.5万元/月
语音算法算法工程师3-5年本科计算机相关专业Python
北京 朝阳区
语音算法工程师
2.5-3.5万元/月
语音算法3-5年本科计算机相关专业Python
北京 朝阳区
语音算法工程师(北京)
3.5-5万元/月
语音算法3-5年本科
北京 朝阳区
语音算法工程师(北京)
3.5-5万元/月
语音算法算法工程师3-5年本科
北京 朝阳区
语音算法
2.5-5万元/月
语音算法3-5年硕士语音合成语音识别asrtts声纹识别C/C++Python语音识别工作经验人机对话相关经验
北京 朝阳区
语音识别算法实习岗位
140-160元/天
语音算法经验不限硕士
北京 石景山区
语音合成算法研发工程师
4-6万元/月
语音算法3-5年本科
北京 海淀区
语音算法工程师
3-5万元/月
语音算法10年以上本科
北京 海淀区