职位详情
【部门介绍】
随着大模型技术的迅猛进步,对多模态数据(如图像、视频、音频、3D内容等)的理解与生成能力持续提升。当前,构建支持多模态输入与输出的通用世界模型已成为前沿研究重点,也被视为通往通用人工智能(AGI)的关键路径之一。
通义万相将持续深耕原生多模态预训练、理解与生成融合架构、统一Tokenizer设计、人类反馈机制及强化学习等核心技术方向,致力于在多模态世界模型领域保持领先,打造具有全球影响力的技术成果。
【工作内容】
1、开展原生多模态模型的研发工作,整合文本、图像、语音等多模态输入能力,实现复杂指令下的内容生成,覆盖文生图、图生图、文档合成、可控图像编辑等核心任务。
2、优化图像生成模型性能,深入研究扩散模型、自回归架构及其训练策略,推动关键技术迭代与突破。
3、推进人类反馈驱动的强化学习方法,设计精细化的RL算法方案,结合用户实际反馈持续提升图像生成质量。
【职位要求】
1. 拥有计算机科学、人工智能、机器学习等相关专业硕士或博士学位,具备扎实的计算机视觉理论基础。
2. 熟悉机器学习与深度学习基本原理,掌握主流视觉生成算法,熟练使用Pytorch、Tensorflow等至少一种深度学习框架。
3. 具备突出的科研素养,有大规模视觉生成算法研究经验者优先,发表过高影响力论文或参与知名开源项目者优先,成果见于CVPR、ICCV、NeurIPS、ICLR、TPAMI等顶级会议或期刊者尤佳。
4. 对生成式模型有强烈技术兴趣,具备视觉大模型开发背景,有对话系统、多模态内容生成等实际项目落地经验者优先。
5. 具备敏锐的技术判断力和出色的业务分析能力,能应对复杂场景下的算法挑战,善于与工程、产品团队协作,加速科研成果转化并产生实际价值。
6. 重视技术影响力,认同开放共享理念,对基础模型的前沿问题保持长期关注与探索热情,志在推动具有广泛影响的技术创新。
随着大模型技术的迅猛进步,对多模态数据(如图像、视频、音频、3D内容等)的理解与生成能力持续提升。当前,构建支持多模态输入与输出的通用世界模型已成为前沿研究重点,也被视为通往通用人工智能(AGI)的关键路径之一。
通义万相将持续深耕原生多模态预训练、理解与生成融合架构、统一Tokenizer设计、人类反馈机制及强化学习等核心技术方向,致力于在多模态世界模型领域保持领先,打造具有全球影响力的技术成果。
【工作内容】
1、开展原生多模态模型的研发工作,整合文本、图像、语音等多模态输入能力,实现复杂指令下的内容生成,覆盖文生图、图生图、文档合成、可控图像编辑等核心任务。
2、优化图像生成模型性能,深入研究扩散模型、自回归架构及其训练策略,推动关键技术迭代与突破。
3、推进人类反馈驱动的强化学习方法,设计精细化的RL算法方案,结合用户实际反馈持续提升图像生成质量。
【职位要求】
1. 拥有计算机科学、人工智能、机器学习等相关专业硕士或博士学位,具备扎实的计算机视觉理论基础。
2. 熟悉机器学习与深度学习基本原理,掌握主流视觉生成算法,熟练使用Pytorch、Tensorflow等至少一种深度学习框架。
3. 具备突出的科研素养,有大规模视觉生成算法研究经验者优先,发表过高影响力论文或参与知名开源项目者优先,成果见于CVPR、ICCV、NeurIPS、ICLR、TPAMI等顶级会议或期刊者尤佳。
4. 对生成式模型有强烈技术兴趣,具备视觉大模型开发背景,有对话系统、多模态内容生成等实际项目落地经验者优先。
5. 具备敏锐的技术判断力和出色的业务分析能力,能应对复杂场景下的算法挑战,善于与工程、产品团队协作,加速科研成果转化并产生实际价值。
6. 重视技术影响力,认同开放共享理念,对基础模型的前沿问题保持长期关注与探索热情,志在推动具有广泛影响的技术创新。
2026-09-09 13:47
IP属地:北京
职位福利
硕士3-5年

阿里云计算有限公司
不需要融资 · 10000人以上


鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >











