职位详情
岗位职责:
1.主导车载多模态大模型的技术研发:专注于视觉与语言的深度协同,构建能够准确感知舱内环境(如乘客状态、手势动作、物品识别)及舱外场景(如道路结构、天气情况)的多模态预训练体系
2.推进多模态交互功能落地:设计并实现适用于智能座舱场景的视觉问答(VQA)、图像/视频描述生成、多模态对话系统,支持用户通过自然语言结合视觉信息进行高效交互(例如,“这个按钮有什么功能?”或“根据图片内容为我导航”)
3.研发前沿AIGC与视频理解能力:将文本生成图像/视频(AIGC)技术应用于车载娱乐系统、个性化氛围渲染等场景;同时开发视频理解算法,用于行车记录分析与舱内监控解析,提升驾驶安全性与座舱智能化程度
4.攻关多模态表示学习与融合架构:深入探索跨模态特征学习机制与注意力融合策略,持续优化模型在图文匹配、跨模态检索等基础任务中的表现,为上层应用提供稳定可靠的技术支撑
5.实现模型在端侧的高效部署与调优:与工程团队密切配合,完成多模态模型在车规级硬件平台上的部署工作,采用量化、剪枝、知识蒸馏等技术手段,保障低延迟、高实时性的感知与交互体验
任职要求:
1.计算机、电子工程、自动化等相关专业硕士及以上学历,具备5年以上工作经验,其中至少2年从事多模态算法相关研发
2.精通至少一类主流多模态模型(如CLIP/BLIP系列、Flamingo/LLaVA系列)或生成式模型(如StableDiffusion,Sora-like),并对核心原理有深刻理解
3.拥有扎实的编程能力,熟练掌握PyTorch/TensorFlow框架,并能高效使用HuggingFace、OpenMMLab(如MMPreTrain)等多模态开源工具库
4.熟悉对比学习、跨模态融合、扩散模型(DiffusionModel)等关键技术,具备实际项目落地经验
5.掌握OpenCV、FFmpeg等常用多媒体处理与分析工具的使用方法
1.主导车载多模态大模型的技术研发:专注于视觉与语言的深度协同,构建能够准确感知舱内环境(如乘客状态、手势动作、物品识别)及舱外场景(如道路结构、天气情况)的多模态预训练体系
2.推进多模态交互功能落地:设计并实现适用于智能座舱场景的视觉问答(VQA)、图像/视频描述生成、多模态对话系统,支持用户通过自然语言结合视觉信息进行高效交互(例如,“这个按钮有什么功能?”或“根据图片内容为我导航”)
3.研发前沿AIGC与视频理解能力:将文本生成图像/视频(AIGC)技术应用于车载娱乐系统、个性化氛围渲染等场景;同时开发视频理解算法,用于行车记录分析与舱内监控解析,提升驾驶安全性与座舱智能化程度
4.攻关多模态表示学习与融合架构:深入探索跨模态特征学习机制与注意力融合策略,持续优化模型在图文匹配、跨模态检索等基础任务中的表现,为上层应用提供稳定可靠的技术支撑
5.实现模型在端侧的高效部署与调优:与工程团队密切配合,完成多模态模型在车规级硬件平台上的部署工作,采用量化、剪枝、知识蒸馏等技术手段,保障低延迟、高实时性的感知与交互体验
任职要求:
1.计算机、电子工程、自动化等相关专业硕士及以上学历,具备5年以上工作经验,其中至少2年从事多模态算法相关研发
2.精通至少一类主流多模态模型(如CLIP/BLIP系列、Flamingo/LLaVA系列)或生成式模型(如StableDiffusion,Sora-like),并对核心原理有深刻理解
3.拥有扎实的编程能力,熟练掌握PyTorch/TensorFlow框架,并能高效使用HuggingFace、OpenMMLab(如MMPreTrain)等多模态开源工具库
4.熟悉对比学习、跨模态融合、扩散模型(DiffusionModel)等关键技术,具备实际项目落地经验
5.掌握OpenCV、FFmpeg等常用多媒体处理与分析工具的使用方法
2026-01-15 14:25
IP属地:北京
职位福利
硕士5-10年团队管理经验深度学习目标检测多模态算法其他图像生成优秀开源项目经历图像搜索C/C++留学生优先图像处理库(OpenCV等)国内院校优先Python模型加速/性能优化

奇瑞汽车股份有限公司
不需要融资 · 10000人以上

工作地址

鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >

附近适合您的职位
招图像算法软件工程师
1.5-2.4万元/月
图像算法1-3年本科目标检测多模态算法目标跟踪图像搜索C/C++Python图像处理库(OpenCV等)MATLAB嵌入式开发深度学习机器学习大模型算法发表算法相关优秀论文参加算法相关竞赛/获奖模型加速/性能优化
北京 海淀区









