职位详情
工作职责
1、负责将算法团队训练完成的模型(PyTorch/TensorFlow/PaddlePaddle)高效稳定地部署至云端(GPU/CPU)、边缘设备或终端侧,并封装为高性能推理服务(如 Triton Inference Server、TensorFlow Serving、BentoML);
2、对模型进行工程层面的性能调优,应用模型量化(INT8/FP16)、剪枝、TensorRT 加速、vLLM(针对大语言模型)等技术手段,降低推理延迟,提升服务吞吐能力;
3、设计并实现模型多版本控制、灰度发布流程、A/B 测试机制及流量分发策略,保障线上服务可平滑迭代升级;
4、搭建并维护模型推理服务的监控系统,配置网关转发规则,实时采集服务可用性、响应时间、GPU 使用率、请求吞吐量(QPS)等关键指标,并设置合理的告警阈值;
5、负责线上推理服务的容量规划与弹性扩缩容,依据业务流量动态调整 GPU/CPU 资源分配,通过资源碎片整理与动态调度,提高算力利用率,降低单位计算成本,兼顾性能与经济性;
6、构建并运维 MLOps 持续交付流水线,支持模型的自动化训练与快速上线部署;
7、建立模型上线前的自动化评估与准入体系,在部署前自动执行效果验证(如准确率、推理速度、内存占用),确保上线模型的质量达标;
8、维护算法团队所用的训练平台,管理 GPU 算力集群,解决分布式训练过程中的资源调度、数据读取、通信效率瓶颈等问题;
9、参与 AI 算力资源池化建设与配额管理体系优化,提升 GPU 利用效率,为算法研发团队提供稳定高效的开发运行环境。
任职资格
1、本科及以上学历,计算机相关专业背景;具备2年以上运维开发或后端开发经验,其中至少1年从事AI工程化或模型服务部署相关工作;
2、熟练掌握 Docker 与 Kubernetes,能够独立编写 Dockerfile 及 K8s YAML 配置文件,了解 Kubernetes 中的 GPU 资源调度机制;
3、熟悉至少一种主流推理服务框架,如 NVIDIA Triton Inference Server、TensorFlow Serving 或 TorchServe;
4、了解模型轻量化与加速技术,包括 TensorRT、ONNX、OpenVINO,具备实际的模型转换与优化实践经验;
5、熟悉 Prometheus 与 Grafana 监控组合,有自定义 Exporter 开发经历;了解 Jaeger 等链路追踪工具的使用;
6、熟悉 Jenkins、GitLab CI 或 GitHub Actions,具备CI/CD流水线的设计与维护经验;
7、具有 vLLM、FastChat 等大模型推理框架的部署与性能调优经验,掌握模型并行、流水线并行等分布式推理方案;
8、熟悉腾讯云或阿里云平台的 K8S 服务及其 GPU 实例管理操作;
9、了解腾讯云 TI-ONE 或阿里 PAI 等 MLOps 平台,并有实际运维经验;
10、具备全链路问题定位能力,能从应用层深入至内核层排查“推理延迟高、GPU 显存泄漏、K8s Pod OOM”等复杂故障;
11、责任心强,能快速响应并闭环处理线上问题;
12、能适应一定的工作压力。
1、负责将算法团队训练完成的模型(PyTorch/TensorFlow/PaddlePaddle)高效稳定地部署至云端(GPU/CPU)、边缘设备或终端侧,并封装为高性能推理服务(如 Triton Inference Server、TensorFlow Serving、BentoML);
2、对模型进行工程层面的性能调优,应用模型量化(INT8/FP16)、剪枝、TensorRT 加速、vLLM(针对大语言模型)等技术手段,降低推理延迟,提升服务吞吐能力;
3、设计并实现模型多版本控制、灰度发布流程、A/B 测试机制及流量分发策略,保障线上服务可平滑迭代升级;
4、搭建并维护模型推理服务的监控系统,配置网关转发规则,实时采集服务可用性、响应时间、GPU 使用率、请求吞吐量(QPS)等关键指标,并设置合理的告警阈值;
5、负责线上推理服务的容量规划与弹性扩缩容,依据业务流量动态调整 GPU/CPU 资源分配,通过资源碎片整理与动态调度,提高算力利用率,降低单位计算成本,兼顾性能与经济性;
6、构建并运维 MLOps 持续交付流水线,支持模型的自动化训练与快速上线部署;
7、建立模型上线前的自动化评估与准入体系,在部署前自动执行效果验证(如准确率、推理速度、内存占用),确保上线模型的质量达标;
8、维护算法团队所用的训练平台,管理 GPU 算力集群,解决分布式训练过程中的资源调度、数据读取、通信效率瓶颈等问题;
9、参与 AI 算力资源池化建设与配额管理体系优化,提升 GPU 利用效率,为算法研发团队提供稳定高效的开发运行环境。
任职资格
1、本科及以上学历,计算机相关专业背景;具备2年以上运维开发或后端开发经验,其中至少1年从事AI工程化或模型服务部署相关工作;
2、熟练掌握 Docker 与 Kubernetes,能够独立编写 Dockerfile 及 K8s YAML 配置文件,了解 Kubernetes 中的 GPU 资源调度机制;
3、熟悉至少一种主流推理服务框架,如 NVIDIA Triton Inference Server、TensorFlow Serving 或 TorchServe;
4、了解模型轻量化与加速技术,包括 TensorRT、ONNX、OpenVINO,具备实际的模型转换与优化实践经验;
5、熟悉 Prometheus 与 Grafana 监控组合,有自定义 Exporter 开发经历;了解 Jaeger 等链路追踪工具的使用;
6、熟悉 Jenkins、GitLab CI 或 GitHub Actions,具备CI/CD流水线的设计与维护经验;
7、具有 vLLM、FastChat 等大模型推理框架的部署与性能调优经验,掌握模型并行、流水线并行等分布式推理方案;
8、熟悉腾讯云或阿里云平台的 K8S 服务及其 GPU 实例管理操作;
9、了解腾讯云 TI-ONE 或阿里 PAI 等 MLOps 平台,并有实际运维经验;
10、具备全链路问题定位能力,能从应用层深入至内核层排查“推理延迟高、GPU 显存泄漏、K8s Pod OOM”等复杂故障;
11、责任心强,能快速响应并闭环处理线上问题;
12、能适应一定的工作压力。
2026-08-05 13:28
IP属地:北京
职位福利
本科3-5年

成都迈思信息技术有限公司
不需要融资 · 1000-9999人

工作地址

鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >

附近适合您的职位
北京丰台区招聘感知定位算法工程师。薪资为15000-30000元/月。岗位要求:1.研究生及以上学历,机器人、计算
1.8-2.6万元/月
算法工程师3-5年硕士国内院校优先图像算法规控算法SLAM算法融合感知算法通信算法深度学习机器学习算法工程化经验
北京 丰台区 科技园区









