搜索
登录注册

职位详情

工作职责
1、负责将算法团队训练完成的模型(PyTorch/TensorFlow/PaddlePaddle)高效稳定地部署至云端(GPU/CPU)、边缘设备或终端侧,并封装为高性能推理服务(如 Triton Inference Server、TensorFlow Serving、BentoML);
2、对模型进行工程层面的性能调优,应用模型量化(INT8/FP16)、剪枝、TensorRT 加速、vLLM(针对大语言模型)等技术手段,降低推理延迟,提升服务吞吐能力;
3、设计并实现模型多版本控制、灰度发布流程、A/B 测试机制及流量分发策略,保障线上服务可平滑迭代升级;
4、搭建并维护模型推理服务的监控系统,配置网关转发规则,实时采集服务可用性、响应时间、GPU 使用率、请求吞吐量(QPS)等关键指标,并设置合理的告警阈值;
5、负责线上推理服务的容量规划与弹性扩缩容,依据业务流量动态调整 GPU/CPU 资源分配,通过资源碎片整理与动态调度,提高算力利用率,降低单位计算成本,兼顾性能与经济性;
6、构建并运维 MLOps 持续交付流水线,支持模型的自动化训练与快速上线部署;
7、建立模型上线前的自动化评估与准入体系,在部署前自动执行效果验证(如准确率、推理速度、内存占用),确保上线模型的质量达标;
8、维护算法团队所用的训练平台,管理 GPU 算力集群,解决分布式训练过程中的资源调度、数据读取、通信效率瓶颈等问题;
9、参与 AI 算力资源池化建设与配额管理体系优化,提升 GPU 利用效率,为算法研发团队提供稳定高效的开发运行环境。

任职资格
1、本科及以上学历,计算机相关专业背景;具备2年以上运维开发或后端开发经验,其中至少1年从事AI工程化或模型服务部署相关工作;
2、熟练掌握 Docker 与 Kubernetes,能够独立编写 Dockerfile 及 K8s YAML 配置文件,了解 Kubernetes 中的 GPU 资源调度机制;
3、熟悉至少一种主流推理服务框架,如 NVIDIA Triton Inference Server、TensorFlow Serving 或 TorchServe;
4、了解模型轻量化与加速技术,包括 TensorRT、ONNX、OpenVINO,具备实际的模型转换与优化实践经验;
5、熟悉 Prometheus 与 Grafana 监控组合,有自定义 Exporter 开发经历;了解 Jaeger 等链路追踪工具的使用;
6、熟悉 Jenkins、GitLab CI 或 GitHub Actions,具备CI/CD流水线的设计与维护经验;
7、具有 vLLM、FastChat 等大模型推理框架的部署与性能调优经验,掌握模型并行、流水线并行等分布式推理方案;
8、熟悉腾讯云或阿里云平台的 K8S 服务及其 GPU 实例管理操作;
9、了解腾讯云 TI-ONE 或阿里 PAI 等 MLOps 平台,并有实际运维经验;
10、具备全链路问题定位能力,能从应用层深入至内核层排查“推理延迟高、GPU 显存泄漏、K8s Pod OOM”等复杂故障;
11、责任心强,能快速响应并闭环处理线上问题;
12、能适应一定的工作压力。
2026-09-30 14:33
IP属地:北京

职位福利

本科3-5年
企业发布信息图
成都迈思信息技术有限公司
不需要融资 · 1000-9999人
鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >
下载鱼泡直聘APP

附近适合您的职位

2-3.5万/月
算法工程师3-5年硕士图像算法
北京 丰台区
1.8-2.8万/月
算法工程师3-5年本科PyTorch机器学习图像算法OpenCV深度学习Python
北京 丰台区
2-3万/月
算法工程师经验不限博士
北京 丰台区
2-3万/月
算法工程师经验不限博士
北京 丰台区
2-3万/月
算法工程师经验不限本科
北京 丰台区
2.5-3.5万/月
算法工程师3-5年硕士通气控制算法自动控制原理呼吸机嵌入式控制算法生理信号处理
北京 丰台区
1.5-2.5万/月
算法工程师3-5年本科C/C++大模型算法自然语言处理算法Python
北京 丰台区
1.8-3.5万/月
算法工程师1-3年硕士大模型算法算法工程化经验
北京 丰台区
2-2.4万/月
算法工程师3-5年大专Python算法工程化经验
北京 丰台区 科技园区