职位详情
工作职责:
1、参与某手基础大模型及 Agent 应用的评估系统设计与优化,构建高水平的评测机制,支撑大模型持续迭代升级;
2、参与评测数据集与 Benchmark 的建设,搭建评测环境,开发评测工具,实现评测报告自动化生成,全面提升评测流程效率;
任职资格:
● 计算机科学、软件工程或人工智能等相关专业背景。
● 精通 Python 和 JavaScript,具备扎实的编程功底和工程实践能力,能独立完成技术问题分析与解决。
● 了解主流模型评测数据集(HumanEval、SWE-Bench、τ²-Bench、GAIA 等)。
● 掌握模型评估指标的设计逻辑与结果分析方法(准确率、通过率、BLEU、******、代码执行率等)。
● 具备较强的数据分析意识,能够从数据中提炼有效结论并指导优化方向。
● 拥有撰写技术文档和分析报告的能力,可清晰展示模型性能演进过程。
备注:具备大模型评估实践经验/熟练运用 Python 与 JavaScript 脚本
1、参与某手基础大模型及 Agent 应用的评估系统设计与优化,构建高水平的评测机制,支撑大模型持续迭代升级;
2、参与评测数据集与 Benchmark 的建设,搭建评测环境,开发评测工具,实现评测报告自动化生成,全面提升评测流程效率;
任职资格:
● 计算机科学、软件工程或人工智能等相关专业背景。
● 精通 Python 和 JavaScript,具备扎实的编程功底和工程实践能力,能独立完成技术问题分析与解决。
● 了解主流模型评测数据集(HumanEval、SWE-Bench、τ²-Bench、GAIA 等)。
● 掌握模型评估指标的设计逻辑与结果分析方法(准确率、通过率、BLEU、******、代码执行率等)。
● 具备较强的数据分析意识,能够从数据中提炼有效结论并指导优化方向。
● 拥有撰写技术文档和分析报告的能力,可清晰展示模型性能演进过程。
备注:具备大模型评估实践经验/熟练运用 Python 与 JavaScript 脚本
2026-08-20 14:35
IP属地:北京
职位福利
本科1-3年

北京联和利泰科技股份有限公司
不需要融资 · 1000-9999人


鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >

附近适合您的职位
1.5-2.4万元/月
图像算法1-3年本科目标检测多模态算法目标跟踪图像搜索C/C++Python图像处理库(OpenCV等)MATLAB嵌入式开发深度学习机器学习大模型算法发表算法相关优秀论文参加算法相关竞赛/获奖模型加速/性能优化
北京 海淀区









