职位详情
【岗位职责】
1. 负责大模型(LLM)及AI应用(AI Agent)的自动化评测体系建设,结合不同业务场景,制定相应的评测标准与评估框架。
2. 开展需求分析并推动场景落地,深入理解业务目标,协同产品与算法团队,以评测结果驱动模型优化。针对特定任务(如多轮对话、复杂任务分解)设计动态提示逻辑,提升回复准确性。
3. 掌握“LLM-as-a-Judge”评测方法,能够设计高质量的评判Prompt(如单项评分、成对对比、多维评估量表),完成评测系统从零构建与持续迭代。
4. 构建评测数据集:围绕实际应用场景,搭建并维护具备高质性与多样性(如逻辑推理、代码生成、安全合规、指令执行等)的测试数据集。
5. 评测分析与报告输出:对AI Agent的不同Prompt策略、各类RAG流程进行测试验证,形成深度分析报告,为算法优化提供明确方向支持。
【任职要求】
1. 学历与经验:本科及以上学历,计算机、人工智能、统计学等相关专业优先;具备1-3年AI算法、后端开发或AI评测相关工作经验。
2. 编程与脚本能力:熟练掌握 Python,具有扎实的工程实现能力,能独立编写高效的评测脚本。
3. 理解 LLM-as-a-Judge 方法论:了解其基本原理与适用场景,能够针对不同任务设计合理的评判机制,认知Prompt设计对评测稳定性和有效性的关键影响。
4. 大模型基础:熟悉主流大模型(如智谱GLM系列, DeepSeek, Qwen等)的能力范围、API调用方式及计费规则。
5. 逻辑与数据分析:具备严谨的思维方式,可独立构建科学的评测指标体系,善于从评测数据中发现规律与问题。
1. 负责大模型(LLM)及AI应用(AI Agent)的自动化评测体系建设,结合不同业务场景,制定相应的评测标准与评估框架。
2. 开展需求分析并推动场景落地,深入理解业务目标,协同产品与算法团队,以评测结果驱动模型优化。针对特定任务(如多轮对话、复杂任务分解)设计动态提示逻辑,提升回复准确性。
3. 掌握“LLM-as-a-Judge”评测方法,能够设计高质量的评判Prompt(如单项评分、成对对比、多维评估量表),完成评测系统从零构建与持续迭代。
4. 构建评测数据集:围绕实际应用场景,搭建并维护具备高质性与多样性(如逻辑推理、代码生成、安全合规、指令执行等)的测试数据集。
5. 评测分析与报告输出:对AI Agent的不同Prompt策略、各类RAG流程进行测试验证,形成深度分析报告,为算法优化提供明确方向支持。
【任职要求】
1. 学历与经验:本科及以上学历,计算机、人工智能、统计学等相关专业优先;具备1-3年AI算法、后端开发或AI评测相关工作经验。
2. 编程与脚本能力:熟练掌握 Python,具有扎实的工程实现能力,能独立编写高效的评测脚本。
3. 理解 LLM-as-a-Judge 方法论:了解其基本原理与适用场景,能够针对不同任务设计合理的评判机制,认知Prompt设计对评测稳定性和有效性的关键影响。
4. 大模型基础:熟悉主流大模型(如智谱GLM系列, DeepSeek, Qwen等)的能力范围、API调用方式及计费规则。
5. 逻辑与数据分析:具备严谨的思维方式,可独立构建科学的评测指标体系,善于从评测数据中发现规律与问题。
2026-03-04 11:33
IP属地:上海
职位福利
本科1-3年文本标注文档清洗PROMPT知识库评测

四川智服人力资源有限公司

工作地址

鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >

附近适合您的职位
6千-1万/月
数据标注/AI训练师1-3年本科数据标注不接受居家办公标注结果整理数据分析能力强标注结果抽查区域标注AI标注相关经验接受加班文本标注标注数据分析描点标注标注方法优化标框标注分类标注
上海 徐汇区
8千-1.1万/月
数据标注/AI训练师1-3年大专数据标注不接受居家办公AI标注标注结果整理视频标注标注结果抽查视频标注组长经验优先区域标注有视频标注经验接受加班标注数据分析描点标注标注方法优化标框标注分类标注
上海 徐汇区







