职位详情
【岗位职责】
1. 负责大模型(LLM)及AI应用(AI Agent)自动化评测体系的建设,结合不同业务场景,制定相应的评测标准与评估框架。
2. 开展需求分析并推动场景落地,深入挖掘业务需求,协同产品与算法团队,以评测结果驱动模型优化。针对特定场景(如多轮对话、复杂任务分解)设计动态提示逻辑,提升回复准确性。
3. 掌握“LLM-as-a-Judge”评测范式,能够设计高质量的评判Prompt(如单项评分、成对比较、多维评分表),完成评测系统从无到有的构建与持续迭代。
4. 构建评测数据集:围绕实际应用场景,搭建并维护覆盖多维度(如逻辑推理、代码生成、安全合规、指令遵循等)的高质量评测数据集。
5. 评测分析与报告输出:对AI Agent的不同Prompt策略、不同RAG流程进行测试验证,产出深度评测报告,为算法优化提供明确方向支持。
【任职要求】
1. 学历与经验:本科及以上学历,计算机、人工智能、统计学等相关专业优先;具备1-3年AI算法、后端开发或AI评测相关工作经验。
2. 编程与脚本能力:熟练掌握 Python,具有扎实的工程实现能力,能独立编写高效评测脚本。
3. 理解 LLM-as-a-Judge:了解其核心概念与运行机制,能根据不同场景设计适用的评判方案,认知Prompt设计对评测信效度的影响。
4. 大模型基础:熟悉主流大模型(如智谱GLM系列, DeepSeek, Qwen等)的能力范围、API调用方式及计费规则。
5. 逻辑与数据分析:具备严谨的逻辑思维能力,可独立搭建科学合理的评测指标体系,善于从评测数据中发现关键问题。
1. 负责大模型(LLM)及AI应用(AI Agent)自动化评测体系的建设,结合不同业务场景,制定相应的评测标准与评估框架。
2. 开展需求分析并推动场景落地,深入挖掘业务需求,协同产品与算法团队,以评测结果驱动模型优化。针对特定场景(如多轮对话、复杂任务分解)设计动态提示逻辑,提升回复准确性。
3. 掌握“LLM-as-a-Judge”评测范式,能够设计高质量的评判Prompt(如单项评分、成对比较、多维评分表),完成评测系统从无到有的构建与持续迭代。
4. 构建评测数据集:围绕实际应用场景,搭建并维护覆盖多维度(如逻辑推理、代码生成、安全合规、指令遵循等)的高质量评测数据集。
5. 评测分析与报告输出:对AI Agent的不同Prompt策略、不同RAG流程进行测试验证,产出深度评测报告,为算法优化提供明确方向支持。
【任职要求】
1. 学历与经验:本科及以上学历,计算机、人工智能、统计学等相关专业优先;具备1-3年AI算法、后端开发或AI评测相关工作经验。
2. 编程与脚本能力:熟练掌握 Python,具有扎实的工程实现能力,能独立编写高效评测脚本。
3. 理解 LLM-as-a-Judge:了解其核心概念与运行机制,能根据不同场景设计适用的评判方案,认知Prompt设计对评测信效度的影响。
4. 大模型基础:熟悉主流大模型(如智谱GLM系列, DeepSeek, Qwen等)的能力范围、API调用方式及计费规则。
5. 逻辑与数据分析:具备严谨的逻辑思维能力,可独立搭建科学合理的评测指标体系,善于从评测数据中发现关键问题。
2026-01-09 17:37
IP属地:上海
职位福利
本科1-3年AI大模型评测LLM提示词

四川智服人力资源有限公司

工作地址

鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >







