大模型应用手动评测是一种基于应用维度评估应用效果的方法,通过针对特定业务场景来人工构建评测集,并对应用的回答进行人工分析与评分,产出评测报告。
大模型应用手动评测是一种基于应用维度评估应用效果的方法,通过针对特定业务场景来人工构建评测集,并对应用的回答进行人工分析与评分,产出评测报告。
需先下载评测集模板,按照模板内容进行补充内容。
评测完成后,评测状态显示已完成。单击操作列的结果查看评测结果详情。
第一步:准备评测集
需先下载评测集模板,按照模板内容进行补充内容。
- Prompt:即提示词,简单的理解为它是给大模型的指令。它可以是一个问题、一段文字描述,甚至可以是带有一堆参数的文字描述。
- Completion:Prompt 对应的内容。可以是答案、一段文字描述。
- SessionId:会话 ID,可以自定义编写。
第二步:上传评测集
1
进入评测集页面
访问应用评测的评测集页面。
2
创建评测集
单击创建评测集,自定义评测集名称,上传准备好的评测集文件。
支持扩展名:xls、xlsx,文件最大 20M,单次最多上传 10 个文件。
3
确认并发布
单击确认后,等待导入状态为导入成功时,单击操作列的发布,发布当前评测集。
草稿状态的评测集不能用于应用评测,必须发布后再使用。
第三步:创建评测任务
1
选择应用
访问手动评测页面,单击创建评测任务。在应用批量评测的下拉列表中选择已发布的智能体应用,单击下一步。
当前仅支持选择已发布的智能体应用。
应用批量评测:应用批量评测需要选择评测集进行评测,适用于应用上线前端到端效果验证。
2
选择评测集
选择已经完成上传并发布的评测集,单击下一步。
3
选择评测维度
选择评测维度,单击下一步。如果未配置自定义评测维度模板,可以选择内置模板。
4
确认并开始评测
自定义修改任务名称,查看评测任务的完整信息、单击费用明细查看预估费用。确认无误后单击开始评测。
预估费用:应用批量评测将基于评测集进行推理获取模型结果,使用公共资源部署模型,可能产生 Tokens 调用费用或消耗 Tokens 流量包。评测费用 = 评测产生的 Tokens x 模型调用单价
5
进行打标
等待评测状态为待打标时,单击操作列的打标按钮,针对应用生成结果进行打标。
"打标"是指对应用生成的结果和评测集中的标准答案进行对比,并对应用生成的结果进行评价(如"较差""一般""较好")或者打分(如 1-5 分)。通过打标,可以识别应用在不同场景下的表现优劣。对比评测集结果和应用生成的结果,给出综合评价(较差、一般、较好),单击保存并进入下一条。
6
完成评测
对评测集中的每条数据打标后,单击完成评测并提交,完成应用评测。