Skip to main content
应用评测

人工评测

大模型应用手动评测是一种基于应用维度评估应用效果的方法,通过针对特定业务场景来人工构建评测集,并对应用的回答进行人工分析与评分,产出评测报告。

大模型应用手动评测是一种基于应用维度评估应用效果的方法,通过针对特定业务场景来人工构建评测集,并对应用的回答进行人工分析与评分,产出评测报告。

第一步:准备评测集

需先下载评测集模板,按照模板内容进行补充内容。
  • Prompt:即提示词,简单的理解为它是给大模型的指令。它可以是一个问题、一段文字描述,甚至可以是带有一堆参数的文字描述。
  • Completion:Prompt 对应的内容。可以是答案、一段文字描述。
  • SessionId:会话 ID,可以自定义编写。

第二步:上传评测集

1

进入评测集页面

访问应用评测评测集页面。
2

创建评测集

单击创建评测集,自定义评测集名称,上传准备好的评测集文件。
支持扩展名:xls、xlsx,文件最大 20M,单次最多上传 10 个文件。
3

确认并发布

单击确认后,等待导入状态导入成功时,单击操作列的发布,发布当前评测集。
草稿状态的评测集不能用于应用评测,必须发布后再使用。

第三步:创建评测任务

1

选择应用

访问手动评测页面,单击创建评测任务。在应用批量评测的下拉列表中选择已发布的智能体应用,单击下一步
当前仅支持选择已发布的智能体应用
应用批量评测:应用批量评测需要选择评测集进行评测,适用于应用上线前端到端效果验证。
2

选择评测集

选择已经完成上传并发布的评测集,单击下一步
3

选择评测维度

选择评测维度,单击下一步如果未配置自定义评测维度模板,可以选择内置模板。
4

确认并开始评测

自定义修改任务名称,查看评测任务的完整信息、单击费用明细查看预估费用。确认无误后单击开始评测
预估费用:应用批量评测将基于评测集进行推理获取模型结果,使用公共资源部署模型,可能产生 Tokens 调用费用或消耗 Tokens 流量包。评测费用 = 评测产生的 Tokens x 模型调用单价
5

进行打标

等待评测状态为待打标时,单击操作列的打标按钮,针对应用生成结果进行打标。
"打标"是指对应用生成的结果和评测集中的标准答案进行对比,并对应用生成的结果进行评价(如"较差""一般""较好")或者打分(如 1-5 分)。通过打标,可以识别应用在不同场景下的表现优劣。
对比评测集结果和应用生成的结果,给出综合评价(较差、一般、较好),单击保存并进入下一条
6

完成评测

对评测集中的每条数据打标后,单击完成评测并提交,完成应用评测。

查看评测结果

评测完成后,评测状态显示已完成。单击操作列的结果查看评测结果详情。