Skip to main content
字段抽取

配置字段抽取

使用受约束的 JSON Schema 定义 Extract 字段,以及进行抽取设置

抽取配置说明“Agent 需要哪些信息,以及怎样理解这些信息”。

配置抽取字段Schema

登录 ParseX,在 左侧进入字段抽取,找到字段配置区域。准备要抽取的字段结构,也称为 Schema,决定 Extract 要返回哪些业务字段、字段类型和嵌套结构。清晰、稳定的 Schema 能降低字段歧义,也便于下游系统直接消费结果。可以理解为一张待填写的表:你定义栏目和填写要求,ParseX 从材料中取得对应的值。 Schema的规则设定和限制,请参见Schema规则参考

方式一:逐项设置字段

在字段列表中逐行填写字段名、类型和说明。需要表达组合信息时,可使用子字段组织结构,例如将公司名称和地址放在同一个公司信息对象下。
通过字段列表定义需要抽取的信息。
设置项作用填写建议
字段名标识结果中的一项信息用含义明确、便于区分的名称,避免多个字段使用相近但无法区分的名字
类型说明期望的值或结构根据业务用途选择;金额若需保留原文单位,可先用文本类型验证
说明指明需要找的内容与范围写清主体、期间、单位和容易混淆的概念
子字段将相关信息组织到一起只有需要表达组合结构时再增加层级,避免无意义的嵌套
例如,“收入”容易对应到多个值;“报告期间的营业收入,保留原文金额和单位,不使用上年同期数”更便于确定业务范围。

方式二:用自然语言生成字段

如果还没有准备好字段结构,可以描述需要的信息,由系统生成一份候选 Schema。输入最多支持 4,000 个 Unicode 字符,通常可理解为页面按字符限制长度。
  1. 打开自然语言生成入口。
  2. 描述文档类型、需要的信息以及必要的字段要求。
  3. 生成字段结构,检查字段名、类型、说明和层级。
  4. 确认符合需求后采纳,再检查工作区中的字段配置。
  5. 运行抽取,用真实结果验证这套字段是否合适。
可参考以下需求描述:
从经营报告中抽取报告期间、营业收入和预算承诺占用率。营业收入保留原文金额与单位,预算承诺占用率保留百分比写法,只取本报告期间的数据。
描述需求后先检查生成的字段结构,再决定是否采纳。 生成结构不会自动取得字段值,完成配置并运行抽取后,才会得到材料中的字段值。。若遗漏了一个业务字段,应补充配置;若字段含义不准确,应先修改说明,再运行文档抽取。

方式三:批量编辑字段结构

已有字段定义,或需要一次调整多个字段时,可以进入批量编辑,查看和编辑完整的 JSON Schema。编辑完成后按界面提示应用,再检查字段列表与预期是否一致。 下面的简单示例定义了两个文本字段,用于说明“字段名、类型、说明”之间的关系:
{
  "type": "object",
  "properties": {
    "report_period": {
      "type": "string",
      "description": "报告注明的统计期间,保留原文写法"
    },
    "budget_commitment_rate": {
      "type": "string",
      "description": "报告期间的预算承诺占用率,保留原文百分比写法"
    }
  }
}

这是字段结构示例,不能当作抽取结果。使用批量编辑时注意引号、逗号和括号;若页面提示结构错误,先修正后再应用。完整支持范围与接口参数请查阅独立 API 参考。
在批量编辑区域维护完整字段结构。

设置推理、原文证据和自定义 Prompt

设置默认状态使用说明
字段推理关闭需要根据文档上下文推断字段时再开启;推断结果应与原文明确信息区分并复核
原文证据开启需要回查来源时保持开启;结果有来源页码时,可据此对照原文
自定义 Prompt按需使用补充运行时的统一要求,例如只关注某一业务主体或统计口径
自然语言生成字段解决“要哪些字段”,自定义 Prompt补充“本次抽取遵循什么要求”。字段本身的含义应写在字段说明中,统一要求写在自定义 Prompt 中,并避免两处互相矛盾。 配置完成后提交抽取任务,请参见获取字段抽取结果