托管 PDF、Word、Markdown 等非结构化文档,用类目组织并导入,供智能体检索和引用。
文件连接器用于管理非结构化文档。文件上传后由平台解析成可检索的格式,智能体通过自动生成的工具按关键词查找文件并获取下载链接。
它不需要任何外部系统的凭证,是最适合第一次使用的 App。
描述会用于指导智能体判断该不该调用这个连接器,建议写明数据内容和用途,例如产品手册与发布说明,供回答产品功能问题时引用。
连接器创建成功后自动生成 2 个工具:
在 App 详情页的 可用的工具 区域展开工具即可查看这些参数。
平台支持常见的文档格式,包括 PDF、Word、Markdown、TXT 等。
类目是文件在连接器里的组织单位,每个文件都归属于某个类目。类目支持多级嵌套,可以按业务线、文档类型或时间划分。表格连接器同样用类目组织数据。
未指定类目的文件会进入默认类目。
在连接器的文件管理页面,左侧类目区域单击新建图标,填写类目名称即可。在已有类目下新建时,新类目成为它的子类目。
类目的划分方式会直接影响后续的检索范围和维护成本。几条经验:
在类目上执行删除操作。
文件导入后工具才能搜到内容。导入前先创建或选择一个类目。
OSS 中已有文件时,不必先下载再上传。
前置条件:
标签用于在检索时先做一层筛选,缩小范围以提升效率。
检索时指定标签,应用会先按标签筛选文件,再在筛选结果中检索。
已导入的文件可以补充或替换标签,支持两种模式:
导入后文件按以下状态流转:
在连接器详情页的文件列表中可以看到每个文件的当前状态。
在请求高峰时段,解析可能需要数小时。并发较高时还可能因资源排队而延长耗时,偶现解析超时。
处理建议:
创建连接器
1
打开连接对话框
在 Apps 页面找到 文件连接器 卡片,单击 连接。
2
填写基本信息
| 字段 | 是否必填 | 说明 |
|---|---|---|
| 连接器名称 | 是 | 使用易于识别的名称,最多 64 个字符 |
| 连接器描述 | 否 | 说明存了什么文档、用在什么场景 |
3
确认存储位置
存储位置 目前只有 使用平台存储 一个选项,选中即可。数据存储在阿里云百炼平台提供的存储空间中,提供最大 200,000 个文件、1 TB 存储额度,限时免费,详见配额与限制。
4
确认创建
单击 确认。创建后连接器类型不可更改。
自动生成的工具
连接器创建成功后自动生成 2 个工具:
| 工具 | 功能 | 入参 |
|---|---|---|
| 搜索文件 | 按文件标题的关键词查询文件列表,返回文件的下载链接 | keyWord(string,必填):文件标题的关键词maxCount(integer,可选):返回文件的下载链接的最大数量,默认 5,最大 10 |
| 获取文件 | 按文件 ID 获取文件,返回文件的下载链接 | fileId(string,必填):文件 ID |
搜索文件按标题关键词匹配,不做正文语义检索。需要从文档内容中归纳答案时,把文件导入知识库并使用知识检索。
支持的文件格式
平台支持常见的文档格式,包括 PDF、Word、Markdown、TXT 等。
类目
类目是文件在连接器里的组织单位,每个文件都归属于某个类目。类目支持多级嵌套,可以按业务线、文档类型或时间划分。表格连接器同样用类目组织数据。
未指定类目的文件会进入默认类目。
创建类目
在连接器的文件管理页面,左侧类目区域单击新建图标,填写类目名称即可。在已有类目下新建时,新类目成为它的子类目。
每个业务空间最多创建 500 个类目。需要更多时可以提交工单申请扩容。
怎么划分类目
类目的划分方式会直接影响后续的检索范围和维护成本。几条经验:
| 场景 | 建议 |
|---|---|
| 内容类型差异大 | 按类型分,例如产品手册、内部制度、会议记录 |
| 需要按团队隔离查询 | 按团队分,检索时限定类目范围 |
| 内容持续增长 | 按时间分层,例如年份作为一级类目 |
类目主要用于组织和限定范围,不承载权限控制。需要隔离数据访问时,用不同的业务空间。
删除类目
在类目上执行删除操作。
导入数据
文件导入后工具才能搜到内容。导入前先创建或选择一个类目。
本地上传
1
进入文件管理页面
单击连接器卡片进入详情,打开文件管理页面。
2
选择类目
在左侧类目区域选择一个现有类目,或新建一个。
3
打开导入界面
单击 导入数据,导入方式选择本地上传,然后选择要上传的文件。
4
选择解析方式
可以使用默认设置,也可以自定义设置,针对不同格式配置解析规则以提升解析效果。
5
配置标签
为文件配置标签,可选。标签用于后续限定检索范围,详见下方标签。
6
确认导入
单击 确认,系统开始解析和导入,可在页面查看任务进度。
从 OSS 批量导入
OSS 中已有文件时,不必先下载再上传。
前置条件:
- 已完成服务关联角色授权。
- 目标 Bucket 已添加标签
bailian-datahub-access,值为read。
my-bucket/docs/ 表示该目录下的所有文件,my-bucket/docs/foo.md 表示单个文件。
这里的 OSS 导入会把文件副本存入平台。只想让智能体实时读取 Bucket、不产生副本时,用OSS 连接器。
标签
标签用于在检索时先做一层筛选,缩小范围以提升效率。
| 约束 | 值 |
|---|---|
| 单个文件的标签数量 | 最多 100 个 |
| 单个标签长度 | 不超过 32 个字符 |
| 全部标签总长度 | 不超过 700 个字符 |
| 模式 | 行为 |
|---|---|
OVERWRITE | 全量替换原有标签 |
APPEND | 在原有标签基础上追加 |
文件状态
导入后文件按以下状态流转:
在连接器详情页的文件列表中可以看到每个文件的当前状态。
解析耗时
在请求高峰时段,解析可能需要数小时。并发较高时还可能因资源排队而延长耗时,偶现解析超时。
处理建议:
- 耐心等待或稍后重试,不要反复重复提交同一批文件。
- 大批量导入尽量安排在非高峰时段。
- 在连接器详情页确认文件状态。解析失败时页面会给出失败原因。
注意事项
- 文件导入后作为独立副本存储,与原始数据没有关联。修改原文件不会自动同步。
- 仅支持查看最近 90 天内导入的文件。超过该时间范围后文件不再展示,但不会被删除。
- 导入的文件仅供当前业务空间的用户使用。