理解记忆库的工作原理、记忆类型与关键术语
记忆库是什么
记忆库是一种为大模型提供跨会话长期记忆的服务。它自动从对话中提取关键信息并持久化存储,在后续对话中基于语义检索相关记忆并注入上下文,使智能体能够持续理解用户偏好和历史信息。
工作原理
记忆库提供开放的 API 接口,可接入任意应用,也支持多应用共享同一记忆库。
两种记忆内容
| 类型 | 说明 | 示例 | 适用场景 |
|---|---|---|---|
| 记忆片段 | 从对话中自动提取的关键事件和信息 | "用户每天上午 9 点需要喝水提醒" | 动态事件信息 |
| 用户画像 | 基于自定义模板提取的结构化属性 | 年龄 28、职业工程师、爱好足球 | 固定用户属性 |
Pro 与 Lite 策略版本
记忆库的 Add 和 Search 调用区分 Pro 和 Lite 两个策略版本,核心区别是检索时是否开启 Rerank(结果重排序):
| 策略版本 | Rerank | 检索质量 | 适用场景 |
|---|---|---|---|
| Pro | 开启 | 更高,重排序模型对检索结果二次精排 | 对回答准确性要求高的场景 |
| Lite | 关闭 | 标准,跳过重排序步骤 | 高频调用、成本敏感的场景 |
- Add 调用的版本由记忆片段规则的
plan_version决定,创建规则时选择。 - Search 调用的版本由请求参数
plan_version独立控制,不传时默认 Pro。
关键术语
| 术语 | 说明 |
|---|---|
| 记忆库 | 存储记忆的容器,可被多个应用共享,支持统一配置记忆规则 |
| 记忆片段 | 从对话中自动提取的关键事件和信息片段 |
| 用户画像 | 基于自定义模板从对话中提取的结构化用户属性 |
| 记忆实体 | 记忆的隔离维度,通常用 user_id 标识 |
| 记忆规则 | 定义如何从对话中提取、存储和检索记忆的配置 |
| plan_version | 控制调用策略版本的参数,可选 Pro 或 Lite |
| Rerank | 对初步检索结果进行重排序,提升相关性 |
| 相似度阈值 | 0.0 |