帮你快速理解、总结文档立即下载

使用 WorkBuddy 构建 pgvector 语义搜索

最近更新时间:2026-07-22 10:44:01

我的收藏
WorkBuddy 可以结合云数据库 PostgreSQL 的向量检索能力,辅助用户从业务文本中构建语义检索数据集,并通过自然语言完成相似内容召回和分析。该场景适用于知识库问答、相似工单检索、文档检索、RAG 检索等业务。
本文介绍 WorkBuddy 辅助使用 pgvector 进行向量数据分析的典型流程和注意事项。
说明:
WorkBuddy 生成的初始化计划、导入脚本和检索结论仅作为辅助参考。生产环境中的扩展创建、表结构变更、索引创建和数据写入应由用户确认后执行,并遵循业务发布和数据库变更规范。

前提条件

开始前,请完成以下准备工作:
已完成 PostgreSQL MCP Server 配置,WorkBuddy 能够连接数据库并完成只读验证。
已确认目标实例支持 pgvector,或已在云数据库 PostgreSQL 控制台确认可使用相关 AI 能力。
已准备需要向量化的业务数据,例如文档、工单、FAQ、知识库条目或数据库中的业务表。
已确定 Embedding 模型及向量维度。若使用数据库内模型能力,需要确认 tencentdb_ai 插件和模型配置可用;若使用外部模型,需要通过安全环境变量提供模型凭证。
已准备具备相应权限的临时初始化账号,用于创建扩展、Schema、表和索引。日常检索建议使用只读账号。
如需通过控制台工具生态中的 PostgreSQL MCP Server 查询实例详情和 AI 支持状态,请准备最小权限 CAM 子账号的 SecretId、SecretKey 和地域代码。

流程指引

步骤1:检查实例和扩展能力

用户可以向 WorkBuddy 输入:
请检查当前腾讯云 PostgreSQL 是否适合构建向量检索:
1. 检查 PostgreSQL 版本。
2. 检查 vector 扩展是否可用、是否已安装、版本是多少。
3. 检查 tencentdb_ai 是否可用。
4. 检查当前实例支持哪些向量索引方式。
5. 只做只读检查,不创建对象、不写入数据。
6. 如果当前实例在 AI 应用页面显示不支持 AI,请说明可用能力和不可用能力。
WorkBuddy 应输出实例版本、扩展版本、索引能力和推荐路径。若实例不支持 HNSW,应推荐使用实例当前支持的索引方式。

步骤2:分析业务数据来源

如果业务数据来自文件,可以让 WorkBuddy 先读取文件结构;如果来自数据库表,可以让 WorkBuddy 只读查看表结构和少量样例。
示例指令:
请分析我要向量化的数据来源:
1. 识别标题、正文、分类、时间和元数据字段。
2. 判断是否需要文本切分。
3. 给出向量表字段设计建议。
4. 在我确认前不要写入数据库。
WorkBuddy 应输出字段映射和切分建议,避免用户手工判断列含义。

步骤3:生成初始化和导入计划

请根据我的业务数据生成向量检索初始化计划:
1. 说明目标数据库、Schema、表名和字段设计。
2. 说明使用的 Embedding 模型和向量维度。
3. 说明是否使用 tencentdb_ai;如果不可用,请生成外部模型批量导入方案。
4. 说明预计写入行数和索引类型。
5. 明确哪些步骤会修改数据库,并等待我确认后再执行。
WorkBuddy 应在执行前展示影响范围,包括将创建的对象、写入数据量、索引类型和验证方式。

步骤4:确认执行并回读验证

用户确认后,WorkBuddy 可以执行初始化、导入和索引创建,并通过只读查询回读验证:
vector 扩展状态和版本。
向量表字段和向量维度。
文档总数和空向量数量。
向量索引是否创建成功。
TopK 相似内容检索是否返回结果。

步骤5:自然语言检索

向量数据准备完成后,用户可以直接描述检索目标:
请在向量知识库中检索与“数据库连接数突然升高”最相关的 10 条内容,按相似度排序,并总结可能原因和排查步骤。
只执行只读查询,输出命中标题、相似度和关键片段。
WorkBuddy 应输出实际执行的检索口径、命中内容和基于结果的分析摘要。

典型使用场景

场景
适合解决的问题
主要产出
知识库语义搜索
用户不确定关键词,但知道问题含义
相似文档、相似度、摘要
相似工单检索
新问题需要参考历史案例
相似工单、处理经验、关联原因
RAG 检索
为问答系统提供上下文召回
TopK 文档片段、引用依据
文档归类分析
需要按语义聚合文本
主题归纳、相似主题列表

注意事项

向量维度必须与 Embedding 模型输出一致。更换模型时,应重新确认表结构和索引。
不同实例支持的 pgvector 版本和索引方式可能不同,应以 WorkBuddy 检查结果为准。
如果 tencentdb_ai 不可用,可以让 WorkBuddy 生成外部模型批量导入脚本,但模型凭证必须通过安全环境变量读取。
数据写入、扩展创建和索引创建属于数据库变更,应经过人工确认。
向量检索结果是语义相似结果,不等同于业务事实结论,仍需结合原文和业务上下文判断。

总结

通过 WorkBuddy,用户可以用自然语言完成向量检索能力的准备和验证。WorkBuddy 负责检查实例能力、分析数据来源、生成初始化计划、导入向量数据、创建索引并执行相似内容检索,降低用户直接编写 SQL 和脚本的门槛。

相关文档