AlloyDB Omni 支持所有全文搜索功能和特性,包括对 GIN 和 GiST 索引的支持。
全文搜索的核心概念
如需有效实现全文搜索 (FTS),您应了解 PostgreSQL 如何处理和搜索文本。搜索单位(即文档)通常是文本列或行中列的组合。索引构建过程会解析此文档,以将字词(或 词素,即字词的基本形式)与相应行相关联。
此过程涉及一个预处理流水线,该流水线通过以下方式将原始文本转换为可搜索的格式:
- 将文本分解为词元。
- 移除常见停用字。
- 将字词归一化为词根形式;例如,“run”是“run”“runs”“running”和“ran”的词位。
使用全文搜索还需要了解专门的数据类型、运算符和各种索引策略,包括内置的 PostgreSQL 索引和高性能的 RUM 索引。
PostgreSQL 使用两种主要数据类型和一个匹配运算符来管理 FTS:
tsvector:以可搜索的格式表示文档,即以不同的词素的排序列表表示。tsquery:表示搜索字词,包括可用于组合词素的布尔运算符。@@:检查tsvector是否与tsquery匹配,从而实现语言感知型搜索。
AlloyDB Omni 支持内置 PostgreSQL 支持的所有全文搜索索引类型。索引的选择取决于搜索速度、索引构建时间、更新速度以及所需的特定搜索功能(例如短语搜索或相关性排名)之间的平衡。
如需详细了解如何在 AlloyDB Omni 中创建和使用 RUM 索引,请参阅创建和管理 RUM 索引。
结合使用全文搜索和语义搜索
最强大的搜索实现通常会结合使用 RUM 索引的全文搜索和向量搜索。使用混合搜索,将语义理解和精确关键字匹配的优势相结合,合并不同的结果集以进行全面排名。
例如,在电子商务应用中,您可以先使用包含 RUM 的全文搜索来查找包含特定关键字(例如“跑鞋”)的产品,然后使用向量搜索来根据语义相似度查找与用户更详细的查询(例如“适合长跑训练的舒适鞋类”)相符的结果。然后,数据库使用倒数排序融合 (RRF) 算法将这两个搜索组件的排名结果融合为一个统一的列表,从而生成最终排名。
如需详细了解如何使用这种混合方法,请参阅运行混合向量相似性搜索。
后续步骤
- 了解如何创建和管理 RUM 索引。
- 了解如何运行混合向量相似度搜索。