首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >LlamaIndex >LlamaIndex 的混合检索机制是如何工作的?

LlamaIndex 的混合检索机制是如何工作的?

词条归属:LlamaIndex

1. 混合检索原理

混合检索(Hybrid Search)结合了两种检索方法的优势:

  • 稠密向量检索:基于语义相似度,能够识别同义词和概念相关的查询,但在精确术语匹配上可能表现不佳。
  • 稀疏关键词检索(BM25):基于词频和文档频率的经典信息检索算法,在精确术语匹配上表现优异,但无法理解语义改写。

混合检索通过相对分数融合(Relative Score Fusion)算法,将两种检索方法的结果合并为统一的排序列表。

2. Alpha 参数

LlamaIndex 通过 alpha 参数控制两种检索方法的权重:

  • alpha = 0:纯 BM25 关键词检索。
  • alpha = 1:纯向量语义检索。
  • 0 到 1 之间:两者加权融合。

3. 参数调优建议

alpha 值的选择取决于查询类型和语料特征:

  • 如果查询多为概念性问题(如"我们的事故处理流程是怎样的?"),较高的 alpha(0.65~0.75)更偏向语义匹配。
  • 如果查询多为精确术语查找(如"GDPR 第 17 条核查清单""重试策略死信队列阈值"),较低的 alpha(0.35~0.5)给关键词匹配更高权重。
  • 如果没有明确偏好,从 0.5 开始并根据实际评估结果调优。

4. 支持的向量存储

混合检索依赖向量存储同时支持 BM25 和向量索引。Postgres(pgvector)、Pinecone、Weaviate 等向量存储原生支持混合检索。对于不支持混合检索的向量存储,可以通过组合两个独立的检索器(一个向量检索器、一个 BM25 检索器)并使用 HybridRetriever 实现。

相关文章
Hadoop 的 Checkpoint 机制是如何工作的?如何优化 Checkpoint 的频率?
Hadoop 的 Checkpoint 机制主要用于维护文件系统的元数据一致性,防止因 NameNode 故障导致的数据丢失。Checkpoint 主要通过 Secondary NameNode(在 Hadoop 2.x 及以后的版本中,这个角色可以由 Checkpoint Node 或 Standby NameNode 承担)来实现。
代码小李
2025-01-23
6520
全文检索、向量检索和混合检索的比较分析
畅游当今的信息海洋既是一个奇迹,又是一个迷宫。全文和矢量搜索使我们能够构建搜索体验,使用户能够找到相关的产品、内容等。随着我们对搜索精度和上下文的追求不断发展,出现了一个问题:我们能否平衡全文搜索的词汇灵活性和向量搜索的语义深度?
大数据杂货铺
2024-04-24
7K0
JavaScript 是如何工作的:WebRTC 和对等网络的机制!
WebRTC,名称源自网页即时通信(英语:Web Real-Time Communication)的缩写,是一个支持网页浏览器进行实时语音对话或视频对话的API。
前端小智@大迁世界
2019-03-15
3.5K0
改进 Elastic Stack 中的信息检索:混合检索
在我们的上一篇博文中,我们介绍了 Elastic Learned Sparse Encoder,这是一种经过训练可有效进行零样本文本检索的模型。Elasticsearch ®还具有强大的词汇检索功能和丰富的工具来组合不同查询的结果。在本博客中,我们介绍了混合检索的概念,并探讨了 Elasticsearch 中可用的两种具体实现。特别是,我们探索如何通过使用倒数排名融合和加权分数和将弹性学习稀疏编码器与 BM25 相结合来提高其性能。
点火三周
2023-07-20
4.2K0
组件加载器的错误处理机制是如何工作的?
组件加载器的错误处理机制设计得相当完善,能够捕获和处理组件加载过程中可能出现的各种异常情况。其核心工作原理如下:
搜罗万相
2025-09-17
3910
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券