原子服务是构成智能搜索链路的基石。腾讯云 ES 将复杂的 AI 搜索能力拆解为一系列独立、可复用的标准化组件,涵盖从非结构化数据解析、语义向量化到大模型推理及召回排序的完整环节。在接下来的章节中,我们将详细展示平台所提供的核心原子服务能力。您可以通过灵活组合这些服务,构建出符合业务需求的定制化 AI 应用。
前置条件
原子服务列表
类型 | 描述 | 服务 | 默认限频(QPS) | 说明 |
文档解析 | 本服务可将 PDF、DOC、PPT、XLS、HTML、TXT、PNG 等多格式文档转换为标准格式,满足企业级知识库建设、技术文档迁移、内容平台结构化存储等需求。 | doc-llm | 5 | 腾讯优图实验室推出的精品 OCR 大模型,覆盖论文、书籍、说明书、试卷、PPT、海报等众多场景,可满足各行业的文档处理需求。 |
文本切片 | 文本切片是将长文本分割为短片段的技术,用于适配模型输入、提升处理效率或信息检索,平衡片段长度与语义连贯性,适用于 NLP、数据分析等场景,本服务支持语义切分。 | doc-chunk | 100 | 基于分隔符、文本长度进行切片,适用规则性较强的文本,仅支持 Markdown 与 TXT 格式文件输入。 |
| | doc-tree-chunk | 5 | 腾讯自研文档拆分模型,支持多种文件类型,能够解析并深入理解图表中的信息,语义切分成文本块。 |
查询分析 | 承担搜索链路入口的认知决策,通过意图识别精准路由下游交互模式,多轮改写消除上下文指代歧义,搜索改写将复杂问题拆解为多路并行子查询,该模块能有效提升数据检索的准召率。 | youtu-intent | 2 | 腾讯优图自研,支持多语言,最大 1600 token,支持自定义意图标签识别,负责判定用户请求的交互类型,区分是信息查询、任务执行还是闲聊等,决定后续的链路走向。 |
| | ima-rewrite | 3 | 腾讯 ima 自研,支持中英文,最大 8000 token,将用户原始提问智能拆解为多个语义独立、面向不同检索维度的子查询,通过并行或递进检索全面覆盖信息需求。 |
| | ima-rewrite-multiround | 2 | 腾讯 ima 自研,支持中英文,最大 8000 token,针对对话式搜索设计,解决指代消解与上下文关联问题,结合历史会话,消除语义歧义,确保每一轮交互建立在连贯的上下文逻辑之上。 |
Embedding | 将文本、图片等多模态数据转化为稠密或稀疏的向量形式的服务,支持多款不同语言、输入长度、维度的文本向量模型,可用于信息检索、分类和相似性比较等场景。 | 20 | 768 维,最大 512 token 经典轻量级中文 Embedding 模型,适合资源有限、轻量级 RAG。 | |
| | 20 | 1024 维,最大 512 token 经典轻量级中文 Embedding 模型,适合资源有限、轻量级 RAG。 | |
| | 20 | 896 维,最大 131072 token 微信自研多语言模型,支持多语言。 | |
| | 20 | 1024 维,最大 8194 token 经典 BGE Embedding 模型,支持 100+ 语言,适合多语言检索场景。 | |
| | 20 | 1792 维,最大 512 token 腾讯内部自研,曾登顶中文 CMTEB 榜单,适合高精度中文检索。 | |
| | WeCLIPv2-Base | 10 | 768维,最大 72 token 微信自研图文 Embedding 模型,在中文场景下表现优秀,适合文搜图、图搜图等场景 |
| | WeCLIPv2-Large | 10 | |
重排序 | 在 RAG 场景中,可通过 RAG 排序服务找到相关性更高的内容,引入排序服务可有效提升检索和大模型生成准确率,同时减少大模型成本。 | 20 | 单个 doc 最大 514 token 经典 BGE 重排序模型,通过交叉编码提升 Top-K 结果相关性,支持中文、英文,适合检索结果精排后进行问答。 | |
| | 20 | 单个 doc 最大 8192 token 升级版 BGE 重排模型,有更大的文本长度,同时支持多语言。 | |
| | ima-post-rerank | 5 | 单个 doc 最大 4000 token 腾讯 ima 自研,支持中文、英文,基于 LLM 将用户 query 与一组候选文档进行相关性打分,返回每个文档的得分(0-4分),用于检索结果重排。 |
大模型生成 | 本服务支持一系列高性能的大语言模型,包括 DeepSeek 系列和自主研发的混元大模型,通过深度优化和精确训练,目前已具备强大的自然语言处理能力和高效的文本理解能力,结合混合搜索等先进搜索技术,快速高效实现 RAG,有效解决幻觉和知识更新问题。 | 5 | 最大输入 128k,最大输出 8k 擅长复杂需求拆解、技术方案直译,提供精准结构化分析及可落地方案,实现了与 GPT-4o 和 Claude Sonnet 3.5等模型相媲美的性能。 | |
| | 5 | 最大输入 128k,最大输出 8k 通用型 AI 模型,拥有庞大参数规模及强大多任务泛化能力,擅长开放域对话、知识问答、创意生成等多样化需求。 | |
| | 5 | 最大输入 128k,最大输出 8k deepseek-r1 32b 参数蒸馏模型,使用成本更低,性价比较高。 | |
| | hunyuan-turbo | 5 | 最大输入 28k,最大输出 4k 腾讯新一代旗舰大模型,混元 Turbo 模型,在语言理解、文本创作、数学、推理和代码等领域都有较大提升,具备强大的知识问答能力。 |
| | hunyuan-large | 5 | 最大输入 28k,最大输出 4k 腾讯开发的开源业界参数规模最大、效果最好的 transformer 结构的 MoE 模型,适用对模型效果、复杂指令有较高的要求的场景。 |
| | hunyuan-large-longcontext | 5 | 最大输入 128k,最大输出 6k 擅长处理长文任务如文档摘要和文档问答等,同时也具备处理通用文本生成任务的能力。在长文本的分析和生成上表现优异,能有效应对复杂和详尽的长文内容处理需求。 |
| | hunyuan-standard | 5 | 最大输入 30k,最大输出 2k 在通用效果提升的基础上,训练数据中融合了医疗、金融领域的长文数据、长文翻译数据和长文多文档问答等高质量精标数据。 |
| | hunyuan-standard-256K | 5 | 最大输入 250k,最大输出 6k 256k 极长窗口特化版,复用7B-MoE 框架压缩显存占用,支持百页文献级处理,适用绝大部分场景,同时兼顾效果及推理性能。 |
