其中 Embedding,Rerank,LLM 等类型的原子服务可以通过 ES 的 inference 创建为推理端点。

通过原子服务创建推理端点
您可以将原子服务创建为一个 ES 的 inference 推理端点,这样在 ES 中需要通过 inference API 调用时(例如通过 ingest pipeline 写入、通过 knn 或者 semantic 方式搜索)可以直接调用。
PUT _inference/text_embedding/tencent-embedding{"service": "custom","service_settings": {"url": "http://bj.aisearch.tencentelasticsearch.com/v1/embeddings","headers": {"Authorization": "Bearer ${api_key}","Content-Type": "application/json"},"request": "{\\"model\\": \\"bge-m3\\", \\"input\\": ${input}}","response": {"json_parser": {"text_embeddings": "$.data[*].embedding[*]"}},"secret_parameters": {"api_key": "sk-****"}}}
相关文档
原子服务一览