首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >使用两个 Elasticsearch 数据层替代四个,降低日志存储成本

使用两个 Elasticsearch 数据层替代四个,降低日志存储成本

原创
作者头像
点火三周
发布于 2026-09-30 06:45:47
发布于 2026-09-30 06:45:47
300
举报
文章被收录于专栏:Elastic Stack专栏Elastic Stack专栏

多年来,标准的 Elastic 存储方案将数据依次经过四个层:热(hot)、温(warm)、冷(cold)和冻结(frozen)。每一步都以性能换取成本。该模型有效,但在 PB 级规模下,它增加了不必要的运维开销。

更简单的路径是:热 → 冻结。一天数据在 SSD 上用于实时故障排查,然后索引生命周期管理(ILM)将所有其他数据作为可搜索快照移动到对象存储上的冻结层。没有温层,也没有冷层。冻结索引是部分挂载且只读的。你不会再向它们写入数据。你可以在 Kibana 和 ES|QL 中搜索它们,无需先恢复再查询。

Elasticsearch 在摄取时动态映射字段,因此在发送日志、指标、链路追踪或安全日志之前,你不需要一个严格的 schema。同样的两层 ILM 策略可以覆盖这些数据流。当需要按流处理、丢弃、聚合、降采样或保留时,可以在上层叠加 Elastic Streams。有关配套的成本分析,请参见并非每条日志都值得保留 90 天:Elastic Streams 中的按流保留。

何时四个数据层对于日志存储来说是多余的

传统的 Elastic Cloud Hosted 部署通常遵循这样的阶梯:

使用热、温、冷、冻结四层数据层和快照仓库增加遥测保留时长
使用热、温、冷、冻结四层数据层和快照仓库增加遥测保留时长

每一次过渡都需要调整 ILM 策略,为温层和冷层硬件配置类型规划节点大小,并在各层之间管理副本。冻结层仍然依赖快照仓库,但你需要先经过温层和冷层。

在每天数百 TB 或数 PB 的规模下,这些中间层变得昂贵且难以向财务部门解释。你为那些已经没人以秒级延迟查询的数据支付了旋转磁盘和副本分片的费用。

热到冻结日志存储如何工作

两层热/冻结架构压缩了阶梯:

阶段

存储

用途

热(1 天)

SSD,高 IO

活跃事件、告警、SLO 燃烧率、持续摄取

冻结

对象存储 + 缓存节点

审计、合规、历史搜索(只读可搜索快照)

在最初的 24 小时之后,ILM 将索引转换为快照,存储到 Elastic Cloud Hosted 在云对象存储上提供的 found-snapshots 仓库中。数据仍然可查询。你完全省略了温层和冷层。

热到冻结模式与 Elastic 在大型时间序列可观测性和安全部署中的文档一致——这些场景在摄取后不需要更新。新事件继续落在热层,老化的后备索引转移到冻结层。

Elastic 在 ECH 上对相关的热冻结模式进行了基准测试,测试数据集为 90 天内的 105 TB 日志。在绝大多数任务中,冻结层的 Discover 查询 p99.9 延迟保持在个位数秒内。将一天数据保留在热层,其余数据保留在冻结层,其成本约为将所有数据保持在热节点上的 16 分之一。请参阅测量可搜索快照性能。

Elastic Cloud Hosted 上 PB 级日志存储的成本

以下数字是一个基于电信级工作负载模型的示例,并非 Elastic 的报价或定价承诺。你的实际成本会因摄取量、保留时间、查询模式、云区域、硬件配置和许可层级而异。请使用 Elastic Cloud Hosted 定价和你的客户团队获取具体项目的估算。

Elastic Cloud Hosted 定价与 Serverless 有何不同?

Elastic Cloud Hosted(ECH)主要根据你运行的资源的内存占用量计费:热层和冻结层节点的容量(GB RAM-小时),加上快照存储和数据传输。即使采用两层的热到冻结 ILM 策略,你仍然需要为执行针对对象存储数据的查询的 Elasticsearch 节点和冻结缓存层进行规模设定并付费。

Elastic Cloud Serverless 根据摄取量和存储数据量计费,而不是按分配的集群 RAM。该模型消除了节点大小规划、容量规划和大部分生命周期管理工作。你只需为发送的数据和保留的数据付费。

此示例仅针对 ECH 建模。Serverless 未包含在上述表格中,因为可观测性 Serverless 目前尚不支持将老化数据写入 S3 或对象存储用于长期冻结保留。当该功能发布后,Serverless 上的相同热到对象存储模式应能进一步减少管理开销,同时保持摄取加存储的定价模式。在此之前,带有热到冻结 ILM 策略的 ECH 是在对象存储上实现 PB 级审计和合规的路径。

该示例假设 1 天热数据,然后通过 ILM 转到对象存储(冻结可搜索快照)进行长期保留。请将每 PB 的数字视为混合遥测数据的规划参考,而非声称 1 PB 原始日志与 1 PB 原始指标占用相同磁盘。时间序列数据流 (TSDS) 存储指标的效率远高于常规数据流。计算使用了已发布的 ECH 容量、快照存储和数据传输费率,并采用企业许可。

没有 Streams 时,每天 1 PB 日志存储成本

在此示例中,每天 1 PB 的摄取量,仅 ECH 的模型成本为每月 17.8 万美元(每年 214 万美元),使用的是 elastic.co/pricing/cloud-hosted 上的公布费率。

按线性扩展:

每日摄取量

ECH 月度

ECH 年度

1 PB/天

$178K

$2.14M

2 PB/天

$357K

$4.28M

3 PB/天

$535K

$6.42M

4 PB/天

$713K

$8.56M

5 PB/天

$891K

$10.70M

6.5 PB/天

$1.16M

$13.90M

8.45 PB/天

$1.51M

$18.07M

即使没有 Streams 优化,两层模型也专为每天 PB 级摄取而构建:短热保留、对象存储支持的冻结搜索,且没有温层或冷层硬件配置。竞争对手的总拥有成本(TCO)取决于摄取组合、保留时长,以及其他厂商是否将长期可搜索性作为高级热存储收费。请将已公布的 ECH 费率与你当前的报价进行比较,而不是将任何单一百分比视为通用节省。

Elastic Streams 如何将日志保留成本降低 28%

在相同的热到冻结 ILM 基础上叠加 Elastic Streams 控制(丢弃、聚合、降采样、保留),可将示例运行费率降低约 28%:

每日摄取量

Streams 优化月度

Streams 优化年度

1 PB/天

$127K

$1.52M

2 PB/天

$254K

$3.04M

3 PB/天

$380K

$4.56M

4 PB/天

$507K

$6.08M

5 PB/天

$634K

$7.60M

6.5 PB/天

$824K

$9.88M

8.45 PB/天

$1.07M

$12.85M

在 每天 5 PB,年增长 30% 的情况下,三年的比较如下:

年份

每日数据量

ECH 年度

Streams 优化年度

第 1 年

5 PB/天

$10.70M

$7.60M

第 2 年

6.5 PB/天

$13.90M

$9.88M

第 3 年

8.45 PB/天

$18.07M

$12.85M

在这个示例中,与仅使用 ECH 相比,Streams 优化在三年内降低了 1230 万美元。请将这一差额作为敏感性检查依据,然后根据遥测数据组合进行调整。TSDS 中的指标、降采样序列和详细日志并不共享同一个存储乘数。

当 Serverless 为可观测性数据添加对象存储层保留时,请使用 Serverless 定价 重新运行此比较。按摄取加存储计费,加上零节点管理,应使 Serverless 成为大型长期保留工作负载更简单的运维选择。

ILM 策略示例:一天热数据,冻结保留用于合规

在 ECH 上,附加一个策略,该策略每天在热层滚动,并在冻结层转换为可搜索快照。当审计要求需要对对象存储进行无限期保留时,省略温层、冷层和删除阶段。

代码语言:json
复制
PUT _ilm/policy/obs-hot-frozen
{
  "policy": {
    "phases": {
      "hot": {
        "min_age": "0ms",
        "actions": {
          "rollover": {
            "max_age": "1d",
            "max_primary_shard_size": "50gb"
          }
        }
      },
      "frozen": {
        "min_age": "1d",
        "actions": {
          "searchable_snapshot": {
            "snapshot_repository": "found-snapshots"
          }
        }
      }
    }
  }
}

冻结阶段中的 searchable_snapshot 操作会挂载一个只读、部分挂载的快照(partial-*)。保持热层持续摄取。将历史 Discover 和 ES|QL 查询指向冻结层。

通过索引模板、Kibana 索引管理或 Streams 保留选项卡 应用该策略。冻结层节点本地缓存频繁查询的对象存储区域。首次访问一个新的时间范围可能较慢;重复查询会命中缓存,性能接近热层延迟。

对于受监管的工作负载,可以将无限期冻结保留与 Streams AI 分区结合使用,这样合规性要求高的流(支付审计、安全事件)获得更长的生命周期,而详细的调试流则在其子流上应用较短的 DSL 删除策略。

为什么 Elasticsearch 数据层适用于 PB 级日志存储

在托管可观测性平台中,据我们所知,Elastic Cloud Hosted 是唯一一个同时提供以下能力的选项:

  • PB 级遥测摄取:统一平台处理日志、指标、链路追踪、安全日志等。
  • 两层 ILM:从热到冻结,无需温层或冷层硬件配置。
  • 可搜索快照:直接查询对象存储,无需还原步骤。
  • 公布费率的 TCO 建模:你可以在与财务沟通之前,使用 ECH 定价 进行核算。

其他可观测性 SaaS 工具通常对长期热保留收取高价,按遥测类型计费,或者将老化数据移至无法使用与实时事件相同查询工具进行搜索的归档中。在每天 PB 级摄取量下,这些定价模式会拉大差距。Elastic 将分层直接构建在搜索引擎中,这就是 Discover、ES|QL 和 APM 视图能够透明地在热数据和冻结数据上工作的原因。

如何为 PB 级日志存储调整热节点和冻结节点的大小

确切的节点数量取决于每日摄取量、查询并发性和硬件配置。来自 Elastic 基准测试的一个实用起始比例:

  • 热节点:大小按一天摄取量加上索引余量设计。
  • 冻结缓存节点:大小按并发查询模式设计,而非总对象存储数据量。

在生产部署之前:

  1. 测量每日遥测数据摄取量(日志、指标、链路追踪、安全日志)。
  2. 在代表性数据流上试用一天热策略。
  3. 对冻结数据运行 Discover 和 ES|QL 查询以验证缓存大小。
  4. 应用 Streams 丢弃和分区以减少进入热层的数据量。

将告警评估和 SLO 燃烧率查询保留在热层。规划事故处理流程:从最近 24 小时开始,需要历史上下文时再扩展到冻结层。首次访问(缓存驱逐后)的冻结查询可能显示较高的延迟。

可搜索快照和冻结层需要适当的 Elastic Cloud 能力。在启用大规模冻结层之前,请查看 Elastic Cloud 定价 和你的部署层级。

如何将你的日志保留策略迁移到热到冻结

  • 将可观测性数据流上的温层和冷层阶段替换为热到冻结 ILM 策略。
  • 使用已公布的 ECH 定价以你的摄取量建模 TCO,然后添加 Streams 优化场景。
  • 将 OpenTelemetry 数据发送到接线流,并应用 Streams TCO 控制。
  • 阅读可搜索快照文档和数据层指南。

PB 级可观测性并不需要四个存储层,也不需要在成本和可搜索性之间做出选择。一天热数据,其余数据作为对象存储上的冻结可搜索快照,再叠加 Streams 调节:这就是 Elastic Cloud Hosted 能够以财务团队认可的 TCO 保持完整历史可查询性的方式。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 何时四个数据层对于日志存储来说是多余的
  • 热到冻结日志存储如何工作
  • Elastic Cloud Hosted 上 PB 级日志存储的成本
    • Elastic Cloud Hosted 定价与 Serverless 有何不同?
    • 没有 Streams 时,每天 1 PB 日志存储成本
    • Elastic Streams 如何将日志保留成本降低 28%
  • ILM 策略示例:一天热数据,冻结保留用于合规
  • 为什么 Elasticsearch 数据层适用于 PB 级日志存储
  • 如何为 PB 级日志存储调整热节点和冻结节点的大小
  • 如何将你的日志保留策略迁移到热到冻结
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档