首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >基于日志的监控告警:我们是怎么用一套轻量方案把线上问题"盯"住的

基于日志的监控告警:我们是怎么用一套轻量方案把线上问题"盯"住的

作者头像
码农的日常
发布于 2026-10-08 08:06:40
发布于 2026-10-08 08:06:40
70
举报
概述
业务接口反馈慢,但从监控面板,CPU、内存、QPS 全都绿绿的,看不出哪里不对。最后查日志,发现某个下游服务调用耗时飙到了 5 秒,但因为它没报错,只是慢,所以传统的指标监控根本没捕捉到。
文章被收录于专栏:james大数据架构james大数据架构

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 整体思路:定时拉日志 → 模板匹配 → 阈值判断 → 告警通知
  • 规则配置:一条告警规则长什么样
  • 日志从哪来:ES 查询的 DSL 长什么样
  • 核心处理:Grok 模板匹配 + QLExpress 表达式引擎
  • 去重机制:同一条日志不要反复告警
  • 多线程架构:两层线程池分工
  • 告警通知:钉钉机器人推送
  • 几点实践中的体会
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档