码农的日常
基于日志的监控告警:我们是怎么用一套轻量方案把线上问题"盯"住的
原创
关注作者
腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
码农的日常
社区首页
>
专栏
>
基于日志的监控告警:我们是怎么用一套轻量方案把线上问题"盯"住的
基于日志的监控告警:我们是怎么用一套轻量方案把线上问题"盯"住的
码农的日常
关注
发布于 2026-10-08 08:06:40
发布于 2026-10-08 08:06:40
7
0
举报
概述
业务接口反馈慢,但从监控面板,CPU、内存、QPS 全都绿绿的,看不出哪里不对。最后查日志,发现某个下游服务调用耗时飙到了 5 秒,但因为它没报错,只是慢,所以传统的指标监控根本没捕捉到。
文章被收录于专栏:
james大数据架构
james大数据架构
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系
cloudcommunity@tencent.com
删除。
日志分析
#日志监控
目录
整体思路:定时拉日志 → 模板匹配 → 阈值判断 → 告警通知
规则配置:一条告警规则长什么样
日志从哪来:ES 查询的 DSL 长什么样
核心处理:Grok 模板匹配 + QLExpress 表达式引擎
去重机制:同一条日志不要反复告警
多线程架构:两层线程池分工
告警通知:钉钉机器人推送
几点实践中的体会
问题归档
专栏文章
快讯文章归档
关键词归档
开发者手册归档
开发者手册 Section 归档