概述
作业诊断能够帮您分析作业健康状况,通过实时采集分析作业运行指标、异常事件和错误日志等数据,发现作业异常和潜在风险,提供根因分析,以及针对诊断结果生成对应的处理建议。
操作步骤
1. 在流计算 Oceanus 控制台 > 工作空间 页面,单击体验新版切换到新版 UI(已经在新版 UI 页面忽略此步骤)。

2. 在作业运维页面上,单击具体的作业,切换到诊断 Tab。

3. 单击开始诊断后触发(第一次切换到 Tab 会自动触发诊断),查看诊断结果和优化建议。

诊断项
类型 | 检查项 | 说明 |
启动分析 | 启动失败 | 结合最新失败日志,分析启动失败原因并给出处理建议。 |
运行分析 | 运行异常、频繁重启 | 根据作业最近失败日志和异常事件进行分析,提供原因分析和处理建议。 |
运行分析 | Checkpoint 检查 | 根据 flink 实时指标数据发现 Checkpoint 问题,如生成失败、耗时过长等,并给出优化建议。 |
性能分析 | 性能指标 | 诊断性能指标(CPU/内存/反压/延迟等),识别存在风险,并给出优化建议。 |
配置分析 | HA 状态检查 | 检测作业是否开启自动恢复,未开启可能会因底层组件故障导致作业无法正常 FailOver。 |