帮你快速理解、总结文档立即下载
文档中心>日志服务>Agent 可观测>Agent 可观测应用详情

Agent 可观测应用详情

最近更新时间:2026-07-14 11:27:02

我的收藏
说明:
此功能需要白名单权限使用,如有需要,可 提交工单 与我们联系。
如果您正在使用 AI 工具,可安装 CLS Agent 可观测分析 Skill,让 AI 基于已上报的 Trace 数据自动执行多维度分析(错误诊断、性能瓶颈、Token 成本、用户画像等),直接输出结构化报告。安装后在 AI 对话中描述分析需求即可(如"帮我看看 Agent 最近的运行情况")。

概述

应用详情页是 Agent 可观测的核心功能页面,为已接入的 AI 应用提供全方位的监控与分析视图。进入 CLS 控制台 > 应用中心 > 您的应用,即可查看应用详情。
页面包含三大功能模块:仪表盘调用链会话,帮助您从宏观指标到微观链路全面掌握 AI 应用的运行状况。
场景
能力
核心价值
整体运行状态如何?
仪表盘 - 总览
请求数、错误数、模型调用次数、Token 消耗等核心指标一览,支持按 Agent/模型维度 Top10排行
性能是否有瓶颈?
仪表盘 - 性能
请求耗时分布、P50/P90/P99分位趋势、模型平均耗时排行,定位慢模型和长尾延迟
Token 成本花在哪?
仪表盘 - 成本&Token
输入/输出 Token 总量、分位趋势,掌握成本走向
应用内部组件表现如何?
仪表盘 - 应用观测
按操作类型(generation/tool/agent/retriever 等)分析调用分布和耗时
单次请求发生了什么?
调用链
完整的 Trace 列表和详情,支持按状态/错误类型/耗时等过滤,展示调用树和每个节点的 Input/Output
用户多轮对话全貌?
会话
以 Session 维度聚合 Trace,还原多轮对话上下文,统计会话级 Token 和成本

应用列表

进入 CLS 控制台 > 应用中心 > Agent 可观测页面,可查看所有已接入的 AI 应用。页面顶部展示以下全局指标:
指标
说明
已接入应用
当前已成功接入 Agent 可观测的应用总数。
上报中应用
正在活跃上报数据的应用数量。
昨日写数据总量
前一日所有应用写入 CLS 的数据总量。
昨日 Token 总数
前一日所有应用消耗的 Token 总数。
应用列表展示每个应用的名称/ID、地域、实例状态、接入类型、昨日写数据量和昨日 Token 数等信息。单击操作列中的进入观测,即可进入该应用的详情页。


仪表盘

仪表盘页面提供应用运行的可视化监控面板,通过指标卡片和时序图直观展示应用各项核心指标。仪表盘包含四个子 Tab:总览性能成本&Token应用观测


总览

总览面板提供应用运行状态的全局视角,适合日常巡检和快速定位异常。
功能
说明
核心指标卡片
展示 Agent 数量、请求数、模型调用次数、输入/输出 Tokens、Tokens 总量等核心 KPI,并显示环比变化百分比。
请求数 / 错误数时序
请求量和错误数随时间的变化趋势图,快速发现突增突降。
模型调用次数时序
底层大模型的调用量时序变化。
请求数 Top10(按 Agent)
按 Agent 维度统计请求量排行,定位高频调用的 Agent。
模型调用次数 Top10(按 Agent + 模型)
按 Agent 和模型组合维度统计调用量排行。
Tokens 总量分布
单次请求 Token 消耗的直方图分布,了解 Token 使用集中区间。
Tokens 总量按 Agent/模型 Top10
识别高成本 Agent 和高消耗模型。
模型调用错误数时序
观察模型错误是否存在规律性波动。
每秒输出 Tokens(按模型)
评估各模型的输出吞吐率。
模型首 Token 平均耗时(TTFT)
反映用户感知的响应速度。
请求平均消耗模型次数/Tokens(按 Agent)
了解各 Agent 的模型调用复杂度和单次成本。

性能

性能面板聚焦于延迟和吞吐分析,帮助发现和优化性能瓶颈。
功能
说明
核心指标时序
请求数、错误数、平均耗时、模型调用次数、模型错误数、模型平均耗时的趋势变化。
请求耗时分布
请求耗时的直方图,标注 P50 分位线,直观展示耗时集中区间。
请求耗时分位
P50、P90、P99 耗时的时序趋势,监控长尾延迟变化。
模型调用耗时分布
模型层面的延迟直方图分布。
模型平均耗时时序
各模型平均耗时随时间变化,发现模型性能劣化。
模型调用次数/平均耗时 Top10
按模型统计调用量和耗时排行,识别慢模型。
按 Agent + 模型组合 Top10
请求数和模型调用次数按组合维度排行。

成本&Token

成本&Token 面板帮助您监控和管理 Token 消耗趋势。
功能
说明
输入/输出 Tokens
选定时间范围内的输入和输出 Token 总量。
Token 总量时序
输入和输出 Token 数量随时间的变化趋势。
Token 分位时序
Token 消耗的 P50/P90/P99分位变化趋势,识别异常高消耗请求。

应用观测

应用观测面板提供应用内部组件级别的运行分析,按操作类型(Observation Type)维度展示各组件的行为和性能。
功能
说明
操作类型分布
展示 generation、guardrail、tool、chain、agent、retriever、event 等各操作类型的调用占比。
Observation 平均耗时
各操作类型的平均执行耗时对比,识别慢组件。
LLM 调用次数时序
LLM 调用量随时间的变化趋势。
LLM 耗时分位时序
LLM 调用耗时的 P50/P90/P99分位趋势。
LLM 调用模型排行
各 LLM 模型的调用次数排行。
LLM 平均耗时 Top10
各 LLM 模型的平均耗时排行,定位慢模型。

调用链

调用链页面提供请求级别的细粒度追踪能力,帮助您深入分析单次请求的完整执行路径。支持 Traces 和 Observations 两个视图切换。


Trace 列表与筛选

功能
说明
Trace 状态筛选
按成功(OK)或错误(ERROR)状态过滤,快速聚焦异常请求。
错误类型筛选
按具体错误类型(tool 调用失败、LLM 调用失败、Root span 状态码异常、AGENT 执行失败等)分类过滤。
Trace ID / Session ID 查询
精确查找特定 Trace 或某个会话下的所有 Trace。
Duration 范围筛选
按耗时范围筛选,快速定位慢请求。
列表展示
每条 Trace 显示状态、错误类型、时间戳、Trace ID、Operation 名称、调用模型等信息。

Trace 详情

单击任意一条 Trace 可展开详情视图,完整还原单次请求的调用链路。

功能
说明
基本信息
Trace ID、起始时间、总耗时、Observations 数量、Token 消耗总量(输入→输出)、费用、版本号、Session ID。
调用树
左侧以树形结构展示本次请求的完整调用链路,包括各节点的操作类型(generation/tool/guardrail 等)、耗时和错误状态标识。
节点详情
选中调用树中的任意节点,右侧展示该节点的 Tags、Input/Output 内容、Observation 类型、延迟和执行状态。
错误诊断
ERROR 状态的 Trace 会标注错误信号来源(如"由以下上浮到 Trace 的 Observation 错误触发"),帮助快速定位根因。

会话

会话页面以 Session 维度聚合展示用户与 AI 应用的交互过程,帮助您了解用户的使用模式和对话质量。

功能
说明
Session ID 搜索
支持精确搜索特定会话。
Session Duration 筛选
按会话持续时长范围过滤。
Traces Count 筛选
按会话包含的 Trace 数量过滤。
Input / Output / Total Tokens 筛选
按会话级别的 Token 消耗量过滤。
Input / Output Cost 筛选
按会话级别的成本过滤。
会话列表
展示 Session ID、创建时间、持续时长、模型、用户输入摘要等信息。
会话详情
选中会话后展示该 Session 下的所有 Trace 调用树,右侧展示 Trace 详细信息(Tags、Input/Output 内容、Token 消耗、费用)。