作业运行实例用于查看作业的运行记录,并提供单次运行的状态、配置快照、事件日志和 Pod 详情,便于确认运行结果和定位问题。
概述
作业运行实例适用于以下场景:
查看历史运行结果,包括运行状态、耗时和资源使用情况。
定位运行失败的原因。
分析作业性能问题。
审计作业的执行记录。
前提条件
已开通 AI DLC 服务并完成服务授权。
AI DLC 目前为白名单开放,如需使用,请 提交申请 。
操作步骤
查看运行记录
1. 登录 DLC 控制台。
2. 通过以下任一入口查看运行记录:
在左侧导航栏选择作业运行实例,查看全部作业的运行记录。
在左侧导航栏选择作业配置,单击目标作业名称,然后选择历史任务页签,查看该作业的运行记录。
列表包含以下信息:
字段 | 说明 |
实例名称 / ID | 单次运行的唯一标识。 |
实例状态 | 已提交、待执行、执行中、成功、失败或已取消。 |
创建时间与完成时间 | 任务的提交时间和结束时间。 |
运行时长 | 从开始运行到运行结束的持续时间。 |
执行人 | 提交任务的账号信息。 |
关联资源包与资源组 | 本次运行占用的资源归属。 |
Ray 集群 | 当提交方式为提交到指定集群或提交到集群组上时,显示该实例运行的集群。 |
您可以按时间范围、任务状态筛选记录,或按实例 ID、实例名称搜索。
查看运行详情
在列表中单击目标任务,查看该次运行的详情。
基本信息
展示执行内容,包含作业名称、入口命令。资源配置,包含资源包与资源组、头节点与工作节点组规格。基本信息,包含实例名称、实例 ID、执行人、提交时间、完成时间、运行时长和镜像地址,并以状态流转进度条的形式展示任务生命周期。作业配置,提供本次运行的完整配置快照,便于核对运行环境、环境变量和调度信息。
事件日志
任务运行期间的事件记录,包含事件类型、原因、时间、来源、消息。
Pod 日志
展示 Pod 级别的日志。可支持提交日志和执行日志,可根据容器、级别、输出流、关键字等筛选。
Pod 详情
展示底层容器的运行情况,包含 Pod 名称、角色、IP 地址、状态、所在节点、CPU 与内存的请求值和限制值、GPU 数量、创建时间,并支持查看 Pod 配置。
Pod 状态说明如下:
状态 | 说明 |
Pending | 已被集群接受,但普通容器尚未全部创建完成。可能在等待调度、拉取镜像、挂载卷或初始化。 |
Running | Pod 正在运行。 |
NotReady | 可能是 readiness probe 未通过、容器正在启动、等待、重启或已经异常退出。 |
Succeeded | Pod 已成功运行结束。 |
Failed | 所有容器均已终止,其中至少一个失败退出,或被系统终止,并且不会再重启。 |
Unknown | 控制面无法获取 Pod 状态,例如与节点通信异常。 |
Dashboard
集成 Ray Dashboard,提供作业、节点、Actor、性能指标和日志等监控视图。作业运行结束后仍可访问。
监控时建议关注以下指标:
指标 | 参考范围 | 处理建议 |
CPU 使用率 | 低于85% | 持续偏高时可增加工作节点数量。 |
内存使用率 | 低于80% | 接近上限时存在内存溢出风险,建议提升节点规格。 |
常见问题
任务运行失败如何定位原因?
请按以下顺序排查:
1. 查看事件日志中的告警和错误事件。例如容器因内存不足被终止时,建议提升节点规格;镜像拉取失败时,请检查镜像地址与访问权限。
2. 查看 Pod 详情中的 Pod 状态和配置信息。
3. 在 Dashboard 中查看作业日志,确认代码运行时的输出与异常堆栈。
Pod 长时间处于 Pending 状态如何处理?
常见原因如下:
资源组的可分配配额小于任务请求量,请检查资源组配额。
首次拉取镜像需要一定时间,属正常现象。
任务配置了节点标签,但无匹配的节点,请检查标签配置。
任务运行时可以查看实时日志吗?
可以。在 Dashboard 页签中查看实时刷新的运行日志,在事件日志页签中查看运行事件。