概述
潮汐算力支持在夜间等闲时使用高性能 GPU,以更低成本运行训推业务。潮汐算力适合非实时、可中断、周期性运行的计算任务,例如模型训练、数据标注、离线批量推理、性能评测等。
本文将介绍在 TI-ONE 上使用潮汐算力的前置条件、操作流程、典型场景下的配置建议以及常见问题,帮助您快速上手使用潮汐算力承接业务。
前置条件
使用潮汐算力前,请确认已完成以下准备:
开通 TI-ONE 服务:登录 TI-ONE 控制台,若首次使用需完成服务开通与授权。
了解潮汐机型库存:如需了解当前可售 GPU 机型、库存排期、折扣等信息,请联系您对接的腾讯云销售或产品经理咨询。
准备训推镜像:使用与目标 GPU 机型匹配的镜像,请确保镜像已上传至腾讯云容器镜像服务,并在 TI-ONE 镜像中心完成注册。若不清楚适配情况,可联系对接的腾讯云销售或产品经理咨询。
准备存储资源:训练与标注类任务需挂载存储实例,用于存放代码、数据集和模型 checkpoint。使用腾讯云算力集群的潮汐资源时,可挂载腾讯云控制台已购买的 CFS、GooseFSx 等常规存储;使用其他集群的潮汐资源时,需通过 TI-ONE 平台单独购买平台预置存储,详见后续章节。
可售机型与计费说明
TI-ONE 潮汐算力主推高性能 GPU 机型,覆盖大模型训练、大模型推理、多机分布式训练等主流场景。因潮汐机型库存、机型排期、刊例价格与折扣策略会随业务节奏动态调整,本文不对具体机型与价格作展开说明。如需了解以下信息,请联系对接的腾讯云销售或产品经理咨询:
当前可售 GPU 机型与规格。
潮汐算力刊例价与 CVM 同规格按量价格的对比。
KA 客户折扣、POC 测试支持、长期用量协商。
在 TI-ONE 平台使用潮汐算力
TI-ONE 提供两种潮汐算力的使用模式,供客户根据业务需要选择:
使用模式 | 适用对象 | 特点 |
共享模式 | 算力需求较小、临时性使用、短期 POC 探索 | 无需提前预约,随用随买;提交后进入排队,00:00 起由平台统一调度分配;不保证任务必然被运行 |
专享资源组模式 | 长期稳定使用、团队协作、企业级管理场景 | 通过「预约计划」提前锁定资源,每日固定时段交付到资源组;平台优先满足专享资源组,交付确定性更高;支持资源集中管理、监控与购买记录 |
注意:
两种模式的计费口径不同。共享模式在任务实际启动、占用资源后开始计费;专享资源组模式在资源交付到资源组后即开始计费,无论是否有任务实际使用。请根据业务节奏合理选择。
本章介绍在 TI-ONE 上使用潮汐算力的三条典型链路:共享模式、专享资源组模式,以及使用「其他集群」时的平台预置存储配置流程。
模式一:共享模式
共享模式适合小规模验证、临时性任务和短期 POC。客户无需提前预约资源,直接在创建任务或服务时选择潮汐实例,提交后由平台在潮汐窗口内统一调度。
场景一:使用任务式建模提交训练任务
1. 登录 TI-ONE 控制台,进入训练工坊 > 任务式建模,单击新建任务。
2. 配置任务的基本信息,重点参数说明如下:
机器来源:选择从 TI-ONE 平台购买。
计费模式:选择潮汐实例。
使用方式:选择共享模式。
集群类型(白名单功能):默认为腾讯云算力集群,白名单用户可选择其他集群(覆盖更多可用机型)。
算力规格:从可选列表中选择潮汐时段可用的 GPU 机型与卡数。
镜像:选择与目标 GPU 匹配的内置镜像或自定义镜像。
存储配置:按需挂载 CFS、GooseFSx 或 COS,用于存放训练代码、数据集与 checkpoint。
3. 完成参数配置后,单击提交。
说明:
如果提交时未处于潮汐可用时段(如:00:00–08:00),任务将进入“排队中”状态,鼠标悬停在状态标签上会显示提示“等待潮汐资源”。平台在 00:00 起统一调度并分配资源;08:00 资源回收后未跑完的任务将重新进入“排队中”状态,等待次日调度。
4. 注意:建议在训练脚本中开启定期 checkpoint 保存,以便任务在潮汐窗口结束后可从断点续训(详见后述)。
场景二:使用在线服务部署离线推理
1. 进入模型服务 > 在线服务,单击新建服务。
2. 配置服务的基本信息,重点参数与任务式建模一致:
机器来源:选择从 TI-ONE 平台购买。
计费模式:选择潮汐实例。
使用方式:选择共享模式。
算力规格:选择目标 GPU 机型与卡数。
镜像与模型:选择内置大模型镜像,或自定义镜像并加载待部署的模型。
3. 完成配置后单击提交,服务将在潮汐窗口内启动并对外提供推理接口。
注意:
共享模式下资源为所有用户共享,控制台会展示当前潮汐时段的资源池上限。若同一时段申请量超过池上限,平台将按优先级排队分配,不保证您提交的任务必然被运行。用量较大的客户建议使用专享资源组模式以提升交付确定性。
模式二:专享资源组模式
专享资源组模式面向长期稳定使用潮汐算力的客户,通过预约计划提前锁定资源,平台每日在 00:00 优先将资源交付到指定资源组,用于团队内部的任务或服务。相较共享模式,专享资源组模式具备资源交付确定性高、可集中管理并查看资源购买记录等优势。
步骤一:创建预约计划
1. 登录 TI-ONE 控制台,在左侧导航栏中选择预约计划,单击新建预约计划。
2. 配置预约计划的基本信息:
资源组名称:为该批潮汐资源指定一个易识别的名称,例如
潮汐资源预约计划_模型训练。关联空间:选择使用该资源组的项目空间。
集群类型(白名单功能):选择腾讯云算力集群或其他集群。同一资源组内的所有节点必须使用同一集群类型,首次配置后不可切换。
期望资源量:您希望每日交付到资源组的机器台数。平台将按此值尽力锁定资源。
最少接受资源量:交付下限阈值。若实际锁定数量低于该值,则平台视为交付不成功,全部释放且不计费。
3. 单击提交后,预约计划长期生效。平台在每日 23:00 自动尝试锁定次日 00:00 起的资源,交付结果可在资源购买记录中查看。
说明:
一次提交预约计划长期有效,无需每天重复提单。不再需要该批资源时,可在预约计划列表中单击取消预约释放订单。
步骤二:管理预约计划
预约计划创建后,平台会自动生成一个「潮汐类型」的资源组。您可在预约计划详情页查看和管理:
1. 在预约计划页面的列表中,找到对应订单,单击进入详情页。
2. 在节点管理页签下,可以查看当前资源组内的节点状态。潮汐类型节点的关键说明:
可用时段:每日 00:00–08:00,08:00 后节点自动被平台回收。
节点操作限制:潮汐类型节点不支持释放、删除、移动、续费等操作,节点生命周期完全由预约计划管理。
订单管理:如需调整期望资源量、最少接受资源量或取消预约,单击查看详情打开订单管理弹窗,在弹窗中修改或取消。
3. 切换到资源购买记录页签,可按日期、状态筛选查看每日的资源锁定与交付情况。购买记录的状态分为三种:
购买成功:实际交付数量 ≥ 期望资源量。
部分购买成功:最少接受资源量 ≤ 实际交付数量 < 期望资源量,按实际交付数量计费。
购买失败:实际锁定数量 < 最少接受资源量,资源全部释放,不产生任何费用。
步骤三:在任务或服务中使用专享资源组
1. 创建任务或服务时,参数配置与共享模式一致,区别在于使用方式选择「专享资源组模式」。
2. 在下方资源组下拉列表中,选择前述步骤创建的潮汐资源组。选中后,界面会展示该资源组的集群类型、已预约的节点规格与数量,以及当前可用资源总量。
3. 完成参数配置后单击提交。
说明:
即使提交任务时资源组的可用资源为0(例如白天时段),仍可选择该资源组提交任务。任务将进入“排队中”状态,等待次日 00:00 资源交付后自动启动。
其他:使用其他集群时的平台预置存储配置流程
由于其他集群的潮汐资源与常规腾讯云算力集群的网络并不相通,模型训练/批处理任务需通过 TI-ONE 提供的平台预置存储(专用 CFS-Turbo 实例)挂载数据。使用其他集群类型的潮汐资源前,需先完成平台预置存储的购买与数据准备。
注意:
1. 其他集群及配套的平台预置存储为白名单能力,如需开通请联系对接的腾讯云销售或产品经理咨询。
2. 同一客户 UIN 在同一地域下仅支持创建一个平台预置存储实例,实例名称默认为
<客户 UIN>专用-平台预置存储。步骤一:购买平台预置存储
1. 在创建任务或服务时,选择集群类型为其他集群。系统会自动检测当前 UIN 是否已购买平台预置存储实例:
未购买:控制台显示“检测到您尚未购买平台预置存储实例”提示卡片,单击前往购买跳转至新购页面。
已购买:控制台显示“已绑定存储实例:<存储实例名称>(已购容量:xxx GB;已用容量:xxx GB)”,如需扩容单击扩容跳转至扩容页面。
2. 在新购页面配置存储参数:
服务内容:选择新购。地域:选择其他集群所在的地域。存储类型:CFS-Turbo 标准型。
存储容量:按业务实际需要配置初始容量(后续可通过扩容页面调整)。
3. 单击立即购买并完成支付。平台会自动创建 CFS-Turbo 实例,并将实例 ID 与您的 UIN 绑定,创建完成后即可使用。
步骤二:将数据上传到平台预置存储
购买完成后,需要将训练代码、数据集和模型文件上传到该存储实例。推荐通过 TI-ONE 开发机进行数据传输:
1. 进入训练工坊 > 开发机,单击新建。
2. 配置开发机参数:
机器来源:选择从 TI-ONE 平台购买。
计费模式:选择按量计费。
算力规格:选择 CPU 机型(数据传输无需 GPU)。
存储配置:新增挂载项,存储类型选择平台预置存储,CFS 文件系统会自动回显您已绑定的实例。
3. 开发机启动后,进入 JupyterLab 或 VSCode,即可通过命令行、
scp、rsync 或 Web 上传等方式将本地数据传输至挂载目录。说明:
在启动开发机时,暂不支持同时挂载平台预置存储及 CFS 存储实例(Turbo 型)。如有需要,可联系 TI-ONE 团队处理。
步骤三:使用其他集群潮汐资源运行任务
数据准备完成后,即可创建使用其他集群潮汐资源的训练或推理任务:
1. 在任务式建模或在线服务创建页面,按前述共享模式或专享资源组模式流程配置参数。
2. 关键差异点:
集群类型:选择其他集群。
存储配置:仅支持挂载平台预置存储,CFS 文件系统字段自动回显已绑定的 CFS-Turbo 实例。
3. 完成配置后单击提交,任务将在潮汐可用窗口内使用其他集群的资源运行,直接读写平台预置存储中的数据。
典型使用场景
潮汐算力的核心价值是用时间换成本——将非实时、可中断的计算任务放到夜间闲时执行,以显著更低的价格获取同等性能的 GPU 算力。
由于潮汐资源在 08:00 会被平台回收,任务或服务在使用潮汐算力时,需要针对"可中断、可续跑、可断点恢复"这一特性做相应的配置。以下按训练、数据标注、离线推理、模型评测四类场景,分别说明使用潮汐算力时需要重点关注的配置项。
场景一:模型训练
模型训练(包括大模型预训练、SFT 监督微调、RLHF/DPO 对齐训练、MoE 训练等)通常具有计算密集、周期长、可断点续训的特点,与潮汐算力的夜间固定时段高度契合。
使用潮汐算力承接训练任务时,建议在提交任务前完成以下配置:
开启平台自动重启:在任务式建模的运行策略中,勾选任务失败自动重启,并配置合理的重试次数与间隔。潮汐资源在 08:00 被回收后,任务会进入“排队中”状态,次日 00:00 潮汐窗口开启时,平台会根据该配置自动拉起任务,无需人工介入。
在训练代码中配置定期 checkpoint 保存:将 checkpoint 保存的频率设置为按步数(如每 500 或 1000 步)或按时长(如每 30 分钟)触发一次,并将 checkpoint 写入挂载的持久化存储(CFS、GooseFSx 或平台预置存储),避免存到容器本地磁盘。以 PyTorch 为例,可在训练循环中调用
torch.save({'step': step, 'model_state': model.state_dict(), 'optimizer_state': optimizer.state_dict(), ...}, ckpt_path)。使用 HuggingFace Trainer 时,通过 save_strategy="steps" 与 save_steps 参数控制。在训练代码中支持从最新 checkpoint 恢复:任务启动时先检查 checkpoint 目录,若存在则加载最新的 checkpoint 恢复模型权重、优化器状态、随机数种子、学习率调度器状态与当前训练步数,然后继续训练;若不存在则从头开始。DeepSpeed、Megatron、Accelerate 等主流训练框架均已内置该能力,请确保正确启用相关配置项(如
--load 参数或 resume_from_checkpoint)。合理规划单晚训练量:潮汐窗口约 8 小时,其中包含集群注册、镜像拉取、任务启动等环节,实际训练可用时长约 6–7 小时。建议将大规模训练拆分为多天增量任务,每晚推进一个 epoch 或若干万步,避免因窗口不足导致的重复 warmup。
持久化训练日志与指标:将 TensorBoard 日志、训练指标、异常堆栈等输出到挂载的持久化存储,便于任务中断后次日继续查看和分析。
场景二:数据标注与数据蒸馏
大模型时代的数据标注已从人工划线转向由大模型批量生成候选、再由人工复核的模式。该过程需要大量 GPU 推理算力,但对实时性要求极低,非常适合放到潮汐窗口内执行。
使用潮汐算力承接标注与蒸馏任务时,建议关注以下配置:
将标注任务拆分为可幂等的小批次:将全量数据集切分为可独立处理的小批次(如每批 1 万条),每批处理完成后立即写入结果并记录进度。若任务因潮汐窗口结束被中断,次日重启时可根据进度文件跳过已完成批次,直接从断点续跑。
结果实时落盘:将标注、蒸馏结果以追加写入(append)的方式实时写到 CFS、COS 或平台预置存储,避免累积在内存或本地磁盘中在任务中断时丢失。若使用 COS,可结合分片上传能力保证大文件的可靠性。
合理配置批推理参数:为提高单位时间的处理吞吐,建议在推理框架(如 vLLM、SGLang)中开启动态批处理(continuous batching),并根据模型显存占用尽量提高并发请求数(
--max-num-seqs),避免 GPU 利用率不足。准备好待处理数据集:在潮汐窗口开启前,提前将待标注/蒸馏的原始数据上传至挂载的持久化存储,避免夜间 GPU 资源已就绪、但因数据还在传输而无法开跑。
场景三:离线批量推理
对推理结果没有实时性要求的业务(如离线报表生成、内容审核、图像批量生成、Embedding 计算等),是潮汐算力最直接的应用场景。
使用潮汐算力承接离线推理任务时,建议关注以下配置:
在推理脚本中记录处理进度:将待推理数据以行/条为单位编号,每处理完 N 条即写入进度文件(如
progress.txt 记录当前已完成 index)。重启时读取进度文件跳过已完成部分,从断点续跑。拆分在线与离线推理链路:建议将在线推理服务(承接白天实时请求)与离线批量推理任务(承接夜间批量作业)在部署上完全隔离,前者使用常规按量或包年包月资源,后者使用潮汐资源。两条链路互不影响,且可最大化算力投资回报率。
批推理结果统一归档:将批推理结果按业务日期分目录(如
results/2026-08-13/)写入 CFS 或 COS,便于次日业务侧按日期读取,也便于问题回溯。场景四:模型评测与性能调优
模型评测是 AI 研发中的高频刚需任务——每次模型迭代都需要跑全量评测集或性能压测。该类任务计算量大、周期规律、对时效不敏感,适合放到潮汐窗口内运行。
使用潮汐算力承接评测与调优任务时,建议关注以下配置:
按评测集拆分任务提交:将不同评测集(如 MMLU、C-Eval、HumanEval、自定义业务评测集)拆分为独立任务分别提交,便于单独查看结果、失败重跑,也可让平台在同一潮汐窗口内并行调度多张卡。
评测结果写入持久化存储:将每个评测集的原始输出(如各 sample 的生成文本、logits、耗时等)以及汇总指标(如准确率、BLEU、Pass@1)分别写入持久化存储,命名建议包含模型版本、评测集名称、评测日期,便于对比多个模型版本之间的效果差异。
性能压测使用固定的输入负载:进行推理性能压测(TTFT、TPOT、吞吐等指标测量)时,请使用固定的 prompt 集与并发配置,避免因潮汐窗口内多次运行的输入不同导致数据不可比。
合理配置压测时长:单次性能压测建议控制在 30 分钟以内,避免占用过多潮汐窗口时间;如需长时间压测,可拆分为多晚执行并汇总结果。
常见问题
产品与资源
问题1:潮汐算力与竞价实例的区别是什么?
两者均为低成本算力供给,但适用场景不同:
潮汐算力:仅在每日 00:00–08:00 提供服务,服务时段内资源确定性较高、不会被抢占,适合可安排到夜间执行的训练、标注、批量推理等任务。
竞价实例:全天 24 小时可用,但资源随时可能被回收,SLA 较低,适合容错率高、可快速重跑的短时任务。
问题2:潮汐算力与常规 CVM 共享资源大盘吗?
不共享。潮汐算力是 TI-ONE 平台单独管理的资源池,与 CVM 机型的库存相互独立。
问题3:潮汐算力优先满足哪类客户?
同一批潮汐资源,专享资源组模式(预约计划)的交付优先级高于「共享模式」(临时任务)。
购买与调度
问题4:预约计划需要每天提交一次吗?
不需要。一次提交预约计划长期有效,平台每日 23:00 自动尝试锁定次日 00:00 起的资源,无需每天手动触发。不再需要时可主动取消预约。
问题5:预约计划的优先级如何排序?
平台按单日申请量从大到小排序分配资源。当日锁定量低于最少接受资源量时,视为交付失败,全部释放且不计费;达到或超过最少接受资源量时,按实际锁定量交付并计费。
问题6:从 23:00 锁定到 00:00 交付之间的时间会计费吗?
不会。资源锁定阶段(23:00–00:00)以及从原集群注册到 TI-ONE 公有云的过程(约 30–50 分钟)都不计费,仅在任务实际启动后才开始计费。客户实际可用窗口约为 00:20–07:45。
问题7:能否白天也使用这些 GPU 资源?
潮汐窗口固定为每日 00:00–08:00,08:00 起资源被回收。若需白天独占使用同类 GPU 算力,请通过常规按量付费或包年包月方式购买 TI-ONE 专属资源,不通过潮汐通道。
问题8:任务运行到 08:00 未完成怎么办?
08:00 起 GPU 资源被平台回收,任务将进入“排队中”状态,等待次日 00:00 起继续调度运行。建议在训练脚本中开启定期 checkpoint 保存,确保任务可从断点续跑。
存储与网络
问题9:使用腾讯云算力集群的潮汐资源时,如何配置存储?
存储配置与常规按量付费模式完全一致,支持挂载 CFS、GooseFSx、COS 等腾讯云存储产品,按对应产品的公开刊例价单独计费。
问题10:使用其他集群的潮汐资源时,为什么必须购买平台预置存储?
其他集群与常规腾讯云算力集群的网络并不相通,只有 TI-ONE 预先打通专线的专用 CFS-Turbo 实例可以被其他集群的算力节点挂载。为保证数据安全与隔离,TI-ONE 采用一个客户 UIN 对应一个专用存储实例的方式为不同客户提供独立存储资源。
问题11:客户业务集群与潮汐资源不在同一地域怎么办?
需区分场景:
推理场景:地域仅影响调用延时,跨地域使用不影响功能。例如客户业务在北京、潮汐机器交付在中卫,客户在中卫部署推理服务仍可正常调用。
训练场景:由于涉及数据传输,建议同地域部署以降低传输成本和延迟。如原始训练数据在北京、潮汐机器在中卫,需先将数据同步至中卫地域的存储实例后再启动训练。
机型与适配
问题12:如何了解潮汐算力当前可售的 GPU 机型?
潮汐机型的库存与排期会随业务节奏动态调整,如需了解最新信息,请联系对接的腾讯云销售或产品经理咨询。
问题13:如需评估某模型在潮汐机型上的实测性能,如何申请 POC?
可通过对接的腾讯云销售或产品经理申请 POC 测试。产品和研发团队会协助搭建环境并验证模型的性能与适配情况。