首页
学习
活动
专区
圈层
工具
发布

#gpu

腾讯云GPU算力跑秒剧AI短剧渲染:团队从一周一集到一天三集踩坑复盘

用户12770587

300

秒剧实战:腾讯云GPU跑AI短剧渲染,选型半年重解「文生视频」与「一键成剧」边界

用户12770587

13010

腾讯云GPU算力跑AI短剧渲染:秒剧出海成本从15万打到8000

用户12770587

12510

AI Infra 系列 · 第六章 GPU 性能工程(四):并行策略

dongdonglog

聊并行之前得先知道敌人是谁。训练时一个参数要占多少字节?混合精度 + AdamW 的标准配置下:

24020

AI Infra 系列 · 第六章 GPU 性能工程(三):torch.compile 不是开关——碎算子能快一倍,GEMM 基本白搭

dongdonglog

同一个 torch.compile,A 快了一倍,B 基本没动。这就是本篇全部内容的缩影:编译器省的是开销,不是算力。算子越碎、Python 胶水越重,能省的越...

20720

飞书+Hermes可以做什么?

用户12724357

飞书已经成功连接到的Hermes Agent后,就想看看它到底可以给我做些什么,做到物尽其用。

12510

让 2013 年的 GTX TITAN 跑本地 LLM — Kepler 架构 GPU 复活记

用户8140185

GTX TITAN :2013 年旗舰卡,Kepler 架构(GK110),算力 3.5(sm_35)。 NVIDIA 在 CUDA 12.0 起彻底移除了对 ...

9010

ComfyUI 部署教程:云端 GPU 文生图工作流搭建

克劳德2048

摘要 ComfyUI 以节点连线的方式编排图像生成流程,相比一体化界面更灵活,适合需要精细控制生成过程的创作者。本文在一台带 GPU 的云服务器上完成 Comf...

54010

AI Infra 系列 · 第六章 GPU 性能工程(二):B200 算力涨 2.25 倍,运数据的路一寸没宽,你的内核其实在等数据

dongdonglog

2026 年 3 月,Tri Dao 和 Colfax、Meta、NVIDIA 的人一起发了 FlashAttention-4(arXiv:2603.05451...

22921

Ollama 部署大模型教程:云端 GPU 环境搭建与模型调用

克劳德2048

摘要 Ollama 把开源大模型的下载、加载和推理封装成几条命令,是目前上手本地模型最快的方式。本文在一台带 GPU 的云服务器上完成 Ollama 部署,涵盖...

21410

# LLM 量化到底省不省电?我造了一个实测专家替你算

四王爷

做 LLM 推理部署的人都会默认一件事:模型量化 = 省显存 = 省电。但我在 5 款消费级 GPU 上、从 0.5B 到 14B 的模型里跑了 42 组实测数...

10410

AI Infra 系列 · 第五章 训练与调度(下):一万张 GPU 怎么排班,调度器才是训练场的隐形老板

dongdonglog

如果你管过一个训练集群,下面这个场景一定不陌生:周三下午,三个团队同时提交作业——A 要 512 卡训大模型,B 要 64 卡微调,C 只要 8 卡跑实验。调度...

36132

AI 项目 CI/CD 不用抢 GPU:云端节点按需调度

克劳德2048

摘要: AI 项目把训练、推理验证放进 CI/CD 时,常卡在"没有 GPU 机器可用"这一步。腾讯云云原生构建提供固定 16 核加 48GB 显存的云端 GP...

16810

AI/ML 训练任务怎么调度?GPU 节点跑进 CI/CD 流水线

克劳德2048

摘要: AI/ML 训练任务散落在本地机器上,难以复现和追溯。腾讯云云原生构建用 Pipeline/Stage/Job 三层结构把训练编排进流水线,通过 .cn...

19910

GPU太贵跑不起?这6个优化技巧让LLM推理成本直降

悟空码字

随着深度学习模型(尤其是大语言模型)规模不断增长,推理阶段的计算和存储开销成为实际部署中的主要瓶颈。推理优化的目标是:在尽可能保持模型精度的前提下,降低推理延迟...

21920

GPU高性能编程13: TIRx 与高性能GEMM (下)

fangpin

既然已经有了 TMA 和双缓冲,为什么还说没有真正 overlap?原因是当前代码仍由一个 warpgroup 顺序推进 load、MMA 和 store。它具...

13900

GPU 太贵不敢随便跑?CI/CD 按需调度,用完即释放

克劳德2048

摘要: GPU 单价高,AI 团队常因心疼算力而不敢在 CI/CD 里频繁跑训练和验证。腾讯云云原生构建的云端 GPU 节点按实际运行时间计费、用完即释放,配合...

23310
领券