腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
首页
专栏
文章归档
2026 年 07 月 01 日文章目录
不做数据治理的实施商不是好AI公司,Palantir研究有感
12-数据进入RL前经历了什么
11-Reward不是一个分数函数这么简单
10-KL-clip-entropy给模型更新装限速器
09-DAPO、Dr. GRPO 与长度偏置
08-GRPO 为什么能省掉 critic
07-PPO 在 LLM 后训练里真正训练了什么
第二组导读:算法如何落到工程
06 一轮 PPO/GRPO step 到底发生了什么
05-DataProto-RL训练流水线里的集装箱
04-ResourcePool和WorkerGroup-GPU资源如何被角色化
AI 招聘如何提升校招效率?
03-SingleController一个大脑如何调度一群GPU工人
02 HybridFlow:把 RLHF 看成高层 Dataflow
01 为什么 AI 后训练不是一个训练脚本
从心出发:从“架构原本”到“训推工坊”
校招季简历大战:我从"堆成山"到"一键搞定"的血泪史
AI Native 企业的架构重塑
2026年转型系列--科技革命转机
企业AI应用设计利器--动机与战略建模
第 1 页
第 2 页
第 3 页
第 4 页
第 6 页
第 7 页
第 8 页
第 9 页
第 10 页
第 11 页
领券