首页
学习
活动
专区
圈层
工具
发布

#LLM

RAG 工程里的上下文剪枝:如何减少 68% 的上下文

七牛开发者

做 RAG 时,我们会关注“如何召回更多内容”。去研究怎么切 chunk、怎么做 embedding、怎么混合关键词和向量检索、怎么做 rerank,让尽可能多...

700

大模型入门:从"猜词游戏"到"超级大脑",一篇读懂 AI 大模型

修己xj

2023 年初,ChatGPT 横空出世,"大模型"三个字一夜之间刷爆了所有人的朋友圈。有人拿它写代码,有人拿它写情书,还有人拿它辅导孩子做数学——而且它居然真...

1400

LLM蒸馏与微调·第五章:硬件与物料清单

IT蜗壳-Tango

LoRA 7B 16GB | RTX 4090 24GB | batch 1~2 | ~800 tokens/s

5210

LLM蒸馏与微调·第四章:蒸馏与微调的组合策略

IT蜗壳-Tango

在实际落地中,蒸馏和微调几乎不会单独使用——你需要的是"先蒸馏再微调"或"微调阶段同步蒸馏"的组合策略。本章是全书最核心的实操章节,提供两种策略的完整链路和两个...

2910

LLM蒸馏与微调·第三章:蒸馏实操

IT蜗壳-Tango

方式二:API服务(黑盒蒸馏用) 用vLLM部署教师模型API,只需文本输出。适合闭源模型或显存不够的场景。

2510

LLM蒸馏与微调·第二章:微调实操

IT蜗壳-Tango

合并后的模型是完整的Hugging Face格式,可以直接用transformers加载,也可以用vLLM、SGLang等推理框架部署。

5510

LLM蒸馏与微调·第一章:原理与全景

IT蜗壳-Tango

2024~2025年的实践共识:LoRA是LLM微调的默认选择。QLoRA是LoRA的"穷人版",效果接近但门槛更低。Adapter和Prefix Tuning...

2910

Agent决策核心:从规则引擎到LLM驱动的规划器

张立科

中国移动通信集团有限公司数智事业部 | 项目经理(软件运维岗) (已认证)

智能运维Agent的核心能力差异,最终收敛于决策与规划能力。传统运维自动化高度依赖硬编码规则引擎与有限状态机,具备确定性高、延迟低、可审计的优势,但面对云原生分...

4210

Mac本地部署大模型完全指南:三款工具实测对比,零成本替代付费API

仙踪问道

在Mac上本地部署大模型,是指将开源大语言模型下载到自己的Mac电脑上,利用M系列芯片的GPU直接在本地运行推理,完全不依赖云端API。2026年以来,智谱GL...

3510

LLM 如何批量且精准地实现电商海量标签标注与验证?拆解 Amazon 的 SynthAVE 工业级多模型质检方案

七牛开发者

电商平台要处理海量商品,最绕不开的脏活就是把商品详情里的非结构化文本,整理成标准的属性标签。这些标签不仅直接影响搜索和推荐,也是评测各类抽取模型的基础真值。

3300

Harness 效应:编排设计如何影响企业级 Agent 的 Token 成本

七牛开发者

很多团队评估企业 Agent 成本时,第一反应是看模型价格。比较哪个模型输入便宜,哪个模型输出便宜,哪个模型性价比高。比价自然重要,但论文「The Harnes...

3210
领券