做 RAG 时,我们会关注“如何召回更多内容”。去研究怎么切 chunk、怎么做 embedding、怎么混合关键词和向量检索、怎么做 rerank,让尽可能多...
2023 年初,ChatGPT 横空出世,"大模型"三个字一夜之间刷爆了所有人的朋友圈。有人拿它写代码,有人拿它写情书,还有人拿它辅导孩子做数学——而且它居然真...
LoRA 7B 16GB | RTX 4090 24GB | batch 1~2 | ~800 tokens/s
在实际落地中,蒸馏和微调几乎不会单独使用——你需要的是"先蒸馏再微调"或"微调阶段同步蒸馏"的组合策略。本章是全书最核心的实操章节,提供两种策略的完整链路和两个...
方式二:API服务(黑盒蒸馏用) 用vLLM部署教师模型API,只需文本输出。适合闭源模型或显存不够的场景。
合并后的模型是完整的Hugging Face格式,可以直接用transformers加载,也可以用vLLM、SGLang等推理框架部署。
2024~2025年的实践共识:LoRA是LLM微调的默认选择。QLoRA是LoRA的"穷人版",效果接近但门槛更低。Adapter和Prefix Tuning...
中国移动通信集团有限公司数智事业部 | 项目经理(软件运维岗) (已认证)
智能运维Agent的核心能力差异,最终收敛于决策与规划能力。传统运维自动化高度依赖硬编码规则引擎与有限状态机,具备确定性高、延迟低、可审计的优势,但面对云原生分...
在Mac上本地部署大模型,是指将开源大语言模型下载到自己的Mac电脑上,利用M系列芯片的GPU直接在本地运行推理,完全不依赖云端API。2026年以来,智谱GL...
电商平台要处理海量商品,最绕不开的脏活就是把商品详情里的非结构化文本,整理成标准的属性标签。这些标签不仅直接影响搜索和推荐,也是评测各类抽取模型的基础真值。
很多团队评估企业 Agent 成本时,第一反应是看模型价格。比较哪个模型输入便宜,哪个模型输出便宜,哪个模型性价比高。比价自然重要,但论文「The Harnes...