用 WorkBuddy 的积分消耗比我预想得快。写材料、整理资料、改文案,单看每次都不多,攒到月底一算还挺心疼。
后来想明白一个事:我每天大部分任务其实用不上多强的模型。改错别字、调语气、提摘要、中英互译、转格式,这些活本地跑个 7B 左右的模型就够。而且本地跑有个云端给不了的好处,推理全在自己机器上完成,积分不扣。
所以这篇文章就是把整个过程记下来,顺带把我踩的坑写清楚。
第一步先确认自己的卡能不能跑。
输出会给出型号和显存。这里要注意,决定能不能跑的是显存,不是内存。
显存 | 能跑的档位 | 实际体验 |
|---|---|---|
4GB | 1.5B - 4B | 能用,能力偏弱 |
6GB | 7B 量化版 | 勉强,偶尔爆显存 |
8GB | 7B / 8B 量化版 | 比较舒服 |
12GB | 14B 量化版 | 良好 |
16GB+ | 14B - 32B | 宽裕 |
我的卡是 RTX 4060 Ti 8GB,对着表就锁定 7B/8B。
这里有个误会值得说一下。有人觉得内存大就能跑大模型,其实显存放不下的层会被丢到内存里跑,速度直接掉到每秒几个 token,实际用起来没法忍。所以显存才是硬门槛。
Ollama 装起来最省事,自带 OpenAI 兼容接口,装完别的工具就能直接调。
官网下 Windows 安装包,或者用 winget:
装完它会常驻在系统托盘,监听 11434 端口。
装之前先处理一下模型存放位置。Ollama 默认往 C 盘用户目录塞模型,一个 8B 的差不多 5GB,下几个 C 盘就满了。建议提前改路径:
这个是系统环境变量,设完得重启 Ollama 才认(托盘右键退出再开)。不重启的话它还是照旧往 C 盘放。
我选的是 deepseek 系列。Ollama 仓库里的 deepseek-r1 有一整排蒸馏版本,从 1.5B 到 671B,小尺寸那几个针对消费级硬件做过优化。
8GB 显存能选的:
模型标签 | 参数 | 磁盘占用 | 特点 |
|---|---|---|---|
deepseek-r1:1.5b | 1.5B | 1.1GB | 很轻,能力有限 |
deepseek-r1:7b | 7B | 4.7GB | 通用均衡 |
deepseek-r1:8b | 8B | 4.9GB | 代码和指令遵循更稳 |
下完先确认名字:
名字要原样复制,冒号和后面的后缀一个字都不能差。qwen3:8b 和 qwen3:8b-q4_K_M 是两个不同的 ID,手打很容易错,复制粘贴最稳。
还有一点得提前讲清楚。Ollama 上这些是蒸馏版,不是 DeepSeek 官方的满血模型,底座是 Llama3 或者 Qwen2.5,通过蒸馏学了 R1 的推理行为。比同尺寸的普通模型强,但别指望它跟官方 API 一个水平。
打开客户端,左下角头像进设置,切到"模型",点右上角"添加模型"。
配置项 | 填写内容 |
|---|---|
模型类型 | 本地部署 (Ollama) |
接口地址 | http://127.0.0.1:11434/v1 |
API Key | ollama |
模型名称 | deepseek-r1:8b |
上下文长度 | 32768 |
最大输出 | 8192 |
接口地址末尾的 /v1 别漏。漏了会直接 404,因为 Ollama 的兼容接口挂在 /v1 下面。少三个字符,能让你排查半天。
API Key 随便填一个就行,本地不校验,但字段不能空着。我填的就是 ollama。
改完配置要完全退出 WorkBuddy 再开。只关窗口没用,右下角托盘图标也得右键退出,然后重新启动。配完发现列表里没这个模型,或者选上了没法对话,基本就是这个原因。
重启后在模型选择器里切到本地模型,问句"你好",能回就通了。
要是模型显示灰色选不中,先看 Ollama 有没有在跑,托盘里找找图标。Ollama 没启动,WorkBuddy 自然连不上。
速度方面,4060 Ti 跑 8B 量化模型大概每秒 30 到 60 个 token,日常问答和文本处理都够顺。
接完之后容易犯的一个错,是把所有任务都切到本地。试几天就会发现不行。
本地 8B 能干和不能干的事,界限还算清楚:
适合给本地的:
留给云端的:
原因也简单。本地小模型做多步骤任务容易做着做着跑偏,上下文一长就开始胡言乱语,工具调用的格式稳定性也差不少。这些活丢给本地,省下的积分还不够补你多花的时间。
比较实际的做法是分开用,轻活高频的走本地,重活走云端。
整个流程五步:确认显存定档、装 Ollama 改模型路径、拉 deepseek-r1:8b 核对名字、在 WorkBuddy 里填好带 /v1 的地址、彻底重启后切换验证。
最常踩的三个坑:地址漏掉 /v1、模型名手打出错、改完没完全重启客户端。
接了本地模型不是要拿它顶替云端,是给任务分个流。轻活丢本地,重活留云端,这么用下来积分能省不少,体验掉得也不多。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。