首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >WorkBuddy 接入本地大模型实录:8GB 显存跑通 Ollama #WorkBuddy#

WorkBuddy 接入本地大模型实录:8GB 显存跑通 Ollama #WorkBuddy#

原创
作者头像
用户12804564
发布于 2026-10-07 20:13:53
发布于 2026-10-07 20:13:53
130
举报

为什么折腾这件事

用 WorkBuddy 的积分消耗比我预想得快。写材料、整理资料、改文案,单看每次都不多,攒到月底一算还挺心疼。

后来想明白一个事:我每天大部分任务其实用不上多强的模型。改错别字、调语气、提摘要、中英互译、转格式,这些活本地跑个 7B 左右的模型就够。而且本地跑有个云端给不了的好处,推理全在自己机器上完成,积分不扣。

所以这篇文章就是把整个过程记下来,顺带把我踩的坑写清楚。

先看显卡

第一步先确认自己的卡能不能跑。

输出会给出型号和显存。这里要注意,决定能不能跑的是显存,不是内存。

显存

能跑的档位

实际体验

4GB

1.5B - 4B

能用,能力偏弱

6GB

7B 量化版

勉强,偶尔爆显存

8GB

7B / 8B 量化版

比较舒服

12GB

14B 量化版

良好

16GB+

14B - 32B

宽裕

我的卡是 RTX 4060 Ti 8GB,对着表就锁定 7B/8B。

这里有个误会值得说一下。有人觉得内存大就能跑大模型,其实显存放不下的层会被丢到内存里跑,速度直接掉到每秒几个 token,实际用起来没法忍。所以显存才是硬门槛。

装 Ollama

Ollama 装起来最省事,自带 OpenAI 兼容接口,装完别的工具就能直接调。

官网下 Windows 安装包,或者用 winget:

装完它会常驻在系统托盘,监听 11434 端口。

装之前先处理一下模型存放位置。Ollama 默认往 C 盘用户目录塞模型,一个 8B 的差不多 5GB,下几个 C 盘就满了。建议提前改路径:

这个是系统环境变量,设完得重启 Ollama 才认(托盘右键退出再开)。不重启的话它还是照旧往 C 盘放。

拉模型

我选的是 deepseek 系列。Ollama 仓库里的 deepseek-r1 有一整排蒸馏版本,从 1.5B 到 671B,小尺寸那几个针对消费级硬件做过优化。

8GB 显存能选的:

模型标签

参数

磁盘占用

特点

deepseek-r1:1.5b

1.5B

1.1GB

很轻,能力有限

deepseek-r1:7b

7B

4.7GB

通用均衡

deepseek-r1:8b

8B

4.9GB

代码和指令遵循更稳

下完先确认名字:

名字要原样复制,冒号和后面的后缀一个字都不能差。qwen3:8b 和 qwen3:8b-q4_K_M 是两个不同的 ID,手打很容易错,复制粘贴最稳。

还有一点得提前讲清楚。Ollama 上这些是蒸馏版,不是 DeepSeek 官方的满血模型,底座是 Llama3 或者 Qwen2.5,通过蒸馏学了 R1 的推理行为。比同尺寸的普通模型强,但别指望它跟官方 API 一个水平。

在 WorkBuddy 里配置

打开客户端,左下角头像进设置,切到"模型",点右上角"添加模型"。

配置项

填写内容

模型类型

本地部署 (Ollama)

接口地址

http://127.0.0.1:11434/v1

API Key

ollama

模型名称

deepseek-r1:8b

上下文长度

32768

最大输出

8192

接口地址末尾的 /v1 别漏。漏了会直接 404,因为 Ollama 的兼容接口挂在 /v1 下面。少三个字符,能让你排查半天。

API Key 随便填一个就行,本地不校验,但字段不能空着。我填的就是 ollama。

改完配置要完全退出 WorkBuddy 再开。只关窗口没用,右下角托盘图标也得右键退出,然后重新启动。配完发现列表里没这个模型,或者选上了没法对话,基本就是这个原因。

验证

重启后在模型选择器里切到本地模型,问句"你好",能回就通了。

要是模型显示灰色选不中,先看 Ollama 有没有在跑,托盘里找找图标。Ollama 没启动,WorkBuddy 自然连不上。

速度方面,4060 Ti 跑 8B 量化模型大概每秒 30 到 60 个 token,日常问答和文本处理都够顺。

别全切本地

接完之后容易犯的一个错,是把所有任务都切到本地。试几天就会发现不行。

本地 8B 能干和不能干的事,界限还算清楚:

适合给本地的:

  • 润色、改错别字、调语气
  • 摘要、提取关键信息
  • 中英互译
  • 格式转换、整理结构
  • 日常问答

留给云端的:

  • 写代码、调 Bug
  • 复杂分析、多步骤任务
  • 长文档、多文件处理
  • 要调用工具的任务

原因也简单。本地小模型做多步骤任务容易做着做着跑偏,上下文一长就开始胡言乱语,工具调用的格式稳定性也差不少。这些活丢给本地,省下的积分还不够补你多花的时间。

比较实际的做法是分开用,轻活高频的走本地,重活走云端。

收尾

整个流程五步:确认显存定档、装 Ollama 改模型路径、拉 deepseek-r1:8b 核对名字、在 WorkBuddy 里填好带 /v1 的地址、彻底重启后切换验证。

最常踩的三个坑:地址漏掉 /v1、模型名手打出错、改完没完全重启客户端。

接了本地模型不是要拿它顶替云端,是给任务分个流。轻活丢本地,重活留云端,这么用下来积分能省不少,体验掉得也不多。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 为什么折腾这件事
  • 先看显卡
  • 装 Ollama
  • 拉模型
  • 在 WorkBuddy 里配置
  • 验证
  • 别全切本地
  • 收尾
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档