我是刘工,港华燃气工程部经理。上个月我写了一篇用 WorkBuddy+Obsidian 搭知识库的文章,收到不少同行私信,问得最多的不是知识库怎么搭,而是:
"你一天用这么多AI,积分够花吗?"
确实,真正把 AI 用到工作流里,每天几十上百次调用,光靠签到和免费额度根本顶不住。我试过包月,但算下来还是贵。
所以我自己搭了一套「本地AI推理系统」,用下来的感觉就四个字:零Token真香。
这篇文章不讲概念,全是我实操踩坑后的完整记录。
先算一笔账:
使用场景 | 每天调用次数 | 每次消耗(约) | 日消耗积分 |
|---|---|---|---|
查法规标准 | 20-30次 | 50-100 | 1000-3000 |
整理会议笔记 | 5-10次 | 200-500 | 1000-5000 |
写方案草稿 | 3-5次 | 500-1000 | 1500-5000 |
学习注安师 | 10-20次 | 100-300 | 1000-6000 |
合计 | 38-65次 | — | 4500-19000 |
如果全走云端,一个月几万积分打底。但如果简单任务走本地,云端消耗至少降70%。
我最终搭的方案是「一个入口,三个后端」:
┌─────────────────────────────────────┐
│ local-infer.py(统一入口) │
│ │
│ auto 路由:简单→Ollama │
│ 复杂→依次尝试可用后端 │
└──────┬──────────────────────────────┘
│
▼
┌──────────┐ ┌──────────┐ ┌──────────┐
│ Ollama │ │ DeepSeek │ │ 腾讯HY3 │
│ 本地运行 │ │ 云端API │ │ 云端API │
│ 零Token │ │ 按量计费 │ │ 按量计费 │
│ 7B模型 │ │ V4 Flash │ │ 295B MoE │
└──────────┘ └──────────┘ └──────────┘核心思路很简单:能本地办的事绝不上云端。
Ollama 是目前最成熟的本地推理引擎,macOS 一句话安装:
brew install ollama
ollama serve然后拉几个常用模型:
# 通用对话(日常主力)
ollama pull qwen2.5:7b-instruct
# 推理任务(复杂逻辑)
ollama pull deepseek-r1:7b
# 代码生成
ollama pull deepseek-coder-v2我装了6个模型,日常90%的请求落在 qwen2.5:7b 上。7B模型在M4芯片上跑,单次推理0.3-1.5秒,完全够用。
注意:Ollama 的模型默认装在本机 ~/.ollama/models,如果硬盘空间紧张,可以软链到大容量盘:
ln -s /Volumes/Data/ollama-models ~/.ollama/models这是最核心的部分——一个脚本控制所有AI请求,自动判断该走哪个后端。
smart-router.py 的决策逻辑:
收到请求 → 判断复杂度
├── 简单(查资料、翻译、摘要)
│ └── → Ollama 本地(零成本)
│
└── 复杂(分析、推理、生成方案)
└── → 检查 HY3(如启用)
├── → HY3 云端
└── → 检查 DeepSeek(如启用)
├── → DeepSeek 云端
└── → Ollama 本地(兜底)复杂度判断靠几个简单规则:
实际使用下来,80%的请求被判定为简单 → 走本地零成本。
所有后端配置统一放在 config.json:
{
"ollama": {
"base_url": "http://localhost:11434",
"default_model": "qwen2.5:7b-instruct"
},
"deepseek": {
"enabled": false,
"api_key_env": "DEEPSEEK_API_KEY",
"model": "deepseek-v4-flash"
},
"hy3": {
"enabled": false,
"endpoint": "tokenhub.tencentmaas.com"
}
}智能开关策略:DeepSeek 和 HY3 默认 enabled=false,平时auto模式全走Ollama,一分钱不花。
把本地推理系统注册为 WorkBuddy skill:
.local-ai-master/
├── scripts/
│ ├── local-infer.py # 推理入口
│ ├── smart-router.py # 路由判断
│ └── memory-cache.py # 缓存
├── config.json # 配置
└── SKILL.md # 技能说明WorkBuddy 里调用本地推理:
让本地AI帮我分析这份GB50028关于管道安全距离的内容系统自动走 Ollama 本地推理,无需消耗任何积分。
用了三周,效果对比:
项目 | 之前(全云端) | 现在(本地优先) | 节省 |
|---|---|---|---|
日均请求 | 50次 | 50次(40次本地+10次云端) | — |
日均积分消耗 | ~8000 | ~1500 | 81% |
月消耗积分 | ~240000 | ~45000 | ~20万 |
响应速度 | 1-3秒 | 0.3-1.5秒 | 更快 |
1. 模型名会变
DeepSeek 的模型名三个月变了两次:deepseek-chat → deepseek-v3 → deepseek-v4-flash。配置里写固定模型名不及时更新就会404。建议定期检查官方文档。
2. 符号链接一致性
脚本路径通过符号链接映射,两边是同一份文件。改了一边发现另一边没变——因为本来就是同一个文件,不要慌。
3. 沙箱测不到本地
有些AI工具的沙箱环境连不上本机 localhost:11434,会误报"Ollama未运行"。在沙箱里测本地服务永远测不到,要在真实终端验证。
这套方案的核心价值不是技术多牛,而是把AI用成自来水——打开就有,按需取用,不心疼钱。
适合谁:WorkBuddy重度用户、工程行业高频AI使用者。
本文基于2026年7月实操,涉及脚本版本 v3.0。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。