首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >燃气工程师的本地AI推理方案:Ollama三后端搭建实录

燃气工程师的本地AI推理方案:Ollama三后端搭建实录

原创
作者头像
用户12619379
发布2026-07-12 13:38:36
发布2026-07-12 13:38:36
1220
举报

前言

我是刘工,港华燃气工程部经理。上个月我写了一篇用 WorkBuddy+Obsidian 搭知识库的文章,收到不少同行私信,问得最多的不是知识库怎么搭,而是:

"你一天用这么多AI,积分够花吗?"

确实,真正把 AI 用到工作流里,每天几十上百次调用,光靠签到和免费额度根本顶不住。我试过包月,但算下来还是贵。

所以我自己搭了一套「本地AI推理系统」,用下来的感觉就四个字:零Token真香

这篇文章不讲概念,全是我实操踩坑后的完整记录。

为什么需要本地推理

先算一笔账:

使用场景

每天调用次数

每次消耗(约)

日消耗积分

查法规标准

20-30次

50-100

1000-3000

整理会议笔记

5-10次

200-500

1000-5000

写方案草稿

3-5次

500-1000

1500-5000

学习注安师

10-20次

100-300

1000-6000

合计

38-65次

4500-19000

如果全走云端,一个月几万积分打底。但如果简单任务走本地,云端消耗至少降70%。

方案选型:三后端架构

我最终搭的方案是「一个入口,三个后端」:

代码语言:txt
复制
┌─────────────────────────────────────┐
│  local-infer.py(统一入口)           │
│                                     │
│  auto 路由:简单→Ollama              │
│            复杂→依次尝试可用后端       │
└──────┬──────────────────────────────┘
       │
       ▼
┌──────────┐  ┌──────────┐  ┌──────────┐
│ Ollama   │  │ DeepSeek │  │ 腾讯HY3  │
│ 本地运行  │  │ 云端API   │  │ 云端API   │
│ 零Token   │  │ 按量计费  │  │ 按量计费  │
│ 7B模型   │  │ V4 Flash │  │ 295B MoE │
└──────────┘  └──────────┘  └──────────┘

核心思路很简单:能本地办的事绝不上云端

第一步:安装 Ollama 本地模型

Ollama 是目前最成熟的本地推理引擎,macOS 一句话安装:

代码语言:bash
复制
brew install ollama
ollama serve

然后拉几个常用模型:

代码语言:bash
复制
# 通用对话(日常主力)
ollama pull qwen2.5:7b-instruct

# 推理任务(复杂逻辑)
ollama pull deepseek-r1:7b

# 代码生成
ollama pull deepseek-coder-v2

我装了6个模型,日常90%的请求落在 qwen2.5:7b 上。7B模型在M4芯片上跑,单次推理0.3-1.5秒,完全够用。

注意:Ollama 的模型默认装在本机 ~/.ollama/models,如果硬盘空间紧张,可以软链到大容量盘:

代码语言:bash
复制
ln -s /Volumes/Data/ollama-models ~/.ollama/models

第二步:搭建智能路由系统

这是最核心的部分——一个脚本控制所有AI请求,自动判断该走哪个后端。

smart-router.py 的决策逻辑:

代码语言:txt
复制
收到请求 → 判断复杂度
  ├── 简单(查资料、翻译、摘要)
  │   └── → Ollama 本地(零成本)
  │
  └── 复杂(分析、推理、生成方案)
      └── → 检查 HY3(如启用)
          ├── → HY3 云端
          └── → 检查 DeepSeek(如启用)
              ├── → DeepSeek 云端
              └── → Ollama 本地(兜底)

复杂度判断靠几个简单规则:

  • 字数超过200 → 复杂
  • 包含"分析"、"方案"、"对比"等关键词 → 复杂
  • 其他 → 简单

实际使用下来,80%的请求被判定为简单 → 走本地零成本

第三步:配置文件管理

所有后端配置统一放在 config.json:

代码语言:json
复制
{
  "ollama": {
    "base_url": "http://localhost:11434",
    "default_model": "qwen2.5:7b-instruct"
  },
  "deepseek": {
    "enabled": false,
    "api_key_env": "DEEPSEEK_API_KEY",
    "model": "deepseek-v4-flash"
  },
  "hy3": {
    "enabled": false,
    "endpoint": "tokenhub.tencentmaas.com"
  }
}

智能开关策略:DeepSeek 和 HY3 默认 enabled=false,平时auto模式全走Ollama,一分钱不花。

第四步:对接 WorkBuddy

把本地推理系统注册为 WorkBuddy skill:

代码语言:bash
复制
.local-ai-master/
├── scripts/
│   ├── local-infer.py      # 推理入口
│   ├── smart-router.py     # 路由判断
│   └── memory-cache.py     # 缓存
├── config.json             # 配置
└── SKILL.md                # 技能说明

WorkBuddy 里调用本地推理:

代码语言:text
复制
让本地AI帮我分析这份GB50028关于管道安全距离的内容

系统自动走 Ollama 本地推理,无需消耗任何积分。

省积分实测效果

用了三周,效果对比:

项目

之前(全云端)

现在(本地优先)

节省

日均请求

50次

50次(40次本地+10次云端)

日均积分消耗

~8000

~1500

81%

月消耗积分

~240000

~45000

~20万

响应速度

1-3秒

0.3-1.5秒

更快

踩坑记录

1. 模型名会变

DeepSeek 的模型名三个月变了两次:deepseek-chat → deepseek-v3 → deepseek-v4-flash。配置里写固定模型名不及时更新就会404。建议定期检查官方文档。

2. 符号链接一致性

脚本路径通过符号链接映射,两边是同一份文件。改了一边发现另一边没变——因为本来就是同一个文件,不要慌。

3. 沙箱测不到本地

有些AI工具的沙箱环境连不上本机 localhost:11434,会误报"Ollama未运行"。在沙箱里测本地服务永远测不到,要在真实终端验证。

总结

这套方案的核心价值不是技术多牛,而是把AI用成自来水——打开就有,按需取用,不心疼钱。

  • 硬件成本:0(用现有的M4芯片就行)
  • 软件成本:0(Ollama开源免费)
  • 运营成本:0(本地推理零Token)
  • 省下的积分:每月20万+

适合谁:WorkBuddy重度用户、工程行业高频AI使用者。


本文基于2026年7月实操,涉及脚本版本 v3.0。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 前言
  • 为什么需要本地推理
  • 方案选型:三后端架构
  • 第一步:安装 Ollama 本地模型
  • 第二步:搭建智能路由系统
  • 第三步:配置文件管理
  • 第四步:对接 WorkBuddy
  • 省积分实测效果
  • 踩坑记录
  • 总结
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档