



2026年7月24日,ollama 发布 v0.32.3 版本。本次更新覆盖模型下载、模型集成、GPU 支持、推理引擎、工具调用、聊天能力、命令行与终端交互等多个方面。
从更新内容来看,v0.32.3 的核心方向非常明确:一方面修复影响实际使用体验的问题,例如模型下载在尚未接收数据前发生停滞、GLM 工具调用在生成结尾被静默丢弃等;另一方面持续扩大硬件与模型兼容范围,包括 Windows ARM64 平台 CUDA 支持、通过 CUDA 12 支持 B200、Linux CUDA 与 ROCm 集成显卡降低内存使用,以及 Laguna 2.1 模型的聊天、思考和工具调用能力支持。
此外,Claude Code Channels、Anthropic thinking 流、Hermes Desktop、MLX、llama.cpp 等相关集成与引擎也都迎来调整。对于本地模型部署、终端 AI 助手、模型工具调用以及多平台 GPU 推理场景而言,这是一次兼顾稳定性、兼容性与体验的版本更新。
版本信息
本次版本的更新并非单一功能的增加,而是围绕模型运行链路进行了一系列优化。无论是下载模型、选择推理硬件、调用工具,还是使用聊天和思考能力,多个关键环节都获得了修复或增强。
一、模型下载卡在开始阶段的问题得到修复
v0.32.3 修复了模型下载在尚未发送任何数据之前发生停滞的问题。
模型下载是使用 ollama 的基础流程之一。用户在拉取模型时,如果下载任务长时间没有开始传输数据,往往很难判断是网络问题、服务端问题还是客户端任务已经卡住。此次更新针对“首字节到来之前”的下载停滞场景进行了处理。
对应的改动包括对下载停滞的检测优化,重点是识别模型下载在第一段数据到达之前的异常等待状态。
这一修复的重要性在于,模型下载通常是后续运行、测试、部署的前提。下载任务在开始阶段停滞,会直接阻断模型使用流程。v0.32.3 对这一问题的修复,提升了模型拉取环节的稳定性与可用性。
二、Claude Code Channels 恢复可用,集成能力进一步完善
本次更新恢复了 Claude Code Channels 的可用性。
更新记录中包含“保持 Claude Code channels 可用”的调整,意味着此前相关 Channels 在启动或使用过程中可能存在不可用、无法保留或被移除的情况。v0.32.3 对这一能力进行了恢复,使其重新能够正常使用。
对于依赖 Claude Code 相关工作流的用户而言,这项修复能够避免因 Channels 状态异常造成的功能中断。
与此同时,版本中还移除了无效的 agent 提示词包装逻辑,并对 agent 相关指令、流程代码、用户体验与开发体验进行了整理。这些调整虽然更多体现在内部结构和交互流程上,但也表明 v0.32.3 持续在简化不再需要的逻辑,减少冗余结构,并优化终端与 agent 使用过程中的行为一致性。
三、Anthropic thinking 流修复,思考内容与文本输出顺序更准确
v0.32.3 修复了 Anthropic thinking 流相关问题。
更新内容显示,本次调整包括在启动 thinking 块之前先关闭文本块。这个变化看似是输出结构层面的细节,但对于流式响应而言非常关键。
当模型同时输出普通文本与思考内容时,输出块之间需要具备清晰、正确的边界。如果文本块没有结束就开始思考块,可能导致流解析、前端渲染或下游调用处理出现异常。通过在开始 thinking 块前关闭文本块,v0.32.3 改善了文本内容与思考内容之间的切换过程。
这项修复能够让 Anthropic thinking 流在输出时具备更正确的块结构,避免不同类型内容在流式过程中发生边界混乱。
四、Hermes Desktop 现在能够正确遵守 force-build 参数
本次版本更新了 Hermes 集成,并修复 Hermes Desktop 对 force-build 参数的支持问题。
此前,Hermes Desktop 对 force-build 的处理可能无法按预期生效。v0.32.3 明确让 Hermes Desktop 尊重这一参数。
对于需要强制执行构建流程的场景而言,这项改动能够确保命令传入的构建意图被正确执行,而不是被忽略或采用非预期行为。
Hermes 集成的更新与 force-build 支持修复,体现出本次版本不仅关注模型推理本身,也同步完善了与外部桌面工具、构建流程相关的连接能力。
五、Windows ARM64 平台正式支持 CUDA
硬件支持方面,v0.32.3 增加了 Windows ARM64 平台的 CUDA 支持。
这是本次更新中非常值得关注的一项内容。此前,Windows ARM64 环境下的 CUDA 使用支持可能受到限制,而本版本通过相关改动为该平台加入了 CUDA 能力。
随着不同架构设备的使用需求不断增加,Windows ARM64 的 GPU 推理支持具有实际意义。v0.32.3 将 CUDA 支持扩展到这一平台,进一步扩大了可运行 ollama GPU 推理环境的范围。
对于使用 Windows ARM64 设备并希望借助 CUDA 加速模型运行的用户而言,这次升级意味着硬件能力支持范围得到扩展。
六、通过 CUDA 12 支持 B200
v0.32.3 扩展了 CUDA 12 环境下的 GPU 支持,其中包括对 B200 的支持。
更新中涉及为 Linux 下 CUDA v12 增加计算能力 10.0 支持,这项调整与 B200 支持直接相关。通过 CUDA 12 的能力扩展,ollama 能够覆盖这一 GPU 相关支持需求。
GPU 支持的增加并不只是简单增加一个设备名称,更意味着推理环境在 CUDA 版本、计算能力与硬件适配方面持续演进。对于使用 CUDA 12 环境并部署相关 GPU 的场景,这次更新提供了更完整的支持基础。
另外,本版本还修复了持续集成环境中缺失 CUDA v13.4 子包的问题。虽然这属于构建与持续集成层面的调整,但同样与 CUDA 相关支持链路的完整性有关。
七、Linux CUDA 与 ROCm 集成显卡进一步降低内存使用
v0.32.3 针对 Linux 平台上的 CUDA 与 ROCm 集成显卡,优化了内存使用。
更新内容中提到启用 dio,以降低 Linux CUDA 与 ROCm iGPU 场景下的内存占用。这项改动面向集成显卡推理环境,重点改善资源使用表现。
集成显卡场景与独立显卡场景不同,其显存与系统内存使用关系往往更加紧密。因此,降低内存使用对于提升实际运行可行性具有重要意义。尤其是在内存资源有限、需要控制占用的环境中,这类优化能够减少模型推理对系统资源造成的压力。
本次更新没有只关注高端 GPU 支持,同时也对 Linux CUDA 与 ROCm 集成显卡场景进行优化,体现出硬件兼容策略覆盖了不同层级的设备环境。
八、Laguna 2.1 模型新增聊天、思考与工具调用支持
模型能力方面,v0.32.3 为 Laguna 2.1 模型增加了聊天、思考和工具调用支持。
这意味着 Laguna 2.1 不仅能够用于基础文本生成,也可以进入更完整的交互式使用链路,包括:
聊天支持使模型能够面向多轮交互场景进行工作;思考支持对应模型输出中的相关内容处理;工具调用支持则让模型具备与外部工具协作的能力。
对于需要在统一运行环境中使用不同模型能力的用户而言,Laguna 2.1 的这次适配非常关键。模型是否具备聊天、思考与工具调用支持,会直接影响其能否进入终端助手、自动化流程、交互式对话等使用场景。
本次更新还修复了 Laguna 的 Metal 推理问题。Metal 推理修复使该模型在相关环境中的运行支持更加完整。
在提交记录中,还包含将 Laguna 与上游 llama.cpp 对齐的改动,以及 Laguna v8 聊天支持与 Metal 推理修复相关调整。这些变化共同构成了 Laguna 模型支持的持续完善。
九、GLM 工具调用在生成结束时被静默丢弃的问题修复
v0.32.3 修复了 GLM 工具调用在生成末尾可能被静默丢弃的问题。
工具调用是模型接入外部能力的重要机制。如果模型已经生成了工具调用内容,但因为生成过程接近结束而没有被正确解析或最终输出,那么用户会看到模型似乎没有执行工具调用,且可能没有明显报错提示。
此次改动对不完整的 GLM 工具调用进行了最终处理,核心目标是避免工具调用在生成结束阶段被直接丢弃。
“静默丢弃”问题尤其影响排查体验。因为用户可能只发现模型没有调用预期工具,却无法直接判断是模型没有生成调用意图,还是调用内容在解析阶段丢失。v0.32.3 修复这一问题后,GLM 工具调用在生成结尾的处理更加可靠。
对于依赖工具调用执行操作的场景,这是一项直接影响功能正确性的修复。
十、MLX 与 llama.cpp 推理引擎完成更新
本次版本更新了 MLX 和 llama.cpp 引擎。
更新记录中包含 llama.cpp 更新,同时 MLX 也进行了两次更新。作为模型运行的重要引擎组件,MLX 与 llama.cpp 的版本变化关系到模型兼容性、推理行为和底层能力对齐。
llama.cpp 相关更新之外,Laguna 还进行了与上游 llama.cpp 的对齐调整。这说明本次版本不仅完成基础引擎升级,也针对模型支持进行了相应适配。
MLX 的多次更新也被纳入 v0.32.3 发布内容。对于使用 MLX 推理路径的场景而言,这意味着底层引擎获得同步更新。
引擎更新虽然不一定在表面交互中直接可见,但它通常影响模型支持、运行稳定性以及后续功能适配能力。v0.32.3 将 MLX 与 llama.cpp 的更新纳入版本范围,为整体模型运行能力提供了基础支撑。
十一、云模型默认允许无限工具调用轮次
agent 相关部分,v0.32.3 调整了云模型的默认工具调用轮次策略。
更新内容显示,云模型默认允许无限工具调用轮次。此前,工具调用轮数可能受到默认限制,而本次调整改变了默认行为。
对于需要多轮调用工具才能完成任务的场景,工具轮次限制会影响任务是否能完整执行。云模型默认允许无限工具调用轮次后,连续工具调用流程不再受默认轮数上限约束。
这项调整与工具调用能力的发展方向一致。随着模型承担的任务逐渐涉及多步骤操作、反复查询、持续执行工具链,工具调用轮次的默认限制可能成为流程中断点。v0.32.3 对默认策略进行调整,使云模型工具调用流程更加连续。
十二、agent 与终端交互流程持续精简
除了模型和硬件支持,本版本还对 agent、命令行和终端交互进行了多项整理。
主要变化包括:
这些改动覆盖了终端使用、命令处理、交互显示、服务启动和 agent 流程等多个细节。
例如,斜杠命令在提交前完成补全,可以改善命令输入过程中的交互体验;Markdown 粗体强调统一渲染,能够使聊天内容中的重点表达更一致;删除冗余上下文窗口刷新,则可以减少事件循环中不必要的处理。
移除独立 agent 命令与清理无效提示词包装,也说明 v0.32.3 在继续收敛命令与 agent 流程结构,减少重复或不再需要的入口与逻辑。
根命令的 server start 通过服务器心跳检查,则让服务启动流程与服务状态检查机制更紧密地结合。
十三、技能系统与从编码 agent 导入技能能力加入更新
v0.32.3 的提交记录中还包括 agent 技能系统,以及从编码 agent 导入技能的能力。
技能系统属于 agent 能力组织相关的更新。与此同时,从编码 agent 导入技能的改动,为技能复用和接入提供了相应支持。
这部分更新与前文提到的工具调用轮次、agent 流程整理共同构成了 v0.32.3 在 agent 方向上的变化。虽然本次发布说明的重点集中于下载、集成、GPU、模型支持与引擎更新,但提交记录表明 agent 技能相关能力同样被纳入这一版本。
十四、构建工具链与测试入口同步调整
在构建与测试方面,v0.32.3 包含以下调整:
Linux 工具链升级至 GCC 13,属于构建环境层面的更新。持续集成中 CUDA v13.4 子包缺失问题的修复,则确保相关构建或测试链路具备所需组件。
集成测试入口的重构,表明测试体系本身也进行了整理。测试入口的组织方式会影响后续验证流程的维护与执行。
文档方面,API 文档增加 renderer 和 parser 字段说明,同时 retirements 文档也进行了更新。这些文档调整使接口字段与相关状态信息得到同步维护。
十五、v0.32.3 完整更新要点汇总
为了便于快速查看,以下是本次版本涉及的全部主要变化汇总。
模型下载与服务稳定性
集成与模型协议
GPU 与平台支持
Laguna 模型支持
推理引擎更新
agent、命令行与终端体验
测试与文档
结语
代码地址:github.com/ollama/ollama
ollama v0.32.3 是一次覆盖范围较广的稳定性与兼容性更新。
在基础体验上,模型下载开始阶段停滞的问题得到修复;在模型与协议支持上,Claude Code Channels、Anthropic thinking 流、GLM 工具调用和 Laguna 模型能力均得到增强或修复;在硬件支持上,Windows ARM64 CUDA、CUDA 12 B200、Linux CUDA 与 ROCm 集成显卡内存优化成为重要亮点;在底层引擎上,MLX 和 llama.cpp 同步升级;在终端与 agent 使用链路中,工具调用轮次、技能系统、命令补全、渲染一致性和流程精简也都获得调整。