剪藏#剪藏#晓川AI

本地部署 Qwen3.5 模型:Ollama + LM Studio 双引擎实战,接入 OpenClaw 实现 Token 自由

2026 年 4 月 3 日1 分钟
分享Twitter / XTelegram微博
本地部署 Qwen3.5 模型:Ollama + LM Studio 双引擎实战,接入 OpenClaw 实现 Token 自由 封面

最近在折腾本地大模型,发现通义千问的 Qwen3.5 系列模型在中文场景下表现相当不错。更关键的是,通过 Ollama 或 LM Studio 部署到本地后,再接入 OpenClaw,就能彻底摆脱 API Token 的限制。

这篇文章记录一下完整的实操流程,从模型下载到接入 OpenClaw,踩过的坑都写在这里了。

在本地部署大模型之前,我对比了几个主流开源模型:

  • Llama 3.1:英文能力强,但中文理解稍弱

  • Qwen3.5:阿里出品,中文场景优化好,指令跟随能力强

  • DeepSeek:推理能力不错,但资源占用较高

最终选择 Qwen3.5 的原因很简单:中文场景下的实际表现更符合我的需求。我这次部署的是 9B 参数版本,在性能和资源占用之间取得了不错的平衡。

方案一:Ollama 部署

Ollama 是目前最简单的本地模型部署方案,命令行操作,几分钟就能跑起来。

1. 安装 Ollama

macOS / Linux:

JAVASCRIPT
curl -fsSL https://ollama.com/install.sh | sh

Windows: 直接下载安装包:https://ollama.com/download

安装完成后验证:

JAVASCRIPT
ollama --version

2. 拉取 Qwen3.5 模型

Ollama 支持多个 Qwen3.5 版本,根据你的硬件配置选择:

JAVASCRIPT
# 9B 参数版本(推荐,性能和资源平衡)
ollama pull qwen3.5:9b

模型会自动下载到本地,首次拉取需要等待一段时间(9B 版本约 6.6GB)。

Notion image

3. 启动模型服务

JAVASCRIPT
ollama serve

默认监听 http://localhost:11434,服务启动后可以测试一下:

JAVASCRIPT
curl http://localhost:11434/api/generate -d '{
  "model": "qwen3.5:9b",
  "prompt": "介绍一下你自己",
  "stream": false
}'

4. 验证 OpenAI 兼容接口

Ollama 提供了 OpenAI 兼容的 API 接口,这是接入 OpenClaw 的关键:

JAVASCRIPT
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -'{
    "model": "qwen3.5:9b",
    "messages": [{"role": "user", "content": "你好"}]
  }'

方案二:LM Studio 部署

1. 下载安装 LM Studio

官网:https://lmstudio.ai/

支持 Windows、macOS、Linux,下载对应版本安装即可。

2. 下载 Qwen3.5 模型

打开 LM Studio,在搜索框输入 qwen3.5,会看到多个版本:

  • qwen2.5-7b-instruct-q4_k_m.gguf(4-bit 量化)

  • qwen2.5-9b-instruct-q4_k_m.gguf(推荐,性能和资源平衡)

  • qwen2.5-14b-instruct-q4_k_m.gguf

  • qwen2.5-32b-instruct-q4_k_m.gguf

点击下载按钮,模型会保存到本地(默认路径:~/.lm-studio/models)。

Notion image

3. 加载模型并启动服务

    1. 在 LM Studio 左侧选择已下载的模型
    1. 点击 "Load Model" 加载到内存
    1. 切换到 "Local Server" 标签页
    1. 点击 "Start Server",默认监听 http://localhost:1234

Notion image

4. 测试接口

JAVASCRIPT
curl http://localhost:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -'{
    "model": "qwen/qwen3.5-9b",
    "messages": [{"role": "user", "content": "Hi."}]
  }'

Notion image

接入 OpenClaw:实现 Token 自由

接入 OpenClaw 之前,需要配置模型上下文长度。

  • • 在 LM Studio 右侧的配置栏中找到 "Context Length"(上下文长度)选项。

  • • 将默认的 20484096 手动修改为 (16k) 或 (32k)。

  • 注:Qwen 3.5 原生支持到 128k,但在 24G 内存上设置 32k 是最稳妥、不卡顿的选择。

  • • 找到 "GPU Offload",确保它被拉到最大(Max),让 GPU 来处理这些计算。

  • 点击 "Reload Model"(重新加载模型),让设置生效。

Notion image

1. 配置本地模型

进入 OpenClaw 配置页,选择 Model 进行 BaseUrl 和 ApiKey 配置。

JAVASCRIPT
openclaw config

LM Studio 配置(Ollama类似):

JAVASCRIPT
models: {
    mode'merge',
    providers: {
      'lm-studio': {
        baseUrl: 'http://127.0.0.1:1234/v1',
        apiKey: '__OPENCLAW_REDACTED__',
        api: 'openai-completions',
        models: [
          {
            id: 'qwen/qwen3.5-9b',
            name: 'qwen/qwen3.5-9b (Custom Provider)',
            api: 'openai-completions',
            reasoning:false,
            input: [
              'text',
            ],
            cost: {
              input: 0,
              output: 0,
              cacheRead: 0,
              cacheWrite: 0,
            },
            contextWindow: 16000,
            maxTokens: 16000,
          },
        ],
      },
    },
  }

3. 重启 Gateway

JAVASCRIPT
openclaw gateway restart

现在你可以通过 OpenClaw 调用本地模型了,完全不受 Token 限制。

Notion image

总结

通过 Ollama 或 LM Studio 部署 Qwen3.5 模型,再接入 OpenClaw,整个流程下来不到半小时就能搞定。对于日常开发、学习场景,本地模型完全够用,而且不用担心 API 费用和隐私问题。

如果你也在折腾本地大模型,欢迎交流踩坑经验。

相关资源:

原文地址: https://mp.weixin.qq.com/s?__biz=MzYyMzAzNjM2Mw==&mid=2247484319&idx=1&sn=f77ae05ec3c54b944c4d9ab21bb2aaec&chksm=fe5dc74a32d6c8b91613d66548649dcf416823dde9b1e0facec79a2a3b62fcab384ab413fff3&mpshare=1&scene=1&srcid=0403tR9GFzyVeeoKgcDmEKh7&sharer_shareinfo=42ceb11c507112598555d6a096f26e22&sharer_shareinfo_first=42ceb11c507112598555d6a096f26e22#rd

相关文章