零刻算力卡机型本地模型切换实操指南(模型下载、启动脚本、验证与 OpenClaw 配置)
零刻算力卡机型是通过专门适配算力卡的 llama.cpp 运行本地模型,使用适配后的大模型即可调用算力卡。
本教程以零刻算力卡机型为例,实际上手操作切换本地模型,只需按如下步骤操作即可。
本教程适用于零刻算力卡机型。
llama.cpp 使用 GGUF 格式的模型文件,如需调用算力卡 NPU,还需使用针对算力卡适配过的模型,可在联网状态下,通过以下命令快速搜索已适配模型:
/opt/llama/bin/model-cli query

这里我们选择下载 Qwen3.6-35B-A3B_w4a8 量化模型,这是一个适合用于知识问答、文本生成、文档理解等常见应用场景的大模型,支持 256K 上下文。这里我们记下要下载的模型前面的 ID:1779265995558,然后执行一下命令拉取模型:
sudo /opt/llama/bin/model-cli pull 1779265995558
注:sudo 指获取管理员权限,要求输入用户密码,在终端输入密码默认不会显示,正常输入后回车执行即可。

模型默认存储在 /opt/llama/models/<模型名> 目录,下载好以后,验证是否下载成功,执行:
sudo ls /opt/llama/models
输出结果中包含文件夹(qwen3.6_35b-a3b_w4a8_262144_1_1),说明下载成功,我们要的模型文件就在这个文件夹里面,进一步搜索验证:
sudo ls /opt/llama/models/qwen3.6_35b-a3b_w4a8_262144_1_1
如下图,可以看到输出结果中有三个 GGUF 格式文件,HiModel-Qwen3.6-35b-a3b-w4a8... 文件是模型主文件,mmproj... 文件是多模态投影器,用于实现大模型的多模态能力,让大模型能够理解视觉信息。

下载好本地模型后,需要手动编辑 llama 开机自启脚本,执行:
sudo nano /etc/systemd/system/llama-server.service

主要修改 [Service] 中的 ExecStart 启动参数,这里提供两种更换模型方法,按图片修改参数即可:
适合常驻单个模型,无需频繁切换模型的情况下使用该方法。

编辑完成后,按下 Ctrl+X - Y - 回车,保存退出编辑器。
注:顶部的
Description=xxx是说明文本,可改可不改,不影响运行结果。
下面是 ExecStart 启动参数的说明,有需要可以自行调整参数,更多参数可前往 Llama.cpp 官方查询:
| 启动参数 | 参数全称 | 参数说明 |
|---|---|---|
--log-file /var/log/llama-server.log | --log-file | 指定日志文件路径,将服务运行日志持久写入文件,不再仅输出终端 |
--log-timestamps | --log-timestamps | 为每条日志增加时间戳,方便定位异常发生时间 |
--port 8080 | --port | 设置 HTTP API 监听端口,客户端通过 http://IP:8080 调用推理服务 |
-m /opt/llama/models/qwen3.6_xxx.gguf | --model (-m) | 指定加载的 GGUF 大模型文件路径 |
--mmproj /opt/llama/models/mmproj_xxx.gguf | --mmproj | 指定加载的 GGUF 多模态投影器文件路径 |
--alias qwen36 | --alias | 自定义模型别名,OpenAI 兼容 API 请求时可直接使用别名,无需填写完整模型文件名 |
-np 1 | --parallel (-np) | 最大并发会话数量,限制服务同时处理的推理请求数 |
-c 262144 | --ctx-size (-c) | 上下文窗口总大小,当前配置支持 256K 上下文(对话历史 + 输入 + 输出总 token 上限) |
-n 262144 | --n-predict (-n) | 单次请求最大生成 Token 数量,取值不可超过上下文窗口大小 |
注:mmproj 仅支持多模态大模型,纯文本模型无法使用 mmproj 文件。
适合有多个模型,需频繁切换模型的情况下使用该方法。

编辑完成后,按下 Ctrl+X - Y - 回车,保存退出编辑器。
注:顶部的
Description=xxx是说明文本,可改可不改,不影响运行结果。
下面是 ExecStart 启动参数的说明,更多参数可前往 Llama.cpp 官方查询:
| 启动参数 | 参数全称 | 参数说明 |
|---|---|---|
--log-file /var/log/llama-server.log | --log-file | 指定日志文件路径,将服务运行日志持久写入文件,不再仅输出终端 |
--log-timestamps | --log-timestamps | 为每条日志增加时间戳,方便定位异常发生时间 |
--port 8080 | --port | 设置 HTTP API 监听端口,客户端通过 http://IP:8080 调用推理服务 |
--models-dir /opt/llama/models | --models-dir | 路由模式,扫描目录下全部 GGUF,API 请求指定 model 字段按需热切换 |
--models-max 1 | --models-max | 同时只驻留 1 个模型(切换自动卸载,避免显存不足) |
这里以方法二为例,编辑并保存好 llama 启动脚本后,输入以下命令重启服务,或是直接重启系统即可:
sudo systemctl daemon-reload
sudo systemctl restart llama-server
重启后打开网页 127.0.0.1:8080,点击模型名,可以看到有多个模型可以选择,选中要加载的模型,然后等待模型加载完成即可,打个招呼确认模型能否正常使用,得到回应后说明成功了。


注意:OpenClaw 2026.6.11 之后版本连接 llama.cpp / vLLM / LM Studio 等本地推理后端会出现错误,暂时不要升级 OpenClaw,等待 OpenClaw 官方修复。
新模型就绪后,还需要到 OpenClaw 中切换默认模型,打开终端执行:
openclaw config
http://127.0.0.1:8080/v1。sk-local(可以随意输入)。
这样就配置完成了,再移动到 Done 并按下回车,结束配置。

结束配置后,还需要重启 OpenClaw Gateway 以应用修改,执行:
openclaw gateway restart
重启后即可以新模型使用 OpenClaw。

配置好新模型后,原先的模型如果没有取消勾选,会自动以备用模型配置,可以通过以下命令查询可用模型列表:
openclaw models list
在终端中可以切换默认模型,无需重启 Gateway,执行:
openclaw models set <模型名称>

如需临时切换模型,可以在与 OpenClaw 的对话中回复:/model <模型名称> 快速切换,无需重启。
Tips:如后续需频繁调用 model-cli 命令查询、下载模型,建议将以下命令加入环境变量简化命令,后续可以省略 /opt/llama/bin,直接使用 model-cli <命令> 即可:
echo 'export PATH="$PATH:/opt/llama/bin"' >> ~/.bashrc
source ~/.bashrc

本指南整理自零刻官方知识库,供用户参考。