这才是今年最香的本地部署Agent!DeepSeek Harness + Muse-Glimmer-30B 强强联手!

2026年8月17日 · AOAI AI

(在正式安装 DeepSeek Harness 之前,需要先准备两个基础环境:Node.js   pnpm)

第一步,安装环境
1、确保你的电脑里有 Node.js 环境。打开终端 PowerShell或 CMD,执行

node -v                                                                    
如果能够正常显示 Node.js 版本号,说明 Node.js 已经安装成功。没有安装的,下载最新的 Node.js。

官方下载:https://nodejs.org/zh-cn

夸克下载:https://pan.quark.cn/s/13c1dd6af560#/list/share
2、安装 pnpm

接下来安装 pnpm。

如果你的 Node.js 已经自带 Corepack,可以直接执行(以管理员身份运行):pnpm -v
第二步,下载llama.cpp一键安装包

llama.cpp是在本地,以最小的设置和最先进的性能,在各种硬件上实现 LLM(和 VLM)推理。

纯 C/C++ 实现,没有任何依赖项

苹果芯片是一等公民——通过 ARM NEON、Accelerate 和 Metal 框架进行了优化。

支持 x86 架构的 AVX、AVX2、AVX512 和 AMX 指令集

对 RISC-V 架构的 RVV、ZVFH、ZFH、ZICBOP 和 ZIHINTPAUSE 支持

支持 1.5 位、2 位、3 位、4 位、5 位、6 位和 8 位整数量化,以加快推理速度并减少内存占用。

用于在 NVIDIA GPU 上运行 LLM 的自定义 CUDA 内核(通过 HIP 支持 AMD GPU,通过 MUSA 支持 Moore Threads GPU)

Vulkan 和 SYCL 后端支持

利用 CPU+GPU 混合推理技术,部分加速大于总显存容量的模型。

接下载 llama.cpp的一键安装包  
官网:https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF/tree/main(国内可以镜像网站下载)
夸克网盘:/~25253aFEkS~:/ 链接:https://pan.quark.cn/s/d7d6c2ba0e19 提取码:xvGc

第三步,下载模型Muse-Glimmer 30B 开源模型

1、Huggingface 下载:https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF/tree/main
2、国内镜像下载:https://hf-mirror.com/unsloth/Muse-Glimmer-30B-GGUF/tree/main

 第四步,安装运行DeepSeek Harness

在 PowerShell终端一行命令拉起黑鲸鱼:npx @deepseek-ai/dsh web。 
 第三步,划重点!在 Harness 的设置里选择 ‘OpenAI Compatible’。

第四步,Base URL 填入你本地跑 Muse-Glimmer 的服务地址,模型名称直接手写 Muse-Glimmer-30B。点击保存,你的‘缝合怪’智能体就已经诞生了!”