你们好, 我是硅谷茶馆。近来跟大闺女探讨游戏对战方面的事儿, 我俩就要着手进行人物设计以及对战方案设计, 她问我, 既然云端AI这般便利, 为啥还要耗费时间在本地部署? 我跟她说你能够是为了真正的自由以及安心。

要是此刻交由我去推举一套对普通用户而言最为适配跑本地模型以及 Agent 的方案, 我会毫无迟疑地进行推荐, 那便是: Qwen3.6 最新开源模型。这组搭配最大的长处在于: 免费, 好用, 灵活, 并且极为适宜日常运用。

substr php\_Hermes Qwen3.6 本地部署方案 _ Qwen3.6开源模型本地化部署教程

为什么值得本地化部署?

即便云端 AI 极为强大, 然而于处理诸如长文档、代码项目抑或私人资料之际, Token 费用极易出现累积的状况, 并且将敏感内容上传至网络总归会让人存有一些顾虑。Qwen3.6 开源了之后, 本地运行的性能获得了显著的提升, 在和 Agent 配合以后, 它不再仅仅只是聊天工具了, 更是能够执行具体的任务、进行连接, 甚至还能帮你处理日常的工作流。

环境准备:用WSL2搭建稳定环境

在系统的情形之下, 我做出这样的推荐, 那便是使用WSL2( for Linux), 其性能方面的损耗是比较小的, 并且稳定性相对较好一些。

1、开启WSL2

运用管理员身份予以打开, 接着运行: wsl, 随后输入: --, 紧接着输入: -d, 再接着输入: -24.04, 在安装完毕之后重启电脑, 并且运用-smi去检查显卡驱动可否正常被识别此这需安装那支持WSL2的驱动哟。

2、安装CUDA

于WSL环境以内进行如下操作: 运行sudo apt , 接着运行sudo apt -y cuda--12-8, 在安装完毕之后要记得将CUDA路径增添至~/.环境变量, 以此防止后续编译之际无法找到GPU。

核心部署:用llama.cpp运行Qwen3.6

llama.cpp对GGUF格式予以支持, 其能够有效地将显存占用降低, 适用于不同配置的电脑, 对llama.cpp进行编译。

sudo apt install -y cmake build-essential git
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES=89
cmake --build build -j$(nproc)

如果这样的错误出现, 其中主要缘由乃 CUDA 未进行安装所致, 在 WSL2 之中得单独予以安装, 运行如下:

wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2404/x86_64/cuda-keyring_1.1-1_all.deb
sudo dpkg -i cuda-keyring_1.1-1_all.deb
sudo apt update
sudo apt install -y cuda-toolkit-12-8

眼下这个下载量颇为可观(大概是2GB), 需耐心等待一番……待完成下载之后, 当下就要着手设置路径, 随后再进行重新编译:

export PATH=/usr/local/cuda-12.8/bin:$PATH
export LD_LIBRARY_PATH=/usr/local/cuda-12.8/lib64:$LD_LIBRARY_PATH
echo 'export PATH=/usr/local/cuda-12.8/bin:$PATH' >> ~/.bashrc
echo 'export LD_LIBRARY_PATH=/usr/local/cuda-12.8/lib64:$LD_LIBRARY_PATH' >> ~/.bashrc
cd ~/llama.cpp
rm -rf build
cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES=89
cmake --build build -j$(nproc)

模型选择建议

模型下载(我使用的是3.6-27B模型作为参考):

hf download unsloth/Qwen3.6-27B-GGUF \
  Qwen3.6-27B-UD-Q4_K_XL.gguf \
  --local-dir ~/models/

在将所谓的模型下载完成之后, 这会儿正式开始启动与之相关的模型服务: (这里需要注意的关键点在于要把下方所给出命令内的模型名词修改为你自身所拥有的)开始启动服务:

~/llama.cpp/build/bin/llama-server \
  --model ~/models/Qwen3.6-27B-UD-Q4_K_XL.gguf \
  --n-gpu-layers 99 \
  --ctx-size 32768 \
  --flash-attn on \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 20 \
  --presence-penalty 1.5 \
  --port 8080

现在打开 Windows 浏览器访问:http://localhost:8080,就能看到内置聊天界面,直接开始和 Qwen3.6-27B 对话了。



小建议, Qwen3.6默认开启思维链模式, 要是感觉回复比较慢, 那么可以添加参数把它关闭, 以此来提升速度, 能够使用进行控制。

末尾加:禁止输出思考过程、隐藏思维链,直接输出最终答案

接入 Agent,解锁任务执行能力

有了模型作为“大脑”,还需要 Agent来提供“执行力”。

以官方途径来对Agent进行安装, 借助curl -fsSL | bash, 于配置里挑取 , 填进:8080/v1, 鉴于咱们采用的是本地模型, 能够随性去书写 , 模型会自行识别无需进行操作 ;针对演示操作我来予以对接: 等申请到机器人Token之后 , 你能够于外出之际借助消息去指挥电脑上的AI为你开展搜索资料 、整理大纲等事项 , 回到家便可收到结果。

这种本地+自动化的组合,隐私性和便利性都比较突出。

配置好以后我们就可以进行聊天和工具调用了:

实操心得与注意事项

对于具备一定动手相应能力的友人来讲, 整个其部署的全程流程并非是特别困难的, 然而在首次进行操作之际, 或许是需要具备耐心去开展调试工作的。在不同的硬件配置情形之下, 实际所呈现出来的效果是会存有差别的, 因而建议依据自身电脑的具体状况去做出相应调整。

注:因为我们使用的是,所以可以设置开启自启脚本,如下:

cat > ~/start-llm.sh << 'EOF'
#!/bin/bash
echo "Starting Qwen3.6-27B llama-server..."
~/llama.cpp/build/bin/llama-server \
  --model ~/models/Qwen3.6-27B-UD-Q4_K_XL.gguf \
  --n-gpu-layers 99 \
  --ctx-size 65536 \
  --flash-attn on \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 20 \
  --presence-penalty 1.5 \
  --port 8080 \
  --host 0.0.0.0 &
echo "llama-server started, PID: $!"
echo "API: http://localhost:8080/v1"
echo "Chat UI: http://localhost:8080"
EOF
chmod +x ~/start-llm.sh

已然创建好了自启脚本, 仍旧得去设置WSL2启动之际自动运行的命令, 设置完毕之后每一次打开WSL2终端便都会自动去跑模型了。

echo '# Auto-start llama-server' >> ~/.bashrc
echo 'if ! pgrep -f "llama-server" > /dev/null 2>&1; then' >> ~/.bashrc
echo '    ~/start-llm.sh' >> ~/.bashrc
echo 'fi' >> ~/.bashrc

我致使它为我撰写了一项网站统计功能, 能够查看所消耗的, 对于本地的而言无需担忧会造成浪费, 咱们普通客户运用本地模型便已足够, 要是属于大项目的话仍旧得对接付费模型的。

总结:

这套, 与Qwen3.6相关的本地方案, 给出了一种私密的、免费的、能够长期使用的AI工作方式。适用有一定显卡配置的朋友去尝试, 使闲置的GPU发挥出更多价值。

要是你同样对本地人工智能部署怀有兴趣, 那就欢迎于评论区域分享你的配置以及使用时候的心得体会, 咱们一块儿交流进而取得进步。

抱有对这篇文章喜爱之情的朋友, 热忱欢迎去点赞, 收藏起来, 并且关注「硅谷茶馆」, 而后我会持续不断地分享着实实用、满满干货一般的AI工具此外还有部署经验。祝愿大家新的一周能够高效地进展顺利安好!

本文源于个人实际操作经验而整理, 所涉及的技术操作, 应以官方文档为准, 不同环境会存在差异, 要注意备份数据且谨慎进行操作。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐