Qwen3.8-27B 系列模型在 RTX 4060 Ti 16GB 上的测试报告

  • 报告日期:2026-08-23
  • 测试对象:6 个 Qwen3.8-27B 系列 GGUF 模型(unsloth / mudler 量化版)
  • 启动方式:llama.cpp router 模式单服务热切换(F:\llama_cpp\startup\ 一键启动链)
  • 参数来源startup\presets.ini(严格照 llama_cpp_guide.txt 手工验证参数填写,ParaRule)
  • 测试记录startup\llama_startup.log(当日 11:55–13:43 共 11 次会话 + 全程实时日志)

数据来源标注
[G] = llama_cpp_guide.txt 手册记录;[P] = presets.ini 模型段落注释(用户实测,已与日志交叉核对);
[L] = llama_startup.log 本次解析出的数据;[LIVE] = 报告撰写时 8080 现场会话(13:40 起);
[M] = 本项目上轮基准实测(同参数)。
速度口径:tg = 逐 token 生成(decode)速度,来自 print_timing: tg = xx t/s。[P] 注释值均与 [L] 交叉一致。


1. 本地环境(物理硬件)

CPU Intel Core i5-12600K,10 核 / 10 逻辑线程
内存 31.8 GB DDR(系统总计,Win32_ComputerSystem 实测)
GPU NVIDIA GeForce RTX 4060 Ti 16GB(显存 16380 MiB
显卡驱动 566.36
操作系统 Windows 10 专业版 64 位,build 19045
后端 Vulkan(ggml_vulkan),非 CUDA — 见 §2

⚠ 后端特性(影响本机所有测试结果):

  1. Vulkan 对显存分配是硬失败ggml_vulkan: vk::Device::allocateMemory: ErrorOutOfDeviceMemory),
    不会像 CUDA 优雅降级 —— 全量 offload 装不下的模型直接加载失败(当天 Q4 调试时反复复现,见 §4.1)。
  2. 实测日志多处出现 layer 0 is assigned to device CPU but fused Gated Delta Net (chunked) is assigned to device Vulkan1
    这几个 Gated Delta Net 模型(Q3_K_XL / Uncensored / Q4_K_XL 等)的 fused chunked 算子不支持 Vulkan,layer 0 回退 CPU。

2. llama.cpp 信息

可执行文件 C:\Users\xxx\AppData\Local\Microsoft\WindowsApps\llama.exe
安装方式 llama.app:irm https://llama.app/install.ps1 | iex
版本 b10217ddd4ec142)(llama --versionb10217-ddd4ec142
构建 Clang 22.1.8 for Windows x86_64
无独立二进制 本机没有 llama-server.exe / llama-cli.exe;仅通过子命令
llama serve(=原 llama-server)、llama cli(=原 llama-cli)调用
运行模式 router 模式serve --models-dir + --models-preset,6 模型注册、按需加载、
网页下拉热切换;/v1/models 已确认 6 模型全部注册
单次生成 上限由网页端 max tokens 控制(ParaRule 要求 CLI 不传模型参数)

3. 参数治理规则(ParaRule,2026-08 生效)

  1. presets.ini 每个模型的启动参数严格按 llama_cpp_guide.txt 逐条显式填写,不调整;
  2. presets.ini 是唯一参数真源llama-oneclick.ps1 的 CLI 只传 router 基建参数
    serve --models-dir --models-preset --host 127.0.0.1 --port 8080 --models-max 1),不传任何模型参数;
  3. 以后调参只改 presets.ini改完需重启服务才生效(ini 头部已注明)。
llama serve --models-dir F:\llama_cpp\models --models-preset F:\llama_cpp\startup\presets.ini --host 127.0.0.1 --port 8080 --models-max 1

4. 各模型详细启动参数与测试数据

4.1 Qwen3.8-27B-UD-Q4_K_XL(17.5GB 级,最大块)— 已判“不具备生产力”

  • 文件:models\Qwen3.8-27B-UD-Q4_K_XL.gguf16.35 GB

  • 结论前置:presets.ini 段头标注 「勿使用,该模型不具备任何生产力,ctx-size=8192 时也只有 10TPS」
    最大制约:16.35GB 权重装不进 16G 显存,且试过 gpu-layers=99即使把 ctx 调到 4096 也加载不了、显存必爆

  • 启动参数(最终版,已调优 ≠ guide 裸启动;guide 原文只有 llama serve -m ./...gguf 无参数):

preset 键 说明
ctx-size 8192 从默认→32768→最终 8192(见调试记录)
batch-size / ubatch-size 2048 / 512
threads 6
load-mode mmap 权重走内存映射,靠默认 fit 自动分层
flash-attn on --flash-attn 1
temp / top-p / top-k 1 / 0.95 / 20
parallel 1 --parallel 1
cache-type-k / cache-type-v q4_0 KV 量化,尽力省显存
spec-type draft-mtp --spec-type draft-mtp
spec-draft-n-min / -max / p-min 1 / 2 / 0.0 MTP×2
chat-template-kwargs {“preserve-thinking”: true, “reasoning_effort”: “low”} 低思考
reasoning-preserve / reasoning-budget true / 16384
gpu-layers / fit 99 / off 刻意不写,写了必 OOM(日志验证,见下)
  • 调试与测试数据(三段配置,均 startup.bat 自动执行):
配置 tokens tg [P] 时长 负载/温度观察 [P]
① 不加任何参数(guide 裸启动) 3392 5.37 t/s 11min47s 强制打断 CPU 60%、大核跑满;GPU 负载 30%、温度 55°、显存 30%
② 复刻 Uncensored 参数(不设 gpu-layers/fit,ctx=32768) 2921 8.5 t/s 5min20s 强制打断 CPU 66%、大核跑满小核一半;GPU 41%、55°、显存 38%
③ 同 ② 但 ctx=8192(最终采用 1787 10.46 t/s 5min20s 强制打断 CPU 66%;GPU 40%、温度 63°、显存 38%;内存 81%
  • 日志交叉验证 [L]:Q4 全程 tg 样本 min≈5.4 / max≈10.9(对应 ①③ 两段),344 个 tg 样本;
    13:20–13:33 调参期间连续 7 次 OOM 失败(PID 61098/61146/61214/61290/61341/61426/61459):
    • ggml_vulkan: Device memory allocation of size 1039907712 failed + ErrorOutOfDeviceMemory
    • common_fit_params: failed to fit params to free device memory: n_gpu_layers already set by user to 99, abort
    • → 结论:gpu-layers 一旦手写死,fit 无法兜底,必爆显存 ⇒ 最终段不写这两项。
  • [LIVE] 报告撰写时 8080 现场服务正在跑 Q4 最终配置:tg ≈ 10.8 t/s(n≈1727 仍在生成)。

4.2 Qwen3.8-27B-UD-Q3_K_XL(13GB 级)

  • 文件:models\Qwen3.8-27B-UD-Q3_K_XL.gguf12.24 GB
  • 启动参数(照 guide 原样):
preset 键 guide 原参数
gpu-layers 999 -ngl 999
threads 6 --threads 6
load-mode none --no-mmap
flash-attn on --flash-attn 1
temp / top-p / top-k 1 / 0.95 / 20 同名
min-p 0.0 --min-p 0.0
parallel 1 --parallel 1
spec-type draft-mtp --spec-type draft-mtp
spec-draft-n-min / -max / p-min 1 / 3 / 0.0 同名(MTP×3)
presence-penalty / repeat-penalty 0.0 / 1.0 同名
  • 测试数据:
    • [G] guide:23.6 t/s(加 KV 量化反而降到 23,故不配 cache-type);
    • [P] startup.bat 自动执行24.9 t/s(tokens=4227);
    • [L] 日志聚合:avg 24.6、max 26.1、样本 53,最终样本 n=4129 → tg=24.9,与 [P] 完全一致 ✓
  • 备注:日志有该模型的 layer 0 → CPU(fused Gated Delta Net 不支持 Vulkan) 回退警告。
  • 结论:24.9 t/s 可用;但 13 级权重全量 offload 在 16G 显存属临界,仍偏保守选型。

4.3 Qwen3.8-27B-UD-IQ3_S(11GB 级,长上下文)

  • 文件:models\Qwen3.8-27B-UD-IQ3_S.gguf11.21 GB
  • 启动参数(照 guide 原样):
preset 键 guide 原参数
ctx-size 65536 -c 65536
batch-size / ubatch-size 2048 / 512 -b 2048 -ub 512
gpu-layers 99 -ngl 99
threads 12 -t 12
load-mode none --no-mmap
flash-attn on --flash-attn 1
temp / top-p / top-k 1 / 0.95 / 20 同名
parallel 1 --parallel 1
cache-type-k / cache-type-v q4_0 同名
spec-type draft-mtp --spec-type draft-mtp
spec-draft-n-min / -max / p-min 1 / 2 / 0.0 同名
  • 测试数据:
    • [P] llama serve -m 直接执行:26.8 t/s(tokens=3592);
    • [P] startup.bat 自动执行:27.8 t/s(tokens=8136);
    • [L] 日志聚合:avg 27.6、max 28.2、样本 94,最终 n=8039 → tg=**27.8**,与 [P] 完全一致 ✓
  • 结论:长上下文 + KV 量化,27.8 t/s —— 长文场景主力备选。

4.4 Qwen3.8-27B-UD-IQ3_XXS(10GB 级,低思考强度)

  • 文件:models\Qwen3.8-27B-UD-IQ3_XXS.gguf10.18 GB
  • 启动参数(照 guide 原样 = IQ3_S 全套 + 思考相关):
preset 键 guide 原参数
ctx-size 65536 -c 65536
batch-size / ubatch-size 2048 / 512 -b 2048 -ub 512
gpu-layers 99 -ngl 99
threads 12 -t 12
load-mode none --no-mmap
flash-attn on --flash-attn 1
temp / top-p / top-k 1 / 0.95 / 20 同名
parallel 1 --parallel 1
cache-type-k / cache-type-v q4_0 同名
spec-type draft-mtp --spec-type draft-mtp
spec-draft-n-min / -max / p-min 1 / 2 / 0.0 同名
reasoning-budget 16384 --reasoning-budget 16384
chat-template-kwargs {“preserve-thinking”: true, “reasoning_effort”: “low”} 低思考
  • 测试数据:
    • [P]29.2 t/s(tokens=3935);
    • [L] 日志聚合:avg 27.2、max 29.8、样本 42,最终 n=3860 → tg=29.3,与 [P] 一致 ✓
  • 结论:6 模型中速度最快,长上下文 + 低思考,适合长程轻任务。

4.5 Qwen3.8-27B-APEX-I-Nano(主力模型)

  • 文件:models\Qwen3.8-27B-APEX-I-Nano.gguf10.47 GB
  • 启动参数(28 项全量显式,照 guide 原样):
preset 键 guide 原参数
gpu-layers 999 --n-gpu-layers 999
ctx-size 98304 --ctx-size 98304(96K 上下文)
cache-type-k / cache-type-v q4_0 同名
kv-unified true --kv-unified
batch-size / ubatch-size 2048 / 1024 同名
gpu-layers-draft all --gpu-layers-draft all
spec-type draft-mtp --spec-type draft-mtp
spec-draft-n-min / -max / p-min 1 / 3 / 0.0 同名(MTP×3)
reasoning on --reasoning on
chat-template-kwargs {“preserve-thinking”: true, “reasoning_effort”: “medium”} 中思考
reasoning-preserve true --reasoning-preserve
flash-attn on --flash-attn on
threads 6 --threads 6
fit off --fit off
load-mode mmap --load-mode mmap
no-warmup true --no-warmup
jinja true --jinja
temp / top-p / top-k 1 / 0.95 / 20 同名
min-p 0.0 --min-p 0.0
presence-penalty / repeat-penalty 0.0 / 1.0 同名
parallel 1 --parallel 1
  • 测试数据:
    • [G] guide:16GB 显存「平均 50 t/s 没问题,还有显存余量」;MTP×3 提速约 20%、接受率 >56%;
    • [P] startup.bat27.1 t/s(tokens=2654);
    • [L] 日志聚合:avg 28.6、max 30.8、样本 31,最终 n=2609 → tg=27.3,与 [P] 一致 ✓;
    • [M] 上轮基准(同参数):稳态 ≈34 t/s、MTP draft 接受率 93%、VRAM 15.3/16GB、96K 上下文正常。
  • 结论:本环境主力;10.4GB 权重 + KV 量化 + MTP×3 + 96K 长上下文,综合能力与速度最佳平衡。

4.6 Qwen3.8-27B-Uncensored-IQ4_XS(15GB 级,Uncensored)

  • 文件:models\Qwen3.8-27B-Uncensored-IQ4_XS.gguf14.26 GB
  • 启动参数(照 guide 第 154 行原样;第 158 行带 reasoning on 的长命令已标「待废弃不使用」):
preset 键 guide 原参数
ctx-size 32768 -c 32768
batch-size / ubatch-size 2048 / 512 -b 2048 -ub 512
gpu-layers 99 -ngl 99
fit off --fit off
threads 6 -t 6
load-mode mmap --load-mode mmap
flash-attn on --flash-attn 1
temp / top-p / top-k 1 / 0.95 / 20 同名
parallel 1 --parallel 1
cache-type-k / cache-type-v q4_0 同名
spec-type draft-mtp --spec-type draft-mtp
spec-draft-n-min / -max / p-min 1 / 2 / 0.0 同名
chat-template-kwargs {“preserve-thinking”: true, “reasoning_effort”: “low”} 低思考
reasoning-preserve true --reasoning-preserve
reasoning-budget 16384 --reasoning-budget 16384
  • 测试数据:
    • [G] guide:26.2 / 26.9 t/s;已废弃变体 25 / 23.7 t/s;
    • [P] startup.bat28.4 t/s(tokens=3306);
    • [L] 日志聚合:avg 22.0、max 29.4、样本 107,最终 n=3238 → tg=26.4,与 [P] 量级一致 ✓;
      当天 4 次加载(PID 57397/57794/60240/60462)均无 OOM / fit-abort 记录
  • ⚠ 说明(presets.ini 段内注释保留警告):参数严格按 ParaRule 保留 guide 原样(ngl 99 + fit off)。
    上轮会话曾实测 15.3GB 级权重全量 offload 在本机 Vulkan/16G 出现过 ErrorOutOfDeviceMemory
    当日日志 4 次运行却均成功 —— 是否稳定可用需重启实测确认。若失败,自救方法(偏离 guide):
    删掉 gpu-layers 并把 fiton,靠自动分层把部分层留内存。
  • 结论:Uncensored 且速度尚可(26–28 t/s);受显存临界影响,建议 24GB+ 显存机器使用,本机按需实测。

5. 当日测试时间线(llama_startup.log,11 次会话)

时间 主要测试/现象
11:55–12:04 Uncensored(57397,早期慢速)+ Q3_K_XL(57562)初测
12:04–12:32 Uncensored(57794)测速(tg≈7.4,当时配置层多落 CPU)
12:32–13:20 六模型连续切换测速(startup.bat):Uncensored(60240)→IQ3_XXS(60398)→Uncensored(60462)→APEX(60560)→IQ3_S(60618)→Q3_K_XL(60758)→Q4_K_XL(60826) —— 即 presets.ini 各段注释数据的来源
13:20–13:33 Q4_K_XL 调参:gpu-layers=997 次 OOM(cuda/vulkan 硬失败 + fit 拒绝兜底)→ 弃用 gpu-layers/fit
13:31–13:43 Q4_K_XL 最终配置(不设 ngl/fit、ctx=8192)成功,10.4–10.8 t/s,服务常驻至今

6. 现场运行实例状态(报告撰写时快照)

状态
服务 127.0.0.1:8080(PID 17596 + 子进程 2284,13:40 起)
当前模型 Qwen3.8-27B-UD-Q4_K_XL(router 按序自动加载第一个模型)
注册模型 /v1/models 返回全部 6 个 ✅(= presets.ini 6 段全部命中)
实时速度 tg ≈ 10.8 t/s(n≈1727 仍在生成)[LIVE]
GPU 占用 13940/16380 MiB(≈85%;含其它台上应用,Q4 主体层走内存 mmap,显存负载仅 30–40%)

附:速度数据汇总(token/s)

模型 [G] 手册 [P] 用户注释 [L] 日志聚合(avg/max) 备注
Q4_K_XL 10.46(ctx8192 最终配置) 7.2 / 10.9(含调参期) 勿使用;ngl=99 必 OOM
Q3_K_XL 23.6(KV 量化后 23) 24.9 24.6 / 26.1 显存临界
IQ3_S 27.8 27.6 / 28.2 长文备选
IQ3_XXS 29.2 27.2 / 29.8 速度最快
APEX-I-Nano ≈50(56% 接受率) 27.1 28.6 / 30.8 主力;上轮基准 93% 接受率
Uncensored-IQ4_XS 26.2 / 26.9 28.4 22.0 / 29.4 显存临界,需重启确认
Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐