Qwen3.8-27B 系列模型在 RTX 4060 Ti 16GB 上的测试报告
- 报告日期:2026-08-23
- 测试对象:6 个 Qwen3.8-27B 系列 GGUF 模型(unsloth / mudler 量化版)
- 启动方式:llama.cpp router 模式单服务热切换(
F:\llama_cpp\startup\ 一键启动链)
- 参数来源:
startup\presets.ini(严格照 llama_cpp_guide.txt 手工验证参数填写,ParaRule)
- 测试记录:
startup\llama_startup.log(当日 11:55–13:43 共 11 次会话 + 全程实时日志)
数据来源标注:
[G] = llama_cpp_guide.txt 手册记录;[P] = presets.ini 模型段落注释(用户实测,已与日志交叉核对);
[L] = llama_startup.log 本次解析出的数据;[LIVE] = 报告撰写时 8080 现场会话(13:40 起);
[M] = 本项目上轮基准实测(同参数)。
速度口径:tg = 逐 token 生成(decode)速度,来自 print_timing: tg = xx t/s。[P] 注释值均与 [L] 交叉一致。
1. 本地环境(物理硬件)
| 项 |
值 |
| CPU |
Intel Core i5-12600K,10 核 / 10 逻辑线程 |
| 内存 |
31.8 GB DDR(系统总计,Win32_ComputerSystem 实测) |
| GPU |
NVIDIA GeForce RTX 4060 Ti 16GB(显存 16380 MiB) |
| 显卡驱动 |
566.36 |
| 操作系统 |
Windows 10 专业版 64 位,build 19045 |
| 后端 |
Vulkan(ggml_vulkan),非 CUDA — 见 §2 |
⚠ 后端特性(影响本机所有测试结果):
- Vulkan 对显存分配是硬失败(
ggml_vulkan: vk::Device::allocateMemory: ErrorOutOfDeviceMemory),
不会像 CUDA 优雅降级 —— 全量 offload 装不下的模型直接加载失败(当天 Q4 调试时反复复现,见 §4.1)。
- 实测日志多处出现
layer 0 is assigned to device CPU but fused Gated Delta Net (chunked) is assigned to device Vulkan1:
这几个 Gated Delta Net 模型(Q3_K_XL / Uncensored / Q4_K_XL 等)的 fused chunked 算子不支持 Vulkan,layer 0 回退 CPU。
2. llama.cpp 信息
| 项 |
值 |
| 可执行文件 |
C:\Users\xxx\AppData\Local\Microsoft\WindowsApps\llama.exe |
| 安装方式 |
llama.app:irm https://llama.app/install.ps1 | iex |
| 版本 |
b10217(ddd4ec142)(llama --version → b10217-ddd4ec142) |
| 构建 |
Clang 22.1.8 for Windows x86_64 |
| 无独立二进制 |
本机没有 llama-server.exe / llama-cli.exe;仅通过子命令 |
|
llama serve(=原 llama-server)、llama cli(=原 llama-cli)调用 |
| 运行模式 |
router 模式:serve --models-dir + --models-preset,6 模型注册、按需加载、 |
|
网页下拉热切换;/v1/models 已确认 6 模型全部注册 |
| 单次生成 |
上限由网页端 max tokens 控制(ParaRule 要求 CLI 不传模型参数) |
3. 参数治理规则(ParaRule,2026-08 生效)
presets.ini 每个模型的启动参数严格按 llama_cpp_guide.txt 逐条显式填写,不调整;
- presets.ini 是唯一参数真源:
llama-oneclick.ps1 的 CLI 只传 router 基建参数
(serve --models-dir --models-preset --host 127.0.0.1 --port 8080 --models-max 1),不传任何模型参数;
- 以后调参只改
presets.ini;改完需重启服务才生效(ini 头部已注明)。
llama serve --models-dir F:\llama_cpp\models --models-preset F:\llama_cpp\startup\presets.ini --host 127.0.0.1 --port 8080 --models-max 1
4. 各模型详细启动参数与测试数据
4.1 Qwen3.8-27B-UD-Q4_K_XL(17.5GB 级,最大块)— 已判“不具备生产力”
-
文件:models\Qwen3.8-27B-UD-Q4_K_XL.gguf,16.35 GB
-
结论前置:presets.ini 段头标注 「勿使用,该模型不具备任何生产力,ctx-size=8192 时也只有 10TPS」。
最大制约:16.35GB 权重装不进 16G 显存,且试过 gpu-layers=99 时即使把 ctx 调到 4096 也加载不了、显存必爆。
-
启动参数(最终版,已调优 ≠ guide 裸启动;guide 原文只有 llama serve -m ./...gguf 无参数):
| preset 键 |
值 |
说明 |
| ctx-size |
8192 |
从默认→32768→最终 8192(见调试记录) |
| batch-size / ubatch-size |
2048 / 512 |
— |
| threads |
6 |
— |
| load-mode |
mmap |
权重走内存映射,靠默认 fit 自动分层 |
| flash-attn |
on |
--flash-attn 1 |
| temp / top-p / top-k |
1 / 0.95 / 20 |
— |
| parallel |
1 |
--parallel 1 |
| cache-type-k / cache-type-v |
q4_0 |
KV 量化,尽力省显存 |
| spec-type |
draft-mtp |
--spec-type draft-mtp |
| spec-draft-n-min / -max / p-min |
1 / 2 / 0.0 |
MTP×2 |
| chat-template-kwargs |
{“preserve-thinking”: true, “reasoning_effort”: “low”} |
低思考 |
| reasoning-preserve / reasoning-budget |
true / 16384 |
— |
gpu-layers / fit |
99 / off |
刻意不写,写了必 OOM(日志验证,见下) |
- 调试与测试数据(三段配置,均
startup.bat 自动执行):
| 配置 |
tokens |
tg [P] |
时长 |
负载/温度观察 [P] |
| ① 不加任何参数(guide 裸启动) |
3392 |
5.37 t/s |
11min47s 强制打断 |
CPU 60%、大核跑满;GPU 负载 30%、温度 55°、显存 30% |
| ② 复刻 Uncensored 参数(不设 gpu-layers/fit,ctx=32768) |
2921 |
8.5 t/s |
5min20s 强制打断 |
CPU 66%、大核跑满小核一半;GPU 41%、55°、显存 38% |
| ③ 同 ② 但 ctx=8192(最终采用) |
1787 |
10.46 t/s |
5min20s 强制打断 |
CPU 66%;GPU 40%、温度 63°、显存 38%;内存 81% |
- 日志交叉验证 [L]:Q4 全程 tg 样本 min≈5.4 / max≈10.9(对应 ①③ 两段),344 个 tg 样本;
13:20–13:33 调参期间连续 7 次 OOM 失败(PID 61098/61146/61214/61290/61341/61426/61459):
ggml_vulkan: Device memory allocation of size 1039907712 failed + ErrorOutOfDeviceMemory
common_fit_params: failed to fit params to free device memory: n_gpu_layers already set by user to 99, abort
- → 结论:gpu-layers 一旦手写死,fit 无法兜底,必爆显存 ⇒ 最终段不写这两项。
- [LIVE] 报告撰写时 8080 现场服务正在跑 Q4 最终配置:tg ≈ 10.8 t/s(n≈1727 仍在生成)。
4.2 Qwen3.8-27B-UD-Q3_K_XL(13GB 级)
- 文件:
models\Qwen3.8-27B-UD-Q3_K_XL.gguf,12.24 GB
- 启动参数(照 guide 原样):
| preset 键 |
值 |
guide 原参数 |
| gpu-layers |
999 |
-ngl 999 |
| threads |
6 |
--threads 6 |
| load-mode |
none |
--no-mmap |
| flash-attn |
on |
--flash-attn 1 |
| temp / top-p / top-k |
1 / 0.95 / 20 |
同名 |
| min-p |
0.0 |
--min-p 0.0 |
| parallel |
1 |
--parallel 1 |
| spec-type |
draft-mtp |
--spec-type draft-mtp |
| spec-draft-n-min / -max / p-min |
1 / 3 / 0.0 |
同名(MTP×3) |
| presence-penalty / repeat-penalty |
0.0 / 1.0 |
同名 |
- 测试数据:
- [G] guide:23.6 t/s(加 KV 量化反而降到 23,故不配 cache-type);
- [P]
startup.bat 自动执行:24.9 t/s(tokens=4227);
- [L] 日志聚合:avg 24.6、max 26.1、样本 53,最终样本 n=4129 → tg=24.9,与 [P] 完全一致 ✓
- 备注:日志有该模型的
layer 0 → CPU(fused Gated Delta Net 不支持 Vulkan) 回退警告。
- 结论:24.9 t/s 可用;但 13 级权重全量 offload 在 16G 显存属临界,仍偏保守选型。
4.3 Qwen3.8-27B-UD-IQ3_S(11GB 级,长上下文)
- 文件:
models\Qwen3.8-27B-UD-IQ3_S.gguf,11.21 GB
- 启动参数(照 guide 原样):
| preset 键 |
值 |
guide 原参数 |
| ctx-size |
65536 |
-c 65536 |
| batch-size / ubatch-size |
2048 / 512 |
-b 2048 -ub 512 |
| gpu-layers |
99 |
-ngl 99 |
| threads |
12 |
-t 12 |
| load-mode |
none |
--no-mmap |
| flash-attn |
on |
--flash-attn 1 |
| temp / top-p / top-k |
1 / 0.95 / 20 |
同名 |
| parallel |
1 |
--parallel 1 |
| cache-type-k / cache-type-v |
q4_0 |
同名 |
| spec-type |
draft-mtp |
--spec-type draft-mtp |
| spec-draft-n-min / -max / p-min |
1 / 2 / 0.0 |
同名 |
- 测试数据:
- [P]
llama serve -m 直接执行:26.8 t/s(tokens=3592);
- [P]
startup.bat 自动执行:27.8 t/s(tokens=8136);
- [L] 日志聚合:avg 27.6、max 28.2、样本 94,最终 n=8039 → tg=**27.8**,与 [P] 完全一致 ✓
- 结论:长上下文 + KV 量化,27.8 t/s —— 长文场景主力备选。
4.4 Qwen3.8-27B-UD-IQ3_XXS(10GB 级,低思考强度)
- 文件:
models\Qwen3.8-27B-UD-IQ3_XXS.gguf,10.18 GB
- 启动参数(照 guide 原样 = IQ3_S 全套 + 思考相关):
| preset 键 |
值 |
guide 原参数 |
| ctx-size |
65536 |
-c 65536 |
| batch-size / ubatch-size |
2048 / 512 |
-b 2048 -ub 512 |
| gpu-layers |
99 |
-ngl 99 |
| threads |
12 |
-t 12 |
| load-mode |
none |
--no-mmap |
| flash-attn |
on |
--flash-attn 1 |
| temp / top-p / top-k |
1 / 0.95 / 20 |
同名 |
| parallel |
1 |
--parallel 1 |
| cache-type-k / cache-type-v |
q4_0 |
同名 |
| spec-type |
draft-mtp |
--spec-type draft-mtp |
| spec-draft-n-min / -max / p-min |
1 / 2 / 0.0 |
同名 |
| reasoning-budget |
16384 |
--reasoning-budget 16384 |
| chat-template-kwargs |
{“preserve-thinking”: true, “reasoning_effort”: “low”} |
低思考 |
- 测试数据:
- [P] :29.2 t/s(tokens=3935);
- [L] 日志聚合:avg 27.2、max 29.8、样本 42,最终 n=3860 → tg=29.3,与 [P] 一致 ✓
- 结论:6 模型中速度最快,长上下文 + 低思考,适合长程轻任务。
4.5 Qwen3.8-27B-APEX-I-Nano(主力模型)
- 文件:
models\Qwen3.8-27B-APEX-I-Nano.gguf,10.47 GB
- 启动参数(28 项全量显式,照 guide 原样):
| preset 键 |
值 |
guide 原参数 |
| gpu-layers |
999 |
--n-gpu-layers 999 |
| ctx-size |
98304 |
--ctx-size 98304(96K 上下文) |
| cache-type-k / cache-type-v |
q4_0 |
同名 |
| kv-unified |
true |
--kv-unified |
| batch-size / ubatch-size |
2048 / 1024 |
同名 |
| gpu-layers-draft |
all |
--gpu-layers-draft all |
| spec-type |
draft-mtp |
--spec-type draft-mtp |
| spec-draft-n-min / -max / p-min |
1 / 3 / 0.0 |
同名(MTP×3) |
| reasoning |
on |
--reasoning on |
| chat-template-kwargs |
{“preserve-thinking”: true, “reasoning_effort”: “medium”} |
中思考 |
| reasoning-preserve |
true |
--reasoning-preserve |
| flash-attn |
on |
--flash-attn on |
| threads |
6 |
--threads 6 |
| fit |
off |
--fit off |
| load-mode |
mmap |
--load-mode mmap |
| no-warmup |
true |
--no-warmup |
| jinja |
true |
--jinja |
| temp / top-p / top-k |
1 / 0.95 / 20 |
同名 |
| min-p |
0.0 |
--min-p 0.0 |
| presence-penalty / repeat-penalty |
0.0 / 1.0 |
同名 |
| parallel |
1 |
--parallel 1 |
- 测试数据:
- [G] guide:16GB 显存「平均 50 t/s 没问题,还有显存余量」;MTP×3 提速约 20%、接受率 >56%;
- [P]
startup.bat:27.1 t/s(tokens=2654);
- [L] 日志聚合:avg 28.6、max 30.8、样本 31,最终 n=2609 → tg=27.3,与 [P] 一致 ✓;
- [M] 上轮基准(同参数):稳态 ≈34 t/s、MTP draft 接受率 93%、VRAM 15.3/16GB、96K 上下文正常。
- 结论:本环境主力;10.4GB 权重 + KV 量化 + MTP×3 + 96K 长上下文,综合能力与速度最佳平衡。
4.6 Qwen3.8-27B-Uncensored-IQ4_XS(15GB 级,Uncensored)
- 文件:
models\Qwen3.8-27B-Uncensored-IQ4_XS.gguf,14.26 GB
- 启动参数(照 guide 第 154 行原样;第 158 行带
reasoning on 的长命令已标「待废弃不使用」):
| preset 键 |
值 |
guide 原参数 |
| ctx-size |
32768 |
-c 32768 |
| batch-size / ubatch-size |
2048 / 512 |
-b 2048 -ub 512 |
| gpu-layers |
99 |
-ngl 99 |
| fit |
off |
--fit off |
| threads |
6 |
-t 6 |
| load-mode |
mmap |
--load-mode mmap |
| flash-attn |
on |
--flash-attn 1 |
| temp / top-p / top-k |
1 / 0.95 / 20 |
同名 |
| parallel |
1 |
--parallel 1 |
| cache-type-k / cache-type-v |
q4_0 |
同名 |
| spec-type |
draft-mtp |
--spec-type draft-mtp |
| spec-draft-n-min / -max / p-min |
1 / 2 / 0.0 |
同名 |
| chat-template-kwargs |
{“preserve-thinking”: true, “reasoning_effort”: “low”} |
低思考 |
| reasoning-preserve |
true |
--reasoning-preserve |
| reasoning-budget |
16384 |
--reasoning-budget 16384 |
- 测试数据:
- [G] guide:26.2 / 26.9 t/s;已废弃变体 25 / 23.7 t/s;
- [P]
startup.bat:28.4 t/s(tokens=3306);
- [L] 日志聚合:avg 22.0、max 29.4、样本 107,最终 n=3238 → tg=26.4,与 [P] 量级一致 ✓;
当天 4 次加载(PID 57397/57794/60240/60462)均无 OOM / fit-abort 记录。
- ⚠ 说明(presets.ini 段内注释保留警告):参数严格按 ParaRule 保留 guide 原样(ngl 99 + fit off)。
上轮会话曾实测 15.3GB 级权重全量 offload 在本机 Vulkan/16G 出现过 ErrorOutOfDeviceMemory;
当日日志 4 次运行却均成功 —— 是否稳定可用需重启实测确认。若失败,自救方法(偏离 guide):
删掉 gpu-layers 并把 fit 改 on,靠自动分层把部分层留内存。
- 结论:Uncensored 且速度尚可(26–28 t/s);受显存临界影响,建议 24GB+ 显存机器使用,本机按需实测。
5. 当日测试时间线(llama_startup.log,11 次会话)
| 时间 |
主要测试/现象 |
| 11:55–12:04 |
Uncensored(57397,早期慢速)+ Q3_K_XL(57562)初测 |
| 12:04–12:32 |
Uncensored(57794)测速(tg≈7.4,当时配置层多落 CPU) |
| 12:32–13:20 |
六模型连续切换测速(startup.bat):Uncensored(60240)→IQ3_XXS(60398)→Uncensored(60462)→APEX(60560)→IQ3_S(60618)→Q3_K_XL(60758)→Q4_K_XL(60826) —— 即 presets.ini 各段注释数据的来源 |
| 13:20–13:33 |
Q4_K_XL 调参:gpu-layers=99 连 7 次 OOM(cuda/vulkan 硬失败 + fit 拒绝兜底)→ 弃用 gpu-layers/fit |
| 13:31–13:43 |
Q4_K_XL 最终配置(不设 ngl/fit、ctx=8192)成功,10.4–10.8 t/s,服务常驻至今 |
6. 现场运行实例状态(报告撰写时快照)
| 项 |
状态 |
| 服务 |
127.0.0.1:8080(PID 17596 + 子进程 2284,13:40 起) |
| 当前模型 |
Qwen3.8-27B-UD-Q4_K_XL(router 按序自动加载第一个模型) |
| 注册模型 |
/v1/models 返回全部 6 个 ✅(= presets.ini 6 段全部命中) |
| 实时速度 |
tg ≈ 10.8 t/s(n≈1727 仍在生成)[LIVE] |
| GPU 占用 |
13940/16380 MiB(≈85%;含其它台上应用,Q4 主体层走内存 mmap,显存负载仅 30–40%) |
附:速度数据汇总(token/s)
| 模型 |
[G] 手册 |
[P] 用户注释 |
[L] 日志聚合(avg/max) |
备注 |
| Q4_K_XL |
— |
10.46(ctx8192 最终配置) |
7.2 / 10.9(含调参期) |
勿使用;ngl=99 必 OOM |
| Q3_K_XL |
23.6(KV 量化后 23) |
24.9 |
24.6 / 26.1 |
显存临界 |
| IQ3_S |
— |
27.8 |
27.6 / 28.2 |
长文备选 |
| IQ3_XXS |
— |
29.2 |
27.2 / 29.8 |
速度最快 |
| APEX-I-Nano |
≈50(56% 接受率) |
27.1 |
28.6 / 30.8 |
主力;上轮基准 93% 接受率 |
| Uncensored-IQ4_XS |
26.2 / 26.9 |
28.4 |
22.0 / 29.4 |
显存临界,需重启确认 |
所有评论(0)