Published on

Qwen3.6-27B 部署指南 - 256K 上下文下的最优配置

Authors

模型简介

Qwen3.6-27B 是通义千问推出的 27B 参数大语言模型,支持 262K 超长上下文。本文使用 UD-Q4_K_XL 量化版本(约 17 GB),在 AMD RX 395(96 GB 统一内存)上实现 256K 上下文 + 22 token/s 的推理速度,是目前实测最快的配置。

环境信息

项目
系统Linux x86_64
显卡AMD RX 395 (Vulkan)
显存96 GB(统一内存)
模型Qwen3.6-27B-UD-Q4_K_XL.gguf (~17 GB)
llama.cpp 版本b10079 (Vulkan)

1. 启动命令

~/llama.cpp/vulkan/b10079/llama-server \
  -m ~/model-gguf/Qwen3.6-27B-UD-Q4_K_XL.gguf \
  --alias "qwen3.6-27B" \
  --api-key "sk-testing" \
  -ngl 99 -c 256000 \
  -ctk q8_0 -ctv q8_0 \
  -ctkd q8_0 -ctvd q8_0 \
  -fa on \
  --host 0.0.0.0 --port 8080 \
  --spec-type draft-mtp \
  --spec-draft-n-max 2 \
  -ub 4096 -b 2048 \
  --no-mmap

实测速度:22 token/s,256K 上下文全开,是当前 AMD RX 395 上最快的配置。

2. 参数详解

基础参数

参数说明本配置
-m模型文件路径~/model-gguf/Qwen3.6-27B-UD-Q4_K_XL.gguf
--alias模型别名(API 返回中显示)qwen3.6-27B
--api-keyAPI 鉴权密钥sk-testing
--host / --port监听地址和端口0.0.0.0:8080

GPU 与注意力

参数说明本配置
-ngl 99全部层 offload 到 GPU99
-fa onFlash Attention,节省显存、加速长上下文on

上下文与 KV 缓存

参数说明本配置
-c 256000上下文窗口大小(~256K)256000
-ctk q8_0K 缓存量化格式q8_0
-ctv q8_0V 缓存量化格式q8_0

Q8_0 KV 缓存在精度和显存之间取得最佳平衡,每 token 约 32 KiB。相比 iq4_nlq8_0 在 AMD RX 395 上兼容性更好、速度更快。

MTP 推测解码

参数说明本配置
--spec-type draft-mtp使用模型内置 MTP 头作为草稿模型draft-mtp
--spec-draft-n-max 2每次推测最多生成 2 个 token2
-ctkd q8_0草稿模型 K 缓存量化q8_0
-ctvd q8_0草稿模型 V 缓存量化q8_0

Qwen3.6-27B 内置 MTP(Multi-Token Prediction)头,无需额外草稿模型文件。--spec-draft-n-max 2 表示每次推测 2 个未来 token,实测接受率良好。

Batch 与内存

参数说明本配置
-ub 4096Prompt 处理 micro-batch size4096
-b 2048最大 batch size2048
--no-mmap禁用内存映射文件,直接加载到内存启用

-ub 4096 加大 prompt 处理批次,加速长 prompt 的首 token 生成。--no-mmap 避免系统内存映射带来的额外开销,在统一内存架构(UMA)上效果明显。

3. 显存预算

256K 上下文显存计算

项目大小
模型权重 (Q4_K_XL)~17 GB
KV 缓存 (256K, q8_0)~16 GB
运行时开销~2 GB
总计~35 GB

96 GB 显存跑 256K 上下文仍有大量富余,这也是能保持 22 token/s 高速的关键。

KV 缓存大小参考

上下文q8_0 KV 大小说明
8K~0.5 GB普通对话
32K~2 GB长文档
128K~8 GB超长上下文
256K~16 GB模型最大上下文

4. API 调用

curl -s http://localhost:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-testing" \
  -d '{
    "messages": [{"role": "user", "content": "你好"}],
    "max_tokens": 100
  }'

5. 性能对比

配置速度上下文说明
本文配置22 tok/s256KQ4_K_XL + MTP + Q8_0 KV
Hy3 IQ1_M + MTP~20 tok/s80K86 GB 模型,显存更紧张
Ternary-Bonsai-27B 单模型~20-30 tok/s128K7.2 GB 三值化模型

Qwen3.6-27B 的 Q4_K_XL 量化在质量与速度之间取得了很好的平衡,配合 MTP 推测解码和 Q8_0 KV 缓存,在 256K 满上下文下仍能保持 22 token/s。

6. 注意事项

  • AMD RX 395 兼容性:KV 缓存推荐使用 q8_0,避免 iq4_nl(兼容性不佳)
  • --no-mmap:在统一内存架构(UMA)上建议开启,减少内存映射开销
  • -ub 4096:较大的 micro-batch 加速 prompt 处理,但会占用更多显存
  • MTP --spec-draft-n-max 2:Qwen3.6 的 MTP 头设计为预测 2 个 token,不建议设更大
  • 首次请求较慢:模型预热 + 编译缓存,后续请求提速