- Published on
Qwen3.6-27B 部署指南 - 256K 上下文下的最优配置
- Authors

- Name
- JiGu
- @crypto20x
模型简介
Qwen3.6-27B 是通义千问推出的 27B 参数大语言模型,支持 262K 超长上下文。本文使用 UD-Q4_K_XL 量化版本(约 17 GB),在 AMD RX 395(96 GB 统一内存)上实现 256K 上下文 + 22 token/s 的推理速度,是目前实测最快的配置。
环境信息
| 项目 | 值 |
|---|---|
| 系统 | Linux x86_64 |
| 显卡 | AMD RX 395 (Vulkan) |
| 显存 | 96 GB(统一内存) |
| 模型 | Qwen3.6-27B-UD-Q4_K_XL.gguf (~17 GB) |
| llama.cpp 版本 | b10079 (Vulkan) |
1. 启动命令
~/llama.cpp/vulkan/b10079/llama-server \
-m ~/model-gguf/Qwen3.6-27B-UD-Q4_K_XL.gguf \
--alias "qwen3.6-27B" \
--api-key "sk-testing" \
-ngl 99 -c 256000 \
-ctk q8_0 -ctv q8_0 \
-ctkd q8_0 -ctvd q8_0 \
-fa on \
--host 0.0.0.0 --port 8080 \
--spec-type draft-mtp \
--spec-draft-n-max 2 \
-ub 4096 -b 2048 \
--no-mmap
实测速度:22 token/s,256K 上下文全开,是当前 AMD RX 395 上最快的配置。
2. 参数详解
基础参数
| 参数 | 说明 | 本配置 |
|---|---|---|
-m | 模型文件路径 | ~/model-gguf/Qwen3.6-27B-UD-Q4_K_XL.gguf |
--alias | 模型别名(API 返回中显示) | qwen3.6-27B |
--api-key | API 鉴权密钥 | sk-testing |
--host / --port | 监听地址和端口 | 0.0.0.0:8080 |
GPU 与注意力
| 参数 | 说明 | 本配置 |
|---|---|---|
-ngl 99 | 全部层 offload 到 GPU | 99 |
-fa on | Flash Attention,节省显存、加速长上下文 | on |
上下文与 KV 缓存
| 参数 | 说明 | 本配置 |
|---|---|---|
-c 256000 | 上下文窗口大小(~256K) | 256000 |
-ctk q8_0 | K 缓存量化格式 | q8_0 |
-ctv q8_0 | V 缓存量化格式 | q8_0 |
Q8_0 KV 缓存在精度和显存之间取得最佳平衡,每 token 约 32 KiB。相比 iq4_nl,q8_0 在 AMD RX 395 上兼容性更好、速度更快。
MTP 推测解码
| 参数 | 说明 | 本配置 |
|---|---|---|
--spec-type draft-mtp | 使用模型内置 MTP 头作为草稿模型 | draft-mtp |
--spec-draft-n-max 2 | 每次推测最多生成 2 个 token | 2 |
-ctkd q8_0 | 草稿模型 K 缓存量化 | q8_0 |
-ctvd q8_0 | 草稿模型 V 缓存量化 | q8_0 |
Qwen3.6-27B 内置 MTP(Multi-Token Prediction)头,无需额外草稿模型文件。--spec-draft-n-max 2 表示每次推测 2 个未来 token,实测接受率良好。
Batch 与内存
| 参数 | 说明 | 本配置 |
|---|---|---|
-ub 4096 | Prompt 处理 micro-batch size | 4096 |
-b 2048 | 最大 batch size | 2048 |
--no-mmap | 禁用内存映射文件,直接加载到内存 | 启用 |
-ub 4096 加大 prompt 处理批次,加速长 prompt 的首 token 生成。--no-mmap 避免系统内存映射带来的额外开销,在统一内存架构(UMA)上效果明显。
3. 显存预算
256K 上下文显存计算
| 项目 | 大小 |
|---|---|
| 模型权重 (Q4_K_XL) | ~17 GB |
| KV 缓存 (256K, q8_0) | ~16 GB |
| 运行时开销 | ~2 GB |
| 总计 | ~35 GB |
96 GB 显存跑 256K 上下文仍有大量富余,这也是能保持 22 token/s 高速的关键。
KV 缓存大小参考
| 上下文 | q8_0 KV 大小 | 说明 |
|---|---|---|
| 8K | ~0.5 GB | 普通对话 |
| 32K | ~2 GB | 长文档 |
| 128K | ~8 GB | 超长上下文 |
| 256K | ~16 GB | 模型最大上下文 |
4. API 调用
curl -s http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-testing" \
-d '{
"messages": [{"role": "user", "content": "你好"}],
"max_tokens": 100
}'
5. 性能对比
| 配置 | 速度 | 上下文 | 说明 |
|---|---|---|---|
| 本文配置 | 22 tok/s | 256K | Q4_K_XL + MTP + Q8_0 KV |
| Hy3 IQ1_M + MTP | ~20 tok/s | 80K | 86 GB 模型,显存更紧张 |
| Ternary-Bonsai-27B 单模型 | ~20-30 tok/s | 128K | 7.2 GB 三值化模型 |
Qwen3.6-27B 的 Q4_K_XL 量化在质量与速度之间取得了很好的平衡,配合 MTP 推测解码和 Q8_0 KV 缓存,在 256K 满上下文下仍能保持 22 token/s。
6. 注意事项
- AMD RX 395 兼容性:KV 缓存推荐使用
q8_0,避免iq4_nl(兼容性不佳) --no-mmap:在统一内存架构(UMA)上建议开启,减少内存映射开销-ub 4096:较大的 micro-batch 加速 prompt 处理,但会占用更多显存- MTP
--spec-draft-n-max 2:Qwen3.6 的 MTP 头设计为预测 2 个 token,不建议设更大 - 首次请求较慢:模型预热 + 编译缓存,后续请求提速