从Kimi-K2.6到NVFP4:AMD量化工作流程的完整解析
从Kimi-K2.6到NVFP4:AMD量化工作流程的完整解析
【免费下载链接】Kimi-K2.6-NVFP4 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Kimi-K2.6-NVFP4
HuggingFace镜像 / amd / Kimi-K2.6-NVFP4项目是基于Kimi-K2.6模型,通过AMD-Quark工具进行NVFP4量化得到的优化模型。该模型能在保持较高性能的同时,有效降低资源占用,为AI应用部署提供了更高效的解决方案。
模型概览 📋
Kimi-K2.6-NVFP4模型在多个方面展现出独特的特性:
- 模型架构:基于Kimi-K2.6,支持文本、图像、视频输入,输出为文本
- 硬件支持:适用于AMD MI300/MI350/MI355(支持模拟)
- 软件依赖:ROCm 7.2.2、PyTorch 2.10.0、Transformers 5.2.0,运行于Linux系统
- 推理与优化:采用vLLM作为推理引擎,借助AMD-Quark(V0.12)进行模型优化
NVFP4量化技术解析 🔍
NVFP4量化是该项目的核心技术,它通过对模型的权重和激活进行特定方式的量化,实现模型的高效部署。
- 量化层:主要对
experts和shared_experts层进行量化 - 权重量化:采用NVFP4静态量化方式
- 激活量化:运用NVFP4动态量化方式
该模型由moonshotai/Kimi-K2.6通过AMD-Quark量化而来,将权重和激活都量化为NVFP4格式。
量化步骤指南 📝
以下是使用AMD-Quark进行NVFP4量化的脚本:
cd Quark/examples/torch/language_modeling/llm_ptq/
export output_dir=amd/Kimi-K2.6-NVFP4
exclude_layers="*self_attn* *mlp.gate *mlp.gate.linear *lm_head *mlp.gate_proj *mlp.up_proj *mlp.down_proj *mm_projector* *vision_tower*"
python3 quantize_quark.py --model_dir $MODEL_DIR \
--quant_scheme nvfp4 \
--num_calib_data 128 \
--exclude_layers $exclude_layers \
--model_export hf_format \
--output_dir $output_dir \
--trust_remote_code \
--multi_gpu balanced
模型部署方法 🚀
使用vLLM部署
该模型可通过vLLM后端高效部署,启动服务器的命令如下:
export VLLM_ROCM_USE_AITER=1
vllm serve amd/Kimi-K2.6-NVFP4 -tp 8 \
--mm-encoder-tp-mode data \
--tool-call-parser kimi_k2 \
--reasoning-parser kimi_k2 \
--enforce-eager \
--trust-remote-code
模型评估结果 📊
模型在GSM8K和MMLU_PRO基准测试中进行了评估,结果如下:
| 基准测试 | Kimi-K2.6 | Kimi-K2.6-NVFP4(this model) | 恢复率 |
|---|---|---|---|
| GSM8K (flexible-extract) | 93.93 | 93.48 | 99.52% |
| MMLU_PRO (exact-extract) | 81.43 | 79.21 | 97.27% |
评估复现方法
GSM8K和MMLU_PRO的结果是使用lm-evaluation-harness框架,基于Docker镜像rocm/vllm-dev:nightly_main_20260603获得的。
首先在容器中安装lm-eval(版本:0.4.12):
pip install lm-eval[api]
在新终端中评估模型:
lm_eval \
--model local-completions \
--model_args "model=amd/Kimi-K2.6-NVFP4,kv_cache_dtype=fp8,base_url=http://0.0.0.0:8000/v1/completions,tokenized_requests=False,tokenizer_backend=None,num_concurrent=32" \
--tasks gsm8k \
--num_fewshot 5 \
--batch_size 1
lm_eval \
--model local-completions \
--model_args "model=amd/Kimi-K2.6-NVFP4,kv_cache_dtype=fp8,base_url=http://0.0.0.0:8000/v1/completions,tokenized_requests=False,tokenizer_backend=None,num_concurrent=32,max_length=16384,timeout=14400" \
--tasks mmlu_pro \
--gen_kwargs "do_sample=True,temperature=1.0,top_p=0.95,max_tokens=4096,max_gen_toks=4096" \
--batch_size auto \
--limit 100
快速开始使用 🌟
要开始使用Kimi-K2.6-NVFP4模型,首先克隆仓库:
git clone https://gitcode.com/hf_mirrors/amd/Kimi-K2.6-NVFP4
然后按照上述量化和部署步骤操作,即可体验经过NVFP4量化优化的Kimi-K2.6模型。
许可证信息 ⚖️
Modifications Copyright(c) 2026 Advanced Micro Devices, Inc. All rights reserved. 详细许可证信息请查看LICENSE文件。
【免费下载链接】Kimi-K2.6-NVFP4 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Kimi-K2.6-NVFP4
更多推荐

所有评论(0)