从Kimi-K2.6到NVFP4:AMD量化工作流程的完整解析

【免费下载链接】Kimi-K2.6-NVFP4 【免费下载链接】Kimi-K2.6-NVFP4 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Kimi-K2.6-NVFP4

HuggingFace镜像 / amd / Kimi-K2.6-NVFP4项目是基于Kimi-K2.6模型,通过AMD-Quark工具进行NVFP4量化得到的优化模型。该模型能在保持较高性能的同时,有效降低资源占用,为AI应用部署提供了更高效的解决方案。

模型概览 📋

Kimi-K2.6-NVFP4模型在多个方面展现出独特的特性:

  • 模型架构:基于Kimi-K2.6,支持文本、图像、视频输入,输出为文本
  • 硬件支持:适用于AMD MI300/MI350/MI355(支持模拟)
  • 软件依赖:ROCm 7.2.2、PyTorch 2.10.0、Transformers 5.2.0,运行于Linux系统
  • 推理与优化:采用vLLM作为推理引擎,借助AMD-Quark(V0.12)进行模型优化

NVFP4量化技术解析 🔍

NVFP4量化是该项目的核心技术,它通过对模型的权重和激活进行特定方式的量化,实现模型的高效部署。

  • 量化层:主要对expertsshared_experts层进行量化
  • 权重量化:采用NVFP4静态量化方式
  • 激活量化:运用NVFP4动态量化方式

该模型由moonshotai/Kimi-K2.6通过AMD-Quark量化而来,将权重和激活都量化为NVFP4格式。

量化步骤指南 📝

以下是使用AMD-Quark进行NVFP4量化的脚本:

cd Quark/examples/torch/language_modeling/llm_ptq/
export output_dir=amd/Kimi-K2.6-NVFP4
exclude_layers="*self_attn* *mlp.gate *mlp.gate.linear *lm_head *mlp.gate_proj *mlp.up_proj *mlp.down_proj *mm_projector* *vision_tower*"
python3 quantize_quark.py --model_dir $MODEL_DIR \
                          --quant_scheme nvfp4 \
                          --num_calib_data 128 \
                          --exclude_layers $exclude_layers \
                          --model_export hf_format \
                          --output_dir $output_dir \
                          --trust_remote_code \
                          --multi_gpu balanced

模型部署方法 🚀

使用vLLM部署

该模型可通过vLLM后端高效部署,启动服务器的命令如下:

export VLLM_ROCM_USE_AITER=1
vllm serve amd/Kimi-K2.6-NVFP4 -tp 8 \
  --mm-encoder-tp-mode data \
  --tool-call-parser kimi_k2 \
  --reasoning-parser kimi_k2 \
  --enforce-eager \
  --trust-remote-code

模型评估结果 📊

模型在GSM8K和MMLU_PRO基准测试中进行了评估,结果如下:

基准测试 Kimi-K2.6 Kimi-K2.6-NVFP4(this model) 恢复率
GSM8K (flexible-extract) 93.93 93.48 99.52%
MMLU_PRO (exact-extract) 81.43 79.21 97.27%

评估复现方法

GSM8K和MMLU_PRO的结果是使用lm-evaluation-harness框架,基于Docker镜像rocm/vllm-dev:nightly_main_20260603获得的。

首先在容器中安装lm-eval(版本:0.4.12):

pip install lm-eval[api]

在新终端中评估模型:

lm_eval \
  --model local-completions \
  --model_args "model=amd/Kimi-K2.6-NVFP4,kv_cache_dtype=fp8,base_url=http://0.0.0.0:8000/v1/completions,tokenized_requests=False,tokenizer_backend=None,num_concurrent=32" \
  --tasks gsm8k \
  --num_fewshot 5 \
  --batch_size 1
lm_eval \
  --model local-completions \
  --model_args "model=amd/Kimi-K2.6-NVFP4,kv_cache_dtype=fp8,base_url=http://0.0.0.0:8000/v1/completions,tokenized_requests=False,tokenizer_backend=None,num_concurrent=32,max_length=16384,timeout=14400" \
  --tasks mmlu_pro \
  --gen_kwargs "do_sample=True,temperature=1.0,top_p=0.95,max_tokens=4096,max_gen_toks=4096" \
  --batch_size auto \
  --limit 100

快速开始使用 🌟

要开始使用Kimi-K2.6-NVFP4模型,首先克隆仓库:

git clone https://gitcode.com/hf_mirrors/amd/Kimi-K2.6-NVFP4

然后按照上述量化和部署步骤操作,即可体验经过NVFP4量化优化的Kimi-K2.6模型。

许可证信息 ⚖️

Modifications Copyright(c) 2026 Advanced Micro Devices, Inc. All rights reserved. 详细许可证信息请查看LICENSE文件。

【免费下载链接】Kimi-K2.6-NVFP4 【免费下载链接】Kimi-K2.6-NVFP4 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Kimi-K2.6-NVFP4

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐