EGM-Qwen3-VL-8B震撼发布:小模型如何超越2350亿参数量大模型的视觉定位革命

【免费下载链接】EGM-8B 【免费下载链接】EGM-8B 项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-8B

EGM-Qwen3-VL-8B是Efficient Visual Grounding Language Models(高效视觉定位语言模型)家族的旗舰模型,它基于Qwen3-VL-8B-Thinking构建,通过两阶段训练 pipeline(监督微调SFT+强化学习GRPO)实现了突破性的视觉定位能力。这款仅80亿参数的小模型在多项视觉定位任务中超越了2350亿参数量的大模型,同时保持更快的推理速度,为视觉定位领域带来革命性突破。

🌟 核心优势:小模型的逆袭之路

🔍 超越大模型的定位精度

在RefCOCO基准测试中,EGM-Qwen3-VL-8B取得了91.4的平均IoU得分,不仅比基础模型Qwen3-VL-8B-Thinking提升了3.6个百分点,更超越了2350亿参数的Qwen3-VL-235B系列模型(88.2-90.7 IoU)。这一结果证明,通过优化训练方法而非单纯增加参数量,小模型完全可以在特定任务上实现对大模型的超越。

⚡ 5.9倍极速推理

尽管精度提升,EGM-Qwen3-VL-8B的推理速度却大幅领先:

  • 比Qwen3-VL-235B快5.9倍(平均延迟737ms vs 4,320ms)
  • 比Qwen3-VL-235B-Thinking快18.9倍 这种"高精度+高速度"的双重优势,使其在实际应用中更具部署价值。

📊 RefCOCO基准测试结果对比

模型 RefCOCO val RefCOCO test-A RefCOCO test-B 平均IoU
Qwen3-VL-8B-Thinking 91.0 92.5 86.6 87.8
EGM-Qwen3-VL-8B 93.9 95.6 91.2 91.4
Qwen3-VL-235B-A22B-Instruct 90.4 94.6 82.2 88.2
Qwen3-VL-235B-A22B-Thinking 93.4 94.1 90.6 90.7

🧠 创新技术:EGM的工作原理

不同规模的视觉语言模型(VLM)通常共享相同的视觉编码器,小模型性能落后的主要原因在于文本理解能力的差距——62.8%的小模型错误源于对包含多重关系描述的复杂提示的理解不足。EGM通过生成大量中等质量的token(来自小模型),成功匹配了大模型生成少量高价值token的性能。

🔄 两阶段训练Pipeline

  1. SFT阶段:使用专有VLM为视觉定位训练数据生成详细的思维链推理步骤,基础模型在此数据上进行微调。SFT checkpoint可通过nvidia/EGM-8B-SFT获取。

  2. RL阶段:应用GRPO(Group Relative Policy Optimization)强化学习算法,结合IoU和任务成功指标的奖励函数,进一步提升定位精度。

🚀 快速开始:3步上手EGM-Qwen3-VL-8B

1️⃣ 模型下载

pip install -U huggingface_hub
huggingface-cli download nvidia/EGM-8B --local-dir ./models/EGM-8B

2️⃣ 使用SGLang启动服务

pip install "sglang[all]>=0.5.5"

python -m sglang.launch_server \
    --model-path nvidia/EGM-8B \
    --chat-template=qwen3-vl \
    --port 30000

3️⃣ 发送视觉定位请求

import openai
import base64

client = openai.Client(base_url="http://127.0.0.1:30000/v1", api_key="EMPTY")

# 加载本地图片为base64格式
with open("example.jpg", "rb") as f:
    image_base64 = base64.b64encode(f.read()).decode("utf-8")

response = client.chat.completions.create(
    model="nvidia/EGM-8B",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{image_base64}"}},
                {"type": "text", "text": "请提供这句话描述的区域的边界框坐标:左边的人。"},
            ],
        }
    ],
    temperature=0.6,
    top_p=0.95,
    max_tokens=8192,
)
print(response.choices[0].message.content)

📈 模型架构解析

EGM-Qwen3-VL-8B的架构平衡了视觉与语言能力,关键参数如下:

组件 详细信息
架构 Qwen3VLForConditionalGeneration
文本隐藏层大小 4096
文本层数 36
注意力头数 32(8个KV头)
视觉隐藏层大小 1152
视觉层数 27
补丁大小 16 x 16
最大位置嵌入 262,144
词汇表大小 151,936

📚 相关资源

📝 引用

如果您在研究中使用了EGM-Qwen3-VL-8B,请引用以下论文:

@article{zhan2026EGM,
    author = {Zhan, Guanqi and Li, Changye and Liu, Zhijian and Lu, Yao and Wu, Yi and Han, Song and Zhu, Ligeng},
    title = {EGM: Efficient Visual Grounding Language Models},
    booktitle = {arXiv},
    year = {2026}
}

EGM-Qwen3-VL-8B的出现证明了通过创新训练方法和架构优化,小模型完全可以在特定任务上实现对大模型的超越。无论是学术研究还是工业应用,这款高效视觉定位模型都为开发者提供了强大而经济的选择,推动视觉语言模型向更高效、更精准的方向发展。

【免费下载链接】EGM-8B 【免费下载链接】EGM-8B 项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-8B

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐