EGM-Qwen3-VL-8B震撼发布:小模型如何超越2350亿参数量大模型的视觉定位革命
EGM-Qwen3-VL-8B震撼发布:小模型如何超越2350亿参数量大模型的视觉定位革命
【免费下载链接】EGM-8B 项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-8B
EGM-Qwen3-VL-8B是Efficient Visual Grounding Language Models(高效视觉定位语言模型)家族的旗舰模型,它基于Qwen3-VL-8B-Thinking构建,通过两阶段训练 pipeline(监督微调SFT+强化学习GRPO)实现了突破性的视觉定位能力。这款仅80亿参数的小模型在多项视觉定位任务中超越了2350亿参数量的大模型,同时保持更快的推理速度,为视觉定位领域带来革命性突破。
🌟 核心优势:小模型的逆袭之路
🔍 超越大模型的定位精度
在RefCOCO基准测试中,EGM-Qwen3-VL-8B取得了91.4的平均IoU得分,不仅比基础模型Qwen3-VL-8B-Thinking提升了3.6个百分点,更超越了2350亿参数的Qwen3-VL-235B系列模型(88.2-90.7 IoU)。这一结果证明,通过优化训练方法而非单纯增加参数量,小模型完全可以在特定任务上实现对大模型的超越。
⚡ 5.9倍极速推理
尽管精度提升,EGM-Qwen3-VL-8B的推理速度却大幅领先:
- 比Qwen3-VL-235B快5.9倍(平均延迟737ms vs 4,320ms)
- 比Qwen3-VL-235B-Thinking快18.9倍 这种"高精度+高速度"的双重优势,使其在实际应用中更具部署价值。
📊 RefCOCO基准测试结果对比
| 模型 | RefCOCO val | RefCOCO test-A | RefCOCO test-B | 平均IoU |
|---|---|---|---|---|
| Qwen3-VL-8B-Thinking | 91.0 | 92.5 | 86.6 | 87.8 |
| EGM-Qwen3-VL-8B | 93.9 | 95.6 | 91.2 | 91.4 |
| Qwen3-VL-235B-A22B-Instruct | 90.4 | 94.6 | 82.2 | 88.2 |
| Qwen3-VL-235B-A22B-Thinking | 93.4 | 94.1 | 90.6 | 90.7 |
🧠 创新技术:EGM的工作原理
不同规模的视觉语言模型(VLM)通常共享相同的视觉编码器,小模型性能落后的主要原因在于文本理解能力的差距——62.8%的小模型错误源于对包含多重关系描述的复杂提示的理解不足。EGM通过生成大量中等质量的token(来自小模型),成功匹配了大模型生成少量高价值token的性能。
🔄 两阶段训练Pipeline
-
SFT阶段:使用专有VLM为视觉定位训练数据生成详细的思维链推理步骤,基础模型在此数据上进行微调。SFT checkpoint可通过nvidia/EGM-8B-SFT获取。
-
RL阶段:应用GRPO(Group Relative Policy Optimization)强化学习算法,结合IoU和任务成功指标的奖励函数,进一步提升定位精度。
🚀 快速开始:3步上手EGM-Qwen3-VL-8B
1️⃣ 模型下载
pip install -U huggingface_hub
huggingface-cli download nvidia/EGM-8B --local-dir ./models/EGM-8B
2️⃣ 使用SGLang启动服务
pip install "sglang[all]>=0.5.5"
python -m sglang.launch_server \
--model-path nvidia/EGM-8B \
--chat-template=qwen3-vl \
--port 30000
3️⃣ 发送视觉定位请求
import openai
import base64
client = openai.Client(base_url="http://127.0.0.1:30000/v1", api_key="EMPTY")
# 加载本地图片为base64格式
with open("example.jpg", "rb") as f:
image_base64 = base64.b64encode(f.read()).decode("utf-8")
response = client.chat.completions.create(
model="nvidia/EGM-8B",
messages=[
{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{image_base64}"}},
{"type": "text", "text": "请提供这句话描述的区域的边界框坐标:左边的人。"},
],
}
],
temperature=0.6,
top_p=0.95,
max_tokens=8192,
)
print(response.choices[0].message.content)
📈 模型架构解析
EGM-Qwen3-VL-8B的架构平衡了视觉与语言能力,关键参数如下:
| 组件 | 详细信息 |
|---|---|
| 架构 | Qwen3VLForConditionalGeneration |
| 文本隐藏层大小 | 4096 |
| 文本层数 | 36 |
| 注意力头数 | 32(8个KV头) |
| 视觉隐藏层大小 | 1152 |
| 视觉层数 | 27 |
| 补丁大小 | 16 x 16 |
| 最大位置嵌入 | 262,144 |
| 词汇表大小 | 151,936 |
📚 相关资源
- 项目主页:NVLabs EGM项目页
- 代码仓库:GitHub仓库
- 模型权重:通过Hugging Face Hub获取nvidia/EGM-8B
- 配置文件:config.json包含完整模型架构参数
📝 引用
如果您在研究中使用了EGM-Qwen3-VL-8B,请引用以下论文:
@article{zhan2026EGM,
author = {Zhan, Guanqi and Li, Changye and Liu, Zhijian and Lu, Yao and Wu, Yi and Han, Song and Zhu, Ligeng},
title = {EGM: Efficient Visual Grounding Language Models},
booktitle = {arXiv},
year = {2026}
}
EGM-Qwen3-VL-8B的出现证明了通过创新训练方法和架构优化,小模型完全可以在特定任务上实现对大模型的超越。无论是学术研究还是工业应用,这款高效视觉定位模型都为开发者提供了强大而经济的选择,推动视觉语言模型向更高效、更精准的方向发展。
【免费下载链接】EGM-8B 项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-8B
更多推荐

所有评论(0)