Qwen3-VL技术报告
·
1.不再直接把ViT最后一层特征给LLM,而是参考DeepStack,从ViT的三个不同中间层抽特征,再分别经过 merger,加入 LLM 前三个对应层的 hidden states
2.仍采用先练merger,再全参数练多模态
3.在后训练加入更多Agent任务和空间理解任务
4.Qwen2.5-VL用的是MRoPE,在temporal、horizontal、vertical三维(t、h、v)进行旋转,但把它们分配到连续的 embedding chunks(TTTT HHHH WWWW),会让三个坐标轴覆盖的旋转频率不平衡,可能会出现一个轴可能偏低频,一个轴偏中频,一个轴偏高频,会损伤长视频能力和局部细节能力
因此Interleaved MRoPE把t、h、v交叉着分配(T H W T H W T H W T H W ...)
5.视频时间戳训练同时混合 seconds(新加入) 和 HH:MM:SS,让模型学会对齐second和HH:MM:SS的关系(65 sec≈00:01:05),真实世界的timecode本来就常用这两种方式表达;另外,这样的混合方式相当于一种轻度的数据增强,强迫模型去学更好的时间语义
更多推荐


所有评论(0)