1.不再直接把ViT最后一层特征给LLM,而是参考DeepStack,从ViT的三个不同中间层抽特征,再分别经过 merger,加入 LLM 前三个对应层的 hidden states

2.仍采用先练merger,再全参数练多模态

3.在后训练加入更多Agent任务和空间理解任务

4.Qwen2.5-VL用的是MRoPE,在temporal、horizontal、vertical三维(t、h、v)进行旋转,但把它们分配到连续的 embedding chunks(TTTT HHHH WWWW),会让三个坐标轴覆盖的旋转频率不平衡,可能会出现一个轴可能偏低频,一个轴偏中频,一个轴偏高频,会损伤长视频能力和局部细节能力

因此Interleaved MRoPE把t、h、v交叉着分配(T H W T H W T H W T H W ...)

5.视频时间戳训练同时混合 seconds(新加入) 和 HH:MM:SS,让模型学会对齐second和HH:MM:SS的关系(65 sec≈00:01:05),真实世界的timecode本来就常用这两种方式表达;另外,这样的混合方式相当于一种轻度的数据增强,强迫模型去学更好的时间语义

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐