用站内的美食+风景图片微调Qwen3-VL-2B-Embedding模型,

DINO是纯拉开单图的距离,训了。

如果有每个图所在的POI(店铺/景点)text信息,纯图对比学习,把这些POI信息融入:(实现了跨卡对比学习)

输入:图片A
batch内正例:图片A的augment图
batch内负例:其他POI的图

其中,其他POI = 图片所在POI的其他POI,
为提升负例难度,将相似的其他POI作为负例:把 POI类目 相同的POI聚到一个batch里。

尝试了image2text生成式训练 然后取图片emb。

尝试了图文CLIP训练。

尝试了卡相似度阈值卡正负例:就是推理好的Base模型的embedding,在训练时算两两相似度,给正负例卡阈值分数。

尝试了用Qwen3.5多模态模型写提示词 推理选出高质量的站内图,训练。

都没能明显超越Base模型。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐