图片embedding微调记录
·
用站内的美食+风景图片微调Qwen3-VL-2B-Embedding模型,
DINO是纯拉开单图的距离,训了。
如果有每个图所在的POI(店铺/景点)text信息,纯图对比学习,把这些POI信息融入:(实现了跨卡对比学习)
输入:图片A
batch内正例:图片A的augment图
batch内负例:其他POI的图
其中,其他POI = 图片所在POI的其他POI,
为提升负例难度,将相似的其他POI作为负例:把 POI类目 相同的POI聚到一个batch里。
尝试了image2text生成式训练 然后取图片emb。
尝试了图文CLIP训练。
尝试了卡相似度阈值卡正负例:就是推理好的Base模型的embedding,在训练时算两两相似度,给正负例卡阈值分数。
尝试了用Qwen3.5多模态模型写提示词 推理选出高质量的站内图,训练。
都没能明显超越Base模型。
更多推荐

所有评论(0)