跳到正文
原文
Hugging Face Blog·· 2026-04-16精选AI 评分60

Sentence Transformers 多模态嵌入与重排序模型微调教程

Training and Finetuning Multimodal Embedding & Reranker Models with Sentence Transformers

AI 导读

Sentence Transformers 库支持对处理文本、图像、音频和视频的多模态嵌入及重排序模型进行训练或微调。以 Qwen3-VL-Embedding-2B 为例,通过 Visual Document Retrieval 数据集微调后,NDCG@10 从 0.888 提升至 0.947,性能超越参数量大其 4 倍的现有模型。

推荐理由

原文提供了微调多模态嵌入模型的具体代码和Matryoshka训练策略,读者可据此复现视觉文档检索任务并优化部署效率。

来源:Hugging Face Blog · huggingface.co