← Back to the wire

Training and Finetuning Multi-Vector Embedding Models with Sentence Transformers

AchievementResearchAug 26, 2026

A MultiVectorEncoder model finetuned for 14.5 hours on a single RTX 3090, released as multi-vector-encoder/mLateOn-medical, outperformed general-purpose dense, sparse, lexical, and multi-vector retrieval models on a medical evaluation, according to the article. The post introduces MultiVectorEncoder in sentence-transformers for ColBERT-style late interaction retrieval, covering models, datasets, losses, training arguments, evaluators, and trainers. It also reports truncation in released checkpoints cost up to 0.24 NDCG@10 on passages averaging 941 tokens.

Receipt № 15761 source · awaiting confirmation ◐

Evidence

1source· awaiting independent confirmation

No score is assigned. Sources and their independence are shown in the citation chain below.

Citation chain · 1 source

MultiVectorEncoderModelColBERTModelsentence-transformersModelmulti-vector-encoder/mLateOn-medicalModel
Canonical: https://huggingface.co/blog/train-multi-vector-encoder