MTEB, embedding modellerinin farklı yeteneklerini ölçmek için çeşitli görev kategorileri tanımlar. Her görev türü, gerçek dünya uygulamalarındaki farklı bir kullanım senaryosunu yansıtır.
Verilen bir sorgu için büyük bir doküman havuzundan en ilgili dokümanları getirme görevidir. Embedding modellerinin en kritik test alanıdır çünkü RAG pipeline'larının kalbi burasıdır.
İki cümle veya metin parçası arasındaki anlamsal benzerliğin derecesini ölçme görevidir. Tipik olarak 0-5 arası bir benzerlik skoru ile etiketlenmiş cümle çiftleri üzerinde değerlendirilir.
Embedding vektörlerinin bir sınıflandırma görevinde ne kadar ayırt edici özellikler taşıdığını ölçer. Tipik olarak embedding vektörleri üzerine basit bir lojistik regresyon eğitilerek doğruluk ölçülür.
Embedding'lerin benzer metinleri doğal gruplar halinde ne kadar iyi ayırabildiğini test eder.
İki metin arasındaki ilişkinin türünü belirleme görevidir: paraphrase mi, çelişki mi, bağımsız mı?
İlk aşamada getirilen (retrieved) bir aday listesinin, daha hassas bir modelle yeniden sıralanması görevidir. Retrieval pipeline'larının ikinci aşamasını simüle eder
.Yaklaşım: Sorgu ve her bir aday doküman çifti için benzerlik hesaplanır ve adaylar yeniden sıralanır.
Veri Setleri: AskUbuntuDupQuestions, MindSmallReranking, SciDocsRR, StackOverflowDupQuestions.
Bir metnin ve o metnin özetinin embedding uzayında ne kadar yakın olduğunu değerlendirir. İyi bir embedding modeli, bir doküman ile onun özeti için birbirine yakın vektörler üretmelidir.
Farklı dillerdeki çeviri çiftlerini eşleştirme görevidir. Çok dilli (multilingual) embedding modellerinin diller arası hizalama yeteneğini ölçer.
Standart retrieval görevinin talimat (instruction) ile genişletilmiş halidir. Modelden yalnızca ilgili dokümanları getirmesi değil, belirli bir perspektif veya kısıtlama altında getirmesi beklenir. Örneğin: "Bu konuyla ilgili sadece eleştirel bakış açısı içeren dokümanları getir."
Bu görev, instruction-tuned embedding modellerinin gerçek dünya senaryolarındaki esnekliğini test eder.