Add MTEB(slk, v1) results for Qwen/Qwen3-Embedding-4B - #687
Conversation
…ing and NTREXBitextMining tasks with updated dataset revisions (all languages)
|
Note: I wasn't sure how to deal with the |
Model Results ComparisonReference models: Results for
|
| task_name | Qwen/Qwen3-Embedding-4B | google/gemini-embedding-001 | intfloat/multilingual-e5-large | Max result | Model with max result | In Training Data |
|---|---|---|---|---|---|---|
| BelebeleRetrieval | .805 | .907 | .779 | .985 | sionic-ai/comsat-embed-ko-8b-preview | False |
| DemagogSKNLI | .870 | nan | .844 | .896 | intfloat/multilingual-e5-large-instruct | False |
| FloresBitextMining | .740 | .837 | .811 | .982 | google/gemini-embedding-2-preview | False |
| MultiEupSlovakGenderClassification | .752 | nan | .611 | .628 | intfloat/multilingual-e5-large-instruct | False |
| MultiEupSlovakPartyClassification | .460 | nan | .479 | .498 | nomic-ai/nomic-embed-text-v2-moe | False |
| MultilingualSentimentClassification | .775 | nan | .890 | .897 | Snowflake/snowflake-arctic-embed-l-v2.0 | False |
| NTREXBitextMining | .876 | .936 | .914 | .988 | google/gemini-embedding-2-preview | False |
| OpusSlovakEnglishBitextMining | .841 | nan | .862 | .891 | sentence-transformers/LaBSE | False |
| PravdaSKTagClustering | .499 | nan | .612 | .614 | intfloat/multilingual-e5-base | False |
| PravdaSKURLClustering | .611 | nan | .532 | .604 | intfloat/multilingual-e5-large-instruct | False |
| SIB200Classification | .823 | nan | .730 | .969 | codefuse-ai/F2LLM-v2-8B | False |
| SKQuadRetrieval | .648 | nan | .702 | .710 | nomic-ai/nomic-embed-text-v2-moe | False |
| SMESumCategoryClustering | .468 | nan | .275 | .442 | intfloat/multilingual-e5-large-instruct | False |
| SMESumRetrieval | .848 | nan | .859 | .883 | jinaai/jina-embeddings-v3 | False |
| SkQuadReranking | .648 | nan | .728 | .728 | intfloat/multilingual-e5-large | False |
| SlovakHateSpeechClassification.v2 | .597 | nan | .571 | .599 | intfloat/multilingual-e5-large-instruct | False |
| SlovakMovieReviewSentimentClassification.v2 | .833 | nan | .707 | .862 | intfloat/multilingual-e5-large-instruct | False |
| SlovakNLI | .842 | nan | .773 | .842 | intfloat/multilingual-e5-large-instruct | False |
| SlovakParlaSentClassification | .717 | nan | .559 | .588 | sentence-transformers/paraphrase-multilingual-mpnet-base-v2 | False |
| SlovakPharmacyDrMaxReranking | .932 | nan | .937 | .946 | jinaai/jina-embeddings-v3 | False |
| SlovakPharmacyMojaLekarenReranking | .967 | nan | .974 | .974 | intfloat/multilingual-e5-large | False |
| SlovakSTS | .863 | nan | .798 | .858 | jinaai/jina-embeddings-v3 | False |
| SlovakSumRetrieval | .918 | nan | .930 | .939 | jinaai/jina-embeddings-v3 | False |
| SlovakSumSTS | .925 | nan | .920 | .943 | intfloat/multilingual-e5-large-instruct | False |
| SlovakSumURLClustering | .298 | nan | .200 | .309 | intfloat/multilingual-e5-large-instruct | False |
| WebFAQBitextMiningQAs | .991 | nan | .991 | .999 | Snowflake/snowflake-arctic-embed-l-v2.0 | False |
| WebFAQBitextMiningQuestions | .986 | nan | .975 | .992 | Snowflake/snowflake-arctic-embed-l-v2.0 | False |
| WebFAQRetrieval | .780 | nan | .797 | .865 | codefuse-ai/F2LLM-v2-14B | False |
| Average | .761 | .894 | .741 | .801 | nan | - |
Model have high performance on these tasks: SlovakSTS,MultiEupSlovakGenderClassification,PravdaSKURLClustering,SlovakParlaSentClassification,SMESumCategoryClustering
|
@andrejridzik can I ask you to also submit the |
@KennethEnevoldsen As I mentioned in the description, dataset revision has changed for three tasks, so slightly different scores were expected. We can see it in the failing tests on NTREXBitextMining, BelebeleRetrieval and FloresBitextMining. I have just modified the batch size, but rest should be standard. All three look similar to this: |
Results for Qwen/Qwen3-Embedding-4B on MTEB(slk, v1)
This includes: