kangnlp

논문 리뷰

논문 리뷰: Qwen3 Embedding — Advancing Text Embedding and Reranking Through Foundation Models

25분 읽기

Qwen3 Embedding 리뷰

Qwen3 파운데이션 모델 위에 다단계 학습 파이프라인과 대규모 합성 데이터, 모델 머징을 결합하여 텍스트 임베딩과 리랭킹 모두에서 SOTA를 달성한 오픈소스 모델 시리즈.

논문 정보

항목내용
제목Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models
저자Yanzhao Zhang*, Mingxin Li*, Dingkun Long*, Xin Zhang* 외 (Tongyi Lab, Alibaba Group)
학회/저널arXiv Technical Report, 2025년 6월
논문 링크arXiv:2506.05176
코드github.com/QwenLM/Qwen3-Embedding

1. 들어가며

RAG, 에이전트 시스템이 본격적으로 실용화되면서, 텍스트 임베딩과 리랭킹 모델의 품질이 전체 시스템의 병목이 되는 경우가 많아졌다. 검색 품질이 떨어지면 아무리 좋은 LLM을 갖다 붙여도 환각(hallucination)을 피하기 어렵기 때문이다. 그래서 최근 OpenAI의 text-embedding-3, Google의 Gemini Embedding, Cohere의 embed-v3 등 상용 API들이 임베딩 성능 경쟁을 벌이고 있고, 오픈소스 진영에서도 GTE, E5, BGE 시리즈가 꾸준히 발전해왔다.

Alibaba의 Tongyi Lab이 내놓은 Qwen3 Embedding 시리즈는 이 경쟁 구도에서 오픈소스 모델로서 상용 API를 넘어서는 성능을 보여준다. 0.6B, 4B, 8B 세 가지 사이즈의 임베딩 모델과 리랭킹 모델을 동시에 제공하며, MTEB Multilingual 벤치마크에서 Gemini Embedding을 제치고 1위를 차지했다. Apache 2.0 라이선스로 공개된 만큼 상업적 활용도 가능하다는 점에서 실무적 가치가 크다.

이 논문은 Qwen3 파운데이션 모델을 백본으로 삼아 임베딩과 리랭킹 모델을 어떻게 효과적으로 학습시켰는지를 상세히 기술한 테크니컬 리포트다. 합성 데이터 생성 전략, 다단계 학습 파이프라인, 모델 머징(model merging)이라는 세 축이 성능의 열쇠인데, 각각의 설계 동기와 효과를 Ablation으로 검증한 점이 인상적이다.


2. 기존 연구의 한계

2.1 인코더 기반 임베딩 모델의 한계

LLM 이전 시대에는 BERT 같은 인코더 전용(encoder-only) 모델이 텍스트 임베딩의 표준이었다(Reimers & Gurevych, 2019). Sentence-BERT로 대표되는 이 계열은 모델 크기와 사전학습 데이터의 한계로 인해 다국어, 장문서, 코드 검색 같은 복잡한 시나리오에서 성능이 부족했다. 특히 250개 이상 언어를 아우르는 다국어 환경에서는 저자원(low-resource) 언어에 대한 커버리지가 떨어지는 문제가 있었다.

2.2 LLM 기반 임베딩의 발전과 남은 과제

LLM이 등장하면서 더 풍부한 세계 지식과 텍스트 이해 능력을 임베딩에 활용할 수 있게 되었다. GTE(Li et al., 2023), E5(Wang et al., 2022), BGE(Xiao et al., 2024) 시리즈가 대표적이다. 또한 instruction-aware 학습(Su et al., 2023)이나 LLM을 활용한 학습 데이터 합성(Wang et al., 2024; Lee et al., 2025b) 같은 새로운 패러다임도 등장했다.

그러나 여전히 몇 가지 과제가 남아 있었다. 기존의 약지도(weakly supervised) 학습 데이터는 주로 Q&A 포럼이나 학술 논문 같은 공개 소스에서 크롤링하는 방식으로 수집되었는데, 이 방식은 데이터의 다양성과 품질을 통제하기 어렵다. 특히 저자원 언어나 특수 도메인(코드 검색 등)에서는 양질의 학습 데이터를 확보하는 것 자체가 큰 허들이었다. 리랭킹 모델 학습도 제로샷(Ma et al., 2023; Pradeep et al., 2023)이나 SFT(Zhang et al., 2024a) 기반 접근이 시도되었지만, 임베딩 모델과 통합된 학습 프레임워크가 부족했다.


3. 핵심 아이디어

Qwen3 Embedding의 접근은 한 마디로 "파운데이션 모델을 백본으로도, 데이터 팩토리로도 쓴다"는 것이다. Qwen3 LLM이 임베딩/리랭킹 모델의 초기 가중치를 제공하는 동시에, Qwen3-32B가 학습 데이터 합성기 역할도 수행한다. 기존 방식이 웹 크롤링으로 데이터를 "수집"했다면, 여기서는 원하는 태스크, 언어, 난이도, 길이를 명시적으로 지정해서 데이터를 "제조"하는 것이다.

이렇게 만든 1.5억 쌍의 합성 데이터로 약지도 사전학습을 하고, 그중 고품질 1,200만 쌍을 추가 선별해서 지도 학습에도 활용한다. 마지막에는 학습 과정의 여러 체크포인트를 Spherical Linear Interpolation(SLERP)으로 머징해서 강건성을 높인다. 데이터 생성부터 모델 학습, 후처리까지 전 과정에서 LLM의 능력을 최대한 활용하는 셈이다.

기존 GTE, E5, BGE가 "좋은 데이터를 모으자"에 집중했다면, Qwen3 Embedding은 "좋은 데이터를 만들자"로 패러다임을 전환한 것이 근본적 차이다.


4. 제안 방법 (Method)

4.1 모델 아키텍처

Qwen3 Embedding과 Qwen3 Reranker는 모두 Qwen3 파운데이션 모델의 dense 버전을 백본으로 사용한다. 0.6B, 4B, 8B 세 가지 크기로 제공되며, 각각의 사양은 아래와 같다.

Model TypeModelsSizeLayersSeq LengthEmbed DimMRL SupportInstruction Aware
Text EmbeddingQwen3-Embedding-0.6B0.6B2832K1024YesYes
Qwen3-Embedding-4B4B3632K2560YesYes
Qwen3-Embedding-8B8B3632K4096YesYes
Text RerankingQwen3-Reranker-0.6B0.6B2832K--Yes
Qwen3-Reranker-4B4B3632K--Yes
Qwen3-Reranker-8B8B3632K--Yes

Table 1 (원논문): Qwen3 Embedding 모델 아키텍처. MRL Support는 임베딩 차원 커스터마이징 지원 여부, Instruction Aware는 태스크별 입력 인스트럭션 커스터마이징 지원 여부.

모든 모델이 32K 컨텍스트 길이를 지원하고, 임베딩 모델은 MRL(Matryoshka Representation Learning)을 지원해서 사용자가 원하는 차원으로 임베딩을 잘라 쓸 수 있다. 실무에서 저장 공간이나 연산 비용을 줄여야 할 때 유용한 기능이다.

Figure 1: Model architecture of Qwen3-Embedding (left) and Qwen3-Reranker (right).
Figure 1: Model architecture of Qwen3-Embedding (left) and Qwen3-Reranker (right).

Figure 1: Qwen3-Embedding(좌)과 Qwen3-Reranker(우)의 모델 아키텍처. (원논문)

임베딩 모델은 Causal Attention 기반의 LLM에 [EOS] 토큰을 시퀀스 끝에 추가하고, 마지막 레이어의 [EOS] 토큰에 대응하는 hidden state를 임베딩으로 사용한다. 인스트럭션과 쿼리는 하나의 입력 컨텍스트로 연결되고, 문서(document)는 별도로 처리된다. 입력 포맷은 다음과 같다:

{Instruction} {Query}<|endoftext|>

리랭킹 모델은 LLM 채팅 템플릿을 활용한 point-wise 리랭킹 방식이다. 유사도 평가를 "yes/no" 이진 분류 문제로 프레이밍한다는 점이 독특하다. 인스트럭션, 쿼리, 문서를 모두 하나의 컨텍스트에 넣고, 다음 토큰이 "yes"일 확률을 관련성 점수로 사용한다:

score(q,d)=eP(yesI,q,d)eP(yesI,q,d)+eP(noI,q,d)\text{score}(q, d) = \frac{e^{P(\text{yes}|I, q, d)}}{e^{P(\text{yes}|I, q, d)} + e^{P(\text{no}|I, q, d)}}

이 방식은 LLM의 언어 이해 능력을 그대로 활용하면서도 스코어링이 명확하다는 장점이 있다. <think>\n\n</think> 토큰을 포함하는 것으로 보아 Qwen3의 thinking 모드도 활용하는 것으로 보이는데, 빈 thinking 블록을 사용하므로 실제로는 non-thinking 모드로 동작하는 셈이다.

4.2 학습 목표 (Training Objective)

임베딩 모델의 손실 함수는 InfoNCE 프레임워크를 개선한 대조 학습(contrastive learning) 손실이다. 배치 크기 NN에 대해 다음과 같이 정의된다:

Lembedding=1NiNloges(qi,di+)/τZi(Eq. 1)L_{\text{embedding}} = -\frac{1}{N} \sum_{i}^{N} \log \frac{e^{s(q_i, d_i^+)/\tau}}{Z_i} \quad \text{(Eq. 1)}

여기서 s(,)s(\cdot, \cdot)는 코사인 유사도, τ\tau는 온도 파라미터, ZiZ_i는 정규화 항이다. ZiZ_i가 흥미로운 부분인데, 다섯 종류의 네거티브를 모두 고려한다:

Zi=es(qi,di+)/τ+kKmikes(qi,di,k)/τ+jimijes(qi,qj)/τ+jimijes(di+,dj)/τ+jimijes(qi,dj)/τZ_i = e^{s(q_i, d_i^+)/\tau} + \sum_{k}^{K} m_{ik} e^{s(q_i, d_{i,k}^-)/\tau} + \sum_{j \neq i} m_{ij} e^{s(q_i, q_j)/\tau} + \sum_{j \neq i} m_{ij} e^{s(d_i^+, d_j)/\tau} + \sum_{j \neq i} m_{ij} e^{s(q_i, d_j)/\tau}

각 항은 (1) 포지티브 문서 di+d_i^+, (2) KK개의 하드 네거티브 di,kd_{i,k}^-, (3) 배치 내 다른 쿼리 qjq_j, (4) 포지티브 문서 di+d_i^+에 대한 다른 배치 내 문서 djd_j, (5) 쿼리 qiq_i에 대한 다른 배치 내 문서 djd_j와의 유사도를 나타낸다.

일반적인 InfoNCE 손실은 in-batch negative만 사용하는데, 여기서는 하드 네거티브까지 포함하고 query-query, document-document 간 유사도도 고려한다. 이렇게 하면 임베딩 공간에서의 분별력이 더 높아진다.

마스크 팩터 mijm_{ij}는 false negative 문제를 완화하기 위한 장치다:

mij={0if sij>s(qi,di+)+0.1 or dj=di+1otherwisem_{ij} = \begin{cases} 0 & \text{if } s_{ij} > s(q_i, d_i^+) + 0.1 \text{ or } d_j = d_i^+ \\ 1 & \text{otherwise} \end{cases}

포지티브 문서보다 유사도가 높은 샘플을 네거티브에서 제외하는 건데, 임계값 0.1을 더해줌으로써 false negative를 걸러낸다. 이런 디테일이 실제 성능에 영향을 미친다.

리랭킹 모델의 손실 함수는 SFT 손실로, 포지티브 문서에 대해서는 "yes", 네거티브 문서에 대해서는 "no" 라벨의 확률을 최대화한다:

Lreranking=logp(lP(q,d))(Eq. 2)L_{\text{reranking}} = -\log p(l | \mathcal{P}(q, d)) \quad \text{(Eq. 2)}

여기서 ll은 포지티브이면 "yes", 네거티브이면 "no"이다. 리랭킹을 이진 분류로 단순화하면서도 LLM의 문맥 이해 능력을 활용할 수 있는 깔끔한 설계다.

4.3 다단계 학습 파이프라인

Figure 2: Training pipeline of Qwen3 Embedding and Reranking models.
Figure 2: Training pipeline of Qwen3 Embedding and Reranking models.

Figure 2: Qwen3 Embedding과 Reranking 모델의 학습 파이프라인. Embedding 모델은 3단계(약지도 사전학습 → SFT → 모델 머징), Reranker는 Stage 1을 건너뛰고 2단계(SFT → 모델 머징)로 학습된다. (원논문)

학습은 총 3단계로 이루어진다. 기존 다단계 학습 프레임워크(Li et al., 2023; Wang et al., 2022; Chen et al., 2024)를 기반으로 하되, 세 가지 혁신을 도입했다.

Stage 1 — 대규모 합성 데이터 기반 약지도 사전학습: 기존 GTE, E5, BGE 모델이 Q&A 포럼이나 학술 논문에서 약지도 데이터를 크롤링했다면, Qwen3 Embedding은 파운데이션 모델로 직접 합성한다. 태스크, 언어, 길이, 난이도를 프롬프트에서 임의로 지정할 수 있어서, 오픈 도메인 수집 방식보다 품질과 다양성을 훨씬 정밀하게 통제할 수 있다. 약 1.5억 쌍의 멀티태스크 데이터가 이 단계에서 사용된다.

Stage 2 — 고품질 합성+라벨 데이터로 지도 학습: Qwen3 파운데이션 모델의 성능 덕분에 합성 데이터의 품질이 상당히 높다. 이 중 코사인 유사도 0.7 이상인 고품질 쌍 약 1,200만 개를 선별하고, MS MARCO, NQ, HotpotQA, MIRACL 등의 라벨 데이터 약 700만 개와 합쳐서 지도 학습을 수행한다. 임베딩 모델은 Eq. 1의 대조 학습 손실을, 리랭킹 모델은 Eq. 2의 SFT 손실을 사용한다.

Stage 3 — 모델 머징: SFT 과정에서 저장된 여러 체크포인트를 SLERP(Spherical Linear Interpolation) 기법으로 머징한다(Li et al., 2024에서 영감). 단순 평균이 아닌 구면 선형 보간이라 모델 파라미터의 방향성을 더 잘 보존하면서 다양한 데이터 분포에 대한 강건성과 일반화 능력을 높인다.

리랭킹 모델은 Stage 1(약지도 사전학습)을 건너뛰고 Stage 2부터 시작한다는 점을 유의해야 한다. 리랭커는 cross-encoder 구조라 쿼리-문서 쌍을 함께 보는 방식이므로, 대규모 약지도 데이터의 이점이 임베딩 모델만큼 크지 않기 때문으로 추정된다.

4.4 합성 데이터 생성 전략

합성 데이터 생성의 구체적인 방법론이 이 논문의 차별화 포인트 중 하나다. Qwen3-32B를 사용해서 retrieval, bitext mining, classification, STS(Semantic Textual Similarity) 네 가지 태스크에 걸쳐 다양한 텍스트 쌍을 생성한다.

검색(retrieval) 데이터 합성의 경우, document-to-query 방식을 채택했다. Qwen3의 다국어 사전학습 코퍼스에서 문서를 수집한 뒤, 2단계 생성 파이프라인을 적용한다:

  1. Configuration 단계: LLM이 문서에 대해 적절한 "Question Type"(키워드, 사실적 질문, 요약, 판단형 등), "Difficulty"(고등학교, 대학, 박사 수준), "Character"(문서에 관심을 가질 만한 페르소나)를 결정한다. Persona Hub(Ge et al., 2024)에서 검색 모델로 상위 5개 후보 캐릭터를 찾아 프롬프트에 제시하는 방식이다.

  2. Query Generation 단계: 1단계에서 결정된 설정을 바탕으로 실제 쿼리를 생성한다. 쿼리의 길이와 언어도 명시적으로 지정한다.

이런 다차원적(태스크 × 난이도 × 캐릭터 × 언어 × 길이) 프롬프팅 전략이 데이터의 다양성을 보장하는 데 결정적이다. 단순히 "이 문서에 대한 질문을 만들어줘"가 아니라, 특정 페르소나가 특정 난이도의 특정 유형 질문을 특정 언어로 하는 상황을 시뮬레이션하는 것이기 때문에, 훨씬 현실적이고 다양한 쿼리가 나온다.


5. 실험 결과

5.1 실험 설정

평가 벤치마크: 임베딩 모델은 MMTEB(Massive Multilingual Text Embedding Benchmark)로 평가했다. 250개 이상 언어를 커버하는 500개 이상의 품질-통제된 평가 태스크를 포함하며, 총 216개 개별 태스크를 사용했다:

  • MTEB Multilingual: 131개 태스크
  • MTEB English (v2): 41개 태스크
  • CMTEB (중국어): 32개 태스크
  • MTEB Code: 12개 코드 검색 태스크

리랭킹 모델은 세 가지 유형의 검색 태스크로 평가했다:

  1. Basic Relevance Retrieval: 영어(MTEB-R), 중국어(CMTEB-R), 다국어(MMTEB-R), 장문서(MLDR)
  2. Code Retrieval: MTEB-Code
  3. Complex Instruction Retrieval: FollowIR

비교 모델: 오픈소스로는 GTE, E5, BGE 시리즈, NV-Embed-v2, GritLM-7B를, 상용 API로는 OpenAI text-embedding-3-large, Google Gemini Embedding, Cohere embed-multilingual-v3.0을 비교 대상으로 삼았다. 리랭킹은 Jina, mGTE, BGE-m3의 리랭커와 비교했다.

5.2 주요 결과 — 임베딩

ModelSizeMean (Task)Mean (Type)Bitext MiningClassificationClusteringInst. RetrievalMultilabel Class.Pair Class.RerankRetrievalSTS
오픈소스
NV-Embed-v27B56.2949.5857.8457.2940.801.0418.6378.9463.8256.7271.10
GritLM-7B7B60.9253.7470.5361.8349.753.4522.7779.9463.7858.3173.33
BGE-M30.6B59.5652.1879.1160.3540.88-3.1120.1080.7662.7954.6074.12
multilingual-e5-large-instruct0.6B63.2255.0880.1364.9450.75-0.4022.9180.8662.6157.1276.81
gte-Qwen2-1.5B-instruct1.5B59.4552.6962.5158.3252.050.7424.0281.5862.5860.7871.61
gte-Qwen2-7B-instruct7B62.5155.9373.9261.5552.774.9425.4885.1365.5560.0873.98
상용 API
text-embedding-3-large-58.9351.4162.1760.2746.89-2.6822.0379.1763.8959.2771.68
Cohere-embed-multilingual-v3.0-61.1253.2370.5062.9546.89-1.8922.7479.8864.0759.1674.80
Gemini Embedding-68.3759.5979.2871.8254.595.1829.1683.6365.5867.7179.40
Qwen3 Embedding
Qwen3-Embedding-0.6B0.6B64.3356.0072.2266.8352.335.0924.5980.8361.4164.6476.17
Qwen3-Embedding-4B4B69.4560.8679.3672.3357.1511.5626.7785.0565.0869.6080.86
Qwen3-Embedding-8B8B70.5861.6980.8974.0057.6510.0628.6686.4065.6370.8881.08

Table 2 (원논문): MTEB Multilingual 벤치마크 성능. 2025년 6월 4일 MTEB 온라인 리더보드 기준.

MTEB Multilingual에서 Qwen3-Embedding-8B가 Mean(Task) 70.58로 Gemini Embedding(68.37)을 2.21점 상회하며 1위를 기록했다. 4B 모델도 69.45로 Gemini Embedding을 넘겼다. 0.6B 모델조차 64.33으로, 7B급인 GritLM-7B(60.92)이나 gte-Qwen2-7B-instruct(62.51)보다 높은 점수를 받았다. 파라미터 수 대비 효율이 매우 뛰어난 셈이다.

세부 태스크별로 보면, Instruction Retrieval에서 Qwen3-Embedding-4B가 11.56으로 다른 모든 모델을 압도한다. 기존 모델 대부분이 0 근처이거나 음수인데 비해 큰 격차다. 이는 instruction-aware 학습이 효과적으로 작동하고 있음을 보여준다. Retrieval 태스크에서도 8B 모델이 70.88로 Gemini Embedding(67.71)을 3점 이상 앞선다.

한편, Pair Classification이나 Rerank 같은 태스크에서는 모델 크기에 비례한 성능 향상이 덜 뚜렷하다. 8B 모델의 Rerank 점수가 65.63인데, gte-Qwen2-7B-instruct의 65.55와 거의 비슷하다. 이런 태스크에서는 모델 크기보다 태스크 특화 학습 데이터가 더 중요할 수 있다.

ModelSizeDimMTEB (Eng, v2) Mean(Task)MTEB (Eng, v2) Mean(Type)CMTEB Mean(Task)CMTEB Mean(Type)MTEB (Code)
NV-Embed-v27B409669.8165.0063.062.0-
GritLM-7B7B409667.0763.22--73.6
multilingual-e5-large-instruct0.6B102465.5361.21--65.0
gte-Qwen2-1.5B-instruct1.5B153667.2063.2667.1267.79-
gte-Qwen2-7B-instruct7B358470.7265.7771.6272.1956.41
text-embedding-3-large-307266.4362.15--58.95
Cohere-embed-multilingual-v3.0-102466.0161.43--51.94
Gemini Embedding-307273.3067.67--74.66
Qwen3-Embedding-0.6B0.6B102470.7064.8866.3367.4475.41
Qwen3-Embedding-4B4B256074.6068.0972.2673.5080.06
Qwen3-Embedding-8B8B409675.2268.7073.8375.0080.68

Table 3 (원논문): MTEB English, CMTEB, MTEB Code 벤치마크 성능.

코드 검색(MTEB Code) 결과가 눈에 띈다. Qwen3-Embedding-0.6B가 75.41로 이미 GritLM-7B(73.6)과 Gemini Embedding(74.66)을 넘어선다. 8B 모델은 80.68로, 기존 최고 성능인 Gemini Embedding보다 6점 이상 높다. 합성 데이터 생성 시 CodeSearchNet 등 코드 관련 데이터를 적극 포함한 결과로 보인다.

영어 MTEB(v2)에서도 8B 모델(75.22)이 Gemini Embedding(73.30)을 거뜬히 넘기고, 중국어 CMTEB에서는 8B 모델(73.83)이 gte-Qwen2-7B-instruct(71.62)보다 2.2점 높다. 전반적으로 모든 벤치마크에서 일관되게 SOTA를 달성하는 추세다.

5.3 주요 결과 — 리랭킹

ModelParamMTEB-RCMTEB-RMMTEB-RMLDRMTEB-CodeFollowIR
Qwen3-Embedding-0.6B (1st stage)0.6B61.8271.0264.6450.2675.415.09
Jina-multilingual-reranker-v2-base0.3B58.2263.3763.7339.6658.98-0.68
gte-multilingual-reranker-base0.3B59.5174.0859.4466.3354.18-1.64
BGE-reranker-v2-m30.6B57.0372.1658.3659.5141.38-0.01
Qwen3-Reranker-0.6B0.6B65.8071.3166.3667.2873.425.41
Qwen3-Reranker-4B4B69.7675.9472.7469.9781.2014.84
Qwen3-Reranker-8B8B69.0277.4572.9470.1981.228.05

Table 4 (원논문): 리랭킹 모델 평가 결과. Qwen3-Embedding-0.6B의 top-100 검색 결과를 기준으로 리랭킹 수행.

리랭킹 결과에서 몇 가지 흥미로운 패턴이 보인다. 우선 Qwen3-Reranker-0.6B(65.80/71.31/66.36)가 기존 베이스라인 리랭커를 모든 태스크에서 압도한다. 0.6B 파라미터만으로 이 정도 성능이면 비용 대비 효율이 매우 좋다.

MLDR(장문서 검색)에서의 개선 폭이 특히 크다. 임베딩 모델 단독(50.26) 대비 Qwen3-Reranker-0.6B가 67.28로 17점 가까이 올렸고, 8B 모델은 70.19까지 도달했다. 장문서에서 임베딩만으로는 세밀한 관련성 판단이 어려운데, 리랭커가 cross-attention으로 쿼리-문서를 직접 비교하면서 이를 보완하는 것이다.

한 가지 의외인 건, FollowIR(Complex Instruction Retrieval)에서 4B 모델(14.84)이 8B 모델(8.05)보다 훨씬 높다는 점이다. 모델 크기가 항상 유리한 것은 아니며, instruction following 능력은 학습 데이터의 구성이나 체크포인트 선택에 더 민감할 수 있다는 점을 시사한다.

5.4 Ablation Study

ModelMMTEBMTEB (Eng, v2)CMTEBMTEB (Code, v1)
Qwen3-Embedding-0.6B w/ only synthetic data58.4960.6359.7866.79
Qwen3-Embedding-0.6B w/o synthetic data61.2165.5963.3774.58
Qwen3-Embedding-0.6B w/o model merge62.5668.1864.7674.89
Qwen3-Embedding-0.6B (최종)64.3370.7066.3375.41

Table 5 (원논문): Qwen3-Embedding-0.6B의 학습 설정별 성능 비교.

이 Ablation이 논문의 학습 전략을 이해하는 데 가장 중요한 부분이다.

합성 데이터만으로 학습한 경우(1행): MMTEB 58.49, MTEB(Eng) 60.63으로, 지도 학습 없이도 이미 상당한 수준이다. BGE-M3(59.56)에 근접하고, NV-Embed-v2(56.29)를 넘는다. 1.5억 쌍의 합성 데이터 품질이 높다는 방증이다.

합성 데이터 사전학습을 생략한 경우(2행): MMTEB 61.21로, 최종 모델(64.33)보다 3.12점 낮다. Stage 1의 대규모 약지도 학습이 최종 성능에 미치는 기여가 명확하다. MTEB(Eng)에서는 65.59 → 70.70으로 5.11점이나 차이나는데, 영어 벤치마크에서 합성 데이터의 효과가 더 크게 나타나는 것으로 보인다.

모델 머징을 생략한 경우(3행): MMTEB 62.56으로, 모델 머징을 적용한 최종 모델(64.33)보다 1.77점 낮다. MTEB(Eng)에서는 68.18 → 70.70으로 2.52점 차이다. 개인적으로는 모델 머징이 이 정도 효과를 보인다는 게 인상적이다. 추가 학습 없이 체크포인트 보간만으로 전 벤치마크에서 일관된 향상을 얻는 건 비용 대비 효과가 매우 높은 전략이다.

결론적으로, 세 가지 요소(합성 데이터 사전학습, 고품질 데이터 SFT, 모델 머징) 모두가 성능에 의미 있게 기여하며, 가장 큰 기여는 합성 데이터 기반 약지도 사전학습(Stage 1)에서 온다.


6. 추가 실험 및 부록 (Appendix)

6.1 학습 데이터 통계

StageDatasetSize
Weakly Supervised Pre-TrainingSynthetic Data~150M
Supervised Fine TuningMS MARCO, NQ, HotpotQA, NLI, Dureader, T²-Ranking, SimCLUE, MIRACL, MLDR, Mr.TyDi, Multi-CPR, CodeSearchNet 등 + High-quality Synthetic DataLabeled: ~7M, Synthetic: ~12M

Table 6 (원논문): 각 학습 단계별 데이터 통계.

Stage 1에서 1.5억 쌍의 합성 데이터를 사용하고, Stage 2에서는 라벨 데이터 700만 + 고품질 합성 데이터 1,200만으로 총 약 1,900만 쌍을 사용한다. Stage 2의 라벨 데이터는 영어(MS MARCO, NQ, HotpotQA), 중국어(Dureader, T²-Ranking, SimCLUE), 다국어(MIRACL, MLDR, Mr.TyDi, Multi-CPR), 코드(CodeSearchNet) 등 다양한 도메인과 언어를 커버한다.

6.2 MTEB English 상세 결과

MTEB(eng, v2)ParamMean (Task)Mean (Type)ClassificationClusteringPair Class.RerankRetrievalSTSSumm.
multilingual-e5-large-instruct0.6B65.5361.2175.5449.8986.2448.7453.4784.7229.89
NV-Embed-v27.8B69.8165.0087.1947.6688.6949.6162.8483.8235.21
GritLM-7B7.2B67.0763.2281.2550.8287.2949.5954.9583.0335.65
gte-Qwen2-1.5B-instruct1.5B67.2063.2685.8453.5487.5249.2550.2582.5133.94
stella_en_1.5B_v51.5B69.4365.3289.3857.0688.0250.1952.4283.2736.91
gte-Qwen2-7B-instruct7.6B70.7265.7788.5258.9785.9050.4758.0982.6935.74
gemini-embedding-exp-03-07-73.3067.6790.0559.3987.7048.5964.3585.2938.28
Qwen3-Embedding-0.6B0.6B70.7064.8885.7654.0584.3748.1861.8386.5733.43
Qwen3-Embedding-4B4B74.6068.0989.8457.5187.0150.7668.4688.7234.39
Qwen3-Embedding-8B8B75.2268.7090.4358.5787.5251.5669.4488.5834.83

Table 7 (원논문): MTEB(eng, v2) 상세 결과. MTEB 온라인 리더보드 기준.

영어 벤치마크에서 태스크별로 세분화해서 보면, Qwen3-Embedding-8B는 Classification(90.43), Retrieval(69.44), STS(88.58)에서 최고 점수를 기록한다. STS에서 88.58이라는 점수는 Gemini Embedding(85.29)보다 3.3점 높은데, 이는 합성 데이터에 STS 태스크가 잘 포함된 덕분으로 보인다.

반면 Summarization에서는 Qwen3 모델들(33~35점대)이 Gemini Embedding(38.28)에 뒤진다. 요약 태스크의 특성상 단순 의미 유사도보다 내용 압축 능력이 중요한데, 이 부분은 학습 데이터 구성에서 상대적으로 적게 다뤄진 것 같다. 아쉬운 점이긴 하지만, 전체 평균에서는 여전히 압도적이다.

0.6B 모델의 Retrieval 점수(61.83)가 NV-Embed-v2의 7.8B 모델(62.84)에 거의 근접한다는 것도 주목할 만하다. 13배나 작은 모델이 비슷한 검색 성능을 낸다면, 서빙 비용 면에서 엄청난 이점이 있다.

6.3 CMTEB 상세 결과

MTEB(cmn, v1)ParamMean (Task)Mean (Type)ClassificationClusteringPair Class.RerankRetrievalSTS
multilingual-e5-large-instruct0.6B58.0858.2469.8048.2364.5257.4563.6545.81
gte-Qwen2-7B-instruct7.6B71.6272.1975.7766.0681.1669.2475.7065.20
gte-Qwen2-1.5B-instruct1.5B67.1267.7972.5354.6179.5068.2171.8660.05
Qwen3-Embedding-0.6B0.6B66.3367.4471.4068.7476.4262.5871.0354.52
Qwen3-Embedding-4B4B72.2673.5075.4677.8983.3466.0577.0361.26
Qwen3-Embedding-8B8B73.8475.0076.9780.0884.2366.9978.2163.53

Table 8 (원논문): C-MTEB (MTEB(cmn, v1)) 상세 결과.

중국어 벤치마크에서 가장 눈에 띄는 건 Clustering 점수다. Qwen3-Embedding-0.6B가 68.74로 gte-Qwen2-7B-instruct(66.06)보다 높다. 0.6B 모델이 7.6B 모델의 클러스터링 성능을 넘는 건 이례적인데, 다국어 합성 데이터의 품질이 중국어 의미 공간을 효과적으로 학습시킨 것으로 해석된다. 8B 모델은 80.08까지 올라가는데, 이는 gte-Qwen2-7B-instruct 대비 14점이나 높은 수치다.

반면 Rerank 태스크에서는 0.6B 모델(62.58)이 gte-Qwen2-1.5B-instruct(68.21)에 뒤지고, STS에서도 0.6B 모델(54.52)이 약한 편이다. 중국어 STS 데이터가 학습셋에 상대적으로 적었을 가능성이 있다.

6.4 MTEB Code 상세 결과

MTEB(Code, v1)Avg.AppsCOIR-CodeSearchNetCode-Edit-SearchCode-Feedback-MTCode-Feedback-STCode-SearchNet-CCRCode-SearchNetCode-Trans-Ocean-ContestCode-Trans-Ocean-DLCosQAStack-Overflow-QASynthetic-Text2SQL
BGE-multilingual62.0422.9368.1460.4860.5276.7073.2383.4386.8432.6427.9392.9358.67
NV-Embed-v263.7429.7261.8573.9660.2781.7268.8286.6189.1433.4034.8292.3660.90
gte-Qwen2-7B-instruct62.1728.3971.7967.0657.6685.1566.2486.9681.8332.1731.2684.3453.22
gte-Qwen2-1.5B-instruct61.9828.9171.5659.6049.9281.9272.0891.0879.0232.7332.2390.2754.49
BGE-M3 (Dense)58.2214.7758.0759.8347.8669.2753.5561.9886.2229.3727.3680.7149.65
Jina-v358.8528.9967.8357.2459.6678.1354.1785.5077.3730.9135.1590.7941.49
Qwen3-Embedding-0.6B75.4175.3484.6964.4290.8286.3991.7291.0186.0531.3636.4889.9976.74
Qwen3-Embedding-4B80.0689.1887.9376.4993.2189.5195.5992.3490.9935.0437.9894.3278.21
Qwen3-Embedding-8B80.6891.0789.5176.9793.7089.9396.3592.6693.7332.8138.0494.7578.75
Qwen3-Reranker-0.6B73.4269.4385.0972.3783.8378.0594.7688.8084.6933.9436.8393.2462.48
Qwen3-Reranker-4B81.2094.2590.9182.5395.2588.5497.5892.4893.6636.7835.1497.1175.06
Qwen3-Reranker-8B81.2294.5591.8884.5895.6488.4395.6792.7890.8334.8937.4397.3073.40

Table 9 (원논문): MTEB(Code, v1) 상세 결과. nDCG@10 기준.

코드 검색에서의 성능 향상이 가장 극적이다. Apps 태스크에서 Qwen3-Embedding-0.6B(75.34)가 기존 최고인 NV-Embed-v2(29.72)를 45점 이상 앞선다. 이건 거의 다른 차원의 성능이다. Code-Feedback-MT에서도 0.6B 모델이 90.82로, 기존 최고인 NV-Embed-v2(60.27)를 30점 이상 넘겼다. Code-SearchNet-CCR에서도 91.72 vs 73.23(BGE)으로 18점 이상 차이난다.

반면 Code-Trans-Ocean-DL(코드 번역 관련)에서는 Qwen3-Embedding-0.6B가 31.36으로 NV-Embed-v2(33.40)에 약간 뒤진다. 코드 번역이라는 특수한 태스크에서는 합성 데이터의 커버리지가 부족했을 수 있다. 그래도 4B 모델(35.04)에서는 이를 극복한다.

리랭커의 코드 검색 성능도 매우 인상적이다. Qwen3-Reranker-4B(81.20)와 8B(81.22)가 거의 동일한 수준인데, 코드 검색에서는 4B면 충분하다는 의미다. Stack-Overflow-QA에서 리랭커가 97점대를 기록하는 것은 실질적으로 거의 완벽한 랭킹을 달성한 것에 가깝다.


7. 강점과 한계

강점

  • 파라미터 효율: 0.6B 모델이 7B급 오픈소스 모델에 필적하고, 4B/8B 모델이 Gemini Embedding 같은 상용 API를 넘어선다. Table 2에서 Qwen3-Embedding-0.6B(64.33)가 gte-Qwen2-7B-instruct(62.51)를 1.82점 앞서는 것이 대표적이다.
  • 코드 검색에서의 압도적 성능: Table 9에서 확인되듯이, 기존 모델 대비 10~45점 이상의 향상을 보이는 태스크가 다수다. 실무에서 RAG 기반 코드 어시스턴트를 구축할 때 직접적인 이점이 있다.
  • 통합된 학습 프레임워크: 임베딩과 리랭킹 모델을 동일한 파운데이션 위에서 일관된 파이프라인으로 학습시킨다. 배포 시에도 같은 모델 패밀리를 사용하므로 유지보수가 수월하다.
  • 합성 데이터 전략의 검증: Ablation(Table 5)에서 합성 데이터 기반 약지도 학습이 최종 성능에 3점 이상 기여함을 정량적으로 보여줬다. 합성 데이터 '제조' 접근의 유효성을 확인한 점에서 후속 연구에 참고가 될 만하다.
  • 오픈소스(Apache 2.0): 상업적 활용까지 가능한 라이선스로, 실무 도입 장벽이 낮다.

한계 및 아쉬운 점

  • Summarization 태스크의 상대적 약세: Table 7에서 Qwen3-Embedding-8B의 Summarization 점수(34.83)는 Gemini Embedding(38.28)에 뒤진다. 특정 태스크에서의 약점이 남아 있다.
  • 리랭커의 FollowIR 불안정성: Table 4에서 4B 모델(14.84)이 8B 모델(8.05)보다 FollowIR에서 크게 앞서는 비일관적 패턴이 관찰된다. 모델 크기와 instruction following 능력 간의 관계가 불분명하다.
  • 학습 데이터 합성의 재현성: Qwen3-32B를 데이터 합성기로 쓰는 전략은 해당 모델에 접근할 수 있어야 재현 가능하다. 합성 데이터셋 자체는 공개되지 않은 것으로 보인다.
  • Ablation의 범위: Ablation이 0.6B 모델에 대해서만 수행되었다. 4B, 8B 모델에서도 동일한 패턴이 나타나는지 확인되지 않았다. 모델 크기에 따라 각 학습 단계의 기여도가 달라질 수 있는데, 이 부분이 비어 있다.
  • 리랭커 학습 세부 사항 부족: 리랭커는 Stage 1을 건너뛴다고만 언급되었을 뿐, Stage 2에서 사용한 구체적인 데이터 구성이나 하드 네거티브 마이닝 전략에 대한 설명이 부족하다.
  • 추론 비용 분석 미비: 0.6B, 4B, 8B 모델 간의 추론 속도, 메모리 사용량, 처리량(throughput) 비교가 없다. 실무 배포 관점에서 모델 선택의 중요한 기준인데, 이 정보가 빠져 있다.

8. 마치며

Qwen3 Embedding은 "파운데이션 모델이 임베딩/리랭킹의 백본과 데이터 팩토리를 동시에 담당한다"는 접근으로 오픈소스 텍스트 임베딩의 새로운 기준을 세웠다. MTEB Multilingual에서 70.58, MTEB Code에서 80.68이라는 수치는 Gemini Embedding을 넘어선 최초의 오픈소스 모델이라는 의의가 있다.

실무적 관점에서 가장 매력적인 점은 세 가지 사이즈(0.6B/4B/8B)를 모두 제공한다는 것이다. 임베딩 품질이 중요한 파이프라인에는 8B를, 지연시간이 민감한 실시간 서비스에는 0.6B를 쓸 수 있고, 리랭커를 붙이면 검색 품질을 한 단계 더 올릴 수 있다. Apache 2.0 라이선스이므로 상용 API에 대한 의존성을 줄이면서도 동등 이상의 성능을 확보할 수 있다는 점에서, RAG 시스템을 자체 구축하는 팀에게 실질적인 대안이 될 것이다.

합성 데이터 전략의 성공은 향후 연구에도 시사하는 바가 크다. 데이터 '수집'에서 '제조'로의 전환이 임베딩 모델 학습에서도 유효하다는 것을 검증했으며, 특히 저자원 언어나 특수 도메인(코드 검색)에서의 효과가 뚜렷했다. 모델 머징이라는 비교적 저렴한 후처리 기법이 일관된 성능 향상을 가져다준다는 점도 기억해둘 만하다.


References

  • Li et al., 2023. "Towards general text embeddings with multi-stage contrastive learning." (GTE)
  • Wang et al., 2022. "Text embeddings by weakly-supervised contrastive pre-training." (E5)
  • Xiao et al., 2024. "C-pack: Packed resources for general chinese embeddings." (BGE/CMTEB)
  • Chen et al., 2024. "M3-embedding: Multi-linguality, multi-functionality, multi-granularity text embeddings through self-knowledge distillation."
  • Lee et al., 2025b. "Gemini embedding: Generalizable embeddings from gemini."
  • Enevoldsen et al., 2025. "MMTEB: Massive multilingual text embedding benchmark."
  • Li et al., 2024. "Improving general text embedding model: Tackling task conflict and data imbalance through model merging."
  • Yang et al., 2025. "Qwen3 technical report."
  • Ge et al., 2024. "Scaling synthetic data creation with 1,000,000,000 personas." (Persona Hub)