논문 리뷰약 32분
논문 리뷰: Conan-Embedding-v2 — LLM을 처음부터 학습시켜 텍스트 임베딩 SOTA를 달성하다
기존 LLM을 LoRA로 미세조정하는 대신, 임베딩에 최적화된 1.4B LLM을 처음부터 훈련해 MTEB English/Chinese 모두에서 SOTA를 달성한 논문.
Tags /
7개의 글
기존 LLM을 LoRA로 미세조정하는 대신, 임베딩에 최적화된 1.4B LLM을 처음부터 훈련해 MTEB English/Chinese 모두에서 SOTA를 달성한 논문.
서로 다른 토크나이저를 쓰는 대형 임베딩 모델에서 소형 모델로, 어텐션 구조와 표현을 동시에 증류하는 프레임워크
LLM의 자기회귀적 본성을 거스르지 않으면서 고품질 텍스트 임베딩을 생성하는 방법, AutoRegEmbed
디퓨전 언어 모델이 텍스트 임베딩에서 LLM보다 나은 이유를 실증적으로 밝힌 최초의 체계적 연구
텍스트 임베딩에서 차원의 50%를 무작위로 제거해도 검색·분류 성능이 10% 미만만 하락한다는 현상을 발견하고, 그 원인을 "성능을 오히려 악화시키는 차원(degrading dimensions)"의 존재로 설명한 논문.
디코더 전용 LLM을 디퓨전 목적 함수로 계속 사전학습하여 양방향 어텐션을 갖춘 임베딩 모델로 변환하고, 다단계 대조 학습과 네이티브 INT8 양자화를 결합해 웹 스케일 검색에 최적화된 다국어 임베딩 모델 pplx-embed을 제안한다.
Qwen3 파운데이션 모델 위에 다단계 학습 파이프라인과 대규모 합성 데이터, 모델 머징을 결합하여 텍스트 임베딩과 리랭킹 모두에서 SOTA를 달성한 오픈소스 모델 시리즈.