논문 리뷰약 32분
논문 리뷰: Conan-Embedding-v2 — LLM을 처음부터 학습시켜 텍스트 임베딩 SOTA를 달성하다
기존 LLM을 LoRA로 미세조정하는 대신, 임베딩에 최적화된 1.4B LLM을 처음부터 훈련해 MTEB English/Chinese 모두에서 SOTA를 달성한 논문.
Tags /
5개의 글
기존 LLM을 LoRA로 미세조정하는 대신, 임베딩에 최적화된 1.4B LLM을 처음부터 훈련해 MTEB English/Chinese 모두에서 SOTA를 달성한 논문.
쿼리와 문서 임베딩 사이의 분포 불일치(OOD)가 ANN 검색 성능을 떨어뜨린다는 사실을 정량적으로 밝히고, 학습 시점에 간단한 ℓ₂ 정규화를 추가해 이 문제를 완화하는 방법을 제안한다.
LLM의 자기회귀적 본성을 거스르지 않으면서 고품질 텍스트 임베딩을 생성하는 방법, AutoRegEmbed
디퓨전 언어 모델이 텍스트 임베딩에서 LLM보다 나은 이유를 실증적으로 밝힌 최초의 체계적 연구
디코더 전용 LLM을 디퓨전 목적 함수로 계속 사전학습하여 양방향 어텐션을 갖춘 임베딩 모델로 변환하고, 다단계 대조 학습과 네이티브 INT8 양자화를 결합해 웹 스케일 검색에 최적화된 다국어 임베딩 모델 pplx-embed을 제안한다.