논문 리뷰: Fine-Grained Distillation for Long Document Retrieval
긴 문서는 여러 토픽을 담고 있어 크로스 인코더의 지식을 바이 인코더로 그대로 증류하면 잘 먹히지 않는다. 이 논문은 문서 전체가 아니라 문단, 문장 단위의 세밀한 표현으로 지식을 증류하는 Fine-Grained Distillation(FGD) 프레임워크를 제안해, 추론 효율은 그대로 유지하면서 장문서 검색에서 SOTA를 달성한다.
Tags /
6개의 글
긴 문서는 여러 토픽을 담고 있어 크로스 인코더의 지식을 바이 인코더로 그대로 증류하면 잘 먹히지 않는다. 이 논문은 문서 전체가 아니라 문단, 문장 단위의 세밀한 표현으로 지식을 증류하는 Fine-Grained Distillation(FGD) 프레임워크를 제안해, 추론 효율은 그대로 유지하면서 장문서 검색에서 SOTA를 달성한다.
Dense retrieval에서 임베딩 차원을 늘리면 성능이 좋아진다는 건 거의 상식처럼 통용된다. Qwen-Embedding-8B는 4096차원, OpenAI text-embedding-3-large는 3072차원을 쓴다. 그런데 이 고차원 벡터의 모든 좌표가 검색에 도움이 될까? 이 논문의 출발점은 "그렇지 않다"는 관찰이다. 특정 질의(query)에
여러 도메인을 하나의 MoE 모델에 학습시킬 때 생기는 파국적 망각(catastrophic forgetting)을, 도메인마다 다른 전문가(expert)를 동적으로 골라 격리하는 방식으로 잡아낸 통합 파인튜닝 프레임워크 DES-MoE.
RAG와 시맨틱 검색이 실서비스에 들어오면서 텍스트 임베딩 모델은 조용히 인프라의 핵심이 됐다. 문제는 성능을 끌어올리려고 모델을 키우다 보니, 검색 파이프라인 전체의 비용과 지연시간이 임베딩 인코딩에서 결정되는 상황이 자주 생긴다는 점이다. 특히 정보 검색(IR, Information Retrieval)에서는 문서와 쿼리를 같은 모델로 인코딩하는 게 당연
캐싱해둔 교사 임베딩만으로 LLM 임베딩 모델을 BERT급 소형 인코더로 증류하되, 상위 레이어만 교사에 앵커링하고 나머지는 위→아래로 자기 증류하며, ASAM으로 평평한 최소점을 찾아 일반화를 끌어올린 프레임워크.
서로 다른 토크나이저를 쓰는 대형 임베딩 모델에서 소형 모델로, 어텐션 구조와 표현을 동시에 증류하는 프레임워크