RAG, 검색, 추천, 분류 - 요즘 실무에서 쓰이는 머신러닝 파이프라인의 상당수가 텍스트를 밀집 벡터(dense embedding)로 바꾸는 임베딩 모델에 기대고 있다. 그런데 하나의 임베딩 모델이 이 모든 작업을 동시에 잘하기란 쉽지 않다. 문제의 뿌리는 작업마다 "가깝다"의 정의가 다르다는 데 있다.
RAG와 시맨틱 검색이 실서비스에 들어오면서 텍스트 임베딩 모델은 조용히 인프라의 핵심이 됐다. 문제는 성능을 끌어올리려고 모델을 키우다 보니, 검색 파이프라인 전체의 비용과 지연시간이 임베딩 인코딩에서 결정되는 상황이 자주 생긴다는 점이다. 특히 정보 검색(IR, Information Retrieval)에서는 문서와 쿼리를 같은 모델로 인코딩하는 게 당연
Mamba2·RWKV·xLSTM 같은 순환(recurrent) 언어 모델을 텍스트 임베더로 파인튜닝하고, 레이어 방향으로 시퀀스를 잘라 처리하는 "수직 청킹(vertical chunking)" 추론 전략을 도입해 입력 길이와 무관하게 메모리가 상수로 수렴하는 임베딩 모델을 만든 연구.