RAG, 검색, 추천, 분류 - 요즘 실무에서 쓰이는 머신러닝 파이프라인의 상당수가 텍스트를 밀집 벡터(dense embedding)로 바꾸는 임베딩 모델에 기대고 있다. 그런데 하나의 임베딩 모델이 이 모든 작업을 동시에 잘하기란 쉽지 않다. 문제의 뿌리는 작업마다 "가깝다"의 정의가 다르다는 데 있다.
RAG 시스템을 실제로 운영해 본 사람이라면 임베딩 모델의 크기가 얼마나 골치 아픈 변수인지 안다. 검색 품질을 올리려면 파라미터를 키우는 게 가장 확실한 방법인데, 그 순간 두 가지 비용이 동시에 튄다. 하나는 코퍼스 전체를 색인할 때 드는 메모리와 스토리지, 다른 하나는 쿼리마다 발생하는 추론 지연(latency)이다. 특히 다국어 검색으로 넘어가면 상