논문 리뷰약 39분
논문 리뷰: LMK > CLS: Landmark Pooling for Dense Embeddings
문서 하나를 벡터 하나로 압축할 때 쓰는 [CLS]/mean 풀링의 고질적 약점을 짚고, 시퀀스 중간중간에 landmark 토큰을 꽂아 그 임베딩만 평균 내는 단순한 풀링으로 장문 검색 성능을 크게 끌어올린 연구.
Tags /
2개의 글
문서 하나를 벡터 하나로 압축할 때 쓰는 [CLS]/mean 풀링의 고질적 약점을 짚고, 시퀀스 중간중간에 landmark 토큰을 꽂아 그 임베딩만 평균 내는 단순한 풀링으로 장문 검색 성능을 크게 끌어올린 연구.
여러 LLM에서 뽑은 임베딩을 어느 층에서, 어떻게 합칠 것인가를 6개 데이터셋에 걸쳐 실증적으로 파헤치고, 다중 모델 융합이 층·풀링 선택의 민감도를 줄여 특히 저자원 환경에서 안정적인 텍스트 분류를 만든다는 것을 보인 연구.