논문 리뷰약 26분
논문 리뷰: Beyond Single Representations: Multi-Model Embedding Fusion for Stable Text Classification
여러 LLM에서 뽑은 임베딩을 어느 층에서, 어떻게 합칠 것인가를 6개 데이터셋에 걸쳐 실증적으로 파헤치고, 다중 모델 융합이 층·풀링 선택의 민감도를 줄여 특히 저자원 환경에서 안정적인 텍스트 분류를 만든다는 것을 보인 연구.
Tags /
2개의 글
여러 LLM에서 뽑은 임베딩을 어느 층에서, 어떻게 합칠 것인가를 6개 데이터셋에 걸쳐 실증적으로 파헤치고, 다중 모델 융합이 층·풀링 선택의 민감도를 줄여 특히 저자원 환경에서 안정적인 텍스트 분류를 만든다는 것을 보인 연구.
텍스트 임베딩에서 차원의 50%를 무작위로 제거해도 검색·분류 성능이 10% 미만만 하락한다는 현상을 발견하고, 그 원인을 "성능을 오히려 악화시키는 차원(degrading dimensions)"의 존재로 설명한 논문.