kangnlp

Tags /

#dense-retrieval

8개의 글

논문 리뷰31

논문 리뷰: Lost in a Single Vector - Improving Long-Document Retrieval with Chunk Evidence Aggregation

질의: "Industrial Designer는 회의가 브레인스토밍에 우호적이지 않다고 생각했다. 제약은 분위기가 아니라 실제 환경과 제한된 논의 시간에 관한 것이었다. 게다가 상호작용이 구조화되어 각자 한 가지 과제만 맡고 충분한 협업이 없었다. 이메일을 통한 소통도 비효율적이었다." 골드 문서 내 국소 근거: "the meetings ... are mo

논문 리뷰24

논문 리뷰: Fine-Grained Distillation for Long Document Retrieval

긴 문서는 여러 토픽을 담고 있어 크로스 인코더의 지식을 바이 인코더로 그대로 증류하면 잘 먹히지 않는다. 이 논문은 문서 전체가 아니라 문단, 문장 단위의 세밀한 표현으로 지식을 증류하는 Fine-Grained Distillation(FGD) 프레임워크를 제안해, 추론 효율은 그대로 유지하면서 장문서 검색에서 SOTA를 달성한다.

논문 리뷰39

논문 리뷰: LMK > CLS: Landmark Pooling for Dense Embeddings

문서 하나를 벡터 하나로 압축할 때 쓰는 [CLS]/mean 풀링의 고질적 약점을 짚고, 시퀀스 중간중간에 landmark 토큰을 꽂아 그 임베딩만 평균 내는 단순한 풀링으로 장문 검색 성능을 크게 끌어올린 연구.

논문 리뷰28

논문 리뷰: Learning to Select: Query-Aware Adaptive Dimension Selection for Dense Retrieval

Dense retrieval에서 임베딩 차원을 늘리면 성능이 좋아진다는 건 거의 상식처럼 통용된다. Qwen-Embedding-8B는 4096차원, OpenAI text-embedding-3-large는 3072차원을 쓴다. 그런데 이 고차원 벡터의 모든 좌표가 검색에 도움이 될까? 이 논문의 출발점은 "그렇지 않다"는 관찰이다. 특정 질의(query)에