질의: "Industrial Designer는 회의가 브레인스토밍에 우호적이지 않다고 생각했다. 제약은 분위기가 아니라 실제 환경과 제한된 논의 시간에 관한 것이었다. 게다가 상호작용이 구조화되어 각자 한 가지 과제만 맡고 충분한 협업이 없었다. 이메일을 통한 소통도 비효율적이었다." 골드 문서 내 국소 근거: "the meetings ... are mo
긴 문서는 여러 토픽을 담고 있어 크로스 인코더의 지식을 바이 인코더로 그대로 증류하면 잘 먹히지 않는다. 이 논문은 문서 전체가 아니라 문단, 문장 단위의 세밀한 표현으로 지식을 증류하는 Fine-Grained Distillation(FGD) 프레임워크를 제안해, 추론 효율은 그대로 유지하면서 장문서 검색에서 SOTA를 달성한다.
Dense retrieval에서 임베딩 차원을 늘리면 성능이 좋아진다는 건 거의 상식처럼 통용된다. Qwen-Embedding-8B는 4096차원, OpenAI text-embedding-3-large는 3072차원을 쓴다. 그런데 이 고차원 벡터의 모든 좌표가 검색에 도움이 될까? 이 논문의 출발점은 "그렇지 않다"는 관찰이다. 특정 질의(query)에