논문 리뷰약 18분
논문 리뷰: Beyond the Limitation of a Single Query: Train Your LLM for Query Expansion with RL (ExpandSearch)
한 줄 요약: 단일 검색 쿼리의 한계를 넘기 위해, 강화학습으로 LLM이 다중 쿼리 확장(Expand)을 학습하고, 별도의 요약 모델(Squeezer)로 검색 결과를 압축(Squeeze)하여 멀티홉 QA에서 SOTA를 달성한 프레임워크.
Tags /
2개의 글
한 줄 요약: 단일 검색 쿼리의 한계를 넘기 위해, 강화학습으로 LLM이 다중 쿼리 확장(Expand)을 학습하고, 별도의 요약 모델(Squeezer)로 검색 결과를 압축(Squeeze)하여 멀티홉 QA에서 SOTA를 달성한 프레임워크.
한 줄 요약: 프로세스 보상이나 SFT 없이, 2단계 결과 기반 강화학습(RL)만으로 LLM이 추론 중 자율적으로 외부 검색을 수행하도록 학습시키는 프레임워크