논문 리뷰약 35분
논문 리뷰: ViLL-E: Video LLM Embeddings for Retrieval
하나의 VideoLLM이 텍스트 생성(캡셔닝·QA)과 임베딩 기반 검색(비디오 검색·모먼트 검색)을 동시에 해내도록, 생성-대조 결합 학습과 "복잡한 비디오엔 더 오래 생각하는" 적응형 임베딩 헤드를 붙인 통합 모델.
Tags /
1개의 글
하나의 VideoLLM이 텍스트 생성(캡셔닝·QA)과 임베딩 기반 검색(비디오 검색·모먼트 검색)을 동시에 해내도록, 생성-대조 결합 학습과 "복잡한 비디오엔 더 오래 생각하는" 적응형 임베딩 헤드를 붙인 통합 모델.