kangnlp

Tags /

#moment-retrieval

1개의 글

논문 리뷰35

논문 리뷰: ViLL-E: Video LLM Embeddings for Retrieval

하나의 VideoLLM이 텍스트 생성(캡셔닝·QA)과 임베딩 기반 검색(비디오 검색·모먼트 검색)을 동시에 해내도록, 생성-대조 결합 학습과 "복잡한 비디오엔 더 오래 생각하는" 적응형 임베딩 헤드를 붙인 통합 모델.