상세 보기
초록
텍스트-비디오 검색 문제는 주어진 텍스트 쿼리를 활용하여 관련 비디오를 검색하는 연구 분야이다. 이를 위해 텍스트와 비디오 데이터 데이터의 의미가 잘 표상된 공통-임베딩 공간을 구축하여 검색에 활용하는 공통-임베딩 기반 방법들이 널리 사용된다. 그러나 두 종류의 입력 데이터는 본질적으로 서로 다른 특성을 가지고 있기 때문에 공통-임베딩 공간에서의 분포 차이가 발생하고 이는 검색 성능의 저하로 이어질 수 있다. 이러한 문제를 극복하기 위해 본 연구는 비디오의 시각적 특징과 언어적 특징을 결합하는 새로운 비디오 특징 표현 방법을 제안한다. 구체적으로, 제안하는 모델은 비디오로부터 캡션을 생성하고 이 캡션을 비디오의 시각적 특징과 결합하여 언어적 정보와 시각적 정보가 결합된 개선된 비디오 특징 벡터를 생성하였다. 이러한 강화된 특징 벡터는 추론 과정에서 쿼리로 주어지는 텍스트와 후보 비디오간의 모달리티 간격을 완화시킴으로써, 비디오 검색 성능을 향상시킨다. 제안된 방법의 성능을 검증하기 위해 수행한 두가지 벤치마크 데이터셋에 대한 실험에서 베이스라인 모델 대비 Recall@sum 지표로 3.7%(MSR-VTT), 0.7%(VATEX)의 성능 향상을 확인하였다.
키워드
text-video retrieval; joint-embedding space; video feature representation; videocaptioning; 텍스트-비디오 검색; 공통-임베딩 공간; 비디오 특징 표현; 비디오-캡셔닝
- 제목
- 생성 기반 캡션 정보가 결합된 비디오 특징을 이용한 텍스트-비디오 검색 성능 향상
- 제목 (타언어)
- Improving Text-video Retrieval Performance Using Video Features Combined with Generation-based Caption Information
- 저자
- 허찬; 이동훈; 박혜영; 박상효
- 발행일
- 2024-02
- 유형
- Y
- 권
- 30
- 호
- 2
- 페이지
- 84 ~ 90
- 언어
- KOR
- 출판사
- 한국정보과학회
- 발행국가
- 대한민국
- 분량
- 7 페이지
- ISSN
- E 2383-6326
P 2383-6318