일관성 있는 이야기 삽화 생성을 위한 Text-to-image 생성 모델 활용 연구

A study on the Use of a Text-to-image Generative Model to Generate Consistent Story Illustrations
  • 명세민; 
  • 강다빈; 
  • 송채영; 
  • 홍정훈; 
  • 박상효

초록

Text-to-image 생성 모델의 발달로 텍스트에 일치하는 이미지를 만드는 것이 가능하게 되었으나, 이러한 모델을 현실 세계에 바로적용하기에는 여전히 고려해야 할 요소들이 존재한다. 특히 소설과 같이 긴 문장과 여러 단원으로 구성된 이야기에 대한 삽화를 생성하고자 할 경우 해당 매체가 가지는 특성을 반영하는 것이 중요하다. 따라서 본 논문은 Text-to-image 생성 모델을 활용하여 이야기에대한 삽화를 생성하는 프레임워크를 제안한다. 프레임워크는 대규모 언어 모델을 사용하여 긴 문장을 요약하고, 자동화된 방식으로 사전에 구축된 장르별 데이터 셋에 기반한 Text-to-image 검색 및 스타일이 일관된 이미지 생성 방법을 통해 이야기에 대한 여러 장의삽화를 생성한다. 최종적으로, 우리는 제안된 프레임워크와 기존 Text-to-image 생성 모델을 사용하는 경우를 정량적 및 정성적으로분석하여, 제안된 프레임워크가 이야기에 대한 삽화 제작에 있어 유효함을 입증한다.

키워드

Generative Model; Text-to-image Generation; Deep Learning
제목
일관성 있는 이야기 삽화 생성을 위한 Text-to-image 생성 모델 활용 연구
제목 (타언어)
A study on the Use of a Text-to-image Generative Model to Generate Consistent Story Illustrations
저자
명세민; 강다빈; 송채영; 홍정훈; 박상효
DOI
10.5909/JBE.2024.29.6.1043
발행일
2024-11
유형
Y
저널명
방송공학회 논문지
권
29
호
6
페이지
1043 ~ 1055