오픈소스 기반 데이터 스크래핑 탐지 시스템 설계 및 구현

Design and Implementation of Data Scraping Detection System based on Open Source
  • 이지율; 
  • 이용주

초록

데이터는 4차 산업혁명과 디지털 전환의 핵심 요소로서 제2의 원유라 불린다. 그러나 불법적으로 웹스크래핑을 통해 수집한 데이터는 소유자와 수집자 간의 분쟁을 일으키고 있다. 본 논문에서는 데이터 소유자의 권리를 보호하기 위해 오픈소스를 기반으로 웹스크래핑을 탐지하는 시스템을 설계하고 구현한다. 선형회귀를 스크래핑 탐지 모델에 사용하였으며 입력값으로 스크래핑을 시도하는 전후 시간 간격을 사용한다. 반복적인 패턴은 선형회귀에서 일직선의 형태를 띄며 입력값이 많을수록 기울기는 0에 수렴하게 된다. 분석시스템은 DBMS 간 실시간 데이터 동기화 기술을 사용하였는데 이는 웹서버와 분석서버를 분리하여 부하를 분산시킨다. 데이터 분석 및 시각화 구현을 위해 R과 Shiny 패키지를 사용하는데 이는 복잡한 분석 기능을 쉽게 제공하고 반응형 웹 대시보드를 제공한다.

키워드

데이터 스크래핑; 선형회귀; R/Shiny; 실시간 데이터 전송; Data Scraping; Linear Regression; R/Shiny; Real-time Data Capture
제목
오픈소스 기반 데이터 스크래핑 탐지 시스템 설계 및 구현
제목 (타언어)
Design and Implementation of Data Scraping Detection System based on Open Source
저자
이지율; 이용주
DOI
10.13067/JKIECS.2024.19.6.1309
발행일
2024-12
유형
Y
저널명
한국전자통신학회 논문지
권
19
호
6
페이지
1309 ~ 1318