데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      AI기반 한국어 자막 자동 조정 기술 - 연구과정(2)

      CapTin 23.09.07
      939 4 0
      DEVOTEE 요약
      SKT AI Fellowship 5기 3번 과제 "AI기반 한국어 자막 자동 조정 기술" 연구 결과를 공유합니다. 이 연구는 수작업으로 처리되던 한국어 자막 작업을 자동화하여 시간과 비용을 절감하고 텍스트의 맞춤법 오류와 문장 개행 문제를 개선합니다. 맞춤법 교정 모듈은 KoGPT-2와 KoBART를 사용하여 좋은 성능을 보여주었고, 문장 개행 모듈은 KcELECTRA를 활용하여 개행을 수행합니다. 마지막으로 자막 배치 모듈은 Object Detector와 Positioning 알고리즘을 사용하여 자막을 적절하게 배치합니다.
      DEVOTEE 추천 블로그

      안녕하세요. 저희는 SKT AI Fellowship 5기 3번 과제 "AI기반 한국어 자막 자동 조정 기술"을 연구 중인 Cap-Tin입니다.

      이번엔 중간 발표 때까지 진행된 상황을 공유하고자 합니다.


      연구 목표

      image example for Wavve, Netflix, Youtube Shorts

      위 그림은 각각 wavve, NETFLIX, Youtube Shorts를 통해 서비스되고 있는 드라마의 한 장면입니다.

      영상의 음성 및 상황에 대한 이해를 보조하고자 자막을 제공하고 있으며, 이러한 자막 작업은 수작업으로 진행되고 있습니다.

      이에 따라 서비스를 제공하는 입장에선 (1) 시간과 비용 측면의 부담이 존재하며, 영상을 제작하는 입장에선 (2) 제한된 기한으로 인한 실수가 발생하기도 합니다.

      (3) 해당 분야의 연구 또한 충분하지 않아 맞춤법 교정 및 자막 삽입이 적절하게 진행되지 않습니다.

      left: 기존 영상, right: 시스템 적용 예상 영상

      따라서, 저희는 왼쪽 영상의 문제점인 띄어쓰기 오류, 맞춤법 오류, 문맥을 해치는 개행 등의 문제점을 개선하여 오른쪽 영상처럼 만들고자 합니다.


      시스템 구조

      system structure

      영상에서  음성인식 을 통해 텍스트를 생성합니다. 이때 텍스트는 교정되지 않은 텍스트로 ‘사형투펴’와 ‘하게씁니다.’와 같이 맞춤법 오류를 포함하고 있습니다.

       맞춤법 교정 모듈 은 이러한 텍스트를 교정하여 결과로 출력합니다. 이어지는  긴 문장 개행 모듈 은 영상 시청 시 한눈에 자막이 들어오게 줄 바꿈 합니다.

      마지막으로  자막 배치 모듈 을 통해 수정된 자막을 영상 시청에 방해되지 않는 위치에 삽입합니다.


      이제 각 모듈의 진행 상황을 보겠습니다.

      1. 맞춤법 교정 Module

      맞춤법 교정 모듈은 음성인식을 통해 추출한 문장의 오탈자와 띄어쓰기 오류를 수정합니다.

      한국어 문법 연구용 데이터 세트를 활용하였으며, 오탈자와 띄어쓰기 오류가 있는 INPUT 문장과 이를 수정한 LABEL 문장으로 이루어져 있습니다.

      맞춤법 교정 Module Processing

      기존 연구가 Transformer 기반의 생성 모델을 사용했다는 점을 참고하여 Transformer 기반 전이 학습 모델인  KoGPT-2 를 사용하였습니다.

      또한, 맞춤법 문제이기 때문에 입력된 문장의 흐름을 이해하는 것이 중요하다고 판단하여  KoBART 도 함께 사용하였습니다.

      BLEU

      기존 연구

      KoGPT-2

      KoBART

      1-gram

      0.880

      0.654

      0.932

      4-gram

      0.686

      0.331

      0.812

      실험 결과, BLEU 점수 4-gram을 기준으로 KoBART가 KoGPT-2와 기존 연구보다 높은 성능을 달성한 것을 확인할 수 있습니다.


      2. 문장 개행 Module

      문장 개행 모듈은 길이가 긴 (1) 자막이 영상 하단을 차지하는 문제를 해결하고 (2) 자막의 문맥을 빠르게 이해하기 위해 문장의 맥락을 파악하여 긴 문장을 두 문장으로 개행하는 모듈입니다

      dataset example

      많은 시행착오 끝에 청각 장애인용 자막 데이터를 활용하였습니다.

      청각 장애인용 자막에서 끊어지는 두 문장을 수집한 후, 연결한 문장은 Input 데이터로 원래 개행 지점인 공백 위치를 Label 데이터로 이용합니다.


      개행 지점 예측, 유사한 모델과 KoBERT, KoELECTRA, KcELECTRA 비교

      문장 간 개행 연구에서 활용한  KoBERT 와 이를 변형하여 성능을 향상시킨  KoELECTRA ,  KcELECTRA 를 활용하여 학습을 진행하였고, 성능이 가장 좋았던 KcELECTRA로 모듈을 구성하였습니다.


      개행 Module Processing

      자막이 주어지면 ( Preprocessor ) 전처리 되며, ( KcELECTRA ) 개행 지점을 예측하고 이를 통해 ( Postprocessor ) 개행된 결과를 출력합니다.


      3. 자막 배치 Module

      자막 배치 모듈은 앞선 모듈을 통해 완성된 자막을 영상과 조화롭게 배치하는 모듈입니다.

      자막 배치 Module Processing

      영상이 입력되면  Object Detector 가 영상의 직접적인 메세지이자 매개체인 사람과 텍스트 객체를 탐지합니다.

      탐지된 객체 정보는  Positioning 알고리즘 에 입력되어 자막이 삽입될 공간을 찾고 해당 공간에 자막을 배치한 영상을 출력합니다.


      Positioning 알고리즘을 통해 선정된 현재 자막의 위치는 (1) 영상 하단과 상단 중 한 곳이어야 하고, (2) 탐지된 사람과 텍스트 객체와의 겹침이 최소화되는 곳이어야 하며,

      (3) 이전 자막의 위치와 크게 차이나지 않는 곳이어야 합니다. 이에 대한 예시는 다음과 같습니다.

      자막 배치 Module Results

      첫 번째 행처럼 하단에 객체가 탐지되었다면 자막을 상단에 배치합니다.

      두 번째 행처럼 텍스트와 사람 객체가 영상에 골고루 분포되어 있다면 기본 위치인 하단으로 내려와 최대한 객체와 겹치지 않는 공간을 찾아 자막을 배치합니다.


      끝으로

      고유명사 대처 불가에 대한 그림

      현재 시스템은 고유명사에 제대로 대처하지 못합니다.

      위 그림의 '에이닷'이 음성인식을 통해 '에이다'라는 텍스트로 변환되었습니다.

      에이닷이 맞는 단어임에도 에이다 또한 문법적으로 틀린 단어가 아니기 때문에 맞춤법 교정 모델이 오류를 찾아내지 못합니다.

      따라서, 이후 연구에서 '에이닷'과 같은 (1) 고유명사를 인식할 수 있는 기능을 추가함과 동시에 (2) 전반적인 시스템의 성능을 향상시키고자 합니다.

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      CapTin 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기