데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      AI기반 한국어 자막 자동 조정 기술 - 연구계획(1)

      CapTin 23.06.15
      1,894 10 1

      안녕하세요? 저희는 AI Fellowship 5기 3번 연구 과제에 참여하게 된 Cap-Tin 입니다.

      Caption과 Tinsel을 합친 것으로 크리스마스 장식 중 하나인 틴셀처럼 자막을 적절하게 생성 및 배치하고자 하는 각오를 담았습니다.


      저희 연구 과제는 "AI기반 한국어 자막 자동 조정 기술"로

      영상 컨텐츠에 적절한 자막 서비스를 제공함으로써 사회적/기술적 가치를 창출하는 것을 목표로 합니다.


      자막은 영상 내 음성 컨텐츠를 텍스트로 변환함으로써 영상 정보를 다양한 형태로 전달합니다.

      이를 위해 한국어 콘텐츠에 대한 한국어 자막을 생성하는 과정에서 시간과 비용을 줄이고자 자막 자동 조정 기술을 개발하는 것입니다.



      자막 맞춤법 교정

      음성에서 막 변환된 텍스트는 소리를 문자로 변환한 것이므로 여러 문제가 발생할 수 있으며,

      이때 고려해야 할 사항은 맞춤법, 고유 명사 및 욕설 대치, 긴 한국어 문장 개행입니다.

      입력->맞춤법 교정 module->명사/욕설 대치 module->문장 개행 module

      음성 인식에서 텍스트로 변환된 문장을 입력으로 받아 문장 의미/구조적인  맞춤법 교정 을 거친 후,

      단어 단위의 처리를 위해  고유 명사 및 욕설 대치 를 실시합니다.

      나아가 문장을 시각적인 요소로 이용하고자  긴 한국어 문장 개행 하는 것으로 텍스트 측면의 자막 처리가 끝나게 됩니다.



      1. 맞춤법 교정

      맞춤법 교정 단계는 다음과 같습니다.

      맞춤법 교정 module 세부 진행 과정

      사전 구축된 온라인 데이터를 사용하여  ('틀린 문장', '고친 문장')  데이터 세트를 구축합니다.

      한국어 텍스트의 문맥 이해와 의미 추론에 집중하여 개발된 BERT 기반 모델,  KoBERT 와

      한국어 문맥을 고려한 한국어 텍스트 생성을 위해 개발된 BART 기반 모델,  KoBART 를 이용하여 문법 측면의 문제를 해결합니다.



      2. 명사/욕설 대치

      음성을 통해 생성된 단어는 영상에서 주요하게 이야기 하는 명사 단어와 다르게 인식될 수 있으므로

      고유 명사 및 욕설 대치 단계가 필요합니다.

      따라서, 대치하고자 하는 단어와 인식된 단어를 벡터화하여 비교하는 방법과 아래 과정을 통해 해당 문제를 해결하고자 합니다.

      CLIP을 이용한 대치

      고유 명사와 구어체 욕설을 수집하여  ('고유 명사/욕설', '대치 단어') 데이터 세트를 구축합니다.

      그림으로 표현된 텍스트와 기존 텍스트의 유사도를 계산함으로써 영상에서 의도한 단어로 대체합니다.

      이때, 대규모 데이터 세트를 통해 그림과 텍스트를 같은 차원에서 계산하는  CLIP 모델을 이용하여 단어 단위의 처리를 마무리합니다.



      3. 개행

      문장 개행 단계는 다음과 같습니다.

      문장 개행 module 세부 진행 과정

      음성을 통해 변환된 문장이 구어체인 것을 고려하여 말하는 형식이 대중적인 발라드, 힙합 장르의 데이터를 이용하여  ('연결 문장', '개행 문장') 쌍의 데이터 세트를 구축합니다.

      문장 개행은 의미적 분할 만큼 구조적이고 시각적인 분할 또한 필요한 작업이므로

      문맥 정보를 이해하여 문장 구조에 초점을 맞춘  CNN 과

      문맥을 이해하여 의미적 분할에 초점을 맞춘  KoBERT 를 이용하고자 합니다.

      또한, 개행하는 지점을 효과적으로 학습시키기 위해 불균형 데이터에 대한 손실 함수로써 Focal loss를 적용합니다.



      자막 위치 선정

      자막은 내용만큼 위치 선정이 중요합니다.

      YOLO를 이용한 객체 검출

      '기존 영상의 컨텐츠를 가리지 않을 것'과 '시각적 요소로 영상에 녹아들 것'을 충족시키고자

      YOLO를 통해 영상 내 객체 위치를 확인하고 그 위치를 피해 자막을 위치시킵니다.


       YOLO 는 단일 영상을 그리드로 분할하고 각 셀에 포함된 객체를 확인하여 영상의 구성을 파악하는 모델입니다.

      이 과정에서 영상의 주된 객체인 사람과 이미 영상에 컨텐츠로 포함된 텍스트를 피해 자막을 배치하는 것을 목표로 합니다.

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      CapTin 님의 최신 블로그

      더보기
      동영상 기고하기