23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요. 저희는 SKT AI Fellowship 5기 3번 과제 "AI기반 한국어 자막 자동 조정 기술"을 연구 중인 Cap-Tin입니다.
이번엔 중간 발표 때까지 진행된 상황을 공유하고자 합니다.
위 그림은 각각 wavve, NETFLIX, Youtube Shorts를 통해 서비스되고 있는 드라마의 한 장면입니다.
영상의 음성 및 상황에 대한 이해를 보조하고자 자막을 제공하고 있으며, 이러한 자막 작업은 수작업으로 진행되고 있습니다.
이에 따라 서비스를 제공하는 입장에선 (1) 시간과 비용 측면의 부담이 존재하며, 영상을 제작하는 입장에선 (2) 제한된 기한으로 인한 실수가 발생하기도 합니다.
(3) 해당 분야의 연구 또한 충분하지 않아 맞춤법 교정 및 자막 삽입이 적절하게 진행되지 않습니다.
따라서, 저희는 왼쪽 영상의 문제점인 띄어쓰기 오류, 맞춤법 오류, 문맥을 해치는 개행 등의 문제점을 개선하여 오른쪽 영상처럼 만들고자 합니다.
영상에서 음성인식 을 통해 텍스트를 생성합니다. 이때 텍스트는 교정되지 않은 텍스트로 ‘사형투펴’와 ‘하게씁니다.’와 같이 맞춤법 오류를 포함하고 있습니다.
맞춤법 교정 모듈 은 이러한 텍스트를 교정하여 결과로 출력합니다. 이어지는 긴 문장 개행 모듈 은 영상 시청 시 한눈에 자막이 들어오게 줄 바꿈 합니다.
마지막으로 자막 배치 모듈 을 통해 수정된 자막을 영상 시청에 방해되지 않는 위치에 삽입합니다.
이제 각 모듈의 진행 상황을 보겠습니다.
맞춤법 교정 모듈은 음성인식을 통해 추출한 문장의 오탈자와 띄어쓰기 오류를 수정합니다.
한국어 문법 연구용 데이터 세트를 활용하였으며, 오탈자와 띄어쓰기 오류가 있는 INPUT 문장과 이를 수정한 LABEL 문장으로 이루어져 있습니다.
기존 연구가 Transformer 기반의 생성 모델을 사용했다는 점을 참고하여 Transformer 기반 전이 학습 모델인 KoGPT-2 를 사용하였습니다.
또한, 맞춤법 문제이기 때문에 입력된 문장의 흐름을 이해하는 것이 중요하다고 판단하여 KoBART 도 함께 사용하였습니다.
BLEU | 기존 연구 | KoGPT-2 | KoBART |
|---|---|---|---|
1-gram | 0.880 | 0.654 | 0.932 |
4-gram | 0.686 | 0.331 | 0.812 |
실험 결과, BLEU 점수 4-gram을 기준으로 KoBART가 KoGPT-2와 기존 연구보다 높은 성능을 달성한 것을 확인할 수 있습니다.
문장 개행 모듈은 길이가 긴 (1) 자막이 영상 하단을 차지하는 문제를 해결하고 (2) 자막의 문맥을 빠르게 이해하기 위해 문장의 맥락을 파악하여 긴 문장을 두 문장으로 개행하는 모듈입니다
많은 시행착오 끝에 청각 장애인용 자막 데이터를 활용하였습니다.
청각 장애인용 자막에서 끊어지는 두 문장을 수집한 후, 연결한 문장은 Input 데이터로 원래 개행 지점인 공백 위치를 Label 데이터로 이용합니다.
문장 간 개행 연구에서 활용한 KoBERT 와 이를 변형하여 성능을 향상시킨 KoELECTRA , KcELECTRA 를 활용하여 학습을 진행하였고, 성능이 가장 좋았던 KcELECTRA로 모듈을 구성하였습니다.
자막이 주어지면 ( Preprocessor ) 전처리 되며, ( KcELECTRA ) 개행 지점을 예측하고 이를 통해 ( Postprocessor ) 개행된 결과를 출력합니다.
자막 배치 모듈은 앞선 모듈을 통해 완성된 자막을 영상과 조화롭게 배치하는 모듈입니다.
영상이 입력되면 Object Detector 가 영상의 직접적인 메세지이자 매개체인 사람과 텍스트 객체를 탐지합니다.
탐지된 객체 정보는 Positioning 알고리즘 에 입력되어 자막이 삽입될 공간을 찾고 해당 공간에 자막을 배치한 영상을 출력합니다.
Positioning 알고리즘을 통해 선정된 현재 자막의 위치는 (1) 영상 하단과 상단 중 한 곳이어야 하고, (2) 탐지된 사람과 텍스트 객체와의 겹침이 최소화되는 곳이어야 하며,
(3) 이전 자막의 위치와 크게 차이나지 않는 곳이어야 합니다. 이에 대한 예시는 다음과 같습니다.
첫 번째 행처럼 하단에 객체가 탐지되었다면 자막을 상단에 배치합니다.
두 번째 행처럼 텍스트와 사람 객체가 영상에 골고루 분포되어 있다면 기본 위치인 하단으로 내려와 최대한 객체와 겹치지 않는 공간을 찾아 자막을 배치합니다.
현재 시스템은 고유명사에 제대로 대처하지 못합니다.
위 그림의 '에이닷'이 음성인식을 통해 '에이다'라는 텍스트로 변환되었습니다.
에이닷이 맞는 단어임에도 에이다 또한 문법적으로 틀린 단어가 아니기 때문에 맞춤법 교정 모델이 오류를 찾아내지 못합니다.
따라서, 이후 연구에서 '에이닷'과 같은 (1) 고유명사를 인식할 수 있는 기능을 추가함과 동시에 (2) 전반적인 시스템의 성능을 향상시키고자 합니다.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.