데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      Screen Size Adaptive Video Retargeting 기술 연구 - 연구 결과(3)

      andy288400 23.11.07
      612 1 0
      DEVOTEE 요약
      안녕하세요, SKT AI Fellowship 5기 팀 LGTM입니다. 저희는 계층적 디스크리미네이터를 사용하여 비디오 아웃페인팅을 개선하고, 4:3 비율의 옛날 영상을 16:9 비율로 전환하는 기술을 개발했습니다. 이로 인해 SOTA 모델보다 2.09dB 높은 PSNR과 240배 빠른 인퍼런스를 달성하며 상용화 가능성을 입증했습니다.
      DEVOTEE 추천 블로그

      안녕하세요! SKT AI Fellowship 5기에서 Screen Size Adaptive Video Retargeting에 대한 연구 과제를 수행하고 있는 4번 팀 LGTM (Looks Good To Me) 입니다.

      이번 게시글을 통해 연구 결과에 대해 공유하고자 합니다. 저희는 계층적 discriminator을 고안해 Video Retargeting 태스크를 풀어냈습니다.


      먼저 저희 모델의 데모 영상을 첨부하였습니다.

      왼쪽 위는 input, 오른쪽 위는 기존 outpainting SOTA 모델, 왼쪽 아래는 inpainting SOTA 모델이고, 오른쪽 아래가 저희 모델입니다.


      1. 연구 목적

      저희 조의 목표는 비디오의 바깥쪽 영역을 채워 화면비율을 확장하는 Outpainting입니다.

      궁극적으로는 4:3 화면비의 옛날 영상을 16:9 화면비로 Retargeting해서, 최신 영상 기기에서 편안하게 시청할 수 있는 기술을 상용화하는 것이 목적입니다.

      image.png

      디스플레이 기술이 발전하면서 주로 서비스되는 영상들의 aspect ratio도 변화됩니다.

      그에 따라 과거에 만들어진 비디오들을 현재 주로 사용되는 비디오 비율로 확장하고자 하는 수요가 큽니다.

      또한 여러 콘텐츠 플랫폼에서 편안한 시청자 경험을 위해 비디오의 비율을 적절하게 조정하는 기술을 필요로 하고 있습니다.


      예를 들어 최근 유튜브 업데이트에서는, 영상을 시청하는 기기와 영상의 비율이 맞지 않아 발생하는 여백 부분을 영상과 비슷한 색으로 채우는 방식을 도입했습니다.

      가장 큰 동영상 스트리밍 서비스인 유튜브의 이러한 선택은, 비디오 비율을 시청 기기에 맞추어 주는 것이 사용자 경험에 영향이 크다는 것을 보여줍니다.


      이러한 수요에도 불구하고, Video Outpainting연구는 아직 많이 이뤄지지 않고 있습니다. 왜냐하면 바깥 부분을 consistent하게 비디오로 복구하는 것이 매우 어렵기 때문입니다.

      작년 CVPR 워크샵에 발표된 연구가 거의 유일한데요, 이 모델조차도 배경밖에 생성하지 못한다는 극명한 단점이 있습니다.

      그래서 사람이나 중심 물체를 생성하지 못하고, 아래 샘플에서도 자전거와 자전거에 탄 사람이 뚝 끊기다가 사라지게 됩니다.

      또한 이 모델은 내부적으로 딥러닝 모델을 3개나 사용하고, 바깥 영역을 한번의 모델 pass로 채우는 것이 아니라 몇 픽셀씩 반복적으로 채워나가기 때문에,

      겨우 100프레임 비디오를 outpainting하는데 1시간이 걸려 상용화가 불가능한 수준입니다.

      image.png

      미디어3.gif

      저희는 관점을 바꿔, 연구가 활발하게 이루어지는 Video Inpainting 분야의 최고 성능 모델인 E2FGVI 을 가져와 Outpainting에 사용해보고자 했습니다.


      하지만 당연하게도 Inpainting 모델은 내부의 중심 물체를 지우는 것을 학습했기 때문에, 바로 Outpainting적용하면 좋지 않은 결과를 보입니다.

      이 비디오처럼 회색으로 채워버리거나 지직거리는 아티팩트들을 만들어내죠.

      또 단순하게 이 모델과 loss를 그대로 사용해 outpainting에 fine-tuning해도, 저희가 실험해본 결과 성능이 오히려 떨어졌습니다.

      이러한 실험 과정 중 저희는 discriminator 와 generative loss가 결과에 큰 영향을 끼친다는 것을 발견했습니다.


      이에 앞서 video inpainting 및 outpainting의 일반적인 프레임워크를 간단히 소개드리겠습니다.

      마스크된 비디오를 입력으로 받아 generator은 마스킹된 부분에 들어갈 픽셀 값을 예측합니다.

      discriminator은 이렇게 생성된 비디오를 입력으로 받아 이 비디오가 진짜 데이터인지 모델에 의해 생성된 데이터인지 판별합니다.

      그리고 generator은 생성된 비디오를 Ground truth 비디오와 비교해 얻은 reconstruction loss와, discriminator 을 통해 주어진 generative loss 두 개의 가중합에 대해 학습합니다.

      image.png

      비디오 태스크에서 이처럼 generative loss를 사용해주는 이유는 Reconstruction 이 잘 되더라도 perceptual quality 가 낮을 수 있기 때문입니다.

      더 자세하게, discriminator과 generative loss의 목적은 크게 3가지로 정리할 수 있습니다.

      첫째, 프레임 간의 temporal consistency가 지켜지고 있는지 평가하고,

      둘째, blurry 하거나 jittery한 아티팩트들이 있는지 평가하고,

      셋째, 생성된 부분이 real data 와 consistent한지 평가해야합니다.

      image.png

      저희가 발견한 문제점은, 현재 비디오 태스크에서 널리 사용되고, E2-FGVI에서도 사용한 T Patch GAN discriminator 및 loss가 이 중 첫번째와 두번째 목적을 잘 달성하지 못하고 있다는 것입니다.

      그래서 T Patch GAN discriminator을 사용해 E2FGVI를 비디오 아웃페인팅에 fine-tuning 시키면, blurry하거나 지직거리는 결과물이 나오게 됩니다.

      image.png


      그 이유는 T PatchGAN의 디자인에 있습니다. T PatchGAN은 3d convolution을 쌓아나가 점점 receptive field를 늘려서 마지막 레이어는 비디오 전체를 보고 비교할 수 있도록 디자인되었는데,

      이 마지막 Feature 을 갖고서만 loss를 계산하기 때문에 content를 비교하는 global objective에 집중하게 됩니다.

      하지만 그러면 바깥쪽의 생성된 영역의 퀄리티 평가가 잘 이루어지지 않기 때문에, 저희는 더 explicit 하게 outpainting을 위한 objective 가 필요하다고 생각했습니다.

      image.png

      2. 연구 방법

      그래서 저희는 video outpainting을 위한, 새로운 Discriminator 구조 및 loss를 제안합니다.

      그림은 저희가 새롭게 제안한 hierarchical discriminator 의 구조입니다.

      깊은 레이어로 갈수록 receptive field 가 커지는 Convolution 의 특성을 고려해, 얕은 층에선 주어진 receptive field 의 perceptual quality를 평가하고,

      깊은 층에서는 global하게 feature을 비교하는 구조입니다.

      여기서 local feature extractor (LFEM) 은 3d convolution로 구성했습니다.

      image.png

      그러한 학습이 가능한 것은 저희가 제안한 loss 덕분인데요, 마지막 레이어의 Feature인 x_f, z_f 뿐만 아니라 LFEM의 아웃풋인 중간 feature들 x_c, x_d 와 z_c, z_d 을 고려하는 구조입니다.

      특히 중간 feature은 아직 receptive field 가 작아 local한 정보를 담고 있기 때문에, 중간 feature 전체가 아니라 outpaint된 부분만 loss 계산에 반영하도록 디자인했습니다.

      이를 통해 가운데 부분은 주어진 비디오인데도 global한 feature만을 고려하기 때문에 fake로 predict하도록 배우는 T-PatchGAN discriminator의 단점을 극복했습니다.

      image.png

      3. 연구 결과

      image.png

      비디오 태스크에 널리 사용되는 DAVIS 데이터셋을 사용해 저희가 제안한 방법과 기존 SOTA 모델들을 비교한 결과입니다. 보시다시피, 큰 격차로 SOTA를 이뤄냈습니다.

      게다가 2020년 연구 대비 2022년 연구의 PSNR 증가폭이 1.34dB였는데요,

      저희는 기존 SOTA인 2022년 연구보다 PSNR을 2.09dB을 증가시켰습니다. 오른쪽은 DAVIS 테스트 셋 결과 예시입니다.

      image.png

      데모 비디오의 장면입니다. 위가 기존 Outpainting SOTA결과이고, 아래가 저희 결과인데요,

      노란 박스를 보면 기존 sota에서는 아예 잘려버렸던 오토바이 앞바퀴, 뒷바퀴, 헬멧 등을 저희 모델은 완전히 자연스럽게 복구하는 것을 볼 수 있습니다.

      또 배경 생성조차 저희 모델에서 더 잘 되는 것을 볼 수 있습니다.

      image.png

      또한 저희가 제안한 구조가 성능 향상에 기여했다는 것을 증명하기 위해 ablation study를 진행했습니다.

      먼저 E2-FGVI 를 기존의 t-patch gan discriminator 로 Fine-tuning 시키는 것은 오히려 성능이 24.73에서 24.04로 떨어지는 것을 볼 수 있습니다.

      이는 저희가 제안하는 discriminator과 loss를 사용하는 fine tuning 방식이 t patch-gan보다 훨씬 더 아웃페인팅 태스크에 적합하고 효과적이라는 것을 보여줍니다.

      image.png

      E2-FGVI 베이스라인과 비교입니다. 저희가 제안한 방식으로 fine-tuning을 하자 양끝의 blurry 한 부분들이 확연히 사라진 것을 보실 수 있습니다.

      그래서 생성된 부분의 위화감이 크게 줄어들었습니다.

      image.png

      마지막으로 efficiency입니다. 저희가 제안한 구조는 모두 학습에만 사용되고, 인퍼런스는 e2-fgvi를 기반으로 하고 있기에, End-to-end 로 매우 빠른 inference가 가능합니다.

      V100 GPU 1장을 사용해 연산해본 결과 저희 모델은 480p 비디오를 프레임당 0.15초 내에 인퍼런스가 가능하지만,

      3개의 딥러닝 모델을 사용하고 반복적으로 픽셀을 채우는 기존 sota의 경우 프레임당 약 36초가 소요됐습니다.

      이는 240배의 차이로, 엄청난 속도의 개선을 이뤄냈습니다.

      image.png

      요약하자면 저희는 비디오 아웃페인팅을 위한 새로운 계층적 discriminator 구조와 Loss를 제안하였고,

      이를 이용해 CVPR 및 CVPR 워크샵 SOTA 논문들을 뛰어넘어 가장 뛰어난 아웃페인팅 성능을 달성하였습니다.

      뿐만 아니라 기존 아웃페인팅 SOTA 모델과 비교했을 때 inference 속도를 240배 이상 향상시킴으로써 실제로 상용화하여 적용이 가능한 수준의 효율성을 보여주었습니다.

      현재 연구 결과와 관련된 특허 4건 출원 및 논문 투고를 계획하고 있습니다.


      감사합니다.

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      andy288400 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기