데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      VPP를 위한 Object Insertion 기술 연구 - 연구결과(3)

      PROLCY 24.11.05
      306 1 0
      DEVOTEE 요약
      SKT AI Fellowship 6기 C12 과제 VPP를 위한 Object Insertion 기술 연구를 진행한 인서트(INserT) 팀입니다. 이번 연구에서는 VPP를 위한 파이프라인을 개발하여 물체 삽입을 자동화하고, 물체의 위치 결정, 렌더링, 조명 정보 추론 등을 통해 자연스럽고 고퀄리티의 콘텐츠를 제작하는 과정을 소개했습니다. 연구 결과를 통해 성과를 거뒀지만, 고화질 영상 처리와 Occlusion 처리의 어려움 등 한계점도 지적하고 있으며, 앞으로 이를 개선하기 위한 연구가 필요합니다.
      DEVOTEE 추천 블로그

      안녕하세요!


      저희는 SKT AI Fellowship 6기 C12 과제 VPP를 위한 Object Insertion 기술 연구를 진행한 인서트(INserT) 팀입니다.


      드디어 기나긴 5개월간의 여정이 끝났습니다!

      이번 기록에서는 저희가 5개월 동안 진행한 연구를 정리하여 보여드리도록 하겠습니다!

      1. 연구 과제 소개

      VPP (Virtual Product Placement)

      image.png

      Virtual Product Placement (가상 상품 배치) 의 줄임말인 VPP는 제품, 간판 또는 비디오 형태의 디지털 콘텐츠에 특정 브랜드의 제품을 동적으로 삽입하는 기술입니다.

      익히 알려져있는 PPL (Product PLacement)은 영상을 촬영할 때 광고 상품이 삽입되지만, VPP는 촬영된 영상에 광고 제품이 삽입된다는 차이점이 있습니다.

      기존의 VPP는 비디오 편집 툴의 숙련도가 높은 전문가의 수동 작업이 필요해 시간과 비용이 많이 소요된다는 문제점이 존재합니다.

      따라서 저희 팀은 VPP를 AI 기술을 통해 구현 및 자동화함으로써 앞선 단점을 해결하고자 합니다.

      2. 연구 내용

      파이프라인 개요

      image.png

      저희가 개발한 파이프라인은 총 세 단계로 나뉩니다.

      1. 물체를 놓을 위치 결정

      2. 물체 렌더링 및 삽입

      3. 영상의 퀄리티를 높이기 위한 후보정

      image.png

      전체 파이프라인에서 사용된 모델은 위와 같습니다. 아래에서 차근차근 설명해드리겠습니다 😀

      Stage 1: 물체를 놓을 위치 결정

      image.png

      Stage1에서는 이미지 내에서 물체가 들어가기에 알맞은 이미지 픽셀 좌표를 추론합니다.


      사용 모델: RoboPoint

      image.png

      이 과정에서 저희가 채택한 모델은 RoboPoint[1] 인데요, 로보틱스 분야에서 로봇이 물체를 옮겨 놓을 액션 포인트를 찾기 위한 목적으로 학습된 Vision Language Model입니다.

      물체와 그 물체가 놓일 적절한 위치를 이해하고 있다는 점에서 저희 Task에도 적합하다고 판단했습니다!


      image.png

      실제 추론 과정은 위와 같이 이뤄지는데요, single-turn 반복 호출을 통해 필요한 정보를 뽑아내고, 최종 아웃풋으로 이미지 내의 정규화된 픽셀 좌표가 나오게 됩니다.


      image.png

      실제 추론 결과입니다! 위에서 알 수 있듯이, 삽입할 객체를 이해하고, 빈 공간과 맥락을 파악하여 적절한 위치를 선정한 모습을 확인할 수 있습니다.

      Stage 2: 물체 렌더링 및 삽입

      Stage2에서는 Stage1에서 나온 위치를 바탕으로 포인트 트래킹을 진행해 비디오 내에서 물체가 일관성있게 위치할 수 있도록 하고,

      카메라 정보를 추정하여 렌더링해 물체를 비디오에 삽입하는 과정을 거칩니다.

      2-1. Point Tracking

      image.png

      비디오 내에서 물체의 위치를 일관성있게 유지하기 위해 Point Tracking 모델을 도입했는데요,

      중간 연구까지 사용되었던 WOFT[2]의 한계를 극복하고자 다양한 모델을 탐색해봤습니다.

      최종적으로는 Long-Term 정보를 고려하는 MFT 모델을 선정하였습니다!


      사용 모델: MFT

      image.png

      MFT[3]는 연속된 단일 두 프레임간의 플로우 뿐만 아니라, 로그 간격으로 배치된 프레임 pair를 활용하여 트래킹을 진행합니다.

      타 모델과 달리, Uncertainty, Occlusion 확률을 고려하여 가장 신뢰성있는 플로우를 선택한다는 장점이 있어 이 모델을 최종적으로 선정했습니다!

      실제 트래킹 결과는 첨부파일 MFT_example.mp4, MFT_example2.mp4에서 확인하실 수 있습니다!


      2-2. 카메라 정보 및 depth 추론

      image.png

      다음은 카메라 정보 및 depth 추론입니다. 해당 정보를 가지고 물체가 놓일 평면과 카메라 위치를 계산하고 렌더링합니다.


      사용 모델: Droid-Calib & Depth Anything V2

      image.png

      카메라 정보 추론을 위한 모델로 Droid-Calib[4]을 선정하였습니다. 해당 모델은 단일 카메라로 촬영된 영상에서 자동적인 calibration으로 카메라 정보를 추정할 수 있도록 합니다.


      image.png

      또한 Droid-Calib에서 depth 정보가 나오긴 하지만, 부정확한 문제가 있어 최신 SOTA 모델인 Depth Anything V2[5]를 사용하여 depth를 따로 추론, 렌더링의 안정성을 향상시켰습니다.


      image.png

      실제로 카메라 정보 및 depth를 고려하여 렌더링을 할 경우, 위와 같이 보다 자연스럽게 물체가 렌더링되는 것을 확인할 수 있습니다.


      2-3. 조명 정보 추론 및 렌더링

      조명 정보 추론

      사실적인 렌더링을 위해서는 물체의 퀄리티뿐만 아니라 빛 표현도 매우 중요합니다. 따라서 비디오의 조명 정보를 추론하여 렌더링에 반영하는 방식을 선택했습니다.


      사용 모델: DiffusionLight

      image.png

      DiffusionLight[6]는 조명 조건 추론 문제를 HDR 환경 맵 생성 문제로 치환한 모델입니다. 반사율이 높은 크롬볼을 이미지 중앙에 생성하고, 이를 바탕으로 HDR 환경 맵을 생성합니다.

      오른쪽 사진에서 볼 수 있듯, 이 환경 맵을 가지고 렌더링을 할 시 좀 더 사실적인 퀄리티의 렌더링이 가능해집니다.


      image.png

      위의 예시는 실제 이미지를 가지고 HDR 환경 맵을 생성한 예시입니다.


      렌더링

      이후에는 최종적으로 물체 렌더링을 진행하게 됩니다.

      중간 연구까지는 렌더링 라이브러리로 pytorch3d를 사용하였으나, 전반적으로 품질이 낮고 그림자가 따로 만들어지지 않는다는 단점이 있었습니다.

      따라서 저희는 2가지의 새로운 렌더러를 탐색하였고, 자동화 가능 여부를 고려하여 최종적으로 Vulkan을 선택하였습니다.

      • Blender

        • 3D 모델 컴퓨터 그래픽스 소프트웨어

        • 그림자 종류 변경, 모션 블러 처리 등 높은 퀄리티의 오브젝트 렌더링 가능

        • 100% 자동화에는 어려움 존재

      • Vulkan

        • 3D 그래픽스 및 컴퓨팅 API

        • API 수준이기 때문에 높은 개발 난이도가 요구되지만, 높은 퀄리티의 렌더링 가능

        • 자동화 가능

      image.png

      앞서 조명 정보 추론 단계에서 나온 HDR 환경 맵을 가지고, Path Tracing이라는 방법을 통해 렌더링을 진행하면, 오른쪽과 같이 그림자까지 함께 오브젝트가 렌더링된 모습을 확인할 수 있습니다.

      Stage 3: 영상의 퀄리티를 높이기 위한 후보정

      마지막 단계는 영상의 퀄리티를 높이기 위한 후보정 작업입니다. 삽입된 물체는 원래 있던 물체가 아니기 때문에 부자연스러움이 존재합니다.

      이를 후보정 작업으로 처리하여 좀 더 자연스러운 비디오가 만들어질 수 있도록 합니다.


      사용 모델: Harmonizer

      image.png

      후처리 과정에서 사용하는 모델은 Harmonizer[7]입니다.

      해당 모델은 삽입한 물체와 기존 비디오가 어울리도록 색, 밝기, 스타일 등을 변경하는 Harmonization Task를 다루는 모델입니다.

      위 사진에서 볼 수 있듯이, Harmonization 처리가 된 영상이 기존 영상보다 훨씬 자연스러운 것을 확인할 수 있습니다.


      Noise Grain & Blur Addition

      image.png

      또한 촬영된 사진이나 영상에는 Camera Grain이라고 하는 미세한 노이즈 패턴이 존재하는데,

      저희가 렌더링한 물체는 3D 모델을 곧바로 2D로 투영한 것이기 때문에, 기존 영상과의 시각적인 통일감이 떨어질 수 있습니다.

      따라서 Noise Grain과 Blur 효과를 추가하여 보다 자연스러운 합성이 이뤄질 수 있도록 하였습니다.


      image.png

      위의 이미지에서 저희가 적용한 후처리의 결과를 확인할 수 있습니다.

      Demo

      데모 영상은 첨부파일에 올려두었습니다!

      • demo1.mp4 (삽입 물체: cone)

      • demo2.mp4 (삽입 물체: parking sign)

      • demo3.mp4 (삽입 물체: cactus)

      • demo4.mp4 (삽입 물체: cup)

      처음 3개 영상은 Vulkan으로 완전 자동화하여, 마지막 영상은 Blender로 GUI 환경에서 수동으로 렌더링한 영상입니다!

      Contribution & Limitation

      image.png

      저희는 이번 연구를 통해 위와 같은 성과를 달성하였습니다!


      image.png

      또한 한국통신학회에서 주최한 한국 인공지능 학술대회에 논문을 제출하여 9월 25일에 포스터 발표를 진행하였습니다.


      다만 저희 파이프라인의 한계도 존재했는데요,

      1. 고화질 영상 처리 시, 고용량의 메모리 필요

      2. Occlusion의 경우 처리하기 까다로움

      3. Droid-Calib의 학습 데이터셋은 정지된 환경에서 카메라만 움직이는 상황으로 구성되어 있기 때문에, 영상 안의 물체가 많이 움직이는 경우 성능이 떨어질 수 있음

      위와 같은 한계를 개선하는 방향으로 향후 연구가 진행될 수 있을 것 같습니다!

      정리

      전체 파이프라인 소요 시간

      image.png

      연구 진행 타임라인

      image.png

      예산 사용 내역

      image.png

      마무리

      여기까지가 저희 인서트 팀의 5개월 여정의 결과입니다!

      이상으로 글을 마무리하며, 저희에게 좋은 기회를 만들어주신 SKT AI Fellowship 담당자분들께 감사하다는 말씀 드리고 싶습니다!

      또한 5개월 간 저희를 잘 챙겨주시고 연구에 대해서도 많은 도움을 주신 담당 멘토님들, 김현지, 박용현, 최희진 멘토님께도 정말 감사드린다는 말씀 전하고 싶습니다.

      저희도 연구를 진행하며 이전보다 많이 성장했던 것 같습니다!


      지금까지 인서트팀 문승기, 이정은, 이창엽이었습니다.

      감사합니다.

      Reference

      [1] Wentao Yuan, Jiafei Duan, Valts Blukis, Wilbert Pumacay, Ranjay Krishna, Adithyavairavan Murali, Arsalan Mousavian, and Dieter Fox. Robopoint: A vision-language model for spatial affordance prediction for robotics. 2024

      [2] Jon´aˇs ˇSer`ych and Jiˇr´ı Matas. Planar object tracking via weighted optical flow. In Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pages 1593–1602, 2023

      [3] Michal Neoral, Jon´aˇs ˇSerych, and Jiˇr´ı Matas. Mft: Long-term tracking of every pixel. In Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pages 6837–6847, 2024.

      [4] Hagemann, Annika, Moritz Knorr, and Christoph Stiller. "Deep geometry-aware camera self-calibration from video." Proceedings of the IEEE/CVF International Conference on Computer Vision. 2023.

      [5] Lihe Yang, Bingyi Kang, Zilong Huang, Zhen Zhao, Xiao- gang Xu, Jiashi Feng, and Hengshuang Zhao. Depth anything v2. 2024.

      [6] Pakkapon Phongthawee, Worameth Chinchuthakun, Nontaphat Sinsunthithet, Varun Jampani, Amit Raj, Pramook Khungurn, and Supasorn Suwajanakorn. Diffusionlight: Light probes for free by painting a chrome ball. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 98–108, 2024.

      [7] Zhanghan Ke, Chunyi Sun, Lei Zhu, Ke Xu, and Rynson WH Lau. Harmonizer: Learning to perform white-box image and video harmonization. In European Conference on Computer Vision, pages 690–706. Springer, 2022.

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      PROLCY 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기