23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요!
저희는 SKT AI Fellowship 6기 10번 과제 VPP를 위한 Object Insertion 기술 연구 를 진행할 '인서트(INserT)' 팀입니다.
저희 인서트 팀은 문승기, 이정은, 이창엽으로 구성되어 있고,
저는 앞으로 5개월 간 데보션에 연구 과정을 기록할 이창엽입니다! 반갑습니다! 🫡
본론에 들어가기에 앞서, 저희 팀의 이름이 왜 인서트인지 궁금하지 않으신가요?
연구 주제가 Object Insertion이기도 하고, 저희 팀원 모두 MBTI가 INTx로 구성되어 있기 때문에
팀명을 인서트(INserT)로 정하였습니다! 😃
그럼 지금부터 연구 과제를 소개하고, 저희가 제안한 연구 방향은 어떤 것인지 말씀드리겠습니다!
PPL이라는 단어, 이제는 매우 익숙한 단어입니다.
PPL은 Product Placement의 줄임말로, 우리말로는 '간접 광고'라는 단어로 잘 알려져 있죠!
성공적인 PPL: tvN 드라마 <미생>의 홍삼 PPL [1]
PPL은 특정 상품이나 브랜드명, 장소 등을 미디어에서 은연중에 간접적으로 노출시킴으로써 광고 효과를 기대하는 마케팅 전략 중 하나입니다.
꽤나 오래 전에 방영되었던 tvN의 드라마 <미생>에서는 홍삼이나 맥심 믹스커피 PPL이 전혀 위화감없이 드라마 속에 녹아들어 있어 화제가 되기도 했었죠!
저희 팀의 연구 과제 VPP는 Virtual Product Placement의 줄임말로, 완성된 디지털 콘텐츠에 특정 상품을 삽입하는 기술을 말합니다.
콘텐츠 제작 과정에서 상품이 들어가는 것이 아닌, 완성된 콘텐츠에 디지털 상에서 상품을 삽입하는 것이 기존 PPL 방식과의 가장 큰 차이점입니다.
VPP 예시 [2]
위 사진처럼 사진을 촬영할 때가 아닌, 완성된 사진에 상품을 삽입하여 PPL과 동일한 광고 효과를 기대하는 기술이 Virtual Product Placement, 바로 VPP 입니다.
VPP를 활용할 시에는 다음과 같은 장점을 지닙니다.
영상이나 사진 같은 콘텐츠와 삽입하려는 물체만 있다면 쉽게 광고 영상 제작 가능
따로 촬영을 진행할 필요가 없기 때문에 비용 절감 효과
다양한 상품을 콘텐츠에 삽입해보고 분석하면서 광고 효과 증대
VPP를 구현하기 위해서는 물체를 이미지나 영상에 삽입하는 Object Insertion Task가 필수적인데요,
저희 인서트 팀은 SKT AI Fellowship 6기에서 멘토님들과 함께 해당 AI 기술을 개발, 검증하려고 합니다.
최종적으로는 삽입하려는 물체와 타겟 비디오가 주어지면, 해당 물체가 삽입된 자연스러운 비디오를 생성하는 것이 목표입니다.
위 연구[3]는 3D 객체를 비디오에 삽입하는 Task를 다루고 있습니다.
먼저 비디오의 프레임에서 물체를 삽입할 위치를 선별해 삽입한 후, 그림자 생성과 Style Transfer 등을 이용하여 물체가 주변 이미지와 잘 어울릴 수 있도록
후처리 과정을 거치면 최종적으로 물체가 삽입된 비디오가 만들어집니다.
위 연구[4]는 2D 객체를 비디오에 삽입하는 Task를 다루고 있습니다.
이미지에서 물체가 들어갈 만한 빈 공간을 탐지하고, 적절한 위치와 크기를 선정해 물체를 삽입한 후, 후처리 과정을 통해 자연스러운 비디오를 만들어 냅니다.
저희 인서트 팀이 제안한 파이프라인은 다음과 같습니다.
Stage 1: Suitable Placement Detection
- 비디오 프레임 내의 객체와 삽입하려는 객체 간의 관계를 파악하여 적절한 위치를 선정합니다.
Stage 2: Object Insertion
- Stage 1에서 선정된 위치에 객체를 삽입하여 비디오를 구성합니다.
Stage 3: Post-processing & Video Reconstruction
- 삽입된 객체가 자연스럽게 보일 수 있도록 후처리 과정을 거쳐 최종 비디오를 생성합니다.
Stage 1은 비디오 내에서 물체를 삽입할 적절한 위치를 찾는 과정입니다. [5]
기존 연구처럼 단순히 빈 공간을 찾는 것이 아닌, 비디오 프레임 내의 객체와 삽입하려는 객체 간의 관계를 파악하여 위치를 선정해,
좀 더 자연스럽고 현실적인 비디오를 생성할 수 있도록 합니다.
상세 과정은 다음과 같습니다.
비디오 프레임 내의 여러 객체를 탐지합니다.
탐지된 객체들을 LLM에게 프롬포트로 주고, 삽입하려는 객체와 가장 Semantic하게 어울리는 Assistant Object를 선정합니다.
(위 그림에서 cake는 plate 위에 있는 것이 자연스럽기 때문에 plate를 Assistant Object로 선정한 것을 확인할 수 있습니다)
이후 Assistant Object를 중심으로, 객체를 삽입할 위치를 선별합니다.
Stage 2는 Stage 1에서 선별된 위치에 실제로 물체를 삽입하는 과정입니다. [6]
AI 모델을 통해 타겟 비디오에서 Camera Pose, Pixel Depth, Camera Intrinsic Parameter 등의 정보를 추론하고,
이 정보를 활용해 3D 형태의 물체를 비디오에 렌더링하여 물체가 삽입된 비디오를 구성합니다.
비디오가 주어지면, 비디오 프레임 간의 Optical Flow를 추론하고, 이것을 기반으로 다양한 정보를 추출해 렌더링에 활용하는 방식으로 Stage 2가 진행됩니다.
Stage 2에서 완성된 비디오는 물체를 그대로 넣은 것이기 때문에 마치 복사, 붙여넣기한 듯한 색감과 형태를 띄고 있습니다.
Stage 3에서는 Stage 2에서 완성된 비디오를 자연스럽게 만들어주는 작업을 진행합니다.
겹친 부분을 자연스럽게 만드는 Occlusion Making, 현실감을 더해주는 Shadow Generation,
배경과 어울리도록 물체를 재구성하는 Style Transfer(Image/Video Harmonization)을 통해 최종적으로 자연스러운 비디오를 생성합니다.
각 Stage에서 저희가 제안했던 모델을 검증, 개선한 후, 다양한 상황에 대한 실험과 테스트를 통해 성능을 높일 예정입니다.
최종 발표에는 각 Stage를 병합해 하나의 파이프라인을 구성하고 데모를 제작해서 결과물을 보여드리는 것이 목표입니다.
저희 인서트 팀은 고려대학교 학부생 문승기, 이정은, 이창엽으로 이루어진 팀입니다.
저희 팀은 이전에 프로젝트를 함께 진행한 경험이 있기 때문에, 이번 SKT AI Fellowship 6기에서도 뛰어난 팀워크로 연구를 수행할 수 있을 것이라 확신합니다!
김현지, 박용현, 최희진 멘토님과 함께 5개월 동안 즐겁게 연구하고, 좋은 성과 낼 수 있도록 노력하겠습니다!
지금까지 SKT AI Fellowship 6기 10번 과제 VPP를 위한 Object Insertion 기술 연구, 인서트(INserT) 팀이었습니다.
읽어주셔서 감사합니다. 🙂
[1] https://blog.naver.com/overtroubledwarter/220513325480
[2] https://www.marketingbrew.com/stories/2023/02/16/entertainment-companies-are-eager-to-make-virtual-product-placement-happen-that-doesn-t-make-it-easy
[3] Bai, C., Shao, Z., Zhang, G., Liang, D., Yang, J., Zhang, Z., ... & Lu, C. (2024). Anything in Any Scene: Photorealistic Video Object Insertion. arXiv preprint arXiv:2401.17509.
[4] Bhargavi, D., Sindwani, K., & Gholami, S. (2023, June). Zero-shot virtual product placement in videos. In Proceedings of the 2023 ACM International Conference on Interactive Media Experiences (pp. 289-297).
[5] Sharma, A., Yoffe, L., & Höllerer, T. (2024, January). OCTO+: A Suite for Automatic Open-Vocabulary Object Placement in Mixed Reality. In 2024 IEEE International Conference on Artificial Intelligence and eXtended and Virtual Reality (AIxVR) (pp. 157-165). IEEE.
[6] Liu, Ziling, et al. "Place Anything into Any Video." arXiv preprint arXiv:2402.14316 (2024).
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.