23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요~~~ SKT AI Fellowship 6기에서, Media GenAI 팀과 함께 비디오 기반 광고 컨텐츠 및 Layout Generation을 풀어나갈 T1 VAKER 팀입니다🚀🚀🚀!!
저는 이번 포스트를 맡은 김지환입니다!
저희 팀의 이름은 skT와 함께 최고🥇가 될, Video mAKER 라는 뜻을 담고 있어요 😚
먼저 저희의 간략한 소개를 드릴게요!
저희 팀은 모두 같은 과 동기들로 뭉쳐 최고의 팀워크를 자랑할 예정이랍니다 😉
비디오 기반 광고 컨텐츠 및 Layout Generation. 대체 뭘 하려는 걸까요?
우리의 궁극적인 목표🚀는 다음과 같습니다.
🚀 : “광고하고자 하는 상품과 내용이 있을 때, AI로 광고 영상을 만들자”
생각해보면 광고 시장은 우리 삶에서 평생 사라지지 않을텐데, 광고 촬영에는 천문학적인 비용💰(모델, 감독, 촬영 장비, 편집 등…🤯)이 들게 됩니다. AI로 광고 제작을 자동화 한다? 매우 자연스럽고 간단한 생각이지만, 기업에서는 AI 광고 솔루션을 개발하는 것이 경쟁력 측면에서 매우 중요한 문제일 수 있습니다.
특히 최근 몇 년간 Diffusion model을 중심으로 이미지와 비디오 생성 성능이 크게 향상됐다보니, 요즘 AI로 만든 광고 포스터나 영상이 눈에 띄기 시작하더라구요. 다행인건, 아직 성능이 좋아보이지는 않아요 😂
우리의 광고 제작 파이프라인은 크게 두 가지 단계로 나뉩니다.
첫째, LLM 기반 광고 개요(콘티) 생성
둘째, Diffusion 기반 영상 레이아웃 및 배경 영상 생성
이 중에서 저희 팀이 맡은 건 두 번째 단계입니다! Diffusion model을 활용해 영상의 레이아웃과 배경 영상을 생성하는 거죠. 그럼 두 번째 단계를 또 두 가지로 나눌 수 있겠죠?
1️⃣ Dynamic Layout Generation
2️⃣ Background Video Generation
각각에 대해 좀 더 자세히 알아보죠!
레이아웃 생성(Layout Generation)이란, 화면 안의 다양한 요소(제목, 텍스트, 이미지, 비디오, 도형 등)들을 어디에, 어떤 크기로 배치할 것인지를 결정하는 것을 말합니다. 보통 웹이나 앱, 포스터, 문서 디자인에서 많이 사용되죠.
Image source: Lin et al., LayoutPrompter: Awaken the Design Ability of Large Language Models, NeurIPS, 2023.
하지만 저희는 광고 "영상"에 사용할 레이아웃을 만들어야 해요. 각 요소들이 적절한 곳에 위치되는 것 뿐 아니라, 시청자들의 눈길을 사로잡을 수 있게 역동적인 움직임을 만들어야 하죠. 사전 연구는 고사하고 데이터도 전혀 없기 때문에, 굉~~~장히 험난한 여정이 예상됩니다..🧐
저희는 이 문제를 “Dynamic Layout Generation”이라고 정의했습니다. 저희가 누구보다 먼저 정의하고, 풀어보려는 문제인 만큼, 달에 처음 깃발을 꽂는 심정으로 출발해보겠습니다! 🚀
비디오 생성(Video Generation)은 요즘 매우 유명하죠! OpenAI의 SORA부터, Google DeepMind의 veo, 이번 주에 공개된 KWAI의 KLING, Luma의 Dream Machine까지.. 원래 비디오 생성을 연구하고 있는 저로서는 최신 연구를 팔로업 하기도 힘들만큼 빠른 속도로 발전하고 있는데요 🔥
광고 배경 영상을 생성해야 한다면, 가장 중요한 것은 영상의 1) reality와 2) length라고 생각해요. 생성된 영상이 AI로 만든 티가 심하게 나거나 너무 짧게 끊긴다면, 보는 사람들로 하여금 거부감을 불러일으킬 수 있으니까요.
다음은 연구의 (아주) 대략적인 계획이에요. 현재로서 저희는 Dynamic Layout Generation에 더 큰 비중을 두고 있어요. 아무래도 우리가 처음으로 정의한 문제이다보니, 훨씬 많은 시간이 필요할거에요. 레이아웃 생성이 잘 마무리되면, Background Video Generation으로 넘어갈 생각이에요.
우리는 레이아웃에 역동성(dynamic)을 불어넣어야 해요. 정적인(static) 데이터에 time-series 특성을 부여하는 거죠. 이는 마치 이미지(static) 생성에서 비디오(dynamic) 생성으로 넘어오는 것과 동일하다고 볼 수 있어요. 이미지를 시간 순서로 나열한게 비디오기 때문이죠!
그럼 이미지와 비디오 생성의 차이점을 알아볼까요? 이미지 생성 기술이 비디오 생성으로 발전될 때, 이미지에 “시간 축”을 추가하는 방법을 사용했어요. 딥러닝에서 이미지는 높이, 너비, 채널 축을 가지고 있는 3차원 텐서로 표현돼요. 그렇다면 비디오는? 이미지의 시간적 나열이니까, 시간, 높이, 너비, 채널 축을 가지고 있는 4차원 텐서로 표현할 수 있죠. 그것 말고는 완전히 동일해요. 딥러닝 모델 입장에서 이미지 생성과 비디오 생성은, 생성할 텐서의 차원 수의 차이 뿐이기 때문에, 학습과 데이터 수집이 조금 (많이) 어렵다는 것 빼고는 동일해요 😝
저희는 이 흐름에서 영감을 받아, dynamic layout을 “시간 축이 추가된” layout으로 생각하기로 했어요. 조금 더 자세히 말하자면, static layout generation 모델을 학습하고, 이 모델에 temporal layer를 추가하여 학습할 생각이에요. 자세한건 다음 포스트에서 다룰게요!
위에서 광고 배경 영상의 핵심은 1) reality와 2) length라고 했습니다. 하지만 먼저 reality는 현실적으로 해결이 어려울 수 있어요. (reality가 높은 비디오 foundation 모델을 만드려면 연구비가 10000배는 필요할거에요..🤯) 하지만 우리는 오픈소스를 활용할 수 있어요! 이 정도 발전 속도라면 두 달 정도만 기다려도 훨씬 좋은 오픈소스 모델이 나올거에요. 또 다른 문제는 length입니다. 현재 가용 가능한 비디오 모델들은 대부분 1~3초 짜리 짧은 클립을 만들 뿐이에요. 영상의 길이가 길어질수록 필요한 GPU VRAM이 기하급수적으로 증가하기 때문이죠.
기습 홍보를 하자면, 제 최근 연구인 FIFO-Diffusion을 활용하면 추가적인 학습 없이도 무한히 긴 비디오를 만들수 있어서 이 문제를 해결 할 수 있어요 😙😉 저희는 이 FIFO-Diffusion과 오픈 소스 비디오 생성 모델을 활용해서 광고 배경 비디오를 생성할 계획입니다.
A video generated by FIFO-Diffusion with a prompt "An astronaut floating in space, high quality, 4K resolution."
이번 포스트에서는 저희 연구 과제에 대한 소개와, 대략적인 연구계획에 대해서 다뤄봤습니다!
저희의 생각과 고민이 잘 전달됐으면 좋겠네요 😆
다음 포스트에서는 진행된 연구의 결과에 대해 다뤄볼게요! 긴 글 읽어주셔서 감사합니다 🥰
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.