23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요
5월 27일 저희의 3번재 모임을 진행하였습니다.
금일 저희 스터디에서 발표한 논문은 다음입니다.
"PEEKABOO: Interactive Video Generation via Masked-Diffusion"
최근 비디오 생성분야의 빠른 진전이 있었지만 아직도 공간-시간을 제어하기 위해선 모델의 재훈련이나 외부 어댑터등이 필요합니다.
이러한 작업은 매우 어렵고 시간과 자원이 많이 소요됩니다.
본 논문은 다음과 같은 문제를 다룹니다.
"초원에서 말이 달린다" 라를 프롬프트와 말이 포함된 사진이 주어졌을때 짧은 동영상 클립을 생성하는 문제입니다.
Peekaboo는 기존 방법과는 달리 재훈련이나 추론시간을 늘이지 않고 기존 공간 및 시간 축을 제어하는 모델을 제안합니다.
핵심은 Mask 입니다. 위의 예에서 시작부분에서 말이 위치한 곳에 mask를 두고 말이 이동할 위치로 마스크의 이동하는 인터페이스를 사용하여 말의 움직임을 생성합니다.
A Horse galloping through a meadow |
|---|
이런 기능의 구현의 핵심은 Spation-Temporal Attention Module 입니다.
일반적으로 Video 는 여러 프레임의 정보를 조합하기 위해 다양한 Attention 메커니즘을 사용합니다. 대표적으로 spatial, temporal , cross attention 이 적용되는 데,
본 논문은 마스크를 적용한 masked-spatial, temporal, cross attention을 inference 때 사용하여 동영상을 생성합니다.
논문의 그림 2 (아래) 를 보면 Eagle 과 Sky 영역이 마스크에 의 해 정해지는 것을 볼수 있습니다.
추가 학습이 없이 간단한 마스크를 사용해서 움직임 동영상을 생성하는 아이디는 새롭고 LDM을 사용하는 새로운 방법을 제시하는 논문이라 흥미로운것 같습니다.
오늘은 치킨을 시켜먹었습니다.!!!
다음 스터디에도 재밌는 내용으로 돌아오겠습니다.!!!
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.