데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      OpenLab - Generative AI 스터디 3번째 모임

      poderoso 24.06.04
      196 0 0
      DEVOTEE 요약
      최근 비디오 생성 분야의 어려움을 해결하기 위해, "PEEKABOO: Interactive Video Generation via Masked-Diffusion" 논문이 제안되었습니다. 이 논문은 초원에서 말이 달리는 같은 프롬프트와 사진을 이용해 짧은 동영상을 생성하며, 마스크를 사용한 Spation-Temporal Attention Module을 활용하여 재훈련 없이 효율적인 동영상 생성을 가능하게 합니다. 새로운 방식이라 흥미롭고 다음 스터디에도 재밌는 내용으로 돌아올 예정입니다.
      DEVOTEE 추천 블로그

      안녕하세요


      5월 27일 저희의 3번재 모임을 진행하였습니다.


      금일 저희 스터디에서 발표한 논문은 다음입니다.

      "PEEKABOO: Interactive Video Generation via Masked-Diffusion"


      최근 비디오 생성분야의 빠른 진전이 있었지만 아직도 공간-시간을 제어하기 위해선 모델의 재훈련이나 외부 어댑터등이 필요합니다.

      이러한 작업은 매우 어렵고 시간과 자원이 많이 소요됩니다.


      본 논문은 다음과 같은 문제를 다룹니다.

      "초원에서 말이 달린다" 라를 프롬프트와 말이 포함된 사진이 주어졌을때 짧은 동영상 클립을 생성하는 문제입니다.


      Peekaboo는 기존 방법과는 달리 재훈련이나 추론시간을 늘이지 않고 기존 공간 및 시간 축을 제어하는 모델을 제안합니다.

      핵심은 Mask 입니다. 위의 예에서 시작부분에서 말이 위치한 곳에 mask를 두고 말이 이동할 위치로 마스크의 이동하는 인터페이스를 사용하여 말의 움직임을 생성합니다.

      A Horse galloping through a meadow

      horse.gif

      horse-mask.png

      이런 기능의 구현의 핵심은 Spation-Temporal Attention Module 입니다.

      일반적으로 Video 는 여러 프레임의 정보를 조합하기 위해 다양한 Attention 메커니즘을 사용합니다. 대표적으로 spatial, temporal , cross attention 이 적용되는 데,

      본 논문은 마스크를 적용한 masked-spatial, temporal, cross attention을 inference 때 사용하여 동영상을 생성합니다.

      논문의 그림 2 (아래) 를 보면 Eagle 과 Sky 영역이 마스크에 의 해 정해지는 것을 볼수 있습니다.

      peekaboo-fig2.png


      추가 학습이 없이 간단한 마스크를 사용해서 움직임 동영상을 생성하는 아이디는 새롭고 LDM을 사용하는 새로운 방법을 제시하는 논문이라 흥미로운것 같습니다.


      오늘은 치킨을 시켜먹었습니다.!!!

      genai-3.jpeg


      다음 스터디에도 재밌는 내용으로 돌아오겠습니다.!!!

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      poderoso 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기