23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
기본 아이디어는 아래 동영상 처럼 심플함 그 자체! (Volume 높이고~~!!!)
사진 1장과 음악이 입력되면 사진의 인물이 음악에 맞춰 춤을 추는 안무 동영상을 생성합니다. 나의 사진을 넣고 K-pop 스타처럼 춤추는 영상을? 만들면 어떨까요?
즉, 음악과 댄스 동작간의 관계를 이해하고, 이를 바탕으로 자동으로 안무 동영상을 생성하는 모델을 개발하는 것이 본 연구 그룹의 목표입니다.
아이디어는 심플하지만, 연구해야 될 분야는 아주 다양합니다. 각 분야 모두 최신 생성형 AI 기술분야이며 흥미진진합니다.
본 과제에선 아래 5 가지 관련 기술을 디테일 하게 분석하고 조합하여 최적의 모델을 제안하고 구현하여 최상의 성능을 달성하는것을 목표로 합니다.
함께 연구에 참여하여 이 분야의 새로운 발전을 만들어가시길 바랍니다!!!
참고로, 이미 음악특징 추출기술, Identity 보존 기술, Pose 생성기술등은 본 연구 그룹내부에서 연구가 상당부분 진행된 상태이므로, 개발된 내용을 빠르게 배우며,
핵심 모델의 개발과 모델의 평가 부분에 집중하여 연구결과를 쌓을 좋은 기회가 될것입니다.
음악 특징 추출 기술
음악은 리듬, 멜로디, 다이내믹스등 다양한 특징을 가지고 있습니다. 음악과 장르에 따라 적합하게 추출된 특성은 네트워크의 다음 단계에서 다양하고 자연스러운 안무를 생성하는데 필수입니다.
음악 신호에서 특성을 추출하기 위한 여러 접근 방식이 제안되었습니다.
오디오 특성 추출 방법: Librosa와 같은 도구는 스펙트럼 중심(Spectral Centroid), 스펙트럼 롤오프(Spectral Roll-off), 멜 주파수 켑스트럼 계수(MFCC)와 같은 특성을 추출합니다.
딥러닝 기반 방법: Jukebox, MusicGen 및 Whisper와 같은 모델은 인코더-디코더 구조를 사용하여 복잡한 음악 패턴을 캡처하는 임베딩을 생성합니다.
Identity 보존 기술
Identity 보존 기술은 이미지 또는 동영상 생성 과정에서 주어진 reference 의 정체성을 유지하면서 고품질의 결과물을 생성하는 데 초점을 맞춥니다.
많은 경우 Latent Diffusion model 기반의 연구이며, 몇가지 연구를 소개하면, ConsistentID는 세밀한 얼굴 특징을 보존하며 맞춤형 초상화를 생성하고,
PhotoMaker는 텍스트 임베딩과 정체성 특징을 융합하여 이미지를 생성합니다.
이러한 모델들은 정체성 보존의 정확도와 창의적 표현의 균형을 이루며 다양한 응용 분야에서 활용되고 있습니다.
Music-to-Pose 생성 기술
음악-포즈 생성 기술은 음악의 리듬, 멜로디, 에너지와 같은 특성을 분석하여 이에 맞는 춤 동작을 생성하는 기술입니다.
Break, House, Ballet Jazz, Pop과 같은 다양한 음악 장르의 파형은 각 장르의 고유한 리듬과 에너지를 반영하며, 이러한 데이터를 기반으로 모델은 장르에 적합한 춤 동작을 생성합니다.
대표적인 예로 EDGE, POPDG 등의 연구가 있습니다.
포즈는 관절(joint)의 2D 또는 3D공간에서의 위치 X,Y(또는 Z 포함)로 표현하며 이 위치를 키포인트라 합니다.
포즈를 표현하는 대표적인 기술로는 SMPL, OpenPose, DensePose, DwPose 등이 있습니다.
Pose-Conditioned-Latent Diffusion Framework 기술
최근 잠재 확산 모델(Latent Diffusion Models)은 포즈와 Identity 같은 다양한 특성을 조건으로 받아 인간 동작 영상을 생성하는 데 큰 발전을 이루었습니다.
포즈를 조건으로 입력하면 이에 따라 세밀한 동작 제어가 가능해집니다. 대표적인 연구로는 AnimateAnyone,Champ, UniAnimate, MagicAnimate 등이 있습니다.
성능 평가 및 개선
생성된 동영상의 품질 및 댄스의 리듬적 일관성, 적합성, 자연스러움 등을 평가해야 합니다.
동영상의 품질을 평가하는 지표는 FVD 와 같이 일관되고 많이 사용되는 지표가 존재하지만, 댄스의 적정함을 평가하는 지표는 연구 및 제안할 부분이 많이 있습니다.
평가를 개선하는 연구의 제안도 고려하고 있습니다.``
관련 기술의 디테일한 파악 및 분석
후보 모델의 제안 및 구현
최적 모델을 선택 및 검증하기 위한 학습 및 Ablation Study
특허 출원 및 Top Conference 논문 제출
간단한 데모 제작
대학 및 대학원생
Latent image/video diffusion 모델 연구 및 개발 유경험자
Human pose estimation 모델 연구 개발 유경험자
PyTorch 에 능숙하고 Pytorch 모델 최적화 유경험자
수학/통계적 역량
최신 및 Hot 한 주제의 연구 주제 진행
국제 학술대회 및 저널에 논문을 제출 장려
미디어 AI 분야 최고 멘토링 지원
2021~2022 AI fellowship 최우수상
2023 AI fellowship 대상수상
2024 AI fellowship 우수상( 미디어 AI 분야)
박노갑 Ph.D.
SK AI R&D 센터/ Media Lab / Gen AI 개발팀 소속
Video 생성 모델 개발
화질 개선 모델 개발
전진 Ph.D.
SK AI R&D 센터/ Media Lab / Gen AI 개발팀 소속
Generative AI 를 활용한 이미지 / Video 생성 AI 개발
SUPERNOVA (AI 미디어 혁신 / 개선 기술 ) 개발
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.