23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요 👾
저희는 SKT AI Fellowship 5기에서 Multi-concept Text-to-Image Generation 연구를 맡은 🛸 UFO팀 🛸의 이선민, 정진우입니다.
5개월동안 연구했던 최종 연구 결과에 대해 소개해드리려고 합니다. 🥰
먼저 저희 연구에 대해 간단하게 설명드리겠습니다.
저희가 연구한 multi concept text to image generation은 사용자에게 문장과 이미지를 입력받아 입력 받은 객체의 concept을 유지하면서 prompt에 맞는 이미지를 생성해내는 기술입니다.
이 기술의 핵심은 사진과 같이 사용자에게 입력 받은 여러 객체에 대한 concept을 유지하면서 새로운 이미지를 생성해내는 것입니다.
그러나 여러 객체의 concept을 유지하면서 이미지를 생성하는 것은 결코 쉽지 않습니다.
일반적으로 알려진 Multi concept generation의 문제점은 concept mixing과 omitting입니다.
Concept mixing과 omitting은 두 concept에 대한 이미지 생성 시 하나의 concept이 빠지거나 섞이는 현상을 말합니다.
저희는 중간 발표 이전에는 multi concept에 대한 여러 메소드들을 검증하고 실제 발생하는 에러 케이스들을 확보하였으며, 어떤 상황에서 문제들이 주로 발생하는지 분석하였습니다.
중간 발표 이후에는 수집한 케이스 및 실험 결과를 바탕으로 concept mixing 및 omitting 문제를 해결하는데 집중하였습니다.
저희가 연구 과제를 해결하기 위해 선행했던 연구들을 소개해드리겠습니다.
저희는 multi concept text to image generation의 한계점을 분석하고 해결점을 찾아내는 연구를 진행하기 위해
기존에 선행되었던 text to image generation 모델들의 논문 리뷰 및 연구를 진행했습니다.
Stable diffusion을 fine-tuning한 textual inversion, lora, dreambooth 모델부터 multi concept text to image generation 모델인
custom diffusion까지 각 모델을 검증하고 concept 이미지들을 생성하면서 multi concept text to image generation의 한계점을 정의했습니다.
이 한계점을 해결하는 모델을 만드는 것이 저희 연구의 목표입니다.
저희는 모델 검증을 위해 test case로 자체적으로 다양한 데이터셋을 구축했고, 다양한 object들로 구성했습니다.
저희는 기존에 많이 사용되는 LoRA Dreambooth Custom Diffusion 모델을 가지고 다양한 concept에 대한 학습 및 검증을 진행하였습니다.
그 결과 single concept은 모든 방법에 대해 concept 유지를 잘하는 편이었고 또한 특정 concept에 상관 없이 general 하게 concept 유지가 가능한 것을 보여주었습니다.
앞서 살펴본 Single concept 기법들에 Multi Concept을 학습하면 대부분 concept 유지에 대해 어려움을 겪고 있는 것을 확인했습니다.
저희는 그 원인을 파악하고자 모델의 다양한 하이퍼파라미터를 변경해 가며 학습을 진행하였습니다.
multi concept 모델의 다양한 하이퍼파라미터를 변경해 가며 생성을 시켜본 결과 concept mixing과 omitting 현상을 완화 시킬수는 있었으나 유의미한 수준으로 없애는 것은 어려웠습니다.
또한 시각적으로 생성 이미지 결과를 판단해야하기 때문에, 각 concept마다 최적의 hyperparameter를 찾는 것도 challenge일 뿐더러,
기존 multi concept을 위한 custom diffusion 모델은 hyperparameter에 민감하게 반응하기 때문에
어떤 input에도 multi concept이 잘 유지되는 robust한 모델의 필요성을 느끼고 이를 개발하기 위해 연구를 진행하게 되었습니다. 🤓
이 선행 연구들을 통해 저희는 multi-concept text-to-image generation의 한계점을 재정의할 수 있었습니다.
한계점은 바로 concept이 시각적으로 유사한 경우, omitting과 mixing 현상이 더 빈번히 발생한다는 것입니다.
이렇게 선행 연구를 통해 기존 연구의 한계점을 구체화하여 visual 유사도가 높은 concept의 omitting과 mixing 현상을 해결하는 방향으로 연구의 방향을 정할 수 있었습니다.
따라서 저희는 비슷한 visual을 더 잘 구분할 수 있도록 text prompt 외에 새로운 시각정 정보를 모델에 추가하는 방식으로 연구를 진행했습니다.
앞서 설명한대로, visual 적으로 유사한 concept을 동시에 생성하도록 할 때 mixing과 omitting이 심해집니다.
저희는 이를 통해 text prompt 만으로는 시각적으로 비슷한 concept 두 가지를 명확하게 구분하기 어렵다 라는 가설을 세우고 이를 해결하기 위한 연구를 진행했습니다.
Text prompt 외에 다른 visual condition을 추가하기 위해 controlNet을 이용하는 방법을 사용했습니다.
ControlNet은 canny edge, depth map, segment map 등 image condition을 더해 사용자가 원하는 형태의 이미지를 생성할 수 있도록 도와주는 모델입니다.
저희는 이 controlNet을 이용해 두 개의 concept을 분리하여 생성할 수 있도록 모델을 구성하였습니다.
저희 모델은 2 stage를 거쳐 학습이 진행됩니다. 먼저 stage 1에서는 stable diffusion에 사용자가 원하는 multi concept을 학습시킵니다.
이때 multi concept을 학습하는 방법은 Dreambooth, custom diffusion 등 어떤 방식을 사용해도 상관없습니다.
저희는 이번 연구에서는 custom diffusion을 이용하여 연구를 진행했습니다. stage 2에서는 ControlNet을 fine-tuning 합니다.
stable diffusion은 stage 1에서 이미 concept들에 대해 학습이 진행되어 concept을 이해하고 있지만, controlNet은 그렇지 않은 상태이기 때문에 controlNet에 새로운 concept을 학습시키는 과정입니다.
새로운 concept data 만을 가지고 학습하게 되면 기존 controlNet이 가진 정보가 사라질 수 있기 때문에 regularization dataset을 구성하여 최대한 기존 정보를 유지한 채 새로운 concept을 학습 할 수 있도록 하였습니다.
canny edge를 기반으로 학습한 저희 모델의 결과와 학습되기 이전 결과의 비교입니다.
학습하기 전 canny edge에 따라 이미지를 생성해 주기는 하지만 concept에 대한 이해가 떨어져 다소 어색한 얼굴 생성이 되는 편이고, 얼굴 주변 부에 대한 생성이 어색해지는 편입니다.
예를 들어 학습 이전의 이미지는 concept 얼굴이 비교적 닮지 않은 채로 생성이 되고 얼굴 주변 헤어 스타일에 대한 표현력이 다소 떨어집니다.
반면에 학습 이후에는 concept과 더 닮도록 생성이 되고, 헤어 스타일 등에 대한 표현이 어색하지 않고 자연스럽게 생성 되는 것을 확인 할 수 있습니다.
저희 모델에 대한 평가를 진행하기 위해 human preference에 대한 설문을 진행하였습니다.
현재 생성 모델에 대한 평가 metric은 그 수치가 human preference를 반드시 반영하지 못할 수 있어 새로운 평가 metric이 필요로 하는 상황입니다.
따라서 저희는 논문 등에서 사용한 FID, KID 등의 평가 metric을 사용하기 보다는 직접 결과를 비교하는 설문지를 작성하여 human preference를 조사하였습니다.
구글 폼을 활용하여 어느 이미지가 더 선호도가 높은지 선택하는 방식으로 설문을 진행했습니다.
단순히 ControlNet을 이용한 결과물과 저희 모델의 결과 중 어느 것의 이미지가 더 concept을 반영하였는지 설문한 결과
저희 모델의 결과가 더 낫다고 응답한 비율이 68.2%로 더 높은 선호도를 얻었습니다.
이를 바탕으로 저희 모델의 성능이 더 우수하다는 것을 확인하였습니다.
그러나 Concept Control Diffusion에는 Visual Condition에 지나치게 의존적이라는 한계가 존재합니다.
특히 canny edge와 같이 세세한 표현이 들어가는 condition의 경우에는 visual condition의 영향을 많이 받아 text를 반영한 생성이 다소 어려워집니다.
이에 따라 다양한 환경의 이미지 생성이 어렵습니다. 또한 visual condition이 원래의 concept과 큰 차이를 보인다면 concept을 유지하는데 어려움을 겪습니다.
따라서 저희는 좀 더 rough한 visual condition이 필요하다 느끼고 연구를 진행하였습니다.
앞서 말한 concept control diffusion의 한계점을 보완하기 위해 저희는 multi concept을 유지한 채 region을 나눠 이미지를 생성할 수 있는 concept region diffusion을 고안했습니다.
Concept region diffusion은 먼저 diffusion based text to image generation model을 이용해 각 concept을 학습한 후
multi diffusion을 적용해 사용자가 각 concept이 생성될 지역을 지정하면, 해당 지역에 맞는 concept 이미지를 생성합니다.
Region을 나눠서 생성할 때는 Multi diffusion이라는 새로운 diffusion process를 이용했습니다.
Multi diffusion은 여러 diffusion process를 하나로 합쳐 process를 진행 할 수 있도록 하는 새로운 diffusion process 입니다.
이 diffusion을 이용하면 사용자가 지정한 region에서 각각 생성되는 diffusion process를 하나로 통합하여 진행 할 수 있습니다.
그래서 저희는 앞서 진행했던 single concept 모델별 실험을 진행한 결과, single concept에서 dreambooth가 가장 성능이 좋았다는 점을 이용하여
reference diffusion 모델로 dreambooth를 선택하여 한번의 학습으로 multi concept을 유지하는 방법을 고안했습니다.
모델별 photo of man and woman prompt를 입력했을때 생성된 이미지를 비교해보았습니다.
multi diffusion만 사용할 경우, concept을 학습하지 않고, 오직 prompt만 입력받으므로 모델이 학습했던 남자와 여자의 이미지를 생성합니다.
Dreamboth만 사용할 경우, 생성된 두 객체의 얼굴이 닮게 나오거나 경계가 모호한 multi concept text to image generation의 한계점이 그대로 나타납니다.
Multi diffusion과 dreambooth를 합칠 경우, 두 객체의 얼굴이 잘 생성되며 경계가 뚜렷합니다.
Human preference evaluation 결과를 보면 높은 확률로 concept control diffusion 모델이 생성한 이미지를 선호한다는 것을 알 수 있습니다.
앞서 생성한 이미지를 보면 두 이미지 중 퀄리티가 높은 이미지를 쉽게 구분하실 수 있을것입니다.
그래서 저희는 퀄리티가 비슷한 이미지의 경우 사람들의 선호도가 얼마나 달라지는지 추가로 실험하기 위해 sampler parameter를 바꿔가면서 테스트 이미지를 생성했습니다.
기존에 생성한 이미지는 DPM++ 2M SDE exponential sampler를 이용했습니다. 그 외 5개의 sampler를 이용하여 이미지를 생성했습니다.
Sampler에 따라 human preference evaluation을 진행했더니, 결과는 흥미로웠습니다.
대부분의 sampler가 비슷한 선호도를 나타냈지만, 얼굴이 잘 생성되지 않았던 Unipic sampler는 0%를 기록했고 PLMS sampler가 가장 높은 선호도를 나타냈습니다.
주관식으로 가장 선호하는 이유를 설문조사한 결과, 대부분이 가장 실존 인물들과 흡사하고 형태가 어색하지 않은 이미지를 골랐다는 답변을 받았습니다
그러나 concept region diffusion 역시 한계점이 존재합니다.
정해진 region에서 생성을 진행하다 보니 두 object 사이의 interaction 표현이 어색해지고, 경계 부분에서 두 object가 섞이는 등 bad anatomy가 발생하게 됩니다.
이런 연구 결과를 통해 저희는 향후 계획과 기술 상용화 방안을 정했습니다.
저희는 연구를 진행하면서 bad anatomy를 해결할 수 있는 방법을 많이 고민했고, 2023년 5월에 발표된 RLAIF라는 강화학습 모델을 알게되었습니다.
RLAIF는 image captioning과 bert score를 이용해 human preference를 향상시키는 방향으로 reward를 업데이트하여 이미지가 prompt에 맞게 생성되도록 하는 강화학습 모델입니다.
그래서 저희는 이를 이용해 bad anatomy를 해결할 수 있는 적용 예시를 설계해보았습니다.
그리고 저희는 robust한 end to end 모델을 개발하여 생성 이미지의 높은 퀄리티를 안정적으로 유지하기 위한 2가지 모델을 가져왔습니다.
먼저 GFPGAN 모델은 어색하게 생성된 얼굴을 교정해주는 모델입니다.
왼쪽에 생성된 이미지를 보면, 전체적으로 두 사람 모두 얼굴이 어색한 모습을 보실 수 있을 것입니다.
이런 이미지는 GFPGAN 모델을 거쳐 오른쪽과 같이 좀 더 자연스러운 얼굴로 개선할 수 있습니다.
이외에도 Tiled diffusion을 통해 upscaling하여 생성 이미지의 해상도와 전반적인 quality를 높여 높은 퀄리티의 이미지를 생성할 수 있습니다.
최종적으로 저희는 SKT AI Fellowship 연구를 통해 visual similarity가 높은 concept끼리 concept을 유지하지 못하는 한계점을 해결하는 robust한 새로운 방안을 제시했다고 생각합니다.
그래서 저희는 2024년에 국, 내외 paper를 제출을 준비할 예정이고, 사용자들이 저희 모델의 demo를 사용해볼 수 있도록 hugging face에 모델을 등록할 예정입니다.
그리고 저희는 SKT AI Fellowship 활동을 통해 멘토님들께 단지 연구에 대한 조언뿐만 아니라,
앞으로 이 분야에서 저희가 나아가야할 방향 등 연구를 넘어 정말 많은 도움을 받아 매 순간이 뜻깊은 시간이였습니다.
5개월동안 저희에게 이런 기회를 제공해주신 🔥 SKT 운영진 분들과 김찬란 멘토님, 백열민 멘토님, 김봉모 멘토님, 이희열 멘토님 🔥 께 정말 감사드립니다.
이번 SKT AI Fellowship에서의 5개월을 발판으로 앞으로 더 성장해나갈 팀 UFO를 기대해주세요! 🥰
그동안 저희 연구를 함께 지켜봐주셔서 정말 감사했습니다.
이상으로 SKT AI Fellowship 5기 UFO팀 이선민, 정진우였습니다. 👽 🛸
High-Resolution Image Synthesis with Latent Diffusion Models, Ludwig Maximilian University, Heidelberg University, Robin Rombach et al., 2020
An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion, Rinon Gal et al., 2022
LoRA: Low-Rank Adaptation of Large Language Models, Microsoft, Edward J.Hu et al., 2021
DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation, Google, Boston University, Nataniel Ruiz et al., 2022
Multi-Concept Customization of Text-to-Image Diffusion, Carnegie Mellon University, Tsinghua University, Adobe, Nupur Kumari et al., 2022
Adding Conditional Control to Text-to-Image Diffusion Models, Stanford University, Lvmin Zhang et al., 2023
Mixture of Diffusers for scene composition and high resolution image generation, Instituto de Ingeniería del Conocimiento and Universidad Autónoma de Madrid, Álvaro
MultiDiffusion: Fusing Diffusion Paths for Controlled Image Generation, Omer Bar-Tal et al.
Training Diffusion Models with Reinforcement Learning, University of California, Berkeley, Massachusetts, Kevin Black et al., 2023
RLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback, Harrison Lee et al., 2023
Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback, Stephen Casper et al., 2023
Aligning Text-to-Image Models using Human Feedback, Kimin Lee et al., 2023
Towards Real-World Blind Face Restoration with Generative Facial Prior, Xintao Wang et al., 2021
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.