23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
ICLR 2024에서 Spotlight를 받은 논문을 통해 소개된 PixArt-α모델은 텍스트-이미지(T2I) 생성 분야에서 큰 주목을 받고 있습니다.
이 모델들은 코드와 함께 모델도 공개되어 있어 누구나 쉽게 사용해 볼 수 있습니다.
PixArt-α는 기존의 Stable Diffusion과 같은 대형 모델에 비해 훈련 비용을 크게 절감하며, 훈련 시 발생하는 이산화탄소 배출량도 90%까지 줄였습니다.
특히, SD1.5 버전 대비 훈련 비용을 12%로 절감했음에도 불구하고, 이미지 품질은 더욱 뛰어난 것이 특징입니다.
이러한 성과는 적은 양의 데이터로 효율적으로 훈련할 수 있는 새로운 접근 방식을 통해 가능해졌습니다.
PixArt-α는 세 단계의 훈련 과정을 통해 고품질의 텍스트-이미지 생성 모델을 만듭니다:
단계적 훈련: 처음에는 이미지만을 사용하여 이미지 분포를 학습한 후, 텍스트와 이미지를 함께 학습합니다.
마지막으로, 고품질의 이미지를 사용해 파인 튜닝을 진행합니다.
Diffusion Transformer(DiT): 이 모델은 Unet 대비 더 효율적으로 텍스트-이미지 쌍을 학습할 수 있습니다.
고품질 학습 데이터: SOTA 이미지 캡셔닝 모델인 LLaVA를 사용해 SAM 데이터셋을 라벨링함으로써,
기존 LAION 학습 데이터셋으로 인해 부족했던 텍스트-이미지 정렬 성능을 향상시켰습니다.
PixArt-α를 기반으로 한 PixArt-Σ는 더욱 발전된 모델입니다. 이 모델은 몇 가지 주요 개선 사항을 통해 성능을 더욱 높였습니다:
향상된 캡셔닝 성능: LLaVA 대신 Share-Captioner를 사용하여 캡셔닝 성능을 개선하고, T5 텍스트 인코더의 토큰 길이를 300으로 늘렸습니다.
고해상도 데이터셋 학습: 2K에서 4K에 이르는 고해상도 데이터를 추가로 학습했습니다.
PixArt-Σ는 약 80% 적은 파라미터 수로도 Human preference 측면에서 SDXL과 Playground-V2.0을 능가하는 성과를 보여주었습니다.
PixArt-α와 Σ 모델은 효율적인 훈련 방법과 고품질 데이터 사용을 통해 기존의 대형 모델에 비해 훨씬 낮은 비용으로 고품질의 이미지를 생성할 수 있는 가능성을 보여주었습니다.
[1] J. Chen, J. Yu, C. Ge, "PixArt-α: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis," arXiv, 2024.
[2] J. Chen, C. Ge, E. Xie, "PixArt-Σ: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation," arXiv, 2024.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.