데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      Text2Image생성모델 PixArt-α,Σ 모델 소개

      weallhappy 24.06.24
      453 4 1
      DEVOTEE 요약
      ICLR 2024에서 주목받은 PixArt-α 모델은 기존의 대형 모델에 비해 훈련 비용과 이산화탄소 배출량을 크게 줄이면서도 뛰어난 이미지 품질을 제공합니다. 이 모델은 단계적 훈련, 효율적인 Diffusion Transformer(DiT) 모델, 그리고 고품질 학습 데이터를 사용하여 텍스트-이미지 생성 성능을 극대화했습니다. 또한, PixArt-α를 확장한 PixArt-Σ 모델은 향상된 캡셔닝 성능과 고해상도 데이터를 학습하여 더 적은 파라미터로도 뛰어난 성과를 보여줍니다.

      PixArt-α와 Σ 모델 소개

      ICLR 2024에서 Spotlight를 받은 논문을 통해 소개된 PixArt-α모델은 텍스트-이미지(T2I) 생성 분야에서 큰 주목을 받고 있습니다.

      이 모델들은 코드와 함께 모델도 공개되어 있어 누구나 쉽게 사용해 볼 수 있습니다.


      1. PixArt-α의 주요 기여

      PixArt-α는 기존의 Stable Diffusion과 같은 대형 모델에 비해 훈련 비용을 크게 절감하며, 훈련 시 발생하는 이산화탄소 배출량도 90%까지 줄였습니다.

      특히, SD1.5 버전 대비 훈련 비용을 12%로 절감했음에도 불구하고, 이미지 품질은 더욱 뛰어난 것이 특징입니다.

      이러한 성과는 적은 양의 데이터로 효율적으로 훈련할 수 있는 새로운 접근 방식을 통해 가능해졌습니다.


      2. PixArt-α의 학습 방법

      PixArt-α는 세 단계의 훈련 과정을 통해 고품질의 텍스트-이미지 생성 모델을 만듭니다:

      1. 단계적 훈련: 처음에는 이미지만을 사용하여 이미지 분포를 학습한 후, 텍스트와 이미지를 함께 학습합니다.

        마지막으로, 고품질의 이미지를 사용해 파인 튜닝을 진행합니다.

      2. Diffusion Transformer(DiT): 이 모델은 Unet 대비 더 효율적으로 텍스트-이미지 쌍을 학습할 수 있습니다.

      3. 고품질 학습 데이터: SOTA 이미지 캡셔닝 모델인 LLaVA를 사용해 SAM 데이터셋을 라벨링함으로써,

        기존 LAION 학습 데이터셋으로 인해 부족했던 텍스트-이미지 정렬 성능을 향상시켰습니다.


      3. PixArt-Σ의 학습 방법

      PixArt-α를 기반으로 한 PixArt-Σ는 더욱 발전된 모델입니다. 이 모델은 몇 가지 주요 개선 사항을 통해 성능을 더욱 높였습니다:

      1. 향상된 캡셔닝 성능: LLaVA 대신 Share-Captioner를 사용하여 캡셔닝 성능을 개선하고, T5 텍스트 인코더의 토큰 길이를 300으로 늘렸습니다.

      2. 고해상도 데이터셋 학습: 2K에서 4K에 이르는 고해상도 데이터를 추가로 학습했습니다.


      4. 결과

      PixArt-Σ 결과 이미지

      PixArt-Σ는 약 80% 적은 파라미터 수로도 Human preference 측면에서 SDXL과 Playground-V2.0을 능가하는 성과를 보여주었습니다.

      image.png

      5. 결론

      PixArt-α와 Σ 모델은 효율적인 훈련 방법과 고품질 데이터 사용을 통해 기존의 대형 모델에 비해 훨씬 낮은 비용으로 고품질의 이미지를 생성할 수 있는 가능성을 보여주었습니다.


      Reference

      [1] J. Chen, J. Yu, C. Ge, "PixArt-α: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis," arXiv, 2024.

      [2] J. Chen, C. Ge, E. Xie, "PixArt-Σ: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation," arXiv, 2024.

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      weallhappy 님의 최신 블로그

      더보기
      동영상 기고하기