데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      VLM(LLM) Basic & Trend 정리 1편

      direcf1520 24.06.13
      11,746 4 1
      DEVOTEE 요약
      멀티모달 LLM은 이미지와 텍스트를 함께 이해하며 더 폭넓은 문제를 해결할 수 있어 중요합니다. 대표적인 발전 모델인 CLIP과 Flamingo는 이미지와 텍스트를 동일한 공간에 배치하거나 함께 입력 받아 다양한 태스크를 수행할 수 있습니다. 많은 기업이 LLM을 개발 중이며, META에서는 LLaMA와 이를 기반으로 한 Alpaca, Vicuna 등의 모델을 공개해 주목받고 있습니다.
      DEVOTEE 추천 블로그

      [Step1. Basic Research Flow]

      Screenshot 2024-05-30 오전 11.24.15.png

      1. 멀티모달 LLM은 왜 중요할까요?

      1. 추상적인 답변: 인간이 이해하고 표현하는 다양한 정보 표현방식을 모두 이용함으로써 더 포괄적이고 다양한 문제를 풀 수 있다는 점입니다

      2. 엔지니어적 답변: zero-shot, few-shot 등 예시가 없거나 적은 경우에도 다양한 task를 풀 수 있다는 점에서 매력적인 모델입니다

      3. 멀티모달 LLM의 구체적인 예시를 한 번 보고 가실까요?

        • GPT4 - 홀란드 (세상에서 가장 잘 생긴 남자)

          llm1.png

          llm2.png

          llm3.png

          한 번의 정확한 예시 제공(이름)만으로 얼굴인식, ReID 등의 task를 풀 수 있게 된다는 점이 굉장히 놀랍습니다

          (하지만 정확도면에서는 task-specific model 보다 낮은 performance를 보이는 경우가 아직은 많다는 점!)


      2. 멀티모달 LLM이 발전하게 된 계기가 된 2개의 모델을 뽑자면 어떤 것이 있을까요?

      1. CLIP (2020) : 이미지와 텍스트를 동일한 embedding space에 매칭되도록 학습된 multi-modal model입니다.

        (1) 의미: 이때까지의 모든 task는 이미지 데이터를 활용한 task, 텍스트 데이터를 활용한 task로 나뉘어졌는데, 이후 부터는 이미지와 텍스트를 함께 사용해 더 폭넓은 정보를 활용할 수 있게 되었습니다.

        💡 image와 text를 함께 활용하면 모델에 더 폭넓은 이해를 시킬 수 있겠다는 insight를 얻을 수 있습니다

        (2) 사진스크린샷 2024-05-30 오전 11.28.05.png

      2. Flamingo (2021) : CLIP을 활용해 completion task 수행하는 모델입니다.

        (1) CLIP의 단점: zero-shot classification 성능에서 좋은 성능을 보이지만 그 이외의 task에서는 성능이 떨어진다는 특징이 있습니다

        (2) 의미: 높은 few-shot learning, CLIP보다 높은 범용성, image-text를 함께 input으로 받는다는 점이 큰 특징입니다.

        💡 image와 text를 함께 input으로 받아 language형태의 output을 만들 수 있겠다는 insight를 얻을 수 있습니다.

        (3) 그 이후: BLIP2, RAM과 같은 vision-text 중심의 학습이 가능한 모델들이 등장했지만 GPT와 같은 질의응답 형식으로 확장은 불가능하다는 단점이 존재합니다.


      [Step2. LLM (Large Language Model)]

      스크린샷 2024-05-30 오전 11.24.21.png

      1. LLM history

      (현재) 생각보다 많은 기업에서 LLM을 개발하고 있으며, 주류를 이루고 있는 기업 3개를 꼽자면, OpenAI, META, Google이라고 볼 수 있습니다.스크린샷 2024-05-30 오전 11.35.21.png

      (과거) META에서 LLaMA 모델을 오픈소스로 공개


      (1) LLaMA의 등장 (2023.02.24)

      • ChatGPT의 흥행이 이어지던 2023년 초 META에서도 언어모델을 하나 발표했습니다.

      • Open source: v1때는 일부 연구기관에서 사용가능하도록, v2때는 전체공개

      • DB: Public DB만을 이용해서 학습 + 자체 정제모델을 사용하여 데이터 퀄리티 향상

      • sLLM: 이전까지 LLM(Foundation model)의 문제점은 학습성능에만 주로 초점을 맞춰, 추론시의 computing resource를 고려하지 않았습니다.

      💡 Foundation model을 대부분의 기업이 만들기는 몹시 어려운 상황에서, sLLM 형태의 완성도 높은 LLaMA가 세상에 공개되었습니다

      스크린샷 2024-05-30 오전 11.36.45.png

      • 왜 META는 LLaMA라는 모델을 공개했을까? 다음과 같은 3가지로 답변할 수 있을 것 같습니다.

      • 개발자 생태계 확장: LLaMA기반의 연구, 개발 및 피드백을 통해 기술력 향상 + 인재유치

      • AI생태계 주도권 확보: AI 선도 기업 이미지, AI 규제 압박 완화

      • 장기적인 AI 시장 확보: 콘텐츠 생성 AI가 활성화되면 자체 플랫폼(Facebook, Instagram)과의 시너지 + 이용자 데이터 확보 용이


      (2) Alpaca (Stanford)

      LLaMA를 instruction tuning한 모델

      • 자체 instruction following data를 이용한 fine-tuning

        • instruction-following data는 llm이 수행해야할 task에 대한 정보를 instruction형태로 주어진 data를 의미

        스크린샷 2024-05-30 오전 11.38.03.png

        self-instruct 논문에서 LLM을 이용해 자체 생산한 self-instruction data가 모델 성능을 올리는데(부정확한 정보 표현) 도움이 된다고 주장했습니다.


      (3) Vicuna ⭐️⭐️⭐️⭐️⭐️

      Alpaca와 동일하게 LLaMA를 fine-tuning

      • 성능은 open-source 중 가장 높음

      • 7시간 동안 A100 8대로 학습시키면 학습이 끝남

        스크린샷 2024-05-30 오전 11.39.10.png

      [Alpaca vs Vicuna]

      • Alpaca의 경우, fine-tuning에 필요한 instruction following 얻기 위해 사람이 작성한 instruction-output 쌍으로 구성된 self-instruct seed를 GPT3의 프롬프트로 입력하여 추가적인 52k 예제를 생성

      • Vicuna는 ChatGPT의 대화를 공유할 수 있는 웹사이트인 ShareGPT에서 약 70K개의 사용자-ChatGPT간 대화를 수집하여 fine-tuning

      • 의의: Google의 Bard보다 훨씬 가볍게 구성했는데 거의 동일한 성능이 나옴 (충격적인 결과) + 추후 사용하게 될 Multi-modal LLM에서 LLM을 Vicuna로 사용하게 되는 흐름이 나옴


      정리

      지금까지 LLM의 기초적인 발전과정과 핵심이 되는 모델들을 소개해드렸습니다.

      다음에는 VLM(Vision-Language Model)부터 인기있는 fine-tuning에 대한 글로 돌아오겠습니다.


      좋은 하루 되세요~

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      direcf1520 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기