23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
추상적인 답변: 인간이 이해하고 표현하는 다양한 정보 표현방식을 모두 이용함으로써 더 포괄적이고 다양한 문제를 풀 수 있다는 점입니다
엔지니어적 답변: zero-shot, few-shot 등 예시가 없거나 적은 경우에도 다양한 task를 풀 수 있다는 점에서 매력적인 모델입니다
멀티모달 LLM의 구체적인 예시를 한 번 보고 가실까요?
GPT4 - 홀란드 (세상에서 가장 잘 생긴 남자)
한 번의 정확한 예시 제공(이름)만으로 얼굴인식, ReID 등의 task를 풀 수 있게 된다는 점이 굉장히 놀랍습니다
(하지만 정확도면에서는 task-specific model 보다 낮은 performance를 보이는 경우가 아직은 많다는 점!)
CLIP (2020) : 이미지와 텍스트를 동일한 embedding space에 매칭되도록 학습된 multi-modal model입니다.
(1) 의미: 이때까지의 모든 task는 이미지 데이터를 활용한 task, 텍스트 데이터를 활용한 task로 나뉘어졌는데, 이후 부터는 이미지와 텍스트를 함께 사용해 더 폭넓은 정보를 활용할 수 있게 되었습니다.
💡 image와 text를 함께 활용하면 모델에 더 폭넓은 이해를 시킬 수 있겠다는 insight를 얻을 수 있습니다
(2) 사진
Flamingo (2021) : CLIP을 활용해 completion task 수행하는 모델입니다.
(1) CLIP의 단점: zero-shot classification 성능에서 좋은 성능을 보이지만 그 이외의 task에서는 성능이 떨어진다는 특징이 있습니다
(2) 의미: 높은 few-shot learning, CLIP보다 높은 범용성, image-text를 함께 input으로 받는다는 점이 큰 특징입니다.
💡 image와 text를 함께 input으로 받아 language형태의 output을 만들 수 있겠다는 insight를 얻을 수 있습니다.
(3) 그 이후: BLIP2, RAM과 같은 vision-text 중심의 학습이 가능한 모델들이 등장했지만 GPT와 같은 질의응답 형식으로 확장은 불가능하다는 단점이 존재합니다.
(현재) 생각보다 많은 기업에서 LLM을 개발하고 있으며, 주류를 이루고 있는 기업 3개를 꼽자면, OpenAI, META, Google이라고 볼 수 있습니다.
(과거) META에서 LLaMA 모델을 오픈소스로 공개
ChatGPT의 흥행이 이어지던 2023년 초 META에서도 언어모델을 하나 발표했습니다.
Open source: v1때는 일부 연구기관에서 사용가능하도록, v2때는 전체공개
DB: Public DB만을 이용해서 학습 + 자체 정제모델을 사용하여 데이터 퀄리티 향상
sLLM: 이전까지 LLM(Foundation model)의 문제점은 학습성능에만 주로 초점을 맞춰, 추론시의 computing resource를 고려하지 않았습니다.
💡 Foundation model을 대부분의 기업이 만들기는 몹시 어려운 상황에서, sLLM 형태의 완성도 높은 LLaMA가 세상에 공개되었습니다
왜 META는 LLaMA라는 모델을 공개했을까? 다음과 같은 3가지로 답변할 수 있을 것 같습니다.
개발자 생태계 확장: LLaMA기반의 연구, 개발 및 피드백을 통해 기술력 향상 + 인재유치
AI생태계 주도권 확보: AI 선도 기업 이미지, AI 규제 압박 완화
장기적인 AI 시장 확보: 콘텐츠 생성 AI가 활성화되면 자체 플랫폼(Facebook, Instagram)과의 시너지 + 이용자 데이터 확보 용이
자체 instruction following data를 이용한 fine-tuning
instruction-following data는 llm이 수행해야할 task에 대한 정보를 instruction형태로 주어진 data를 의미
self-instruct 논문에서 LLM을 이용해 자체 생산한 self-instruction data가 모델 성능을 올리는데(부정확한 정보 표현) 도움이 된다고 주장했습니다.
성능은 open-source 중 가장 높음
7시간 동안 A100 8대로 학습시키면 학습이 끝남
Alpaca의 경우, fine-tuning에 필요한 instruction following 얻기 위해 사람이 작성한 instruction-output 쌍으로 구성된 self-instruct seed를 GPT3의 프롬프트로 입력하여 추가적인 52k 예제를 생성
Vicuna는 ChatGPT의 대화를 공유할 수 있는 웹사이트인 ShareGPT에서 약 70K개의 사용자-ChatGPT간 대화를 수집하여 fine-tuning
의의: Google의 Bard보다 훨씬 가볍게 구성했는데 거의 동일한 성능이 나옴 (충격적인 결과) + 추후 사용하게 될 Multi-modal LLM에서 LLM을 Vicuna로 사용하게 되는 흐름이 나옴
지금까지 LLM의 기초적인 발전과정과 핵심이 되는 모델들을 소개해드렸습니다.
다음에는 VLM(Vision-Language Model)부터 인기있는 fine-tuning에 대한 글로 돌아오겠습니다.
좋은 하루 되세요~
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.