23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
메타AI에서 라마, 라마2에 이어 미국 시간으로 4월 18일 오늘, 드디어 라마3 발표했습니다.
라마 1, 2가 오픈소스 언어모델에 준 영향은 어마어마했습니다. 그런만큼 라마3에 대한 기대도 매우 컸는데요,
실제로 출시된 모델을 보니 충분히 기대에 부응할 만한 결과가 나왔습니다.
라마3의 모델 크기는 8B, 70B, 400+B 세 가지인데요, 마지막 초거대 모델은 아직 학습중이라서 완료된 뒤에 공개한다고 합니다.
400B를 넘는다니 GPT3의 두 배를 넘는 초거대 언어모델이라고 할 만하네요.
라마3 소형 모델의 성능은 어떨까요? 라마3 8B는 라마2 13B를 압도하고, 라마3 8B instruction 모델은 라마2 70B조차 뛰어넘습니다.
이러한 성능 향상은 아키텍처의 변화 때문은 아닌 것 같습니다.
라마3에서는 라마2의 아키텍처를 거의 그대로 가져왔고, 몇 가지 소소한 변화만 주었습니다.
성능에 영향을 줄 만한 변화는 학습 데이터를 2T에서 15T 토큰으로 7배 이상 늘렸다는 점입니다.
친칠라 공식에 따르면 모델 크기에 따라 최소한 20배 이상의 학습 데이터를 투입할 때에 최적 성능을 기대할 수 있다고 하는데요,
이것은 최소한의 분량일뿐 더 많은 데이터를 투입하면 성능이 더욱 올라간다는 사실도 알려져 있었습니다.
다만 몇 배 늘리는 정도가 아니라 몇십배를 늘려도 더욱 성능이 향상된다는 것이 이번 메타의 중요한 발견입니다.
학습 데이터를 2T에서 15T로 늘림
context window를 4096에서 8192로 늘림
GQA를 70B뿐만아니라 8B 모델에도 적용
토크나이저 크기를 32k에서 128k로 늘림
instruction tuning시 SFT, rejection sampling, PPO, DPO 모두 적용
8B는 2023년 3월, 70B는 2023년 12월까지의 데이터로 학습
400+B 모델 학습중
Multimodal 모델 공개 예정
라마3에 새로운 아키텍처는 없었습니다. 데이터 증량 이외에 모델 자체에 가장 큰 영향을 줄 부분은 토크나이저가 4배 커졌다는 점입니다.
이로 인해 소형 모델 크기도 7B에서 8B로 증가했습니다.
토크나이저가 4배 커졌다는 것은 매우 큰 의미를 갖습니다.
잘하면 같은 분량의 데이터를 4배 압축할 수도 있다는 얘기니까요. (단어 분포가 균일하지는 않기 때문에 딱 4배가 되지는 않습니다)
데보션 매니페스토로 확인해 볼까요? 데보션 매니페스토는 이 페이지 에서 볼 수 있는데요,
"여기, 개발자들을 위한 지식의 바다가 있습니다. 우리는 당신이 끝없이 펼쳐진 이 바다 위에서 소통과 공유를 통해 보이지 않던 길을 찾아가길 원합니다.
새로운 시대라는 높은 파도를 만나도 두려울 것 없는 실력 혁신이라는 신대륙을 발견하는 능력 그리고 우리는 믿습니다. 그 실력이 보다 나은 세상을 만들 거라고"
라마2에서는 이 문구를 토크나이징하면 246토큰이 나왔습니다.
잘 만들어진 한국어 토크나이저의 4배를 넘었습니다.
라마3에서는 어떨까요? 93토큰이면 됩니다.
얼마 전에 소개한 구글 Gemma보다도 고효율입니다.
라마2는 한국어로 튜닝하려면 토크나이저에 한국어 토큰을 추가하는 복잡한 과정이 필요했지만,
이제는 그냥 한국어 데이터만 추가로 학습시키면 라마3 한국어 특화 모델을 만들어낼 수 있습니다.
라마3 기반 튜닝 모델은 llama3-라고 꼭 앞에 붙여서 배포해야 한다고 합니다.
이 모델을 업무에 활용할 분들은 주의하셔야 합니다.
그밖에 월간 활성 사용자가 7억명 이상인 서비스에서 상업적 이용 시 메타에 미리 문의를 달라고 합니다.
세계적 대기업에 다니는 분들도 주의하십시오.
아직 블로그와 모델카드만 있고 기술보고서나 학습 코드가 공개되지 않아서 앞으로 라마3에 대한 추가 분석이 필요할 것 같습니다.
그래서 제목도 간단한 분석이라고 지었습니다. 앞으로 등장할 400+B 모델이나 멀티모달 모델도 업계에 큰 영향을 줄 것으로 보입니다.
또한 한국어 사용자로서 라마3의 영향은 매우 지대할 것으로 예상합니다. 곧 다양한 한국어 튜닝 모델이 등장하겠네요.
혹시 제가 쓴 다른 글을 보셨던 분이라면 "오픈소스 LLM에 새로운 표준을 제시할" 구글 Gemma는 어떻게 됐는지 궁금해하실 수도 있습니다.
아쉽게도 제 예상이 빗나갔다고 봐야겠습니다. 아직까지는 아키텍처의 변화 없이 데이터만으로 모델의 성능을 크게 끌어올릴 수 있는 구간인가봅니다.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.