23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요! SKT AI Fellowship 6기에서 LLM Performance Evaluation 과제를 맡은 ttf 팀입니다!
이번 포스트에서는 최종 발표까지의 연구 결과가 어떻게 도출되었는지 공유해드리겠습니다!
최근 LLM 연구가 활발해지면서 기존 벤치마크들은 그 유효성이 줄어들고, 데이터셋의 단순성 때문에 모델의 다양한 능력을 평가하는 데 한계가 있습니다.
이에 저희 ttf 팀은 기존의 Question-Answering Evaluation의 벤치마크를 벗어나 능동적으로 모델을 평가할 수 있는 LLM-based Evaluation, 생성형 평가 모델을 제시하고자 합니다!
기존의 Question-Answering Evaluation과 LLM-based Evaluation의 차이점은?
이전 연구과정에서도 설명 드렸던 바와 같이, 주어진 Question에 대해서 평가 모델이 가능한 최선의 출력(정답)을 생성하고,
이를 평가 대상 LLM의 출력과 비교할 뿐만 아니라 그 자체로 어떤 점에서 차이가 있는지를 평가할 수 있습니다!
보충 예시는 연구과정(2)에서 확인해주시면 감사하겠습니다!
이와 같은 생성형 평가 모델(Generative Evaluation Model) 방법론을 SPEED라고 부르기로 했습니다.
SPEED: LLM Performance Evaluation with Structured Peer discussion and Expert's Evaluation on specific Domain
중간 발표와 크게 달라진 점은 없으나, 이번 연구 결과에서는 자세한 실험 결과들이 많이 준비되어 있습니다.
이전과 비교해서 더욱 간단히 표현한 SPEED의 전체 파이프라인입니다.
먼저 정답을 만드는 Answer Generation 단계입니다. 질문과 피평가 모델의 답안이 주어졌을 때,
SPEED는 특정 도메인에 신뢰성 있는 성능을 가진 전문가가 Question에 대한 답변을 생성합니다.
해당 답변을 기능 전문가들이 보고 피드백을 제공함으로써, 도메인 전문가의 답변에 문제가 있다면 이를 고치도록 하는 토론을 통해 보다 온전한 정답을 만들어냅니다.
그 다음 단계인 Evaluation Step은 SPEED의 정답과 주어진 Question을 기준으로 피평가 모델의 답변을 기능 전문가들과 평가에만 활용되는 Context 전문가를 통해 정성적인 평가를 제공합니다.
중요 키워드의 포함 여부를 중심으로 정량평가 또한 제공하여 최종적으로 모델 답안의 평가를 제공합니다.
그럼 다음으로는 위의 설명에서 언급된 전문가들에 대해 소개하겠습니다.
소개할 전문가들은 모두 LLaMA3: 8B 모델을 Foundation Model로 하고 있습니다.
먼저 Domain Expert, 도메인 전문가입니다. 도메인 전문가의 경우 정답을 만드는 주요한 역할을 하는 전문가로, 특정 도메인에 신뢰성 있는 능력을 가지고 있다고 판단되는 모델입니다.
저희 팀의 경우에는 의료 도메인을 기반으로 전문가를 만들었으며, Low-Rank Adaptation와 Parameter-Efficient Fine-tuning을 적용하여 효율적인 학습을 진행했습니다.
또한 Persona 부여, 문제 풀이 Stage, Choice Shuffling, Ensemble Refinement 등의 추론 기법을 활용했습니다.
위는 도메인 전문가의 성능 표입니다. 저희가 전문가를 만들 때 중요하게 생각한 부분은 최소 비슷한 크기의 모델보다 뛰어나거나, 또는 한 단계 더 큰 모델과 유사한 성능을 가지는 것이 목표였습니다.
평균적인 점수를 보았을 때 유사한 크기인 BioMistral 7B보다 정확도가 높으며 더 큰 모델인 GPT-3.5 turbo와 유사한 성능을 보이는 것을 확인할 수 있었습니다.
다음은 Hallucination Expert, 환각 전문가입니다. 이는 LLM의 고질적인 문제인 환각 현상을 Domain Expert가 생성하는 것을 캐치해 답변을 더욱 사실적으로 만드는 역할을 합니다.
학습은 도메인 전문가와 동일한 방식으로 이루어졌으며, 추론에서는 Persona 적용과 Stage 제공만 이루어졌습니다.
위는 환각 전문가의 성능 표입니다.
GPT-4o보다 높거나 또는 유사한 환각 감지 성능을 보임으로써, 환각 전문가가 도메인 전문가가 Question과 충돌되는, 반사실적인 답변을 하는 것을 보완해줄 능력을 갖추었다는 것을 증명합니다.
다음은 Toxic Expert, 유해성 전문가입니다.
이는 LLM이 유해한 답변을 생성했을 경우 이에 대한 피드백을 제공하는 역할입니다. 학습과 추론은 앞선 환각 전문가와 동일한 방식입니다.
위는 유해성 전문가의 성능 표입니다.
유해성 탐지 부분에서 LLaMA3:70B와 유사하거나, 이를 뛰어넘는 성능을 보였습니다.
마지막으로, Context Expert, 문맥 전문가는 Evaluation Step에서만 사용되는 전문가로, 피평가 답안의 문맥이나 어휘력을 평가하기 위한 전문가입니다.
학습과 추론은 앞선 환각 전문가와 동일한 방식입니다.
위는 문맥 전문가의 성능 표입니다.
문맥 전문가의 경우 LLaMA3:70B보다 다소 낮은 Judge 점수를 받았는데, 해당 전문가의 역할은 어휘나 문맥 파악 관련 능력이기 때문에
해당 부분은 따로 학습했다고 할지라도 파라미터 자체가 큰 모델의 어휘 능력에 비해 약할 수밖에 없다고 판단했습니다.
이번 장에서는 SPEED의 전체 파이프라인마다 어떤 결과가 나오는지, 실제로 저희가 테스트한 예제와 함께 보여드리겠습니다.
먼저 Answer Generation 부분입니다. Question은 의학 도메인에 적절하면서, 동시에 간단한 문제를 생각해서 정했습니다.
그림과 같은 답변이 나오면, 이 답변에 대해서 환각 전문가는 Hallucination이 없다고 했으며, Toxicity 또한 내용에 맞게 중립적인 표현이라고 설명했습니다.
피드백 상에서 딱히 고칠 점이 없기 때문에 도메인 전문가의 답변이 그대로 유지되었습니다.
만약 잘못된 답변을 생성해서 피드백에 환각이 있거나, 유해성이 있는 내용이 올 경우, 도메인 전문가가 답변을 수정하게 됩니다.
Evaluation Step에서는 기존의 Question과 SPEED의 Answer, 피평가 답안이 주어집니다.
정량평가의 경우 서술형 시험지를 채점할 때 중요한 구문을 중점으로 평가하는 것처럼 SPEED의 Answer에서 중요한 키워드를 뽑고,
해당 키워드를 기반으로 피평가 답안에서 유사도가 높은 키워드를 뽑아 SPEED의 Answer와 피평가 답안 사이의 pair 간 유사도 변화를 측정합니다.
이후 측정한 유사도를 정규화하여 정량평가 종합 점수를 얻습니다.
정성평가의 경우, 문맥, 환각, 유해성 전문가가 주어진 요소들로 각각 문맥에 집중된 평가, 사실성에 근거한 환각 평가, 부정확한 의료 정보가 끼칠 수 있는 유해성들을 언급하며 평가를 제공합니다.
위 그림은 SPEED에 대한 성능 실험 결과입니다. 표 14는 정량평가, 표 15는 정성평가 결과입니다. 이 성능 실험에 올해 진행된 의사 국가시험 문제를 데이터셋으로 활용했습니다.
Original Answer는 의사 국가시험 문제 중 샘플링한 25문제를 하나당 4점, 총 100점으로 환산하여 모델의 답변이 얻은 점수입니다.
SPEED score의 경우 SPEED가 만든 답변을 기준으로 각 모델들이 맞춘 답을 정량평가한 점수입니다.
비교해봤을 때 실제 모델 간의 순위와 정량 평가를 통한 순위가 비슷하게 나오는 것을 볼 수 있고,
실제로도 한 문제 차이를 보인 모델 간의 점수가 SPEED의 정량 평가에서도 근소한 차이를 보이는 것을 확인할 수 있습니다.
정성평가에서는 GPT-4o로 LLM Judge한 100점 만점의 평가를 진행했습니다.
전체 점수를 볼 때 LLaMA3:70B보다 근소하게 높은 점수를 얻었으며, GPT-3.5와도 크게 차이 나지 않는 점수를 받았습니다.
이로써 정량평가와 정성평가 모두 실제 정답으로 매기는 점수, 유명한 Large LLM과 비교했을 때 부족하지 않음을 확인할 수 있습니다.
SPEED는 생성, 평가가 모두 가능한 생성형 평가 모델입니다. 특정 도메인에 뛰어난 생성 능력을 갖추며 자체적인 정답을 도출합니다.
이는 기업이 자사 데이터를 활용하여 모델을 만들 때 답안이 없는 경우 저희 SPEED가 답안을 제시해줄 수 있으며, 나아가 해당 정답을 기반으로 특정 도메인을 평가하는 지표로 활용될 수 있습니다.
그리고 SPEED는 다재다능합니다. 정해진 정답에 대해서 평가만 하는 것이 아닌,
자체적으로 정답을 새로 생성하며 평가를 진행하기 때문에 질문에 맞는 최선의 정답을 생성하고 그를 기준으로 능동적인 평가를 제시할 수 있습니다.
마지막으로는 SPEED는 전문가 교체가 용이합니다. 저희는 의료 도메인을 사용하였지만, 필요에 따라 금융, 법률 등 이미 존재하는 도메인 전문가를 가져와 대체할 수 있습니다.
여기서 제대로 된 평가가 나올지 확인하기 위해 직접 전문가 교체를 실험해보았습니다.
금융 분야에서 Hugging Face에 있는 LLaMA3-finance 모델을 가져와서 의료 도메인 전문가를 대체하고,
금융 보고서 데이터셋을 찾아와 실제 데이터셋의 답변을 피평가 답안으로 설정하여 전체 파이프라인을 진행해보았습니다.
위 그림으로 보시다시피, 각 전문가 모델들의 답안이 잘 나와 전문가 교체가 용이하다는 것을 확인할 수 있습니다.
SPEED를 연구 및 개발함으로써 얻는 Contribution 학술적인 측면과 산업적인 측면으로 나뉩니다.
최근 LLM 성능 평가에 LLM을 활용하는 다양한 기법들이 연구되고 있습니다. 저희 방법론은 이런 학계의 흐름과 잘 맞닿아 있다고 생각합니다.
산업적인 면에서 SPEED는 생성 및 평가를 모두 만족하는,
즉 그 자체로 하나의 Chatbot이 되는 동시에 평가 모델이 될 수 있는 AI 결정 모델을 제안합니다.
또한 고객사의 필요에 따라 전문가들을 대체할 수 있다는 점에서 큰 강점을 가집니다.
저희 팀은 아이디어를 제시하기 시작한 5월부터, 연구 방법을 제안하고, 실질적인 실험을 하나씩 설계하고,
그 안에서 멘토분들의 조언을 얻어 방향성을 잡아가는 과정이 저희에게 많은 성장이 되었습니다.
훌륭한 멘토님들과 SKT AI Fellowship을 할 수 있었음에 진심으로 감사드립니다. ttf 팀이었습니다.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.