23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요! SKT AI Fellowship 6기에서 Multimodal 정신 건강 인식 프로젝트 과제를 수행하게 된 B-7 emo카세 팀입니다.
저희 팀은 우울 증상 및 우울증 예측을 위한 Pretraining-Finetuning Framework을 목표로 연구를 진행하고 있습니다.
첫 포스트에서는 Fellowship 기간동안 수행하게 될 연구의 계획과 최종 예상 결과물을 소개해 드리도록 하겠습니다.
<목차>
정신 건강 인식이란?
연구 배경
연구 최종 목표
연구 내용
제안 모델
데이터셋
예상 결과물
Project Plan & Team Introduction
저희 팀은 현대사회에서 중요한 문제로 자리 잡고 있는 정신 건강, Mental Health를 보다 잘 이해하고자 하는 것을 최종 목표로 두고 있습니다. ‘건강’이라고 하면 신체적 건강을 일차적으로 떠올리게 되는데, 정신 건강도 신체 건강과 마찬가지로 인간의 전반적인 건강 관리에 있어 굉장히 중요한 요소입니다. 예를 들어, 우울증은 당뇨병, 심장병, 뇌졸중과 같은 다양한 질병의 위험을 증가시킬 수 있다고 합니다. 그럼 정신 건강이란 무엇일까요?
정신 건강이란 감정적, 인지적, 사회적 웰빙을 의미하며 포괄적으로 심리적 장애, 정신질환이 없는 상태를 일컫습니다. 정신 건강을 잘 유지하는 것이 우리가 일상에서 느끼는 스트레스를 다루고, 사람들과 사회적 관계를 맺고 전반적인 삶의 질을 결정하기에, 아동, 성인, 노인 모두에게 중요합니다. 이러한 정신 건강은 **정서적 건강 (emotional health)**과 밀접한 관련이 있어, 정서적 심리 상태를 보다 잘 이해하고 조절 및 관리하는 것이 곧 정신 건강을 유지하는 데에 필수적입니다. 특히, 2020년에는 70만 명 이상이 우울증으로 진단을 받았으며, 기분 장애로 진단 받은 사람은 100만 명을 넘어섰다고 하는데, 이는 현대 사회에서 정신 건강 관리가 중요함을 나타냅니다.
그럼 인간의 정신 건강 상태와 감정 상태를 가장 잘 알 수 있는 것들이 무엇이 있을까요? 개인적으로 작성하는 일기 및 친한 친구와의 대화 혹은 고민 상담 등이 있겠죠. 결국, 인간은 본인의 감정을 글로 표현하거나 대화로 외부에 표현을 하여 나타내기에, '대화'에서의 감정 인식을 통해 정신 건강을 이해하는 연구를 진행하고자 합니다. 특히, 대화는 의미적 정보를 담고 있는 text 정보와 화자의 심리적 상태를 나타내는 speech 정보로 이루어져 있어 text+speech 멀티모달 데이터에 기반한 정신 건강 인식 모델을 개발하고자 합니다.
Text+Speech의 대화 데이터를 통해 정신 건강을 이해하기 위해서는 저희는 크게 3가지 포인트를 중점적으로 다뤄야 한다고 판단하였습니다.
(1) Modality Gap 해소 (2) 감정 분류의 인지심리학적 접근 (3) 우울 진단의 설명 가능성
첫째는, text와 speech 개별 modality 사이에 존재하는 갭을 해소하는 것으로, 인간은 대화만으로 상대방의 복합적인 감정을 이해할 수 있으나, 딥러닝 모델 관점에서는 별개인 text와 speech 데이터를 전반적으로 고려해야만 모델의 안정적인 성능을 확보할 수 있습니다. 이를 위해 기존의 멀티모달 모델들은 각 모달의 특징을 추출할 encoder를 통과한 output을 통합하기 위해 cross attention 기법을 활용합니다.
이는 각 모달이 담고 있는 정보의 차이를 고려하지 못하고 두 모달리티를 동일선상의 개념으로 바라보고 통합합니다. 하지만 실제로 text 모달은 의미론적 정보만을 담고 있지만, speech 모달은 의미적 정보뿐만 아니라 음역대, 소리의 떨림, 반언어적 표현 등의 추가적인 정보를 담고 있습니다. 따라서, 저희는 각 모달리티에 존재하는 정보의 차이를 고려한 cross modal attention을 진행하고자 합니다.
둘째는, 감정 분류에 있어 인지심리학적 관점을 중점으로 두었습니다. 너무나도 복합적이고 복잡한 인간의 감정을 정의하기란 어렵지만, 다양한 인지심리학자들이 감정을 정의하여 감정 모델을 제안한 바가 있습니다. 이 중 저희는 Rober Plutchik이 제시한 감정 분류 체계를 흥미롭게 보았습니다. Plutchik Wheel은 인간의 감정을 총 8가지로 분류하며 감정의 유사도에 따라 바퀴 내에서 위치가 달라지도록 표현하였습니다. 예시로 ‘혐오’와 ‘분노’는 서로의 옆에 위치하고, ‘혐오’와 ‘신뢰’는 반대에 위치하는 것을 확인할 수 있습니다. 해당 감정 모델에 따르면 우리의 감정은 discrete하게 분류되는 것이 아니라 복합적이며 감정 사이에 관계가 존재함을 의미합니다.
이는 감정 인식을 단순 분류 문제로 바라보는 것이 아닌 감정 레이블 자체의 의미적 유사도, 내제적 특성을 고려하여 학습을 진행해야 복합적인 우리의 감정을 잘 이해할 수 있음을 나타냅니다. 따라서, Plutchik Wheel에 따른 loss를 정의하여 학습에 적용하여, 감정 인식 정확도를 향상시켜보고자 합니다.
마지막으로는, 저희 연구의 최종 목표에 해당되는 정신 건강 인식, 우울 진단과 관련된 내용입니다. 우울증을 앓는 사람들은 부정적인 감정에 압도되고 긍정적인 감정을 경험할 수 없다고 합니다. 우울 진단에 있어 감정적인 요소가 영향을 끼친다는 점을 기반으로 저희는 앞선 감정 인식 모델을 pretrain model로 활용하여 우울 진단에 knowledge를 transfer하여 활용하고자 합니다. 이와 더불어, 우울 진단에 있어 우울증 유/무를 예측하는 분류 정확도만큼이나 우울증 예측에 있어 지배적인 영향을 준 요소를 파악하는 것이 중요하기에 우울 진단의 설명 가능성을 확보하고자 합니다. 이를 위해 우울증 진단에 대표적으로 활용되는 설문이자, 우울 판단을 위한 세부 증상 항목 9개 (예: Loss of interest, Feeling of Depression) PHQ-9을 활용하여 저희는 각 증상 항목의 attention score를 기반으로 우울 진단의 근거를 제시하고자 합니다.
=
‘대화’ 기반의 정신 건강 인식 모델 개발에 있어 중요한 3가지 포인트를 중점으로 진행하며 달성하고자 하는 최종 목표는 우울 증상 및 우울증 예측을 위한 Pretraining-Finetuning Framework 개발로, 각 세부 목표는 다음과 같습니다.
Text & Speech 정보의 효율적 통합을 위한 학습 모델 설계
감정의 intrinsic relationship을 반영한 Representation Loss 설계
Pretrain-Finetuning 프레임워크로 두 가지 task (감정 인식, 우울 진단)에서의 성능 고도화
최종 목표를 달성하기 위해 저희가 설계한 제안 모델을 설명하도록 하겠습니다. 위의 내용을 다시 요약하자면 저희는 text+speech 멀티모달 데이터를 기반으로 두 가지 모델 (1) 감정 인식 모델과 (2) 감정 인식 모델 기반의 우울 진단 모델을 개발하고자 합니다.
저희는 텍스트 정보와 음성 정보를 효율적으로 통합하기 위해 텍스트 정보에 기반한 음성 특징을 추출하고자 합니다. 이를 위해, 우선 텍스트 정보의 representation을 추출하기 위해 pretrained language encoder를 활용하고, speech 정보를 추출하기 위해 똑같이 pretrain model을 활용하는데 이 때, ‘발화 특징’을 추출하기 위해 Whisper 모델을, ‘의미적 요소’를 추출하기 위해 WavLM 모델을 활용하고 이에 adaptor를 붙여 저희 테스크에 맞게 학습을 진행하고자 합니다. 최종적으로 연구배경 1에서 언급한 cross modality gap 해소를 달성하기 위해 speech representation 추출 시 text representation을 추가적으로 활용하도록 하고자, adaptor에 multi-head cross modal attention layer를 추가하여 학습을 진행합니다.
인지심리학자 Plutchik의 감정 모델을 기반으로 감정 레이블 사이에 존재하는 intrinsic relationship을 반영하여 학습에 활용하고자 합니다. 유사한 감정은 덜 유사한 감정보다 가깝도록 정의하고 반대 감정은 반대 방향에 위치하도록 하는 Plutchik Wheel을 기반으로 저희는 각 감정을 circular 공간에 mapping하여 각 감정에 대한 emotion vector를 정의합니다. 일반적으로는 text+speech의 representation에 대해 classification 문제를 해결하기 위한 cross entropy 손실함수를 활용하여 레이블 예측을 진행합니다. 이에 추가로 저희는 emotion vector를 label로 활용하여 Emotion Vector Loss를 도입합니다.
이 때, 많은 감정 분류 데이터셋에서 정의된 레이블을 기반으로 Plutchik Wheel에 매핑한 각 레이블별 emotion vector는 다음과 같이 활용할 예정입니다. 아래 표에서 θ는 vector의 방향을 나타내기 위한 각도를, r은 길이를 나타내며 r=0을 통해 중립 감정을 나타냅니다.
우울 진단 예측 모델을 위해 감정 예측 모델을 사전학습 모델로 활용하여 text+speech 데이터의 representation을 추출하고 우울증 데이터에 finetuning하여 활용합니다.이 때 사전학습 감정 예측 모델 전체를 finetuning하는것은 파라미터 학습의 비효율성 및 catastrophic forgetting 문제가 발생할 수 있어, 사전 모델은 frozen한 상태로 4가지의 adaptor (LoRA, Bottleneck Adaptor, Weighted Sum Adaptor, Weight Gating Adaptor)를 활용합니다. 특히, 우울을 진단하는 데에 있어 지배적인 요소를 설명하기 위해 (1) PHQ-9의 각 우울 증상을 예측하고 (2) 우울을 진단 (binary classfication)하는 2단계로 진행합니다.
진단에 대한 설명을 제공하기 위해서 ‘(1) PHQ-9의 각 우울 증상을 예측’에서 도출되는 9가지 우울증 증상에 대한 attention score를 시각화하여 나타냅니다.
Emotion Classification과 Depression Detection을 위해서는 아래의 데이터셋을 활용할 예정입니다.
IEMOCAP
MELD
(미정) MOSEI - 데이터셋 규모가 커서 학습 시간 고려하여 최종 선정 결정
세 가지 데이터 모두 비디오, 음성, 텍스트 세 가지 모달리티를 포함하지만 본 연구에서는 ‘대화’ 형식 셋팅을 고려하여 음성과 텍스트 데이터만 활용하고자 합니다. 아래의 표는 각 데이터셋별 레이블과 그 분포를 나타내는데 보시다시피 데이터 불균형 문제가 극심한 것을 확인할 수 있습니다. 데이터 불균형은 학습에 불안정을 야기하기 때문에 간단한 loss reweighting 등의 방식을 접목해 볼 예정입니다.
DAIC-WOZ
(미정) E-DAIC
우울 진단에 있어서는 우울증 여부와 더불어 증상별 레이블이 포함된 데이터셋을 선정하였습니다. DAIC-WOZ는 우울증 관련 가장 대표적으로 활용되는 벤치마크 데이터셋으로 PHQ-8 레이블이 존재하여 선정하여 활용하고자 합니다.
본 연구의 최종 결과물의 예상 시나리오도 고려해봤습니다! 저희는 두 명의 화자가 자유대화하는 전화와 같은 상황에 대해 대화별로 감정 인식 예측 결과를 나타내고, 전반적인 정신 건강 상태를 예측하는 상황을 그려보았습니다. 이 때, 대화 데이터 자체에는 텍스트 데이터가 포함되어 있지 않기에 STT API를 이용하여 speech 데이터를 text로 변환하여 함께 활용할 예정입니다.
저희가 개발한 모델의 결과물을 사용자에게 친숙하게 나타내기 위해 감정 모델, 우울 모델 각각에 대한 시각화 또한 제공하고자 합니다.
감정 모델에 대해서는 각 발화의 output prediction에 대한 input text의 영향력을 XAI 기법은 SHAP으로 표현하고, 각 발화에 대한 예측 결과 클릭 시 output prediction을 Plutchik wheel에 매핑하여 visualize합니다.
우울 진단에 대한 설명을 제공하기 위해 각 증상별 attention score를 추출하여 우울 진단에 대한 설명으로 제공합니다.
저희가 5개월 동안 진행할 연구에 대한 계획으로, 최종 발표와 더불어 연구 결과를 논문으로 작성하여 학회지에 투고하고자 합니다!
저희 팀은 '오마카세만큼 만족스러운 Emotion 진단을 목표'로 만들어졌으며 김다혜, 성은선, 이하림으로 3인으로 구성되었으며 SKT BioMedical AI 팀의 김창현 멘토님, 이상율 멘토님과 함께 활동 중에 있습니다:)
저희 팀은 매주 1회 멘토님과 온라인 미팅, 팀원들끼리 추가 1회 오프라인 미팅을 통해 프로젝트를 진행할 예정입니다.
5개월동안 이어질 저희 emo카세의 여정을 함께 지켜봐주시고 응원해주시면 감사하겠습니다! 단기간이지만 저희도 유의미하고 즐거운 연구를 통해 폭발적 성장을 경험할 수 있도록 끊임없이 정진하겠습니다:)
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.