데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      생성형 AI 기술을 이용한 보이스 피싱 탐지 기술 개발 - 연구계획(1)

      hee 24.06.16
      443 4 0
      DEVOTEE 요약
      안녕하세요, SKT Fellowship 6기 팀 피싱피싱입니다. 저희는 생성형 AI 기술을 이용해 두 가지 하위 과제로 보이스피싱 탐지 기술을 개발합니다. 첫 번째는 합성 음성 탐지 기술 개발, 두 번째는 대화 내용 분석을 통한 보이스피싱 탐지 기술 개발입니다.
      DEVOTEE 추천 블로그

      안녕하세요 : )

      SKT Fellowsup 6기 [생성형 AI 기술을 이용한 보이스 피싱 탐지 기술 개발] 과제를 진행하게 된 팀 피싱피싱(Phishing Fishing) 입니다.

      첫 번째 포스트에서는 저희가 진행할 연구에 대해 소개하고자 합니다.



      서민 울리는 ‘그놈 목소리’

      뉴스나 주위 사람들을 통해 '보이스피싱'에 대해 한 번쯤은 들어보셨을 텐데요,

      보이스피싱이란, 피해자를 기망 또는 협박하여 개인정보 및 금융거래 정보를 요구하거나 피해자의 금전을 이체하도록 하는 수법을 말합니다.

      보이스피싱은 현재 우리 사회에서 만연한 범죄 중 하나로 개인의 금전적 문제를 넘어 사회적 신뢰에도 큰 타격을 주어 다양한 문제를 야기하는데요,

      일례로 수사기관을 사칭한 보이스피싱 범죄가 늘어나면서 실제 경찰을 보이스피싱범으로 오해하여 수사 과정이 복잡해지고, 수사가 지연되는 문제가 발생하고 있습니다.

      image.png

      최근 피해자에 대한 정보를 취득한 후 피해자의 상황에 맞춘 연령별 맞춤형 시나리오를 기반으로 한 보이스피싱 범죄가 늘면서,

      정보의 접근성이 좋은 20대, 30대조차 보이스피싱에 피해를 보는 사례가 증가했습니다.

      그림17.png

      보이스피싱 수법이 점차 교묘해지는 탓에 보이스피싱을 알아차리는 것이 더욱 어려워지고 있습니다.

      최근에는 사람들이 분간하기 어려울 정도로 자연스러운 음성/영상을 생성하는 기술이 발전하면서 이를 보이스피싱에 악용하는 사례가 발생하고 있습니다.

      저희 팀은 보이스피싱 범죄 예방을 위해 두 가지 하위 과제로 나누어 프로젝트를 진행할 계획입니다.



      과제 1. 생성형 AI로 합성한 음성 탐지 기술 개발

      텍스트를 음성으로 합성하는 TTS(Text-to-Speech), 원하는 목소리로 음성을 변조하는 VC(Voice Conversion) 와 같은 합성 음성 생성 기술이 보이스피싱에 악용될 경우를 대비하여

      합성 음성 탐지 모델 개발을 목표로 합니다.


      그림14.png



      과제 2. 대화 내용 분석을 통한 보이스피싱 탐지 기술 개발

      통화 내용을 분석하여 보이스피싱이라고 판단하기 모호한 상황 에서도 높은 탐지 성능을 보이는 보이스피싱 판별 모델 개발을 목표로 합니다.


      그림15.png

      [과제 1] 생성형 AI로 만든 합성 음성 탐지 기술 개발

      최근 생성형 AI의 발전으로 실제 사람 목소리와 거의 구분이 되지 않는 합성 음성을 생성할 수 있게 되었습니다.

      심지어 3초짜리 음성 샘플만으로 해당 목소리를 그대로 재현하는 AI 기술이 공개되었습니다.

      소리만으로 실제 발화 음성과 합성 음성을 구분하는 것이 점점 더 어려워지고 있습니다.

      저희 팀은 이러한 도전에 대응하기 위해 효과적인 합성 음성 탐지를 위한 세부 목표를 3가지 설정하였습니다.


      1. 한국어 합성 음성 데이터셋 구축


      현재까지 선행된 합성 음성 탐지 연구[2-5]의 대부분이 '영어'를 중심으로 진행되어 왔습니다.

      저희 팀은 한국어 특화 모델을 개발하기 위해 한국어 합성 음성 데이터셋 구축을 우선적인 과제로 삼았습니다.

      최대한 다양한 합성 모델을 활용해 서로 다른 특징을 가진 합성 음성 오디오를 생성하고, 데이터셋을 구축할 계획입니다.

      최신의 다양한 음성 합성 모델을 활용하기 위해서 영어 데이터로 학습한 음성 합성 모델의 사용이 불가피하며, 영어로 학습된 모델 사용 시 발생하는 어눌한 발음 문제를 완화하기 위해

      한국어 데이터로 추가적인 학습을 진행할 것입니다.

      VC

      TTS

      StarGAN-Voic e-Conversion(2018)

      Coqyi tts(2021)

      AUTOVC(2019)

      YourTTS(2021)

      FreeVC(2022)

      coqui_tts_korea

      Korean-Voice-Conversion(2017)

      gTTS (google)

      Voice Conversion with Non-Parallel Data(2018)

      speechtify

      speechtify

      narakeet


      CLOVA


      Amazon Tr

      위의 표는 현재까지 조사한 음성 합성 모델 및 서비스입니다. 추후 변경될 수 있으나, VC와 TTS 각각 5~8개의 모델을 사용해 약 300,000개의 데이터를 생성하는 것이 목표입니다.


      2. 기존 합성 음성 탐지 기술 성능 비교


      AASIST, MH-CONFORMER, RAD 총 3가지 모델의 성능 비교를 통해 최적의 모델을 선정하고자 합니다.

      2-1. AASIST

      기존 RawGAT-ST 모델을 발전시킨 모델로,

      주파수 축과 시간 축의 정보를 효과적으로 결합하고 다양한 관점에서 그래프를 분석하여 보이스피싱 탐지 성능을 개선하였습니다.[3]

      image.png

      2-2. HM-CONFORMER

      음성 인식(Seq-to-Seq )에서 뛰어난 성능을 보인 Conformer를 음성 스푸핑 탐지와 같은 분류 작업에 적용하기 위해

      [Hierarchical pooling method] 입력 시퀀스의 길이를 점진적으로 줄여 중복 정보를 제거하여 다양한 시간 스케일에서의 특징을 추출하였으며,

      [Multi-level classification token aggregation method] 각 Conformer 블록마다 분류기를 학습하여 다른 부분에서 중요한 특징을 추출하고, 추출된 특징을 모두 결합하여 최종적으로 분류 작업에 활용해 성능을 개선했습니다.[4]

      image.png

      2-3. RAD

      기존 합성 음성 탐지기는 훈련 데이터에 포함되지 않은 새로운 생성기로 합성된 음성 오디오에 대해 탐지 성능이 저하되는 문제가 있었습니다.

      이를 해결하기 위해 외부 데이터 참조하는 RAG 구조를 딥페이크 오디오 탐지에 활용하여 새로운 유형의 합성 음성 데이터에 대해서도 효과적으로 탐지할 수 있도록 개선하였습니다.[5]

      RAD.png


      3. 일반 발화 음성/합성 음성 양방향 참조를 통한 RAD 개선


      RAD는 참조 데이터 베이스를 일반 발화 음성 만으로 구성하였습니다.

      합성 음성 데이터셋과 일반 발화 음성 데이터셋 두 가지를 모두 구축해 입력 오디오와의 유사 샘플 참조 시 합성 음성 오디오와 일반 발화 오디오를 양방향으로 비교하고자 합니다.

      이는 앙상블과 같은 효과를 만들어 판별의 신뢰도 및 성능을 높일 것이라 기대합니다.

      RAD [5]

      양방향 참조 RAD

      1.png

      2.png

      3.png

      4.png

      [과제 2] 대화 내용 분석을 통한 보이스피싱 탐지 기술 개발

      다음은 대화 내용을 바탕으로 보이스피싱을 탐지하는 모델 개발에 대한 내용입니다.

      총 3가지의 세부 목표를 설정했습니다.

      1. Challenging Dataset 구축

      기존 보이스피싱 탐지 모델 연구에서 주로 활용되고 있는 KorCCVi 데이터셋의 보이스피싱 대화(Phishing)와 일반 대화(Non-Phishing)를 살펴본 결과,

      사용되는 어휘 및 어조 등에서 현저한 차이가 있음을 확인했습니다.

      그.러.나. 현실에서는 일상 대화와 보이스피싱 사이의 경계가 모호할 수 있습니다. 가족 간 금융 거래에 대한 대화를 할 수 있으며, 금융 상담 전화와 같은 상황도 발생할 수 있습니다.

      현실에서 발생할 수 있는 다양한 상황을 반영한 데이터셋을 구축하여 실제 활용 가능한 신뢰도를 가진 보이스피싱 탐지 모델을 개발하고자 합니다.


      또한, KorCCVi 데이터셋은 일반 대화(Non-Phishing) 데이터가 2,841개(약 80%), 보이스피싱(Phishing) 데이터가 731개(약 20%)로 매우 불균형한 분포를 보입니다. 데이터 불균형을 해결하기 위해 LLM을 활용하여 보이스피싱 데이터를 증강할 계획입니다.


      아래는 참고를 위해 KorCCVi[6, 7] 데이터셋 중 일부 샘플을 가져온 것입니다.

      Phishing

      Non-Phishing

      일 금융권에서 대출이 안 되시는 분들이 그 상 상담사 통해서 지금 뭐 신규 대출 기존 대출 상환하신 다음에 상환 능력 높혀서 이렇게 대출 받아 보신 사례가 있어서 그럼니다. 아, 그래요. 그랬으면 좋겠어요. 왜냐면 지금 요청하신 공문이 이런 사랑 유사에서 (. . . 생략 . . . ) 네 기업 은행 이시고 지금 십오 분 열람 됐으니까 납부해 주시고 연락 주시고 한 번에 이걸 이천 칠백만원 납부해 주셔야 됩니다. 예 알겠습니다. 네 감사합니다. 네.

      저는 여행 다니는 것을 굉장히 좋아하는데요. 그래가지고 스페인이나 뭐 영국 유럽 아니면 국내에서도 뭐 강릉이나 전주 같은 데를 많이 다녔는데 혹시 여행 다니는 거 좋아하시나요? 저 여행 다니는 거 되게 좋아해서 대학교 내내 여행을 엄청 많이 다녔었는데요. 제가 고등학교 때는 여행에 대한 흥미가 없었는데 그게 좀 아버지가 짠대로 패키지처럼 여행을 다녀서 그런 것 같아요. 그래서 대학교 간 이후로는 해외여행을 되게 많이 갔었는데 그중에서 제일 기 좋았던 거는 스페인이랑 포르투갈이었거든요.

      저희가 좀 김영국을 중심으로 명의도용이 불법 거래 자기 다른 공부 하는 과정에서 대장이 신용카드와 대포통장 신분증 보안 카드가 납부했습니다. 증거품 대로 확인 하는 과정에서 명의로 되어 있는 능력과 국민은행 통장 약수가 되었고요. 배당금 인권에 대해 좀 해 본 결과 본인 명의로 개설되는 통장까지 확인하였습니다. 예약 본인명의 대포통장이 범죄현장에 사용됨에 따라 많은 피해자들이 발생되었습니다. 피해자들은 11분 고소 고발 신청 안 하면 되고요. 절차를 밟아 주식 고수 갈 거니 제한조치를 키워줄 수 있습니다. 내용이 하셨어요. 예 아 예 일단 본인께서 지금 김해항공 입장 제거에 문자내역이 나 전화 내역이 저녁 발견되지 않았기에 일 진행이 됩니다네. 지금 절차를 통해 분인가 김영국 1장 2절의 무관하다. 증거를 녹취자료 남기시는 겁니다네 저희가 좀 빨리 증거 자료로 하는게 것이고요. 녹취조사 좀 주변에 소음이 심하게 들리거나 제 3자에 목소리가 본인의 음성보다 크게 들리게 된다면 공포의 법적인 증거자료로 제출될 수 없습니다. 말씀드리면서 욕실 공사 시작하겠습니다. 장소가 어디세요?.

      자신이 생각하는 성격은 어때요? 자신의 성격 한 단어로 표현하자면 소심함. 소심함이라고 표현할 수 있을 거 같아요. 예전에 초등학교 때부터 아니 태어났을 때부터 항상 제가 뚱뚱했어가지고 그~ 뚱뚱함 때문에 자기에 대한 자기에 대한 자신감이라고 해야 되나 부끄러움도 많고 나는 뚱뚱해서 뭐가 안 될 거 같아. 아 안 된다고 생각해 아니면 다른 사람이 나를 이상하게 생각할 거 같아 라는 생각을 엄청 하다 보니까 매사에 소극적이게 되고 소심하게 되고 그게 쭉 이어져서 성인 될 때까지는 그런 소심한 성격으로 계속 살아 왔었던 거 같아요. 성격을 한마디로 표현하자면 어떻게 표현하실 수 있을까요 아니면 자신의 성격에 대해서 설명 해 주실 수 있나요?


      2. 기존 보이스피싱 탐지 모델 성능 비교

      앞서 구축한 데이터셋을 바탕으로 다양한 모델[6, 7]들을 비교 실험하여 최적의 모델을 선정하고자 합니다.

      저희 팀은 네트워크 연결 없이도 실시간으로 보이스피싱을 탐지할 수 있도록 On-Device에서 활용 가능한 모델 개발을 목표로 합니다.

      따라서, 처리 속도 및 모델 크기, 탐지 성능 등을 종합적으로 평가하여 최적의 모델을 결정할 계획입니다.

      기존 ML/DL 성능 평가 결과[6]

      기존 DL 성능 평가 결과[7]

      Untitled.png

      Untitled (2).png


      3. LLM 기반 Multi-Agent를 활용한 보이스피싱 탐지 성능 향상

      On-Device에서 활용할 탐지 모델의 판별 결과 신뢰도가 낮은 경우,

      LLM 기반 다중 에이전트 협업 기법[8]을 도입하여 판별 결과의 신뢰도를 향상하고 성능을 개선하고자 합니다.

      LLM의 강력한 언어 이해 능력을 활용하기 위해 3가지 역할(언어 전문가, 보이스피싱 수사관, 감정 전문가)을 부여해 다각도에서 대화 내용을 분석하고,

      분석 결과를 보이스피싱 탐지에 활용할 계획입니다.

      그림19.png


      마치며

      이번 포스팅에서는 SKT Fellowship 6기 생성형 AI 기술을 이용한 보이스 피싱 탐지 기술 개발 을 위한 연구 계획을 소개했습니다.

      본 연구 과제는 생성형 AI로 합성한 음성 탐지 기술 개발과 대화 내용 분석을 통한 보이스피싱 탐지 기술 개발을 목표로 하며, 각 기술 개발의 세부 목표는 아래와 같습니다.

      [생성형 AI로 합성한 음성 탐지 기술 개발 세부 목표]

      1. 한국어 합성 음성 데이터셋 구축

      2. 기존 탐지 모델 성능 평가를 통한 최적 모델 선정

      3. RAD 성능 최적화

      [대화 내용 분석을 통한 보이스피싱 탐지 기술 개발 세부 목표]

      1. Challenging Dataset 구축

      2. 기존 보이스피싱 탐지 모델 성능 평가를 통한 최적 모델 선정

      3. LLM 기반 Multi-Agent를 활용한 보이스피싱 탐지 모델 개발

      앞으로 최현상, 한상현, 윤나은, 여동기 멘토님들의 지도를 받아 좋은 결과 만들 수 있도록 달려보겠습니다.

      다음 포스팅에서 뵙겠습니다 : )



      참고 문헌


      [1] 금융감독원. (2024, 3월 7일). 작년 보이스피싱 피해자 1인당 1,700만원 피해, 전년比 1.5배↑- 2023년 보이스피싱 피해현황 분석 -[보도자료]. google에서 검색됨 https://zrr.kr/8AEG.

      [2] Yi, J., Wang, C., Tao, J., Zhang, X., Zhang, C. Y., & Zhao, Y. (2023). Audio deepfake detection: A survey. arXiv preprint arXiv:2308.14970.

      [3] Jung, Jee-weon, et al. "Aasist: Audio anti-spoofing using integrated spectro-temporal graph attention networks." ICASSP 2022-2022 IEEE international conference on acoustics, speech and signal processing (ICASSP). IEEE, 2022.

      [4] Shin, Hyun-seo, et al. "HM-Conformer: A Conformer-based audio deepfake detection system with hierarchical pooling and multi-level classification token aggregation methods." ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2024.

      [5] Kang, Z., He, Y., Zhao, B., Qu, X., Peng, J., Xiao, J., & Wang, J. (2024). Retrieval-Augmented Audio Deepfake Detection. arXiv preprint arXiv:2404.13892.

      [6] Moussavou Boussougou, Milandu Keith, and Dong-Joo Park. "Attention-Based 1D CNN-BiLSTM Hybrid Model Enhanced with FastText Word Embedding for Korean Voice Phishing Detection." Mathematics 11.14 (2023): 3217.

      [7] 밀란두, and 박동주. "Exploiting Korean Language Model to Improve Korean Voice Phishing Detection." 정보처리학회논문지. 소프트웨어 및 데이터 공학 11.10 (2022): 437-446.

      [8] Lan, Xiaochong, et al. "Stance detection with collaborative role-infused llm-based agents." arXiv preprint arXiv:2310.10467 (2023).

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      hee 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기