데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      생성형 AI 기술을 이용한 보이스 피싱 탐지 기술 개발 - 연구과정(2)

      hee 24.08.31
      249 0 0
      DEVOTEE 요약
      SKT Fellowship 6기 프로그램에서 생성형 AI를 이용한 보이스 피싱 탐지 기술을 개발하고 있습니다. 딥페이크 오디오와 통화 내용을 기반으로 보이스 피싱을 탐지하는 두 가지 과제를 진행 중이며, 현재까지의 연구 진행 상황과 향후 계획을 공유합니다. 딥페이크 오디오 탐지와 통화 내용 분석을 통해 보이스 피싱에 효과적으로 대응할 수 있는 기술을 계속해서 개발할 예정입니다.
      DEVOTEE 추천 블로그

      안녕하세요!


      SKT Fellowsup 6기 생성형 AI 기술을 이용한 보이스 피싱 탐지 기술 개발 과제를 진행하는 피싱피싱(Phishing Fishing) 입니다.

      이번 포스트에서는 현재까지 진행한 연구 내용과 중간발표 때 받았던 피드백을 반영한 향후 연구 계획에 대해 공유하고자 합니다.

      1. 연구 배경 및 목표


      2. 연구 진행 상황

        1. 고도화된 보이스피싱 대응을 위한 딥페이크 오디오 탐지

        2. 신규 시나리오 대응을 위한 통화 내용 기반 보이스피싱 탐지


      3. 피드백을 반영한 향후 연구계획

        1. 고도화된 보이스피싱 대응을 위한 딥페이크 오디오 탐지

        2. 신규 시나리오 대응을 위한 통화 내용 기반 보이스피싱 탐지


      1. 연구 배경 및 목표

      최근 기술의 발전으로 이를 보이스피싱에 악용하는 사례가 발생할 뿐만 아니라 수법도 더욱 교묘해지고 있습니다.

      저희 팀은 이에 대응하기 위해 보이스피싱 범죄 예방 기술 개발을 목표로 하고 있습니다.

      프로젝트는 두 가지 하위 과제로 진행하고 있습니다.

      1. 딥페이크 오디오 탐지 기술 개발 : 딥페이크 오디오 생성 기술이 보이스피싱에 악용될 경우에 대응하고자 합니다.

      2. 대화 내용 분석을 통한 보이스피싱 탐지 기술 개발 : 보이스피싱이라고 판단하기 모호한 상황에서도 높은 탐지 성능을 보이는 보이스피싱 판별 모델을 개발하고자 합니다.


      2. 연구 진행 상황

      두 가지 하위 과제에 대한 진행 상황을 각각 살펴보겠습니다.

      2-1. 고도화된 보이스피싱 대응을 위한 딥페이크 오디오 탐지

      2-1.1. 기존 딥페이크 오디오 탐지 모델 연구 현황

      기존 모델들은 주로 영어 중심으로 개발되어 있습니다.

      저희는 한국어에 적용 가능한 모델 개발을 위해 한국어 데이터셋 구축 및 모델 학습을 계획했습니다.

      2-1.2. 한국어 특화 딥페이크 오디오 데이터셋 구축

      실제 발화 데이터 수집

      AI Hub에서 다양한 조건의 데이터를 선별하여 수집했습니다.

      또한, TTS로 생성한 딥페이크 오디오의 자연스러운 발음을 위해 띄어쓰기 교정과 발음변환도 진행했습니다.


      딥페이크 생성 모델 파인튜닝

      다음 조건을 고려해 딥페이크 오디오 생성 모델을 선정했습니다.

      1. 최신 오픈소스 모델일 것

      2. 여러 사람의 목소리로 합성이 가능한 모델일 것

      3. 한국어 지원이 가능한 모델일 것

      이에 부합하는 XTTS (2023)와 FreeVC (2022)를 주요 모델로 선정했습니다. 선정된 모델들은 수집한 한국어 발화 데이터를 사용해 파인튜닝을 진행했습니다.

      API와 파인 튜닝 모델을 활용한 딥페이크 오디오 생성

      다양한 API와 파인튜닝 모델을 활용해 한국어 딥페이크 오디오를 생성했습니다.

      현재 목표 50,000개의 데이터 중 20% 정도 생성을 완료했습니다.


      추가로 생성 딥페이크 오디오의 유효성 검증을 위해 설문조사를 진행했는데요,

      79명의 응답자 중 약 40%의 응답자들은 딥페이크와 실제 음성을 구분하는데 어려움을 겪었으며,

      대부분 딥페이크 오디오와 실제 발화 오디오 간의 유사도가 높게 평가되었습니다. 이는 딥페이크 오디오가 원본 음성의 특성을 잘 반영하고 있다는 것을 의미합니다.

      2-1-3. 기존 딥페이크 오디오 탐지 모델 성능 비교

      높은 성능을 보이는 세 가지 최신 딥페이크 탐지 모델을 선정하고, 성능 평가를 진행하고 있습니다.

      AASIST

      HM-Conformer

      RAD

      그래프 어텐션 네트워크

      이종 누적 그래프 어텐션 레이어(HS-GAL)

      최대 그래프 연산(MGO)

      Conformer 구조 개선

      계층적 풀링 및 다중 레벨 분류 토큰 집계

      검색 기반 증강

      WavLM 특징 추출기

      다중 융합 어텐티브(MFA) 분류기




      성능 평가에는 보안 시스템의 성능을 평가하는 주요 지표인 EER* 을 사용했으며, 모든 모델은 ASVspoof2019 데이터로 학습한 뒤 평가하였습니다.

      *실제 발화 오디오를 딥페이크로 잘못 판단하는 비율과 딥페이크 음성을 정상으로 잘못 판단하는 비율이 교차하는 지점이 바로 EER입니다.

      이 값이 낮을수록 딥페이크를 잘 탐지한다고 볼 수 있습니다.


      AASIST

      HM-Conformer

      RAD

      ASVspoof2019

      0.82

      -

      -

      ASVspoof2021

      20.97

      39.49

      -

      Ours

      65.09

      -

      -

      AASIST는 학습된 데이터(ASVspoof2019)에서는 낮은 EER을 보였지만, 학습되지 않은 데이터(ASVspoof2021, Ours)에서는 높은 EER을 보이며,

      새로운 데이터 탐지에 취약함을 보였습니다. 이를 극복하기 위해 AASIST와 HM-Conformer는 새로운 딥페이크 오디오 탐지 시 재학습이 필요합니다.

      반면, RAD는 검색증강 기술을 활용해 데이터베이스 갱신만으로 탐지가 가능합니다.

      이러한 장점을 적극 활용하기 위해 추후 RAD를 기반으로 추가 아이디어를 도입하여 모델 성능을 향상시킬 계획입니다.


      2-2. 신규 시나리오 대응을 위한 통화 내용 기반 보이스피싱 탐지

      2-2-1. 기존 한국어 시나리오 기반 보이스피싱 탐지 모델 및 데이터셋 검토

      다음은 KorCCVi로 학습한 최신 주요 모델들의 탐지 성능을 정리한 표입니다.

      Models

      Precision

      Recall

      F1

      LGBM

      99.43

      99.43

      99.43

      CatBoost

      99.41

      96.61

      97.99

      BiLSTM

      97.01

      96.99

      96.99

      KoBERT

      1

      99.14

      99.57

      Attention-Based 1D CNN-BiLSTM

      99.32

      99.32

      99.31

      KorCCVi로 학습한 모델들이 매우 높은 성능을 보였지만, 데이터를 분석한 결과 다음과 같은 문제점들을 발견했습니다

      KorCCVi 의 일반 대화와 보이스피싱 대화의 어휘 차이

      KorCCVi 일반 대화

      KorCCVi 보이스피싱 대화

      건물주들이 어 말도 안 되는 가격을 말도 안 되게 가격을 아 보증금을 올리고 있는 그런 얘기가 많이 나오는데요. 그런 점에거 그게 맞는 합당하다고 생각하시나요? ...

      다만 아직까지 피해자라고 증명할 증거가 없으셔서 피해자 입증 조사 도와드리려고 하는 부분이고요. 본인 같은 경우는 1차적인 혐의점이 없으셔서 ....

      반려동물을 키우고 계신가요? 혹시 안 키우고 계시다면은 어떤 반려동물을 한번 키워보고 싶은 생각이 있으신지 저는 반려동물을 키우지 않고 있는데요. 어~ 키우지 않고 있는 이유는 반려동물을 끝까지 책임질 수 있다는 ...

      깡통 계좌 내용에 대한 거는 이제 실질적으로 제가 설명드렸듯이 이 계좌 잔고가 얼마가 있던 상관 없습니다. 돈이 액수가 필요한게 아니고 한번 확인을 해도 출금 시도를 해봐야 ...

      명확히 구분되는 KoBERT 문장 임베딩 분포

      보이스피싱과 유사한 금융 관련 어휘를 다수 포함하고 있는 금융 상담 대화와 임베딩 분포를 비교해보았습니다.

      KorCCvi 일반 대화와 보이스피싱 대화의 임베딩 분포

      KorCCvi 보이스피싱 대화와 일반 금융 대화의 임베딩 분포



      일반 금융 상담 대화의 대부분을 보이스피싱으로 오탐

      금융 상담 대화로 기존 모델을 평가한 결과, 매우 낮은 정확도를 보였고 대부분의 금융 상담을 보이스피싱으로 오탐했습니다.

      이러한 결과는 실제 서비스 적용 시 **모든 일반 금융상담 통화를 보이스피싱으로 오탐**할 수 있는 심각한 문제를 나타냅니다.

      Model

      Accuracy

      LGBM

      0.0100

      CatBoost

      0.0080

      1D CNN

      0

      KoBERT

      0.1055

      Attention based 1D CNN-BiLSTM

      0.0020

      현실적인 문제 해결을 위해, 보이스피싱과 문맥이 매우 유사한 일반 대화(예: 금융상담, 경찰조사, 가족 간 개인정보 관련 통화)를 포함한 챌린징 데이터셋 구축을 시작했습니다.

      2-2-2. LLM을 활용한 챌린징한 데이터셋 구축

      현재 약 45%의 데이터셋 구축이 완료되었으며, 지속적으로 설문조사 피드백을 반영하여 데이터를 생성 중입니다. 데이터셋 구축 과정은 다음과 같습니다.

      문맥 데이터 수집

      AI Hub 금융상담 통화 데이터, KorCCVi 데이터셋, 금융 감독원의 보이스피싱 사례 요약 자료 크롤링

      LLM을 활용한 통화 스크립트 생성
      1. 스크립트 생성 전략 수립

        실제 보이스피싱 스크립트에서 사기 수법 추출 및 새로운 상황 적용

        실제 보이스피싱 사례 요약을 바탕으로 새로운 통화 구성

        일반 금융 상담 대화에 사기성 요소 추가

        실제 보이스피싱 스크립트에서 사기성 요소 제거

      2. 시스템 프롬프트 최적화

        서술 형식, 언어, 출력 형식

      3. LLM 하이퍼파라미터 최적화

        temperature, top_p, frequency_penalt, presence_penalt

      4. API 호출을 통한 데이터 생성

        일반 스크립트

        보이스피싱 스크립트

        안녕하세요, OO캐피탈 상담원 OOO입니다. 무엇을 도와드릴까요? 안녕하세요. 저금리 대환대출에 대해 알아보고 싶습니다. 네, 저금리 대환대출에 관심이 있으시군요. 현재 어떤 대출을 이용 중이신가요? 신용대출을 이용 중입니다. 알겠습니다. 대환대출을 진행하기 전에 몇 가지 확인이 필요합니다. 현재 대출의 금리, 남은 상환 기간, 그리고 고객님의 신용점수를 알고 계신가요? 현재 금리는 연 8%이고, 상환 기간은 3년 정도 남았습니다. 신용점수는 정확히 모르겠네요. 네, 말씀해 주셔서 감사합니다. 대환대출 가능 여부를 정확히 판단하기 위해서는 고객님의 신용정보 조회가 필요합니다. 이를 위해 고객님께서 직접 저희 홈페이지나 모바일 앱을 통해 본인인증을 하신 후 대출 상담을 신청해 주셔야 합니다...

        여보세요, OO은행 고객센터입니다. OOO 고객님 맞으신가요? 자동이체일 변경 문의 주셨다고 들었습니다. 네, 맞습니다. 21일에서 25일로 바꾸고 싶은데요. 알겠습니다. 최근 관련 법규가 변경되어 자동이체일 변경을 위해서는 본인확인 절차가 필요합니다. 주민등록번호와 텔레뱅킹 정보를 확인해야 하는데요, 계좌번호, 계좌 비밀번호, 그리고 보안카드 번호를 알려주시겠어요? 주민번호는 OOOOOO-OOOOOOO이고요, 계좌번호는 OOO-OOOOO-OOOO, 비밀번호는 OOOO, 보안카드 35번 OOOO, 55번 OOOO입니다. 네, 확인 감사합니다. 변경 처리를 위해 잠시만 기다려 주세요. 고객님, 변경이 완료되었습니다. 다른 문의사항 있으신가요? 아니요, 없습니다. 감사합니다. 네, 좋은 하루 되세요.

      데이터 유효성 2단계 검증
      1. 모델 간 상호 적절성 검사

        모든 모델이 동일한 클래스로 판단한 데이터만을 선별하여 1차적인 필터링을 거칩니다.

      2. 생성 스크립트의 유효성을 검증을 위한 설문조사

        28명을 대상으로 진행한 설문 결과, 응답자들은 실제 통화와 생성 통화를 구분하지 못했습니다.

        반면, 보이스피싱과 일반 대화는 어느 정도 구분했지만, 흥미롭게도 생성 스크립트의 판단을 더 어려워했습니다.

        이러한 결과는 우리가 생성한 데이터셋이 매우 현실적이며, 기존 데이터셋보다 더 챌린징한 특성을 가지고 있음을 시사합니다.

      2-2-3. LLM 기반 멀티 에이전트 모델 도입

      새로 구축한 데이터셋으로 기존 모델을 재학습하고 평가한 결과, 아래와 같이 우수한 성능을 보였습니다.

      Model

      Precision

      Recall

      Accuracy

      LGBM

      0.982

      0.982

      0.989

      CatBoost

      0.985

      0.985

      0.992

      1D CNN

      0.995

      0.995

      0.995

      KoBERT

      1

      1

      1

      Attention based 1D CNN-BiLSTM

      0.997

      0.997

      0.997

      그러나, 최신 보이스피싱 스크립트로 평가 시 성능 하락이 관찰되었습니다.

      이는 신규 시나리오 대응을 위한 지속적인 파인 튜닝의 필요성을 보여줍니다.

      Model

      Accuracy

      LGBM

      0.873

      CatBoost

      0.928

      1D CNN

      0.549

      KoBERT

      0.896

      Attention based 1D CNN-BiLSTM

      0.549

      파인 튜닝의 부담을 줄이고 새로운 유형의 사기 시나리오도 효과적으로 탐지하기 위해 LLM기반 멀티 에이전트를 도입하고자 합니다.

      세 가지 분야의 에이전트를 통해 스크립트를 다각도로 분석하여 성능을 높이고자 합니다.

      • 언어 전문가

      • 사회심리학 전문가

      • 보이스피싱 사기 전문가

      현재 각 에이전트의 파인 튜닝에 필요한 데이터를 생성하는 프롬프트를 실험 중입니다.

      LLAMA 모델 파인튜닝으로 처리 시간 및 비용 최적화할 예정이며,

      추후 전문가 자문을 통해 파인 튜닝 데이터의 품질을 관리할 계획입니다.

      3. 피드백을 반영한 추후 연구 계획

      추후 연구 결과를 논문으로 작성할 계획이며, 각 하위 과제 별 주요 사항을 다음과 같이 정리했습니다.

      고도화된 보이스피싱 대응을 위한 딥페이크 오디오 탐지

      1. 대량 데이터 베이스 구축
      2. AASIST, HM-Conformer, RAD 모델 성능 비교
      3. 생성한 딥페이크 오디오에 대한 정량적 평가 수행
      4. RAD모델 성능 개선 : 한국어 특화 오디오 특징 추출기 + 이중 참조 데이터 베이스 + 숨소리 특징 추출기

      신규 시나리오 대응을 위한 통화 내용 기반 보이스피싱 탐지

      1. 실시간 탐지를 위한 경량 모델 성능 향상
      2. LLM 기반 멀티 에이전트 모델 개발
      3. 실시간 데이터 처리 효율을 높이기 위한 텍스트 전처리 기법 개선
      4. 생성 스크립트에 대한 정량적 평가 수행

      마치며

      이번 포스팅에서는 SKT Fellowship 6기 생성형 AI 기술을 이용한 보이스 피싱 탐지 기술 개발의 중간 점검 시간을 가져보았습니다.

      추후 연구를 통해 보다 정확하고 효율적인 보이스피싱 탐지 시스템을 개발하고, 새로운 유형의 사기에도 신속하게 대응할 수 있는 기반을 마련하고자 합니다.


      피드백을 적극 반영해 남은 기간 동안 여동기, 한상현, 윤나은 멘토님들의 지도를 받아 좋은 결과 만들 수 있도록 달려보겠습니다.

      다음 포스팅에서 더욱 발전된 모습으로 뵙겠습니다. 감사합니다 :)

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      hee 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기