23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요 : )
SKT Fellowsup 6기 [생성형 AI 기술을 이용한 보이스 피싱 탐지 기술 개발] 과제를 진행하게 된 팀 피싱피싱(Phishing Fishing) 입니다.
첫 번째 포스트에서는 저희가 진행할 연구에 대해 소개하고자 합니다.
뉴스나 주위 사람들을 통해 '보이스피싱'에 대해 한 번쯤은 들어보셨을 텐데요,
보이스피싱이란, 피해자를 기망 또는 협박하여 개인정보 및 금융거래 정보를 요구하거나 피해자의 금전을 이체하도록 하는 수법을 말합니다.
보이스피싱은 현재 우리 사회에서 만연한 범죄 중 하나로 개인의 금전적 문제를 넘어 사회적 신뢰에도 큰 타격을 주어 다양한 문제를 야기하는데요,
일례로 수사기관을 사칭한 보이스피싱 범죄가 늘어나면서 실제 경찰을 보이스피싱범으로 오해하여 수사 과정이 복잡해지고, 수사가 지연되는 문제가 발생하고 있습니다.
최근 피해자에 대한 정보를 취득한 후 피해자의 상황에 맞춘 연령별 맞춤형 시나리오를 기반으로 한 보이스피싱 범죄가 늘면서,
정보의 접근성이 좋은 20대, 30대조차 보이스피싱에 피해를 보는 사례가 증가했습니다.
보이스피싱 수법이 점차 교묘해지는 탓에 보이스피싱을 알아차리는 것이 더욱 어려워지고 있습니다.
최근에는 사람들이 분간하기 어려울 정도로 자연스러운 음성/영상을 생성하는 기술이 발전하면서 이를 보이스피싱에 악용하는 사례가 발생하고 있습니다.
저희 팀은 보이스피싱 범죄 예방을 위해 두 가지 하위 과제로 나누어 프로젝트를 진행할 계획입니다.
텍스트를 음성으로 합성하는 TTS(Text-to-Speech), 원하는 목소리로 음성을 변조하는 VC(Voice Conversion) 와 같은 합성 음성 생성 기술이 보이스피싱에 악용될 경우를 대비하여
합성 음성 탐지 모델 개발을 목표로 합니다.
통화 내용을 분석하여 보이스피싱이라고 판단하기 모호한 상황 에서도 높은 탐지 성능을 보이는 보이스피싱 판별 모델 개발을 목표로 합니다.
최근 생성형 AI의 발전으로 실제 사람 목소리와 거의 구분이 되지 않는 합성 음성을 생성할 수 있게 되었습니다.
심지어 3초짜리 음성 샘플만으로 해당 목소리를 그대로 재현하는 AI 기술이 공개되었습니다.
소리만으로 실제 발화 음성과 합성 음성을 구분하는 것이 점점 더 어려워지고 있습니다.
저희 팀은 이러한 도전에 대응하기 위해 효과적인 합성 음성 탐지를 위한 세부 목표를 3가지 설정하였습니다.
현재까지 선행된 합성 음성 탐지 연구[2-5]의 대부분이 '영어'를 중심으로 진행되어 왔습니다.
저희 팀은 한국어 특화 모델을 개발하기 위해 한국어 합성 음성 데이터셋 구축을 우선적인 과제로 삼았습니다.
최대한 다양한 합성 모델을 활용해 서로 다른 특징을 가진 합성 음성 오디오를 생성하고, 데이터셋을 구축할 계획입니다.
최신의 다양한 음성 합성 모델을 활용하기 위해서 영어 데이터로 학습한 음성 합성 모델의 사용이 불가피하며, 영어로 학습된 모델 사용 시 발생하는 어눌한 발음 문제를 완화하기 위해
한국어 데이터로 추가적인 학습을 진행할 것입니다.
VC | TTS |
|---|---|
StarGAN-Voic e-Conversion(2018) | Coqyi tts(2021) |
AUTOVC(2019) | YourTTS(2021) |
FreeVC(2022) | coqui_tts_korea |
Korean-Voice-Conversion(2017) | gTTS (google) |
Voice Conversion with Non-Parallel Data(2018) | speechtify |
speechtify | narakeet |
CLOVA | |
Amazon Tr |
위의 표는 현재까지 조사한 음성 합성 모델 및 서비스입니다. 추후 변경될 수 있으나, VC와 TTS 각각 5~8개의 모델을 사용해 약 300,000개의 데이터를 생성하는 것이 목표입니다.
AASIST, MH-CONFORMER, RAD 총 3가지 모델의 성능 비교를 통해 최적의 모델을 선정하고자 합니다.
기존 RawGAT-ST 모델을 발전시킨 모델로,
주파수 축과 시간 축의 정보를 효과적으로 결합하고 다양한 관점에서 그래프를 분석하여 보이스피싱 탐지 성능을 개선하였습니다.[3]
음성 인식(Seq-to-Seq )에서 뛰어난 성능을 보인 Conformer를 음성 스푸핑 탐지와 같은 분류 작업에 적용하기 위해
[Hierarchical pooling method] 입력 시퀀스의 길이를 점진적으로 줄여 중복 정보를 제거하여 다양한 시간 스케일에서의 특징을 추출하였으며,
[Multi-level classification token aggregation method] 각 Conformer 블록마다 분류기를 학습하여 다른 부분에서 중요한 특징을 추출하고, 추출된 특징을 모두 결합하여 최종적으로 분류 작업에 활용해 성능을 개선했습니다.[4]
기존 합성 음성 탐지기는 훈련 데이터에 포함되지 않은 새로운 생성기로 합성된 음성 오디오에 대해 탐지 성능이 저하되는 문제가 있었습니다.
이를 해결하기 위해 외부 데이터 참조하는 RAG 구조를 딥페이크 오디오 탐지에 활용하여 새로운 유형의 합성 음성 데이터에 대해서도 효과적으로 탐지할 수 있도록 개선하였습니다.[5]
RAD는 참조 데이터 베이스를 일반 발화 음성 만으로 구성하였습니다.
합성 음성 데이터셋과 일반 발화 음성 데이터셋 두 가지를 모두 구축해 입력 오디오와의 유사 샘플 참조 시 합성 음성 오디오와 일반 발화 오디오를 양방향으로 비교하고자 합니다.
이는 앙상블과 같은 효과를 만들어 판별의 신뢰도 및 성능을 높일 것이라 기대합니다.
RAD [5] | 양방향 참조 RAD |
|---|---|
다음은 대화 내용을 바탕으로 보이스피싱을 탐지하는 모델 개발에 대한 내용입니다.
총 3가지의 세부 목표를 설정했습니다.
기존 보이스피싱 탐지 모델 연구에서 주로 활용되고 있는 KorCCVi 데이터셋의 보이스피싱 대화(Phishing)와 일반 대화(Non-Phishing)를 살펴본 결과,
사용되는 어휘 및 어조 등에서 현저한 차이가 있음을 확인했습니다.
그.러.나. 현실에서는 일상 대화와 보이스피싱 사이의 경계가 모호할 수 있습니다. 가족 간 금융 거래에 대한 대화를 할 수 있으며, 금융 상담 전화와 같은 상황도 발생할 수 있습니다.
현실에서 발생할 수 있는 다양한 상황을 반영한 데이터셋을 구축하여 실제 활용 가능한 신뢰도를 가진 보이스피싱 탐지 모델을 개발하고자 합니다.
또한, KorCCVi 데이터셋은 일반 대화(Non-Phishing) 데이터가 2,841개(약 80%), 보이스피싱(Phishing) 데이터가 731개(약 20%)로 매우 불균형한 분포를 보입니다. 데이터 불균형을 해결하기 위해 LLM을 활용하여 보이스피싱 데이터를 증강할 계획입니다.
아래는 참고를 위해 KorCCVi[6, 7] 데이터셋 중 일부 샘플을 가져온 것입니다.
Phishing | Non-Phishing |
|---|---|
일 금융권에서 대출이 안 되시는 분들이 그 상 상담사 통해서 지금 뭐 신규 대출 기존 대출 상환하신 다음에 상환 능력 높혀서 이렇게 대출 받아 보신 사례가 있어서 그럼니다. 아, 그래요. 그랬으면 좋겠어요. 왜냐면 지금 요청하신 공문이 이런 사랑 유사에서 (. . . 생략 . . . ) 네 기업 은행 이시고 지금 십오 분 열람 됐으니까 납부해 주시고 연락 주시고 한 번에 이걸 이천 칠백만원 납부해 주셔야 됩니다. 예 알겠습니다. 네 감사합니다. 네. | 저는 여행 다니는 것을 굉장히 좋아하는데요. 그래가지고 스페인이나 뭐 영국 유럽 아니면 국내에서도 뭐 강릉이나 전주 같은 데를 많이 다녔는데 혹시 여행 다니는 거 좋아하시나요? 저 여행 다니는 거 되게 좋아해서 대학교 내내 여행을 엄청 많이 다녔었는데요. 제가 고등학교 때는 여행에 대한 흥미가 없었는데 그게 좀 아버지가 짠대로 패키지처럼 여행을 다녀서 그런 것 같아요. 그래서 대학교 간 이후로는 해외여행을 되게 많이 갔었는데 그중에서 제일 기 좋았던 거는 스페인이랑 포르투갈이었거든요. |
저희가 좀 김영국을 중심으로 명의도용이 불법 거래 자기 다른 공부 하는 과정에서 대장이 신용카드와 대포통장 신분증 보안 카드가 납부했습니다. 증거품 대로 확인 하는 과정에서 명의로 되어 있는 능력과 국민은행 통장 약수가 되었고요. 배당금 인권에 대해 좀 해 본 결과 본인 명의로 개설되는 통장까지 확인하였습니다. 예약 본인명의 대포통장이 범죄현장에 사용됨에 따라 많은 피해자들이 발생되었습니다. 피해자들은 11분 고소 고발 신청 안 하면 되고요. 절차를 밟아 주식 고수 갈 거니 제한조치를 키워줄 수 있습니다. 내용이 하셨어요. 예 아 예 일단 본인께서 지금 김해항공 입장 제거에 문자내역이 나 전화 내역이 저녁 발견되지 않았기에 일 진행이 됩니다네. 지금 절차를 통해 분인가 김영국 1장 2절의 무관하다. 증거를 녹취자료 남기시는 겁니다네 저희가 좀 빨리 증거 자료로 하는게 것이고요. 녹취조사 좀 주변에 소음이 심하게 들리거나 제 3자에 목소리가 본인의 음성보다 크게 들리게 된다면 공포의 법적인 증거자료로 제출될 수 없습니다. 말씀드리면서 욕실 공사 시작하겠습니다. 장소가 어디세요?. | 자신이 생각하는 성격은 어때요? 자신의 성격 한 단어로 표현하자면 소심함. 소심함이라고 표현할 수 있을 거 같아요. 예전에 초등학교 때부터 아니 태어났을 때부터 항상 제가 뚱뚱했어가지고 그~ 뚱뚱함 때문에 자기에 대한 자기에 대한 자신감이라고 해야 되나 부끄러움도 많고 나는 뚱뚱해서 뭐가 안 될 거 같아. 아 안 된다고 생각해 아니면 다른 사람이 나를 이상하게 생각할 거 같아 라는 생각을 엄청 하다 보니까 매사에 소극적이게 되고 소심하게 되고 그게 쭉 이어져서 성인 될 때까지는 그런 소심한 성격으로 계속 살아 왔었던 거 같아요. 성격을 한마디로 표현하자면 어떻게 표현하실 수 있을까요 아니면 자신의 성격에 대해서 설명 해 주실 수 있나요? |
앞서 구축한 데이터셋을 바탕으로 다양한 모델[6, 7]들을 비교 실험하여 최적의 모델을 선정하고자 합니다.
저희 팀은 네트워크 연결 없이도 실시간으로 보이스피싱을 탐지할 수 있도록 On-Device에서 활용 가능한 모델 개발을 목표로 합니다.
따라서, 처리 속도 및 모델 크기, 탐지 성능 등을 종합적으로 평가하여 최적의 모델을 결정할 계획입니다.
기존 ML/DL 성능 평가 결과[6] | 기존 DL 성능 평가 결과[7] |
|---|---|
On-Device에서 활용할 탐지 모델의 판별 결과 신뢰도가 낮은 경우,
LLM 기반 다중 에이전트 협업 기법[8]을 도입하여 판별 결과의 신뢰도를 향상하고 성능을 개선하고자 합니다.
LLM의 강력한 언어 이해 능력을 활용하기 위해 3가지 역할(언어 전문가, 보이스피싱 수사관, 감정 전문가)을 부여해 다각도에서 대화 내용을 분석하고,
분석 결과를 보이스피싱 탐지에 활용할 계획입니다.
이번 포스팅에서는 SKT Fellowship 6기 생성형 AI 기술을 이용한 보이스 피싱 탐지 기술 개발 을 위한 연구 계획을 소개했습니다.
본 연구 과제는 생성형 AI로 합성한 음성 탐지 기술 개발과 대화 내용 분석을 통한 보이스피싱 탐지 기술 개발을 목표로 하며, 각 기술 개발의 세부 목표는 아래와 같습니다.
[생성형 AI로 합성한 음성 탐지 기술 개발 세부 목표]
한국어 합성 음성 데이터셋 구축
기존 탐지 모델 성능 평가를 통한 최적 모델 선정
RAD 성능 최적화
[대화 내용 분석을 통한 보이스피싱 탐지 기술 개발 세부 목표]
Challenging Dataset 구축
기존 보이스피싱 탐지 모델 성능 평가를 통한 최적 모델 선정
LLM 기반 Multi-Agent를 활용한 보이스피싱 탐지 모델 개발
앞으로 최현상, 한상현, 윤나은, 여동기 멘토님들의 지도를 받아 좋은 결과 만들 수 있도록 달려보겠습니다.
다음 포스팅에서 뵙겠습니다 : )
[1] 금융감독원. (2024, 3월 7일). 작년 보이스피싱 피해자 1인당 1,700만원 피해, 전년比 1.5배↑- 2023년 보이스피싱 피해현황 분석 -[보도자료]. google에서 검색됨 https://zrr.kr/8AEG.
[2] Yi, J., Wang, C., Tao, J., Zhang, X., Zhang, C. Y., & Zhao, Y. (2023). Audio deepfake detection: A survey. arXiv preprint arXiv:2308.14970.
[3] Jung, Jee-weon, et al. "Aasist: Audio anti-spoofing using integrated spectro-temporal graph attention networks." ICASSP 2022-2022 IEEE international conference on acoustics, speech and signal processing (ICASSP). IEEE, 2022.
[4] Shin, Hyun-seo, et al. "HM-Conformer: A Conformer-based audio deepfake detection system with hierarchical pooling and multi-level classification token aggregation methods." ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2024.
[5] Kang, Z., He, Y., Zhao, B., Qu, X., Peng, J., Xiao, J., & Wang, J. (2024). Retrieval-Augmented Audio Deepfake Detection. arXiv preprint arXiv:2404.13892.
[6] Moussavou Boussougou, Milandu Keith, and Dong-Joo Park. "Attention-Based 1D CNN-BiLSTM Hybrid Model Enhanced with FastText Word Embedding for Korean Voice Phishing Detection." Mathematics 11.14 (2023): 3217.
[7] 밀란두, and 박동주. "Exploiting Korean Language Model to Improve Korean Voice Phishing Detection." 정보처리학회논문지. 소프트웨어 및 데이터 공학 11.10 (2022): 437-446.
[8] Lan, Xiaochong, et al. "Stance detection with collaborative role-infused llm-based agents." arXiv preprint arXiv:2310.10467 (2023).
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.