데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      개인화 보이스 생성 기술 소개

      ilhwan.kim 24.09.06
      1,828 4 0
      DEVOTEE 요약
      AI 기술 발전으로 개인화 음성 합성 기술이 눈에 띄게 향상되었습니다. SKT의 기술은 소량의 샘플 음성으로 맞춤형 음성을 생성하며, Instant, Custom, Professional의 세 가지 방식으로 구분됩니다. 이 기술은 개인화된 가상 비서나 맞춤형 교육 도구 등 다양한 애플리케이션에서 활용될 수 있습니다.
      DEVOTEE 추천 블로그

      머릿말

      AI 연구가 급속히 발전함에 따라, 개인화 기술이 실생활에 점점 더 깊숙이 스며들고 있습니다.

      그 중에서도 음성 합성 기술은 이제 단순히 기계적이고 로봇 같은 음성을 생성하는 것을 넘어서, 개개인의 목소리를 그대로 재현해 내는 수준에 이르렀습니다.

      이러한 혁신의 중심에 서 있는 것이 바로 개인화 보이스 생성 기술입니다.

      Voice Cloning 기반 음성합성 기술을 통해, 소량의 샘플 음성만으로도 사용자 고유의 목소리를 매우 유사하게 복제할 수 있습니다.

      이번 글에서는 SKT의 개인화 보이스 생성 기술의 상세 작동 원리와 응용 가능성에 대해 살펴보겠습니다.


      기술 개요

      개인화 보이스 생성 기술은 최근 음성 합성 분야에서 가장 혁신적이고 주목받는 기술 중 하나입니다.

      이 기술의 핵심 목표는 사용자의 음성 특징을 반영한 맞춤형 음성을 생성하는 것으로, 사용자의 고유한 억양, 음색, 발음 스타일 등을 복제하여 자연스러운 대화를 가능하게 합니다.

      기존의 개인화 음성 합성 기술은 대체로 대규모 데이터셋과 꽤 긴 학습 시간을 필요로 했고, 비교적 적은양의 데이터셋을 사용하면 품질이 뛰어난 개인화 음성을 얻기가 어려웠습니다.

      그러나 최근 SSL(Semi-Supervised Learning) 및 AudioLM(Audio Language Model)과 같은 최신 AI모델 및 기술들을 활용하여,

      소량의 데이터로도 높은 품질의 개인화 음성을 생성할 수 있는 Voice Cloning 학습 기술들이 등장했습니다.

      이러한 개인화 보이스 생성 기술은 수 초에서 수 십초 분량의 음성 샘플만으로도 사용자의 음성 패턴을 학습하고, 이를 바탕으로 상당히 자연스럽고 유사한 음성을 생성할 수 있습니다.


      SKT의 개인화 보이스 생성 기술은 타겟 음성의 데이터셋 규모 및 학습 방식에 따라 Instant, Custom, Professional 의 3가지 Voice Cloning 기술로 구분할 수 있습니다.

      해당 기술들의 상세내용은 다음 챕터에서 기술합니다.

      이 기술은 특히 개인화된 사용자 경험을 제공하는 데 큰 장점을 가지고 있습니다.

      예를 들어, 개인화된 가상 비서, 맞춤형 교육 도구, 캐릭터의 음성 등 다양한 응용 분야에서 사용자에게 더욱 친밀한 인터페이스를 제공할 수 있습니다.

      또한, 기존의 음성 합성 기술이 가지고 있던 한계,

      예를 들어 스튜디오에서 대량으로 녹음한 학습 데이터가 필요하던 단점을 극복하여, 소량의 음성으로 타겟 화자와 유사한 음성을 생성할 수 있습니다.

      이와 같은 개인화 보이스 생성 기술은 앞으로 더 많은 분야에서 활용될 것이며, 사용자에게 더욱 풍부하고 개인화된 경험을 제공할 것입니다.


      개인화 보이스 생성 기술 상세내용

      SKT의 개인화 보이스 생성 기술은 타겟 음성의 데이터셋 규모 및 학습 방식에 따라 크게 3가지 기술로 구분할 수 있습니다.

      • Instant Voice Cloning

      • Custom Voice Cloning

      • Professional Voice Modeling

      개인화 보이스의 품질은 타겟 음성의 양과 모델 학습 시간에 비례합니다.

      따라서 합성음이 사용될 목적이나 서비스 종류에 따라 적절한 기술을 선택하는 것이 중요합니다.

      아래는 해당 기술들의 상세내용을 기술합니다.

      개인화 보이스 생성 기술

      필요한 타겟 음성 규모

      모델 재훈련 필요

      GPU 훈련 필요

      Instant Voice Cloning

      5~60초

      X

      X

      Custom Voice Cloning

      1분 ~ 10분

      X

      X

      Professional Voice Modeling

      10분 ~ 30분

      O

      O

      <표 1. SKT의 개인화 보이스 생성 기술>


      1. Instant Voice Cloning

      Instant Voice Cloning 기술은 약 5~60초의 짧은 음성 샘플을 사용하여 실시간으로 개인화된 음성을 생성합니다.

      2가지 세부 모델이 있으며, 첫번째 모델인 Voice Model은 타겟 음성과 텍스트를 입력받아,

      타겟 음성에서 스타일을 추출한 후(Style Extraction), 입력된 텍스트를 기반으로 타겟 음성의 스타일이 반영된 speech token을 생성하는  단계입니다.

      T2S (Text to Speech tokens)라고도 부르며, 이 speech token은 pretrained SSL모델의 피처로써, 음성에서 의미와 운율 정보를 추출한 token을 말합니다.

      Style Extraction 모듈은 pretrained SSL모델의 latent값이 피쳐로 사용하여 타겟 음성의 음향정보 보다는 타겟 화자 고유의  운율, 발성 스타일을 추출합니다. 

      T2S 훈련에는 음성 데이터와 해당 음성에 상응하는 텍스트 전사 정보가 반드시 쌍으로 필요합니다.


      SKT의 T2S 기술은 Non-AR(auto-regressive) 모델과 AR(auto-regressive) 모델의 2가지 기술을 보유하고 있습니다.

      Non-AR 모델의 경우, 병렬 연산이 가능하여 빠른 실시간 합성음 생성이 가능하고 안정적인 운율을 가진 합성음 생성이 가능합니다.

      AR 모델의 경우 순차적 연산으로  Non-AR 대비 생성이 느린 스트리밍 출력의 특성을 갖지만, 보다 다양한 운율 변화를 가지는 자연스러운 합성음 생성이 가능합니다.

      두번째 모델인 Vocoder는, 타겟 음성에서 음색을 추출하고(Timbre Extraction), 이전 단계에서 생성한 speech token을 활용하여 개인화 음성을 생성하는 단계입니다.

      Timbre Extraction 모듈은 음향정보가 많이 포함된 멜 스펙트로그램을 피쳐로 사용하여 타겟 화자의 음색을 추출하여 최종 합성음에 반영 되도록 합니다.

      Vocoder 훈련에는 텍스트 전사 정보는 필요하지 않고 음성 데이터만 필요로 하기 때무에 T2S 훈련 대비 좀 더 대용량의 훈련 데이터를 사용할 수 있습니다.


      SKT의 Vocoder 모델은 flow와 GAN기반 보코더가 결합된 구조를 사용하고 있습니다.

      일반적인 Instant Voice Cloning 기술은 소량의 음성을 사용해 비훈련 방식으로 실시간 개인화 음성을 생성할 수 있다는 장점이 있지만,

      다른 개인화 보이스 생성 기술에 비해 합성 음성이 다소 불안정할 수 있습니다.

      이로 인해 주로 Fun한 호기심용이나 데모용으로 주로 사용되고 있습니다.

      그러나 SKT의 Instant Voice Cloning 기술은 약 25,000명 이상의 화자를 사용한 대용량 모델을 기반으로 하며,

      클린한 음성 뿐 아니라, 노이즈가 포함된 훈련 방식을 통해 새로운 화자 및 녹음 환경에 대한 강건성을 높여 안정적인 cloning 성능을 제공할 수 있도록 실제 상용화 가능한 기술을 개발하고 있습니다.


      <그림 1. Instant Voice Cloning 합성 블록도>

      Instant Voice Cloning 샘플

      타겟 화자

      타겟 화자 음성

      개인화 보이스 합성음

      화자1 (약 5초 데이터)

      [Click]

      [Click]

      화자2 (약 5초 데이터)

      [Click]

      [Click]

      화자3 (약 5초 데이터)

      [Click]

      [Click]

      Noisy 1 (약 5초 데이터)

      [Click]

      [Click]

      Noisy 2 (약 5초 데이터)

      [Click]

      [Click]


      2. Custom Voice Cloning

      Custom Voice Cloning 기술은 1분~10분 가량의 타겟 화자 음성 신호가 있을 때, 타겟 화자 피쳐 추출 후, 실시간으로 개안회 보이스를 생성하는 기술입니다.

      이 기술에서는 타겟 화자의 특징이 반영된 화자 피쳐를 추출하는게 중요한 기술입니다.

      타겟 화자 피쳐는 Speaker Encoder를 통해 화자 음성의 멜 스펙트로그램들의 통계적 특성을 코드북으로 생성합니다.

      타겟 화자의 피쳐를 추출하는 훈련과정이 필요하며, 한번 추출 한 후에는 동일한 화자에 대해서 재 추출이 필요하지 않습니다.

      음성 합성 과정에서는 입력된 임의의 텍스트와 타겟 화자피쳐를 이용하여 Text Encoder에서 텍스트 피쳐를 생성하고,

      Duration Predictor, Flow, Decoder 단계를 거쳐 최종적으로 입력된 텍스트에 대한 타겟화자 목소리의 합성음을 생성합니다.

      Custom Voice Cloning 기술은 앞서 설명한 Instant Voice Cloning 기술과 비교하여 타겟 화자의 피쳐를 추출하는 훈련 시간이 의무적으로 필요하지만,

      상대적으로 입력되는 임의의 텍스트에 대해서 보다 안정적인 합성음 제공합니다.


      현재 SKT의 Custom Voice Cloning 기술은 1분~10분 이내의 타겟화자 음성신호가 있다면, 1분 이내에 타겟 화자의 피쳐를 추출하는 Speaker Encoder를 개발하였고,

      이 내용에 관해서는 최근 세계적인 AI컨퍼런스인 ICLR(The International Conference on Learning Representations) 2024에

      "ELF: Encoding Speaker-Specific Latent Speech Feature for Speech Synthesis"라는 제목의 논문으로 개제되었습니다. [ELF Demo Link]


      <그림 2. Custom Voice Cloning 합성 블록도>

      Custom Voice Cloning 샘플

      타겟 화자

      타겟 화자 음성

      개인화 보이스 합성음

      화자 1 (약 3분 데이터)

      예시) [Click]

      [Click : sample 1]

      -

      [Click : sample 2]

      화자 1 (약 3분 데이터)

      예시) [Click]

      [Click : sample 1]

      -

      [Click : sample 2]


      3. Professional Voice Modeling

      Professional Voice Cloning Modeling 기술은 GPU훈련을 사용하여, 10분에서 30분의 타겟 음성 데이터를 통해 개인화된 음성을 생성하는 기술입니다.

      이 기술은 단순한 Voice Cloning을 넘어, 신규 음성 모델링과 거의 동등한 수준의 음성 합성을 목표로 합니다.

      물론 별도의 GPU 훈련 시간과 리소스가 소모되어 비용 및 임프라 부담이 발생하며, 실시간 Voice Cloning 적용은 어렵다는 단점이 있지만,

      음성의 미세한 억양, 발음, 음색까지 정확하게 복제하며, 결과적으로 가장 높은 유사성과 품질을 자랑하는 개인화 음성을 생성할 수 있습니다.

      Professional Voice Modeling은 10문장 정도의 짧은 음성 샘플로도 구현이 가능하지만, 권장되는 1~2시간 분량의 음성을 통해 더욱 정교하고 고품질의 음성 모델을 구축할 수 있고,

      이를 통해 타겟 음성의 고유한 음색과 발화 스타일을 재현합니다.


      SKT의 Professional Voice Modeling 기술은 대용량의 훈련 데이터를 바탕으로 unseen 환경과 음향적 변동에도 높은 강건성을 유지하여, 매우 자연스럽고 일관된 음성 합성을 제공합니다.

      정교한 음성 표현이 요구되는 다양한 애플리케이션에서 최적의 성능을 발휘하고 있고,

      예시로, 'SK텔레콤 오픈 2024' 골프 대회의 'AI 최경주 원포인트 레슨' 시스템에서 AI 최경주 음성을 생성하기 위해 SKT의 Professional Voice Modeling 기술이 적용되었습니다.

      Professional Voice Modeling 샘플

      타겟 화자

      타겟 화자 음성

      개인화 보이스 합성음

      SKT CEO

      (약 30~60분 데이터)

      예시) [Click]

      [Click : sample 1]

      -

      [Click : sample 2]

      -

      [Click : sample 3]

      최경주

      (약 30~60분 데이터)

      예시) [Click]

      [Click : sample 1]

      -

      [Click : sample 2]

      -

      [Click : sample 3]


      맺음말


      개인화 보이스 생성 기술은 적은 양의 데이터로도 사용자 고유의 목소리를 생성할 수 있다는 점에서, 다양한 응용 분야에 적합한 솔루션을 제공합니다.

      특히 SKT의 Instant, Custom, Professional Voice Cloning 기술은 각각의 사용 목적과 요구에 맞춰 최적의 솔루션을 제공하며,

      향후 더 많은 분야에서 개인화된 음성을 활용할 수 있는 기회를 만들것 입니다.

      앞으로도 기술의 세부적인 성능을 개선하고, 다양한 환경에서 적용할 수 있도록 연구를 계속할 계획입니다.

      개인화 보이스 생성 기술이 점점 더 많은 분야에서 활용될 것이며, 이를 통해 사용자에게 더 새로운 경험을 제공할 수 있기를 기대합니다.


      저자

      김일환 (i.h.kim@sk.com)

      박지훈 (batho2n@sk.com)

      김정민 (jmkim94@sk.com)

      이준모 (ljun4121@sk.com)

      김상진 (kimsangjin@sk.com)

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      ilhwan.kim 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기