데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      페르소나 생성을 위한 Voice Cloning API 테스트 후기

      ji1003 24.04.16
      4,878 9 0
      DEVOTEE 요약
      시니어 케어를 위한 AI 대화 기능을 구현하며, 사용자 맞춤형 음성을 생성하는 Voice Cloning 기술 테스트를 경험했습니다. 두 가지 서비스를 테스트한 결과, Eleven labs에서 보다 나은 결과를 얻었지만, 완벽하진 않았습니다. 이러한 기술은 사랑하는 사람의 목소리를 AI 말벗 서비스에 통합할 수 있는 잠재력을 가지고 있으나, 정확도와 윤리적 문제는 여전히 과제로 남아있습니다.

      안녕하세요. 😀

      저는 SK플래닛에서 서비스 기획 업무를 맡고 있습니다.


      올해 초 시니어 케어를 위한 서비스 기획을 진행하였는데요.

      돌봄이 필요한 시니어 타겟에 특화된 AI 대화 기능을 고려하게 되었습니다.


      AI 말벗은 GPT 기반으로 구현하였는데요.

      시니어 서비스인만큼 텍스트 입력 뿐 아니라 음성 대화 제공이 필요했습니다.

      여러 기업의 TTS API가 있지만, 아무래도 활용할 수 있는 목소리 종류는 제한이 있고, 개인마다 선호도도 차이가 있었습니다.


      그래서 사용자가 원하는 목소리를 일부를 녹음하여 업로드 하면, 내 말벗의 페르소나에 그 목소리를 입힐 수 있는 시나리오를 생각하게 되었는데요.

      나의 손자나 자녀 등 원하는 대상의 목소리를 입히면, 말벗과 대화를 하는 즐거움이 더 커질 수 있지 않을까요?

      이번 서비스에 당장 적용하지는 않더라도, Voice Cloning API가 제공되고 있는 두 서비스를 찾아 테스트해 보았습니다.


      1. stablediffusionapi.com

      stable diffusion으로 구글링하다 들어가 보게된 사이트인데요.

      Stability AI와는 관련이 없어 보이고, 이미지 생성, Voice cloning 등 여러 생성형 AI 모델을 API로 제공하는 곳인 것 같습니다.

      사이트의 구성이나 내용이 신뢰도가 가지는 않았는데요. 잭스팰로우, 톰행클스 같은 유명인을 Voice Cloning 샘플로 제공하고 있어, 속는 셈(?) 치고 테스트해보기로 하였습니다.

      1) 사이트 내에 일치하지 않는 정보들 😅

      Standard 요금제가 모든 API를 사용할 수 있다고 되어 있는데요.

      Voice Cloning의 Product 소개 화면에 들어가 보면, Voice Cloning 서비스는 별도의 요금제 페이지가 연결됩니다. 😥




      그리고 메인 화면의 서비스 소개에는 120개 언어가 지원이 가능하다고 되어 있는데요.


      API 문서를 확인해 보니 현재는 ‘영어’만 가능하다고 되어 있습니다.


      한국어는 지원되지 않는 건가 했는데, Playground의 언어 Option에서는 한국어를 포함한 여러 언어가 포함되어 있었습니다.



      서비스가 개편, 업그레이드 되는 내용이 사이트에 정확히 반영되지 않고 있는 듯 해보였습니다.

      기본 정보에 대한 관리가 잘 되지 않는 듯한 모습은 서비스에 대한 신뢰도를 떨어뜨리게 만드네요.


      2) 당혹스러운 Voice Cloning Test 결과 😑

      유명인 중 목소리의 Identity가 확실한 분으로 테스트해 보려고 했는데요.

      대한민국 대표 꿀보이스로 유명한 성발라 ‘성시경’ 님의 목소리로 시도하였습니다.


      유튜브에 있는 “잘자요” 짤인데요. 주변 소음이 있는 영상이었지만 이때는 더 괜찮은 걸 찾지 못해서, 일단 이 영상의 음원으로 테스트해 봅니다.

      음원 소스로 활용한 유튜브 영상> https://youtube.com/shorts/dgk0pQxlVuk?si=esk00SAhTB4KulZc


      아래 파일은 Playground에서 테스트한 결과인데요.

      https://cdn2.stablediffusionapi.com/generations/67c54a0e-92e5-4f59-bb85-2fdfb7af21ce.wav

      쉰목소리의 할아버지 성시경 님인가요. 전혀 비슷한 느낌이 없습니다.


      그의 시그니쳐 문장인 “잘자요~”로 문장을 바꿔 봤지만, 결과는 더 참담하네요. 😟

      https://pub-3626123a908346a7a8be8d9295f44e26.r2.dev/generations/38727194-7e4c-494c-a454-520ef7e61eed.wav


      혹시 한국인 음성이 학습이 잘 안되나 싶어, 사이트에서 제공 중인 ‘톰행클스’ 목소리를 선택해 봤는데요.

      https://pub-3626123a908346a7a8be8d9295f44e26.r2.dev/generations/36df9c30-6aa3-41c2-a742-755030e7a862.wav

      역시나 목소리의 주인이 떠오르지 않는 아쉬운 결과였습니다.


      속았다.😤


      2. Eleven labs (https://elevenlabs.io/)

      다음은 Eleven labs에서 테스트를 해보았습니다.

      폴란드 출신의 개발자와 컨설턴트가 2022년에 공동 창업한 음성AI 전문 기업인데요.

      최근 8000만 달러의 시리즈B 펀딩를 받기도 했습니다. 국내에도 많이 알려져, 활용하시는 분들이 꽤 계신 것 같았습니다.


      Creator 요금이 첫 달 50% 할인 중이라, 11달러로 사용해 볼 수 있었는데요.


      일단 사이트와 Playground의 UX가 보기에도 사용하기에도 편했습니다.

      VoiceLab에 목소리 녹음 파일을 올려서 보이스를 생성한 후, Speech Synthesis에서 원하는 text를 적용해 보면 됩니다.



      테스트 결과

      일단은 이 전 사이트에서 사용했던 같은 유튜브 음원으로 테스트를 해보았는데요.

      배경 소음이 꽤 있는 파일이었는데도, 생각보다 나쁘지 않은 결과를 확인할 수 있었습니다.

      Voice Cloning 결과 > https://youtu.be/N9Eix0Lti6g


      한국어 발화가 어색하지 않고, 보이스 톤도 깨끗한데요. 하지만 성시경 님 목소리 톤과는 차이가 있긴 합니다.


      그래서, 성시경 님이 예전 라디오 DJ 시절 독백한 유튜브를 찾아 mp3로 짧게 추출한 후 voice를 적용해 보았습니다.

      끝음 처리 등이 다소 어색한 면은 있지만, Voice tone은 성시경님과 매우 유사하게 구현되네요.

      Voice 생성 시 원본 파일을 여러 개 올릴 수 있어서, 동일한 인물의 다양한 형태의 발화를 올리면 더 완성도 있는 결과가 나올 수 있을 것 같습니다.

      Speech에서 제공되는 Voice setting (Stability, Clarity 등)값으로도 어느 정도 조정이 가능합니다.


      정리

      위의 테스트는 1월 말 정도에 진행을 했었는데요.

      지난 3월 29일, Open AI에서도 15초 녹음 파일로 음성을 복제할 수 있는 Voice Engine 개발 결과를 공개했지요.

      하지만 딥페이크는 중대한 이슈인 것을 인지하고, 공식적인 서비스 오픈은 하지 않고 있습니다.


      실제로, 바이든의 목소리를 딥페이크하여 정치적인 선동인 일으킨 콘텐츠가 일레븐랩스를 통해 만들어진 사실이 밝혀지면서, 해당 사용자의 계정을 정지시킨 사건이 있었습니다.

      *관련 기사> https://www.aitimes.com/news/articleView.html?idxno=156814


      비용, 윤리적 문제 등을 차치한다면, Front 앱에서 사용자가 원하는 목소리를 짧게 녹음하여 올리고, 그 목소리로 대화를 해주는 말벗 서비스 구현은 어렵지 않아 보입니다.


      특히, 공개 서비스가 아닌 개인용이라면, 나에게 특별한 누군가를 페르소나화하여 대화할 수 있는 서비스를 쉽게 만들어 사용할 수가 있겠네요.

      한 GPT 커뮤니티에서, 자신의 어머니와 나눴던 모든 카톡 대화와 어머니의 특징을 넣어서, 어머니 페르소나 챗봇을 만든 글을 본적이 있는데요.

      여기에 완성도 있는 Voice cloning 모델까지 적용한다면, 나의 진짜 어머니와 대화하는 음성 챗봇을 일반인도 쉽게 만들 수 있겠어요.


      어쩔 수 없는 이별의 순간을 겪는 게 인간의 숙명이었는데, AI가 어느 정도는 해결책이 되어줄 것 같습니다.

      현실 인물과 가상 인물의 경계가 사라지는 묘한 느낌이 드네요. 😮

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      ji1003 님의 최신 블로그

      더보기
      동영상 기고하기