데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      OpenAI 의 음성인식 Whisper #1

      fromDK 23.03.02
      20,468 42 11

      ChatGPT로 떠들석한 가운데 작년 9월에 음성인식(ASR: Automatic Speech Recognition) 모델인 Whisper를 공개 했습니다.

      https://openai.com/blog/whisper/

      https://github.com/openai/whisper


      학습데이터를 무려 680,000시간을 사용하여 학습한 모델을 공개하였습니다.

      사용된 데이터의 양을 보면 아래 그림과 같이 다양한 언어를 학습을 시켰는데요. 그중에 특히 한국어가 약 8,000시간, 영어 제외 언어로는 7번째 많은 양의 데이터를 학습을 시켰습니다.

      아마 A.I.Hub(https://aihub.or.kr)의 데이터를 사용하지 않았을까 추측되는데요.

      기존의 오픈 된 ASR 모델들은 영어 또는 영어권 위주의 데이터로 학습이 되어 있어서 국내에서 사용하기엔 다시 한국어로 모델을 학습해서 사용했었어야 하는데요.

      그런데 친절히도 OpenAI의 Whisper는 한국어 데이터셋을 사용하여 학습하여 한국어의 인식에도 뛰어난 성능을 보여줍니다.

      image.png


      Whisper 논문의 저자를 보니, 익숙한 한국인의 이름이 있는데요.

      공동 저자이신 김종욱님께서 Whisper개발에 기여를 해주셔서 한국어 데이터가 학습에 이용된 것 같습니다.

      김종욱님 감사합니다!!

      image.png



      Network

      image.png


      네트워크 모델자체는 Transformer를 사용해서 특별히 큰 차이점은 없어보이는데요.

      아래 그림과 같이 Multitasking Training으로 Transcription 과 Translation Task가 있습니다. 잠깐? Translation도 된다구요??

      인식 뿐만 아니라 바로 번역까지 되고, Time Alignment도 됩니다. 우와~~

      image.png


      Facebook wav2vec, AWS Transcribe, Google STT와 비교해도 인식률이 월들히 좋은 것을 확인 할 수 있습니다.

      특히 일상생활 대화부터 감정이(?) 섞이 거나 소리지르듯이 발화하거나, 모델명 처럼 속삭이는 소리로 잘 인식이 됩니다.

      특히 노래도 인식이 잘 되는 점이 타 모델들(데이터셋의 차이?)과의 큰 차이점이 아닐까 싶습니다.


      다음 번에는 성능 분석, 예제 코드인 실시간 인식 부터 번역 예제, 파인튜닝까지 분석해보도록 하겠습니다.

      Whisper를 사용하면 실시간 인식, 번역 가사동기 등 다양한 분야에 사용할 수 있을 것 같습니다.



      #이제 우리아들 영어 유치원 안보내도 되겠어요

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      fromDK 님의 최신 블로그

      더보기
      동영상 기고하기