데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      RAGent팀: 음성 인식 정확도 향상을 위한 후보정 기술 연구 - 연구계획(1)

      7기_원지니 25.06.13
      82 1 0
      DEVOTEE 요약
      팀 RAGent은 도메인 특화 음성 인식(STT) 정확도 향상을 목표로, 도메인 단어 오류를 교정하는 시스템을 연구 중입니다. 이 시스템은 발음과 문맥 정보를 결합해 도메인 단어를 정밀히 교정하는 5단계 파이프라인으로 구성되며, LLM과 강화학습 기술을 활용합니다. 최종적으로, 상용 시스템에 적용 가능한 기술 개발과 학술 논문 발표를 목표로 하고 있습니다.
      DEVOTEE 추천 블로그

      안녕하세요!


      SKT AI Fellowship 7기에서 <음성 인식 정확도 향상을 위한 후보정 기술 연구> 과제를 맡은 팀 RAGent(레이전트)의 강유림, 원지니, 이현진입니다!

      이번 글은 연구 과제 소개, 연구 아이디어, 연구 수행 계획, 연구 최종 목표 순으로 진행됩니다.


      1. 연구 과제 소개

      image.png

      image.png

      1.1 연구 배경

      기존 STT 시스템은 도메인 외에서는 새로운 오류나 이전에 보지 못한 개체명을 정확히 인식하지 못하는 문제가 발생합니다.

      특히 의료, 반도체 등 일상적으로 사용되지 않는 특수 산업군의 전문 용어, 신조어, 약어가 다른 단어로 오인식될 가능성이 있습니다.

      또한, 정답 단어가 아닌 다른 단어가 발음거리가 더 가깝다는 결과를 보아, 발음만으로 오류 단어를 교정하는 기존 방법론에는 한계가 있습니다.

      1.2 연구개발 목표

      STT 문장의 전체적인 오류를 보정하기 전, 도메인 단어에 대한 오류를 교정하는 것을 1차적인 목표로 설정하였습니다.

      알고리즘 기반, LLM 추론 기반, BERT 같은 모델 학습 기반 등 다양한 접근 방식으로 시스템을 실험하고 비교하여 클라우드 기반이 아닌 온프레미스 환경에서 동작하는 STT(음성 인식) 후보정 시스템을 개발함으로서,

      기업 내부 데이터의 보안성과 독립성을 지키면서도 실질적인 정확도 향상을 이끌어내고자 합니다.


      2. 연구 아이디어

      image.png

      저희가 제시하는 아이디어는 RAG 구조를 기반으로, 음성 인식(STT) 결과에서 발생하는 도메인 단어 오류를 정밀하게 교정하기 위한 파이프라인입니다.

      이 시스템은 단순히 하나의 방식에 의존하지 않고, 발음 정보와 문맥 정보를 모두 고려하며, LLM과 강화학습을 구조로 설계되어 있습니다.

      총 5단계로 구성되어 있으며, 저희는 각 단계별로 여러 기법을 실험적으로 비교하고, 정량적인 지표를 바탕으로 최적의 후보정 방식을 찾아내고자 합니다.

      도메인 단어 추출 → 발음 기반 후보 문장 생성 → 문맥 기반 힌트 문장 추출 → LLM 프롬프트 구성 → Test-Time 강화학습의 순서로 진행됩니다.

      • 1단계 : 도메인 단어 추출

        STT된 문장에서 수정이 필요한 도메인 단어를 탐지하는 단계입니다. 도메인 단어 추출은 아래와 같은 방법을 실험할 것입니다.

        • 도메인단어 추출 시 유의해야 할 문제

          • 조사가 여러 개 붙어있을 경우 (ex. 펠로우/분/들/에게/)

          • 하나의 도메인 단어가 띄어쓰기로 떨어져 있는 경우 (ex. “팹리스” → “펫 미스”)

          • 잘못 전사되었지만, 정상 단어처럼 보이는 경우

          • 한/영/숫자가 혼합되어 있는 경우

        • Whisper 로짓 기반 필터링

          • Whisper 모델의 로짓값 분포를 활용하여 threshold를 적절히 설정하여 불확실한 단어(낮은 confidence)를 교정대상으로 설정합니다.

          • 이를 통해 모델이 스스로 확신하지 못한 단어를 중심으로 교정 대상을 좁힐 수 있습니다.

        • 명사후문자열 기반 추출

          • 어절 단위로 나눈 문장에서 조사, 접미사 등 후행 문자열을 제거하고, 남은 어절이 사전에 없는 경우 미등록어로 판단합니다.

          • 이 방식은 신조어나 고유명사처럼 사전 등록되지 않은 도메인 단어에 강점을 가집니다.

        • KoBERT 기반 고유명사 인식

          • 문장의 문맥을 반영하여 BERT 기반 토큰 분류기로 고유명사를 예측합니다.

          • 학습된 태그 시퀀스를 통해 정상 명사 vs 도메인 특화 명사를 구분할 수 있습니다.

      • 2단계 : 발음 기반 후보 문장 추출

        1단계에서 추출한 오인식된 도메인 단어를 활용하여 정답 후보 단어들을 찾아내어 이를 문장에 대입한 후보 문장들을 생성하는 단계입니다.

        • G2P 기반 발음 유사 후보 단어 검색

          • 오류 단어를 G2P(Grapheme-to-Phoneme) 변환을 통해 음소 시퀀스로 변환한 뒤,

            해당 음소 정보를 기반으로 도메인 단어 발음 DB와 발음거리를 측정하여 비교합니다.

          • 유사도가 제일 높은 Top-k 단어를 후보단어로 설정합니다.

        • STT 오류형 DB 기반 실사례 반영

          Whisper 등 ASR모델에서 단순한 발음 유사성만으로는 설명되지 않는 오류들이 다수 발생합니다.

          이를 보완하기 위해, 실제 STT 사용 중 수집된 오인식 사례들을 정리한 오류형 단어 DB를 구축하여 활용합니다.

          STT 데이터셋을 기반으로, 단순한 음소 유사성만으로는 설명되지 않는 오류 패턴(예: 음절 누락, 형태소 왜곡, 신조어 왜곡 등)까지 포괄한 오류형 단어 DB를 구축합니다.

          오류 문장에서 등장한 단어가 이 DB에 포함되어 있을 경우, 해당 오류형 단어와 실제로 자주 연결된 정답 도메인 단어를 역추적하여 후보군에 포함시킵니다.

        • 후보 문장 생성

          • 추출된 후보 단어를 원래 오류 문장에 대입하여 복수의 후보 문장을 생성합니다.

          • 이후 단계에서 이 후보 문장들이 LLM 입력 프롬프트의 일부로 활용됩니다.

      • 3단계 : 문맥 기반 힌트 문장 추출

        문맥 기반 힌트 문장 추출은, 후보 문장과 의미가 유사한 문장을 도메인 문서 DB에서 찾아 프롬프트에 포함시켜 LLM의 교정 판단을 돕는 단계입니다.

        또한, 발음·문맥 기반 매칭이 모두 실패하는 경우를 대비해, LLM이 다양한 응답을 생성하고 다수결로 정답을 추론하는 슈도 라벨링 전략도 함께 적용합니다.

        • 문맥 임베딩 기반 유사도 계산

          • 후보 문장과 도메인 문서 DB 내 문장들을 임베딩하고, 코사인 유사도를 기준으로 Top-K 유사 문장을 힌트 문장으로 선택

          • 이후 단계에서 이 후보 문장들이 LLM 입력 프롬프트의 일부로 활용됩니다.

        • pseudo-label을 통한 대안 보정

          • 발음/문맥 기반 매칭이 어려운 경우(예: 신조어, 외래어)에 대비하여 동일한 STT 입력에 대해 LLM 응답을 다양하게 샘플링

          • 그 중 가장 자주 등장하거나 자연스러운 응답을 다수결로 선택 → 슈도 라벨(Pseudo-label) 생성

          • 예: “하인익스” → 다수 LLM 응답 → “SK 하이닉스” 선택됨

      • 4단계 : LLM 프롬프트 생성 및 후보정 수행

        이 단계에서는 오류 문장, 발음 기반 후보 문장, 문맥 기반 힌트 문장을 조합하여, 경량 LLM이 교정 결과를 생성할 수 있도록 최적의 프롬프트를 구성합니다.

        • 오류 문장, 후보 문장, 힌트 문장을 조합하여 프롬프트를 구성합니다.

        • LLM에 입력하여 최종 교정 문장을 생성하며, 문장 구조 변경 금지 등의 지시문도 함께 제공합니다.

          • 교정 수행에는 경량화된 LLM을 활용하며, 온디바이스 환경에서도 실시간 교정이 가능하도록 추론 속도와 메모리 효율성을 고려한 구성을 지향합니다.

          • 또한, 하나의 모델에 의존하지 않고, 다양한 LLM을 앙상블 구성하는 것도 실험해볼 예정입니다.

      • 5단계 : Test-Time 강화학습 적용

        • 이 단계는 정답 라벨이 없는 실제 환경(test-time)에서도 모델 성능을 지속적으로 개선하기 위한 과정입니다.

        • 먼저, 하나의 입력에 대해 모델이 여러 번 응답을 생성합니다. 그런 다음 다수결(Majority Voting) 방식으로 가장 자주 등장한 결과를 pseudo-label로 설정합니다.

          이후, 현재 출력과 의사 정답 간의 보상을 계산하고 이 보상을 기준으로 모델 파라미터를 policy gradient 방식으로 실시간 업데이트합니다.

        • 이 방식을 통해 모델은 추론과 학습을 동시에 수행하며, 정답 없이도 점진적으로 성능을 향상시킬 수 있습니다.

          특히 실제 서비스 환경에서 발생하는 다양한 STT 오류 상황에 대해 적응적 대응이 가능해집니다.


      3. 연구 수행 계획

      본 연구에서는 데이터셋 중심이 아닌, 모델 중심 접근 방식을 채택하여 LLM 및 멀티모달 모델 기반의 도메인 특화 음성 인식 보정 기술을 집중적으로 개발하고자 합니다.

      이를 위해 먼저, 기존 회의록 자동화 시스템(캐럿 등)들에 대한 구조적 분석을 수행할 예정입니다. 주차별 수행 계획은 아래와 같습니다.

      6월

      • 1주차

        • 연구 방법론에 대한 피드백

      • 2주차

        • 기존 회의록 시스템 분석

        • [데이터셋 구축] 데이터 클리닝 및 도메인 단어 추출 용어 사전 구축

        • [도메인 단어 추출] 도메인 단어 추출 방법론 비교 분석

      • 3주차

        • [도메인 단어 추출] 도메인 단어 추출 방법론 비교 분석

        • [매칭 모델 설계 및 구현] 문맥 기반 매칭 알고리즘 설계 및 구현

      • 4주차

        • [데이터셋 구축] 보정 테스트용 TTS 테스트 데이터 및 음성 데이터 생성

        • [매칭 모델 설계 및 구현] 정규화된 발음 기반 매칭 모델 설계 및 구현

        • [보정 LLM 모델 구현] 경쟁형 LLM 모델 벤치마크 교정 성능 비교 및 실험

      7월

      • 1주차

        • [데이터셋 구축] 보정 테스트용 STT 테스트 음성 생성

        • [매칭 모델 설계 및 구현] 문맥 기반, 발음 기반 모델 통합 및 성능 평가

      • 2주차

        • [보정 LLM 모델 구현] 도메인 특화된 LLM 프롬프트 설계

        • [도메인 특화 AI 회의록 서비스] AI 회의록 WEB 서비스 UX/UI 설계

      • 3주차

        • [보정 LLM 모델 구현] LLM 모델 학습 및 모델별 성능 비교 실험

        • [도메인 특화 AI 회의록 서비스] 교정 추천 어휘 추출 알고리즘 구현

      • 4주차

        • [보정 LLM 모델 구현] 모델 성능 평가 및 하이퍼파라미터 튜닝

        • [도메인 특화 AI 회의록 서비스] PDF 업로드 및 데이터셋 생성 알고리즘 설계 및 구현

      • 5주차

        • [도메인 특화 오류 교정 모델 구현] LLM, 발음, 매칭 알고리즘 통합 오류 교정 성능 평가

        • [도메인 특화 AI 회의록 서비스] AI 회의록 WEB 서비스 구현 및 기능 추가

      8월

      • 1주차

        • [도메인 특화 오류 교정 모델 구현] 모델 성능 평가 및 추가 보정

        • [도메인 특화 AI 회의록 서비스] WEB 내부 테스트 진행

      • 2주차

        • [도메인 특화 오류 교정 모델 구현] 모델 성능 평가 및 추가 보정

        • 중간 리뷰 준비

      • 3주차

        • 중간 리뷰 준비

      • 4주차

        • [강화학습 기반 모델 구현] 보상 계산 알고리즘 구현

        • [지식 종류 기반 적용 모델] 모델 평가지표 설정 / Teacher 모델 설정

      9월

      • 1주차

        • [강화학습 기반 모델 구현] GRPO를 통한 모델 파라미터 업데이트

        • [지식 종류 기반 적용 모델] 모델 학습 평가 및 파인튜닝

        • [이미지 및 그래프 텍스트 추출 알고리즘] 데이터셋 수집

      • 2주차

        • [강화학습 기반 모델 구현] 테스트 데이터로 모델 성능 평가

        • [이미지 및 그래프 텍스트 추출 알고리즘] 모델 성능 비교 및 모델 설정

      • 3주차

        • [강화학습 기반 모델 구현] 모델 튜닝 및 성능 향상 실험

        • [지식 종류 기반 적용 모델] Soft Targets 생성 및 하이퍼파라미터 설정

      • 4주차

        • [강화학습 기반 모델 구현] 모델 통합 및 성능 평가

        • [지식 증류 기반 적용 모델] Student 모델 설정

      10월

      • 1주차

        • [지식 종류 기반 적용 모델] 두 모델의 정확도, 추론 시간 등 성능 비교

        • [이미지 및 그래프 텍스트 추출 알고리즘] 텍스트 탐지 및 분할 알고리즘 설계

        • [도메인 특화 AI 회의록 서비스] AI 회의록 WEB 모델 적용 및 성능 평가

      • 2주차

        • [이미지 및 그래프 텍스트 추출 알고리즘] 텍스트 인식 모델 학습 및 하이퍼파라미터 튜닝

        • [지식 종류 기반 적용 모델] 두 모델의 도메인 특화 성능 비교

      • 3주차

        • [이미지 및 그래프 텍스트 추출 알고리즘] 의미 기반 텍스트 추출


          모델 평가 및 알고리즘 개선

        • [도메인 특화 AI 회의록 서비스] AI 회의록 WEB 서비스 사용성 개선

      • 4주차

        • 통합 모델 성능 비교 및 평가

        • 최종 발표 준비

      • 5주차

        • 최종 발표 준비


      4. 연구 최종 목표

      이번 연구의 1차 목표는, 기존 회의록 자동화 시스템 대비 도메인 특화 음성 인식 정확도를 실질적으로 향상시키는 것입니다.

      이를 통해 개발된 후보정 기술을 SKT의 실제 회의록 시스템에 적용하여, 상용화 가능성을 검증하고 실질적인 활용 사례로 이어지도록 하는 것을 지향합니다.

      2차 목표로는, 전체 실험 과정과 교정 효과에 대한 정량적 분석을 체계적으로 정리하여, 국내외 학술지에 논문으로 제출하는 것을 계획하고 있습니다.


      이상으로 글을 마치도록 하겠습니다.

      감사합니다!

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      7기_원지니 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기