데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      EMNLP24 늦은 후기 1탄: 텔레콤 LLM 벤치마크 TelBench 발표 이야기

      sparklingness 25.07.29
      1,556 8 2
      DEVOTEE 요약
      SK텔레콤 AI Data Engineering팀은 고객센터 업무의 복잡성을 해결하기 위해 한국어 상담 데이터를 기반으로 한 ‘TelBench’를 개발했습니다. TelBench는 상담 대화 요약, 고객 의도 분류, 감정 분석 등 고객센터와 관련된 10가지 과제를 수행하며, 데이터 익명화와 한국어 기반 설계를 통해 실제 상담 환경을 충실히 반영하면서도 개인정보 보호를 철저히 유지합니다. 이 과정에서 상용 및 오픈소스 LLM 평가를 통해 도메인 특화 AI의 발전 가능성을 확인했으며, 텔코 도메인을 넘어 다국어 및 다양한 응용 영역으로 연구를 확장할 계획입니다.
      DEVOTEE 추천 블로그

      고객센터는 왜 ‘텔코 LLM’을 꿈꾸었는가?

      통신사 고객센터의 하루는 복잡합니다. 각기 다른 상담원이 여러 차례 전화를 받으며 문제를 파악하고, 요금제와 부가서비스를 안내하고, 후속 조치를 남겨야 합니다.

      대화는 길고 전문 용어가 많으며, 고객의 감정도 제각각입니다. 이런 과정을 일관성 있게 처리하려면 숙련된 상담사가 필요하지만, 교육과 유지에는 많은 시간과 비용이 듭니다.

      바로 이 지점에서 SK텔레콤 AI Data Engineering팀은 ‘텔코 특화 LLM’의 가능성을 보았습니다.

      기존 범용 LLM이 상담 대화 요약과 후속 업무를 자동화할 수 있다면 상담 효율이 크게 향상될 수 있을 것입니다. 그러나 현실은 녹록지 않았습니다.

      일반 LLM은 통신 도메인의 복잡한 제품명이나 요금제 이름을 잘 알아듣지 못하고, 한국어 데이터도 부족한 듯 보였습니다.

      그래서 저희 팀은 고객센터 업무에 맞춘 자체 벤치마크와 학습 데이터셋을 만들었습니다.

      TelBench: 한국어 상담 데이터를 기반으로 한 첫 통신 벤치마크

      통신 업무를 세분화한 10가지 과제

      저희가 개발한 TelBench는 고객센터 상담의 ‘사후처리(Post‑work)’ 단계를 개선하기 위해 설계된 벤치마크입니다.

      상담 로그에서 고객 감정을 분류하는 Sentiment, 요금제나 기기 이름을 찾아내는 Entity 인식, 고객 의도를

      네 가지 유형(문의/확인/취소/신규)으로 구분하는 Intent 등 TelTask 7개 및 TelInstruct 3개 Task로 구성되어 있습니다.

      특히 Summary와 To‑Do 과제는 상담 종료 후 상담사가 해야 할 일을 자동으로 정리해 주는 데 초점을 둡니다.

      요약 과제는 대화 속 핵심 정보와 통신 전문 용어를 정확히 담아야 하며, To‑Do 과제는 MMS 발송, 계정 소유자 동의 확인, 추가 조사 요청 등 후속 조치를 구체적으로 제안합니다.

      또한 Safety 과제는 한국어 상담 상황에서 나올 수 있는 민감한 표현을 탐지하도록 설계되었습니다.

      데이터는 모두 한국어로 이루어져 있으며, 사람(링귀스트 및 어노테이터)이 직접 검수한 수백개(각 Task 당)의 benchmark set으로 구성해 실제 상담 환경을 충실히 반영했습니다.

      단, TelBench 데이터는 고객 개인정보를 보호하기 위해 모든 상담 기록에서 이름, 전화번호 같은 식별 정보를 제거한 후 사용합니다.

      모델이 학습 과정에서 민감한 내용을 흡수하지 않도록 대화 속 개인정보 표현을 다른 임의의 값으로 치환합니다.

      모델이 출력할 때도 프롬프트 설계로 개인정보를 재구성하지 못하게 하는 등 프라이버시 보호에 신경을 썼습니다.

      LLM 평가 결과(‘24)와 오픈소스 모델의 가능성

      작년 저희 팀은 TelBench를 통해 여러 상용 및 오픈소스 LLM을 평가했습니다.

      Claude 3.5 Sonnet이 전반적으로 가장 뛰어난 성능을 보였지만,

      Llama‑3.1‑405B‑Instruct‑FP8나 Mistral‑Large‑Instruct 같은 ‘24년 기준 최신 오픈소스 모델도 요약이나 감정 분류에서는 상용 모델과 비슷한 성능을 냈습니다.

      하지만 통신 지식이 많이 필요한 엔티티 인식과 의도 분류에서는 오픈소스 모델이 상용 모델보다 약 0.1~0.2 정도 낮은 성능을 보였습니다.

      이러한 결과는 “오픈소스 모델로 파인튜닝을 해봤지만 결과가 좋지 않았다”는 유럽 연구자의 경험과도 동일했습니다.

      도메인 지식이 필요한 과제에서는 아직 상용 모델이 앞서지만, 오픈소스 모델의 개선 속도가 빠르므로 장기적으로는 대안을 제공할 수 있을 것으로 전망했습니다.

      포스터 세션에서 주요 질문과 답변

      포스터 발표에서는 국내외 참가자들이 다양한 질문을 던졌습니다. 주요 내용은 다음과 같습니다.

      • 영어 지원 계획: 현재 TelBench는 한국어 데이터만 포함하지만, 향후 영어를 포함한 다국어 지원을 계획하고 있습니다.

      • 데이터 공개 여부: 사내 정책상 전체 데이터셋을 공개하지는 않으며, 논문 부록에 일부 샘플만 수록했습니다.

      • 모델 사용 현황: Telco‑LLM은 현재 SKT 고객센터의 상담사 업무를 지원하며, 상담 내역 요약과 후속 조치(To‑Do) 생성에 활용됩니다.

      • 연구 vs. 엔지니어링: 팀의 업무는 연구와 엔지니어링가 반반입니다. 데이터 구축, 모델 개발뿐 아니라 실제 서비스 배포까지 담당합니다.

      • 다국어 모델 개발: 다국어 지원은 아직 초기 단계이며, 내년부터 본격적으로 추진할 계획이라고 밝혔습니다.

      • 프라이버시 보호: 음성인식 이후 데이터를 가명화한 데이터를 사용하며, 프롬프트로 민감한 정보 추출을 방지합니다.


      튜토리얼 T4 — Language Agents: Foundations, Prospects and Risks

      학회 중에 ‘Language Agents: Foundations, Prospects and Risks’라는 튜토리얼 세션이 가장 인상 깊었습니다.

      이 세션은 LLM 기반 에이전트가 단순한 언어 모델의 래퍼가 아니라 “언어를 통해 추론과 의사소통을 수행하는 새로운 세대의 에이전트”라고 정의하며,

      Reasoning, Memory, Planning과 같은 기본 구성 요소부터 멀티 에이전트 시스템, 안전성 문제까지 폭넓게 다뤘습니다. (튜토리얼의 세부 내용은 따로 글을 써서 공유할 예정입니다.)

      개인적인 성찰과 앞으로의 계획

      EMNLP 2024 발표를 준비하면서 느낀 가장 큰 보람은 산업 현장의 문제를 해결하는 연구가 얼마나 큰 가치를 지니는지 확인한 것입니다.

      SK텔레콤 AI Data Engineering팀으로서, 상담사들의 업무 부담을 줄이고 서비스 품질을 향상시키는 도구를 만들기 위해 데이터 수집, 익명화, 모델 평가 등 다양한 도전을 해왔습니다.

      TelBench를 통해 우리는 텔코 도메인에서 필요한 과제를 명확히 정의하고, 객관적인 비교 기준을 제시할 수 있었습니다.

      학회 기간에 만난 여러 국내외 연구자와 엔지니어들이 “이런 데이터셋이 있었으면 좋겠다”는 공감을 보여준 것도 큰 힘이 되었습니다.

      한편 2025년 2월 GSMA가 ‘Open‑Telco LLM Benchmarks’라는 오픈 커뮤니티를 출범시키며,

      통신 도메인에서 LLM의 한계를 지적하고 투명한 벤치마크의 필요성을 강조했습니다(gsma-benchmarks).

      GPT‑4가 TeleQnA 데이터셋에서 75% 미만의 점수를 기록했다는 언급도 있었는데, 이는 TelBench 같은 연구가 얼마나 필요한지 보여주는 사례입니다.

      앞으로는 텔코를 넘어서는 더 큰 영역까지 연구를 넓혀 나갈 계획입니다.

      각국의 연구자와 엔지니어를 만나 서로 다른 문제의식을 공유했고, 우리가 가진 고민이 결코 고립된 것이 아니라는 사실을 알게된 것 처럼,

      앞으로도 논문과 데이터셋을 꾸준히 준비해 팀과 SK텔레콤의 연구 역량을 높이고, 더 많은 곳에서 우리의 경험과 성과를 나누고자 합니다.

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      sparklingness 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기