23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
통신사 고객센터의 하루는 복잡합니다. 각기 다른 상담원이 여러 차례 전화를 받으며 문제를 파악하고, 요금제와 부가서비스를 안내하고, 후속 조치를 남겨야 합니다.
대화는 길고 전문 용어가 많으며, 고객의 감정도 제각각입니다. 이런 과정을 일관성 있게 처리하려면 숙련된 상담사가 필요하지만, 교육과 유지에는 많은 시간과 비용이 듭니다.
바로 이 지점에서 SK텔레콤 AI Data Engineering팀은 ‘텔코 특화 LLM’의 가능성을 보았습니다.
기존 범용 LLM이 상담 대화 요약과 후속 업무를 자동화할 수 있다면 상담 효율이 크게 향상될 수 있을 것입니다. 그러나 현실은 녹록지 않았습니다.
일반 LLM은 통신 도메인의 복잡한 제품명이나 요금제 이름을 잘 알아듣지 못하고, 한국어 데이터도 부족한 듯 보였습니다.
그래서 저희 팀은 고객센터 업무에 맞춘 자체 벤치마크와 학습 데이터셋을 만들었습니다.
저희가 개발한 TelBench는 고객센터 상담의 ‘사후처리(Post‑work)’ 단계를 개선하기 위해 설계된 벤치마크입니다.
상담 로그에서 고객 감정을 분류하는 Sentiment, 요금제나 기기 이름을 찾아내는 Entity 인식, 고객 의도를
네 가지 유형(문의/확인/취소/신규)으로 구분하는 Intent 등 TelTask 7개 및 TelInstruct 3개 Task로 구성되어 있습니다.
특히 Summary와 To‑Do 과제는 상담 종료 후 상담사가 해야 할 일을 자동으로 정리해 주는 데 초점을 둡니다.
요약 과제는 대화 속 핵심 정보와 통신 전문 용어를 정확히 담아야 하며, To‑Do 과제는 MMS 발송, 계정 소유자 동의 확인, 추가 조사 요청 등 후속 조치를 구체적으로 제안합니다.
또한 Safety 과제는 한국어 상담 상황에서 나올 수 있는 민감한 표현을 탐지하도록 설계되었습니다.
데이터는 모두 한국어로 이루어져 있으며, 사람(링귀스트 및 어노테이터)이 직접 검수한 수백개(각 Task 당)의 benchmark set으로 구성해 실제 상담 환경을 충실히 반영했습니다.
단, TelBench 데이터는 고객 개인정보를 보호하기 위해 모든 상담 기록에서 이름, 전화번호 같은 식별 정보를 제거한 후 사용합니다.
모델이 학습 과정에서 민감한 내용을 흡수하지 않도록 대화 속 개인정보 표현을 다른 임의의 값으로 치환합니다.
모델이 출력할 때도 프롬프트 설계로 개인정보를 재구성하지 못하게 하는 등 프라이버시 보호에 신경을 썼습니다.
작년 저희 팀은 TelBench를 통해 여러 상용 및 오픈소스 LLM을 평가했습니다.
Claude 3.5 Sonnet이 전반적으로 가장 뛰어난 성능을 보였지만,
Llama‑3.1‑405B‑Instruct‑FP8나 Mistral‑Large‑Instruct 같은 ‘24년 기준 최신 오픈소스 모델도 요약이나 감정 분류에서는 상용 모델과 비슷한 성능을 냈습니다.
하지만 통신 지식이 많이 필요한 엔티티 인식과 의도 분류에서는 오픈소스 모델이 상용 모델보다 약 0.1~0.2 정도 낮은 성능을 보였습니다.
이러한 결과는 “오픈소스 모델로 파인튜닝을 해봤지만 결과가 좋지 않았다”는 유럽 연구자의 경험과도 동일했습니다.
도메인 지식이 필요한 과제에서는 아직 상용 모델이 앞서지만, 오픈소스 모델의 개선 속도가 빠르므로 장기적으로는 대안을 제공할 수 있을 것으로 전망했습니다.
포스터 발표에서는 국내외 참가자들이 다양한 질문을 던졌습니다. 주요 내용은 다음과 같습니다.
영어 지원 계획: 현재 TelBench는 한국어 데이터만 포함하지만, 향후 영어를 포함한 다국어 지원을 계획하고 있습니다.
데이터 공개 여부: 사내 정책상 전체 데이터셋을 공개하지는 않으며, 논문 부록에 일부 샘플만 수록했습니다.
모델 사용 현황: Telco‑LLM은 현재 SKT 고객센터의 상담사 업무를 지원하며, 상담 내역 요약과 후속 조치(To‑Do) 생성에 활용됩니다.
연구 vs. 엔지니어링: 팀의 업무는 연구와 엔지니어링가 반반입니다. 데이터 구축, 모델 개발뿐 아니라 실제 서비스 배포까지 담당합니다.
다국어 모델 개발: 다국어 지원은 아직 초기 단계이며, 내년부터 본격적으로 추진할 계획이라고 밝혔습니다.
프라이버시 보호: 음성인식 이후 데이터를 가명화한 데이터를 사용하며, 프롬프트로 민감한 정보 추출을 방지합니다.
학회 중에 ‘Language Agents: Foundations, Prospects and Risks’라는 튜토리얼 세션이 가장 인상 깊었습니다.
이 세션은 LLM 기반 에이전트가 단순한 언어 모델의 래퍼가 아니라 “언어를 통해 추론과 의사소통을 수행하는 새로운 세대의 에이전트”라고 정의하며,
Reasoning, Memory, Planning과 같은 기본 구성 요소부터 멀티 에이전트 시스템, 안전성 문제까지 폭넓게 다뤘습니다. (튜토리얼의 세부 내용은 따로 글을 써서 공유할 예정입니다.)
EMNLP 2024 발표를 준비하면서 느낀 가장 큰 보람은 산업 현장의 문제를 해결하는 연구가 얼마나 큰 가치를 지니는지 확인한 것입니다.
SK텔레콤 AI Data Engineering팀으로서, 상담사들의 업무 부담을 줄이고 서비스 품질을 향상시키는 도구를 만들기 위해 데이터 수집, 익명화, 모델 평가 등 다양한 도전을 해왔습니다.
TelBench를 통해 우리는 텔코 도메인에서 필요한 과제를 명확히 정의하고, 객관적인 비교 기준을 제시할 수 있었습니다.
학회 기간에 만난 여러 국내외 연구자와 엔지니어들이 “이런 데이터셋이 있었으면 좋겠다”는 공감을 보여준 것도 큰 힘이 되었습니다.
한편 2025년 2월 GSMA가 ‘Open‑Telco LLM Benchmarks’라는 오픈 커뮤니티를 출범시키며,
통신 도메인에서 LLM의 한계를 지적하고 투명한 벤치마크의 필요성을 강조했습니다(gsma-benchmarks).
GPT‑4가 TeleQnA 데이터셋에서 75% 미만의 점수를 기록했다는 언급도 있었는데, 이는 TelBench 같은 연구가 얼마나 필요한지 보여주는 사례입니다.
앞으로는 텔코를 넘어서는 더 큰 영역까지 연구를 넓혀 나갈 계획입니다.
각국의 연구자와 엔지니어를 만나 서로 다른 문제의식을 공유했고, 우리가 가진 고민이 결코 고립된 것이 아니라는 사실을 알게된 것 처럼,
앞으로도 논문과 데이터셋을 꾸준히 준비해 팀과 SK텔레콤의 연구 역량을 높이고, 더 많은 곳에서 우리의 경험과 성과를 나누고자 합니다.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.