23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
최근 다양한 AI 서비스에서 대형 언어 모델(LLM)을 활용한 검색 기능이 빠르게 확산되고 있습니다.
하지만 이러한 모델들이 웹 검색 기반 정보에만 의존할 경우, 도메인 특화 지식, 실시간 정보, 플랫폼 전용 콘텐츠와 같은 특화된 영역에서는 정확한 답변을 제공하기 어렵습니다.
이러한 한계를 극복하기 위해, 도메인별로 구조화된 In-house 데이터를 직접 색인하고 검색에 활용함으로써, LLM의 응답 품질을 획기적으로 향상시킬 수 있습니다.
특히 일반적인 웹 검색으로는 노출되지 않는 다음과 같은 정보에 대해 정확하고 컨텍스트 기반의 답변을 생성할 수 있다는 점에서 그 의의가 큽니다.
이 글에서는 SKT의 다양한 도메인 데이터를 활용한 AI 검색 품질 향상 전략을 중심으로, 검색-생성 통합 구조가 어떻게 구현되고 어떤 차별점을 제공하는지를 살펴봅니다.
In-house 데이터는 실시간 웹 검색 기반의 외부 데이터가 아닌, 내부에서 직접 관리하고 있는 데이터를 의미합니다.
외부 검색과는 분리된 자체 검색 인프라를 통해 검색되도록 구축되어 있습니다.
예를 들어 다음과 같은 데이터들이 이에 해당합니다.
뉴스 데이터
뮤직 데이터
미디어 데이터
SKT 자사서비스 (T월드, T구독, T멤버십 등)
POI 데이터
이러한 데이터는 도메인 특화되어 있기에, 공개 범용 데이터보다 검색 정확도 및 관련성 측면에서 훨씬 높은 가치를 가집니다.
RAG는 대규모 언어 모델(LLM)의 답변 품질을 향상시키는 데 사용되는 기술로,
LLM이 응답을 생성하기 전에 외부 데이터베이스나 지식 기반에서 관련 정보를 검색(Retrieval)하여 이를 기반으로 답변을 강화(Augmented Generation)하는 방식을 의미합니다.
SKT는 RAG에 필요한 3가지 요소인 하이브리드 검색(Hybrid Retrieval), 쿼리 분석(Query Analysis), 그리고 랭킹 모델(Ranking Model) 최적화 기법을 통해
RAG를 구현하며 In-house 데이터를 기반으로 AI 검색 품질을 높이는 방향으로 설계되어 있습니다.
첫 번째, Retrieval 알고리즘을 간단하게 살펴보면 아래와 같습니다.
구분 | Sparse Retrieval | Dense Retrieval | Hybrid Retrieval |
|---|---|---|---|
핵심 원리 | 키워드 빈도 및 일치 | 의미적/문맥적 유사성 | 키워드와 의미의 결합 |
대표 기술 | BM25, TF-IDF | DPR (Dense Passage Retrieval), S-BERT, MPNet | BM25 + DPR, RRF (Reciprocal Rank Fusion) |
강점 | 속도, 키워드 정확성, 해석 용이성 | 문맥 이해, 개념 검색, 언어 유연성 | 높은 정확도, 범용성, 안정성 |
약점 | 의미 파악 불가, 어휘 불일치 | 키워드 민감도 부족, 높은 자원 요구 | 구현 복잡성, 튜닝 필요 |
주요 사용처 | 높은 정확도와 빠른 속도가 요구되는 경우 | 의미적 결과와 높은 Recall이 요구되는 경우 | 정확하면서 의미적 결과가 필요한 경우 |
내부적으로 높은 수준의 검색 품질 요구를 충족하기 위해 Hybrid retrieval 전략과 알고리즘을 적용하고 있습니다.
이를 위해서는 Sparse Retrieval에 필요한 기술을(형태소 분석기, Query Analyzer 등) 내재화 하고 있으며,
Dense Retrieval에 필요한 기술(Semantic Embedding Model, Metric Learning 등) 또한 내재화 하고 있습니다.
기반 기술들을 바탕으로 Hybrid Search Engine 을 구성하고 Relevance를 최적화 하는 방향으로 전략적으로 사용하고 있습니다.
두 번째, 쿼리 분석(Query Analysis)은 사용자의 질문 의도를 명확히 파악하고 검색 성능을 극대화하기 위해 초기 쿼리를 더 효과적인 형태로 변환하거나 분해하는 과정을 말합니다.
이는 더 정확한 정보를 검색하여 최종 답변의 품질을 높이는 데 결정적인 역할을 합니다.
Query reformulation : 사용자의 초기 검색 쿼리(Query)를 더 나은 검색 결과를 얻을 수 있는 형태로 변환하거나 확장하는 모든 기술을 의미합니다.
검색 엔진이 관련성 높은 문서를 찾을 확률을 극대화하기 위한 필수적인 과정입니다.
Query Expansion : 가장 고전적이면서도 여전히 강력한 기법으로, 원본 쿼리에 관련 용어를 추가하여 검색 범위를 넓히는 전략입니다.
어휘 불일치(Vocabulary Mismatch) 문제를 해결하는 데 효과적입니다.
세 번째, 랭킹모델입니다.
아래 수식은 기본적인 랭킹알고리즘을 표현한 수식입니다.
내부적으로는 Recency model, Popularity model 등 다양한 요소를 기반으로 Relevance를 최적화 하는 방향으로 랭킹 알고리즘이 정의되어 있습니다.
랭킹모델은 뉴스, 뮤직, 미디어 등 다양한 도메인에 최적화하는 방향으로 정의하고 튜닝되어 있습니다.
예를들어 뉴스는 Recency 가중치가 높은 모델로 정의되어 있고 뮤직, 미디어는 Popularity, Recency 가 높은 모델로 정의되어 있습니다.
<RAG 검색 랭킹 모델 예시>
이러한 기술들은 단순히 개별적으로 존재하는 것이 아니라 서로 긴밀하게 연결되어 RAG 시스템의 근간을 이루고 있습니다.
특히 Hybrid Retrieval은 Sparse Retrieval의 속도와 키워드 기반 검색의 강점, Dense Retrieval의 문맥적 이해와 높은 Recall 확보 능력을 결합하여 매우 높은 정확성과 유연성을 제공합니다.
쿼리 분석은 사용자의 의도를 정밀히 파악하여 검색 정확도를 향상시키며, 랭킹 모델은 검색된 결과를 효율적으로 정렬하고 최적화하여 사용자 경험을 극대화합니다.
위에서 설명한 세 가지 핵심 기술을 기반으로 하여, SKT는 다양한 검색 환경과 요구 사항에 유연하게 대응 가능한 Hybrid Search Engine을 설계하고 있습니다.
이를 통해 최종적으로는 RAG 시스템이 단순한 AI 검색 도구가 아닌, 실제 환경에서 높은 수준의 검색 품질과 생성 품질을 동시에 달성할 수 있는 강력한 솔루션으로 자리 잡을 수 있도록 구성하고 있습니다.
내부적으로는 보다 복잡한 알고리즘과 다차원적인 기술 요소들이 RAG 시스템에 적용되고 있으며, 이러한 기술들은 각 도메인별 특성에 맞추어 최적화되고 정교하게 조율되고 있습니다.
예를 들어 뉴스 분야에서는 최신 정보를 반영하기 위해 Recency 모델이 중점적으로 사용되며, 음악이나 미디어 분야에서는 Popularity와 Recency가 조화를 이루는 방식으로 설계됩니다.
이처럼 도메인별로 맞춤형 검색 구조를 제공함으로써, RAG 시스템은 폭넓은 활용 가능성과 높은 수준의 검색 및 답변 품질을 보장합니다.
각 도메인의 데이터는 성격과 구조가 다르기 때문에, 각 도메인에 특화된 별도의 검색 엔진을 개별적으로 구축합니다.
검색 엔진의 색인 데이터와 검색 로직은 밀접한 관계가 있지만 마찬가지로 도메인마다 특성이 다르기 떄문에 검색 로직 또한 최적화 하여 전문성 있는 검색 기능을 제공하는게 필수적입니다.
도메인 | 색인 포인트 | 검색로직 특성 |
|---|---|---|
뉴스 | 제목, 본문, 언론사, 발행일 등 | 최신성 + 제목 일치 + 언론사 신뢰도 반영 |
뮤직 | 곡명, 아티스트, 가사, 분위기 등 | 감성 매칭 + 개인 이력 기반 큐레이션 |
미디어 | 콘텐츠명, 배우, 장르, 줄거리 등 | 장르별 정렬 + 배우 매칭 + 시청 트렌드 기반 |
SKT 자사서비스 (T월드, T구독, T멤버십) | 상품명, 가격, 부가 상품, 이벤트 등 | 카테고리 필터 + 의도 중심 정렬 + 상품 키워드 매칭 |
POI | 장소명, 거리, 인기도 등 | 현위치 거리 + 인기도 기반 랭킹 |
뉴스는 시의성과 신뢰도가 중요한 도메인이지만, 기존에는 웹검색 의존도가 높아 적극적인 활용에 한계가 있었기에 내부 기준 기반의 뉴스 색인을 통해 안정적이고 정확한 뉴스 제공 체계를 마련하였습니다.
현재 문제점
시의성이 부족한 뉴스 콘텐츠가 제공되는 문제
실시간 본문 추출로 인한 시스템 부담
사용자의 검색 의도와 부합하지 않는 뉴스 기사가 검색 결과에 포함
개선 방향
검색 쿼리를 분석하여 시의성에 높은 가중치를 둔 뉴스 콘텐츠 제공
실시간 본문 추출이 아닌, 기존에 저장된 데이터를 기반으로 결과 제공
사용자의 검색 의도를 기반으로 동음이의어 키워드에 대한 정확한 결과 제공
<AI 검색에서 기존 웹검색만 활용하던 시기와 웹검색과 in-house 뉴스 검색을 함께 활용하는 비교 그림>
뮤직, 미디어, SKT 자사서비스 등 SKT의 자체 도메인 데이터는 웹검색에서는 노출되지 않는 정보들을 기반으로 AI 검색 품질 향상에 기여하며,
이는 외부 AI 검색 서비스 대비 차별화된 경쟁력이 될 수 있습니다.
자체 색인으로 구조화된 정확한 응답을 제공할 수 있어 정답률이 높고 실행 연결도 용이한 장점이 있습니다.
예를 들어 아래와 같은 사례들은 SKT만 제공할 수 있는 데이터를 기반으로 외부 검색으로는 불가능한 정확한 정답 제공 및 서비스 연계를 실현할 수 있습니다.
"기분전환 음악" → 뮤직 서비스의 큐레이션 결과 제공 및 재생 링크 제공
"런닝맨 틀어줘" → 미디어 서비스의 메타 결과 제공 및 재생 가능한 OTT 연동
"요금제 변경" → T월드의 정확한 가이드 문서 제공
"을지로 맛집" → POI 기반 인기도 정보를 통한 장소정보 제공
이처럼 도메인 특성에 최적화된 검색 인프라를 바탕으로, SKT 통합검색은 단순한 정보 탐색을 넘어 고품질 AI 응답의 기반 역할을 수행합니다.
<SKT 통합검색의 구조>
SKT 통합검색 시스템은 단순히 질의어를 키워드 매칭 기반으로 처리하지 않고, LLM을 활용해 질의의 의도와 맥락을 분석한 뒤, 그 결과를 기반으로 적절한 도메인 검색 API에 요청을 전달하는 구조로 설계되어 있습니다.
이 과정은 다음과 같은 단계로 이루어집니다:
사용자의 입력은 먼저 LLM에게 전달되며, 프롬프트 기반 분석을 통해 질의의 의도, 정보 유형, 응답 형태 등을 판단합니다.
예시 프롬프트:
"이 질의는 어떤 서비스 도메인에 가장 적합한가?"
"질의는 정보형/실행형/추천형 중 어떤 유형인가?"
"검색을 위한 핵심 키워드와 보조 조건은 무엇인가?"
분석 결과에 따라 LLM은 해당 질의를 가장 잘 처리할 수 있는 도메인 검색 API를 식별합니다.
예:
"기분전환 노래 추천해줘" → 뮤직 도메인 + 추천형 검색
"에이닷에서 새로 나온 기능 알려줘" → T월드 도메인 + 운영 문서 기반 응답
"서울역 근처 맛집 알려줘" → POI 도메인 + 위치 기반 정렬
도메인별 특성을 고려해 검색 API 요청을 위한 프롬프트 또는 파라미터를 자동 생성
예: 기분전환 노래 추천해줘
{"query": "기분전환", "user_id": A, "context": "music"}
이로써 각 도메인의 구조와 정책에 맞춘 최적화된 질의 요청이 가능해짐
웹검색 기반의 응답 시스템은 검색 결과에 대한 품질 통제나 최신성 반영에 한계가 있습니다.
특히 내부 정책이나 신제품 정보처럼 외부에 노출되지 않은 콘텐츠는 대응이 어렵습니다.
SKT 통합검색은 운영자가 직접 문서를 등록하고 관리할 수 있는 구조로 설계되어 있어, 특정 질의에 대해 명확하고 정확한 응답을 제공할 수 있습니다.
예: "에이닷 새 기능 뭐야?"와 같은 질문에 대해, 운영 문서를 기반으로 최신 기능 설명을 정답형 응답으로 제공 가능
검색 결과를 실시간 운영 콘텐츠와 연동함으로써, 브랜드 관점에서 신뢰 가능한 커뮤니케이션이 가능해집니다.
SKT 통합검색은 정보 탐색에 그치지 않고, 검색 이후의 사용자 행동까지 이어지는 액션 기반 흐름을 구현할 수 있습니다.
음악 관련 발화 → 뮤직 재생 기능 연결
맛집 검색 발화 → 예약 링크 및 상세 정보 연결
요금제 검색 → T월드 신청 화면 바로가기 제공 등
사용자의 행동 목적에 부합하는 후속 인터랙션 제공이 가능하며, 이는 단순 응답형 검색 모델과의 차별성을 강화하는 요소입니다.
SKT 통합검색은 사용자에게 더 정교한 검색 경험을 제공하기 위해, 개인화 기반의 검색 응답 전략도 함께 고려하고 있습니다.
특히 에이전트 기반 검색 설계와 결합할 경우, 사용자 특성에 따른 도메인별 최적 응답과 후속 액션 연결까지 가능해집니다.
도메인별 API에서는 이미 일부 개인화 기능이 적용되었거나, 확장 가능한 구조로 설계되어 있습니다.
뮤직 API: 사용자의 청취 이력을 기반으로, "음악 추천해줘"와 같은 질의에 대해 개인 맞춤형 곡 추천 가능
POI API: 사용자의 현재 위치 정보를 반영하여 주변 중심의 결과 제공
뉴스 API: 사용자의 선호 언론사, 관심 키워드 기반 추천 기사 우선 노출 가능성 확보
단순하거나 의도가 모호한 질의에 대해서는, 사용자 개인의 도메인 선호도를 반영한 결과 노출 전략이 중요합니다.
"추천해줘", "오늘 뭐볼까?"와 같은 짧은 발화에 대해
A 사용자: 음악 선호도가 높다면 뮤직 도메인 응답을 우선 제공
B 사용자: 영상 콘텐츠 소비가 많다면 미디어 도메인이 먼저 노출
이러한 도메인 간 개인화 전략은 검색 정확도를 높이고, 사용자 만족도를 자연스럽게 향상시킬 수 있는 중요한 방향입니다.
In-house 데이터는 단순한 검색 품질 개선을 넘어, LLM 기반 AI 응답 고도화, 도메인별 맞춤형 액션 설계, 신뢰도 높은 운영형 검색 체계 구축의 핵심입니다.
SKT는 도메인별 전문 검색 인프라와 통합 검색 구조를 통해 정확한 정보 탐색 → 개인화 → 실행 연결 → 자연어 응답 까지 유기적인 검색 흐름을 구현할 수 있으며,
이는 외부 AI 검색 서비스와 명확한 차별점을 갖는 경쟁력입니다.
향후에도 다양한 In-house 데이터를 전략적으로 활용하여 검색 품질의 정밀도와 신뢰도를 지속적으로 고도화해 나갈 계획입니다.
읽어주셔서 감사합니다.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.