23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
최근 인공지능(AI) 기술의 발전은 그야말로 가속도가 붙어 빠르게 진행되고 있습니다.
그중에서도 대형 언어 모델(LLM: Large Language Models)의 등장으로 콘텐츠 탐색 서비스는 새로운 국면을 맞이하고 있습니다.
단순히 키워드를 기반으로 정보를 검색하는 기존 방식에서 나아가, 이제는 사용자의 의도와 맥락을 정교하게 분석하고 이해하는 대화형 시스템이 등장했습니다.
그리고 이에 따라 콘텐츠 추천과 정보 검색의 패러다임도 근본적으로 변화하고 있습니다.
이러한 시스템은 사용자와의 상호작용을 통해 보다 자연스럽고 개인화된 방식으로 정보를 제공할 수 있어, 검색의 효율성과 정확성을 한층 끌어올릴 수 있는 가능성을 가지고 있습니다.
본 포스팅에서는 LLM을 활용한 에이닷 미디어 에이전트 서비스의 현재와 이를 구성하는 몇가지 기술들을 살펴보겠습니다.
그리고 이 블로그의 이미지와 글 역시, 생성형 ai의 도움을 일부 받아 작성하였습니다.
생성형 AI를 활용한 기술을 소개하는 글을 쓰면서도 동시에 그 기술을 사용하니 기분이 참 묘하네요.
B tv와 에이닷은 LLM을 기반으로 한 미디어 에이전트 서비스를 통해 새로운 방식의 콘텐츠 탐색 경험을 제공하고 있습니다.
미디어 에이전트는 LLM을 활용해 사용자의 발화를 이해하고 그 의도와 맥락에 맞춘 답변을 제공합니다.
단순한 키워드 매칭이나 콘텐츠의 나열이 아닌, 대화의 흐름을 따라가며 적절한 콘텐츠를 제안하며 사용자와의 상호작용을 더욱 자연스럽고 효율적으로 만들어줍니다.
이를 통해 사용자 경험을 개인화하고 보다 직관적이고 유연한 방식으로 콘텐츠를 탐색할 수 있도록 노력하고 있습니다.
미디어 에이전트는 크게 세 가지 주요 요소로 구성되어 있으며 각각이 유기적으로 결합되어 사용자에게 최적화된 경험을 제공합니다.
첫 번째 요소는 에이전트의 두뇌이자 핵심 역할을 담당하는 대형 언어 모델(LLM)을 활용한 기술인 'Prompt Chaining'입니다.
이 기술은 에이전트의 전반적인 대화 흐름을 구축하는 역할을 담당하고 있습니다.
사용자의 의도와 맥락을 심층적으로 분석하여 보다 정교하고 자연스러운 대화 흐름을 만들어내는 데 중요한 역할을 합니다.
두 번째로는 RAG(Retrieval-Augmented Generation) 기술을 기반으로 한 'Multi-contents RAG'입니다.
이 기술은 다채로운 콘텐츠를 결합하여 더 풍부하고 완성도 높은 답변을 생성해내는 데 기여합니다.
이를 통해 사용자는 단순한 정보 제공을 넘어서 콘텐츠와 관련된 다채로운 경험을 할 수 있습니다.
마지막으로, 사용자에게 맞춤화된 최적의 콘텐츠를 제공하는 'Search & Recommendation' 시스템이 있습니다.
이 시스템은 사용자의 컨텍스트와 의도를 효과적으로 분석하여 그 순간에 가장 적합한 정보를 추천하고 제공합니다.
이 세 가지 요소를 통해 미디어 에이전트는 사용자에게 개인화된 경험을 선사하고 보다 효율적이고 만족스러운 콘텐츠 탐색을 가능하게 만듭니다.
미디어 에이전트가 LLM을 콘텐츠 검색과 추천에 어떻게 활용하고 있는지 조금 더 자세히 알아보도록 하겠습니다.
LLM을 활용하기 위해 가장 핵심적인 기술은 바로 Prompt Chaining 입니다.
Prompt Chaining 은 단순히 하나의 질문에 대한 답을 제공하는 것을 넘어, 여러 개의 프롬프트를 유기적으로 연결하여 대화의 맥락을 유지하고 발전시키는 일련의 과정을 포함합니다.
이 과정에서는 초기 질문에 대한 간단한 응답을 기반으로 후속 질문을 자연스럽게 이어가며 점진적으로 더 심화된 정보를 도출하는 데 중점을 둡니다.
이러한 방식은 단발적인 질문-응답 구조에서 벗어나 사용자가 필요로 하는 정보의 맥락을 더욱 세밀하게 반영할 수 있도록 돕습니다.
마지막에 이르면 에이전트는 사용자가 요구하는 것에 가장 적합한 최종 답변을 생성하게 되며, 이를 통해 콘텐츠 추천이나 정보 검색의 정확도가 크게 향상됩니다.
이처럼 Prompt Chaining은 LLM의 강력한 능력을 최대한으로 활용하는 중요한 기술적 요소로서 대화형 에이전트의 성능에 핵심적인 역할을 합니다.
에이전트가 사용자의 관심사나 맥락에 맞춰 먼저 질문을 하거나 콘텐츠를 제안하는 단계입니다.
이 단계를 통해 에이전트는 사용자가 아직 명확한 요구를 표현하지 않았더라도 미리 적절한 콘텐츠를 준비하고 제안합니다.
예를 들어, 요즘 가장 인기 있는 영화를 리뷰하는 유튜브 영상을 제안할 수도 있고, 만약 늦은 밤이라면 분위기에 맞는 잔잔한 콘텐츠를 보여줄 수도 있습니다.
혹은 사용자들이 좋아하는 박스오피스 순위를 제시할 수도 있습니다.
이를 '가이드 선톡' 혹은 '콘텐츠 선톡'이라고 하며 대화의 주제를 설정하거나 사용자가 관심을 가질 만한 콘텐츠를 미리 준비하고 추천하는 역할을 합니다.
이러한 Proactive Prompt는 사용자가 보다 빠르고 쉽게 원하는 정보를 얻을 수 있도록 돕고, 보다 풍부한 사용자 경험을 만들어 줍니다.
Proactive Prompt 이후에는 사용자가 실제로 질문을 하고 대화를 시작하는 단계가 이어집니다.
이 단계에서는 사용자가 구체적인 요청이나 궁금한 점을 에이전트에게 전달하며, 대화의 핵심이 되는 텍스트 입력이 이루어집니다.
예를 들어, 사용자가 "액션 영화 추천해줘" 혹은 "지금 볼 만한 드라마 알려줘"와 같은 질의를 할 수 있습니다.
이 질의는 에이전트가 사용자의 의도를 파악하고 적절한 답변을 제공하는 데 중요한 기초 데이터를 제공합니다.
에이전트는 이 질의를 기반으로 사용자가 요구하는 정보의 종류를 분석합니다.
그리고 질의와 연관된 맥락을 이해한 뒤, 적합한 콘텐츠를 제안하거나 관련된 답변을 제공하기 위한 후속 작업을 수행합니다.
이 과정에서 LLM은 사용자의 의도를 정확하게 해석하고 질의 속에 담긴 추가적인 요구나 감정을 파악하는 데 중요한 엔진 역할을 합니다.
이어서 대화 질의를 분석하는 단계입니다. 이 단계에서 에이전트는 사용자의 의도(Intent)와 주요 개체(Entity)를 파악합니다.
'Intent'는 사용자가 대화 속에서 원하는 것을 의미하며, "액션 영화 추천해줘" 라는 입력에서는 “액션 영화 추천”이 바로 'Intent'가 됩니다.
그리고 'Entity'는 대화 속에서 지칭되는 특정한 단어 혹은 대상을 의미하며, 마찬가지로 위 입력에서는 ‘액션’ 그리고 ‘영화’가 'Entity'가 됩니다.
이러한 추출 과정은 LLM으로 진행하게 되며, 기존의 검색/추천 시스템과는 달리 조금 더 유연한 질문에 대처할 수 있고 시의성이 있는 콘텐츠 탐색에 도움이 됩니다.
기존의 검색 시스템에서는 직접 시스템에 등록하지 않으면 의도를 알 수 없는 신조어나 밈(Meme)같은 단어나 질의에 대해서도 LLM을 활용하면 어느정도 해석이 가능해지기 때문입니다.
Intent와 Entity가 추출되었다면, 에이전트는 이를 기반으로 검색 또는 콘텐츠 추천 작업을 수행합니다.
“액션 영화 추천해줘” 질의의 경우, 해석된 ‘액션’, ‘영화’라는 Entity에 맞춰 색인된 데이터 혹은 외부 정보(뉴스, 위키 등)에서 액션 영화를 찾거나 추천 목록을 생성하는 과정을 거칩니다.
이 단계에서는 단순히 색인된 메타 데이터만 활용하는 것이 아니라, 실시간으로 가져온 데이터를 사용하기도 합니다.
또한 사용자들의 과거 이력을 학습한 임베딩 벡터를 활용하여 유사한 추천 목록을 제공하기도 합니다.
이제 최종적으로 에이전트가 사용자들에게 제시할 답변을 생성하는 부분입니다.
중요한 점은 Answer Prompt가 단순히 사용자의 질의를 해석한 결과를 제공하는 것에 만그치지 않고,
이전 단계에서 생성한 검색 또는 추천된 결과를 기반으로 적절한 답변을 함께 만들어낸다는 것입니다.
이 점이 기존의 검색 추천 시스템과 사용성에서 가장 큰 차이가 있는 부분입니다.
예를 들어, "전쟁과 액션이 어우러진 ‘전, 란’을 추천해드립니다. 강동원, 박정민, 차승원이 출연하며, 왜란 시대를 배경으로 진행되는 이야기를 통해 즐거운 관람을 기대해보세요."와 같은 방식으로
구체적인 문장으로 생성된 추천 결과가 포함된 답변이 생성될 수도 있습니다.
이는 AI 기술 활용의 또 하나의 큰 화두 중 하나인 XAI(설명 가능한 인공지능, eXplainable AI)을 포함하는 개념이기도 합니다.
이렇게 Answer Prompt는 사용자 질의의 맥락과 추천된 콘텐츠를 결합하여 사용자가 원하는 답변을 맞춤형으로 제공하게 됩니다.
이 마지막 단계가 중요한 이유는 단순히 정보를 제공하는 것이 아니라 사용자와의 상호작용에서 매끄럽고 자연스러운 대화 경험을 제공하기 때문입니다.
미디어 에이전트가 제공하는 또 하나의 핵심 기능은 '멀티 콘텐츠 RAG(Multi Contents RAG)' 기능입니다.
이는 Retrieval-Augmented Generation(RAG)의 개념을 확장하여 여러 유형의 콘텐츠에 적용한 기술입니다.
RAG는 LLM이 기존에 학습한 데이터에만 의존하지 않고, 외부에서 실시간으로 수집한 다양한 정보와 결합하여 사용자가 필요로 하는 더 폭넓고 정교한 답변을 생성하는 방식입니다.
이를 통해 최신 정보를 동적으로 반영하여 보다 실용적이고 시의적절한 결과를 제공할 수 있습니다.
미디어 에이전트의 경우, RAG 개념을 다중 콘텐츠에 적용하여 사용자에게 더욱 풍부한 정보를 제공하는 데 중점을 두고 있습니다.
이를 위해 단순히 콘텐츠의 메타 정보를 이용하는 것을 넘어 유튜브 동영상, 위키(Wikipedia) 항목, 실시간 뉴스 등 외부의 다양한 콘텐츠를 동원하여 응답을 구성합니다.
이러한 방식은 특정 주제에 대해 깊이 있는 분석과 최신 정보를 기반으로 한 사실 검증이 필요할 때 특히 유용합니다.
사용자가 특정 콘텐츠에 대해 질문했을 때, 미디어 에이전트는 그 콘텐츠에 대한 메타 데이터 뿐만 아니라 최신 리뷰 영상이나 관련된 뉴스 기사,
그리고 위키 정보를 함께 참고하여 보다 종합적이고 신뢰도 높은 답변을 제공합니다.
또한 미디어 에이전트는 단순히 이러한 외부 콘텐츠를 연계하는 것에서 그치지 않고, RAG 성능을 최적화하기 위해 다양한 기술들을 함께 적용하고 있습니다.
RAG 전용 색인 컬렉션을 별도로 정제 및 가공하여 외부 소스에서 수집한 데이터를 효율적으로 정리하고 있으며 중복되거나 불필요한 정보를 제거합니다.
이는 검색의 정확도를 높이고 사용자가 찾는 정보에 보다 빠르게 접근할 수 있도록 도와줍니다.
또한 RAG가 제공하는 콘텐츠의 순서 및 우선 순위 미세 조정을 통해,
여러 컬렉션의 정보 중에서 사용자가 보다 유의미한 정보를 먼저 제공받을 수 있도록 콘텐츠를 전략적으로 배열하고 있습니다.
이를 통해 사용자는 검색 결과에서 더 중요한 정보에 쉽게 접근할 수 있습니다.
마지막으로, RAG 검색에 맞는 후처리 보정 작업을 통해 최종적으로 제공되는 답변의 품질을 보정하고,
다양한 출처에서 수집된 정보를 자연스럽고 일관되게 통합하여 사용자 경험을 향상시킵니다.
이 모든 과정은 LLM의 활용도를 최대한 끌어올리는 개발작업을 수반하고 있습니다.
요약하자면, 미디어 에이전트는 Multi Contents RAG 기능을 활용하여 단일 출처에 의존하지 않고
다양한 채널의 정보를 통합하여 사용자에게 최적화된 콘텐츠를 추천하기 위해 노력하고 있습니다.
그리고 그 과정에서 개발자들의 Prompt Engineering을 통해 시의적절하고 다각적인 답변을 제공하도록 개발되고 있습니다.
미디어 에이전트는 검색과 추천 관점에서 최적의 콘텐츠를 제공하기 위해 여러가지 콘텐츠 탐색 로직을 활용하고 있습니다.
Prompt Chaining에서는 대화형 시스템의 기본 틀을 제공하는 정교한 프롬프트 로직을 구성하였으며,
콘텐츠 벡터를 임베딩하여 질의와 비슷한 콘텐츠를 탐색하는 유사 벡터 검색(Similar Vector Search) 기술도 적용하고 있습니다.
뿐만 아니라, 미디어 에이전트는 검색된 콘텐츠를 적절하게 배열하는 랭킹 로직도 함께 적용하고 있습니다.
이 랭킹 로직은 사용자의 질의와 가장 관련성이 높은 콘텐츠를 상위에 배치하여 사용자에게 최적화된 순서로 결과를 제공하는 데 중요한 역할을 합니다.
그리고 일반적인 검색/추천 시스템에서 한발 더 나아가, 미디어 에이전트는 메타 데이터에 존재하지 않는 키워드까지도 확장하여 검색하는 기능을 제공하고 있습니다.
이는 사용자가 명확하게 정의하지 않았거나, 메타 데이터에 명시되어 있지 않은 숨겨진 의미나 맥락을 탐색하는 데 큰 도움을 줍니다.
대화형 에이전트는 그러한 미세 차이도 잡아내야 하기 때문입니다.
특히 사용자가 입력한 질의에서 발생할 수 있는 언어적 모호성이나 비정형화된 표현을 처리하는 데 있어 이 기능이 중요한 역할을 합니다.
임베딩 모델과 랭킹 로직은 매우 방대한 주제이기 때문에, 이를 깊이 다루기 위해서는 별도의 포스팅이 필요할 수 있습니다.
그래서 이번 포스팅에서는 이 두 가지 기술을 자세하게 소개하는 대신,
메타 데이터에 존재하지 않는 키워드를 자동으로 확장하여 검색할 수 있는 '시맨틱 임베딩 검색(Semantic Embedding Search)'을 간략하게 소개하려고 합니다.
이 방법은 사용자의 질의를 단순히 표면적인 키워드로만 처리하는 것이 아니라, 질의의 의미를 분석하여 검색과 추천에 필요한 메타 정보로 확장해 줍니다.
미디어 에이전트의 주요 기능 중 하나는 '테마 추천 기능'으로, 이는 특정 시간, 상황, 또는 분위기에 맞춘 콘텐츠 탐색을 가능하게 합니다.
예를 들어, '친구와 보기 좋은 영화'나 '비 오는 밤에 감상하기 좋은 영화'와 같은 추천이 이에 해당합니다.
이 기능의 핵심은 사용자가 정확한 콘텐츠를 찾는 것이 아니라, 탐색의 니즈를 다각적으로 반영한 질의를 통해 적합한 추천을 제공하는 데 있습니다.
그런데 만약 사용자가 '과학을 좋아하는 아이와 함께 볼 만한 영화 추천해줘'라고 요청할 경우, LLM은 '과학을 좋아하는 아이'라는 Entity를 추출하게 됩니다.
하지만 이 Entity는 기존의 메타데이터에는 정의되어 있지 않은 테마입니다.
그래서 이러한 Entity를 에이전트가 보유한 지식 체계로 변환해야 할 필요가 있으며, 이 과정에서 추가적인 확장 작업도 수반합니다.
이러한 변환과 확장 과정은 Transformer 기반의 Semantic Embedding 모델을 통해 수행됩니다.
이 모델은 사용자 질의를 의미적으로 분석하고, 관련된 콘텐츠를 보다 폭넓게 탐색할 수 있도록 돕습니다.
결과적으로, 미디어 에이전트는 사용자가 원하는 콘텐츠를 더욱 포괄적으로 추천할 수 있게 됩니다.
앞서 언급한 Proactive Prompt의 역할은, 미디어 에이전트의 사용자에게 적합한 콘텐츠나 질문을 먼저 제안하는 것입니다.
그리고 이는 선제적 추천(Proactive Recommendation)의 가장 중요한 과정입니다.
명확한 콘텐츠 탐색 의도가 없는 사용자의 경우, 이러한 선제적 추천은 콘텐츠 탐색에 중요한 역할을 할 수 있습니다.
이러한 선제적 추천의 역할은 주로 ‘선톡’ 기능을 통해 발현됩니다.
현재 에이닷의 미디어 에이전트는 '콘텐츠 선톡'과 '가이드 선톡' 등을 통해 사용자가 보다 쉽게 콘텐츠를 탐색할 수 있도록 돕고 있습니다.
콘텐츠 선톡은 사용자가 선호하는 콘텐츠를 먼저 제안하는 방식이며, 가이드 선톡은 사용자가 보다 구체적인 선택을 할 수 있도록 안내합니다.
지금 요일과 시간에 어울리는 선톡 추천인 '콘텍스트 선톡'을 제외하면, 현재의 선톡은 인기 콘텐츠를 추천해주는 것이 가장 주요한 기능이라고 할 수 있습니다.
하지만 미디어 에이전트는 개인화를 방향성으로 삼고 있기 때문에, 선톡 기능을 개인화하며 고도화 할 수 있는 새로운 기술을 도입중에 있습니다.
그래서 선택지 중 최적의 결정을 실시간으로 결정하는 알고리즘인 MAB(Multi-Armed Bandit)를 활용하여,
여러 가지 종류의 선톡 중 사용자에게 가장 받아들여질 확률이 높은 선톡을 제공하는 방식의 시스템을 개발중에 있습니다.
대화형 콘텐츠 탐색 경험은 단순히 콘텐츠를 나열하는 것이 아닌 사용자의 취향과 순간적인 필요에 따라 실시간으로 조정되는 시스템을 필요로 합니다.
이를 위해서 미디어 에이전트는 LLM을 고도화하여 더 깊이 있는 맥락 이해 능력을 갖추기 위한 노력을 기울이고 있습니다.
Semantic Search, LLM Fine-Tuning 등의 방법을 사용하여 사용자와의 상호작용에서 더 자연스러운 경험을 제공하는 방향으로 발전해 나가고 있습니다.
또한 콘텐츠 선톡과 가이드 선톡을 비롯한 Proactive Recommendation 기능과 더 자연스러운 대화를 제공하는 멀티 턴(Multi-Turn) 기능도 더욱 정교해져야 합니다.
앞으로도 미디어 에이전트는 더 나은 사용자 경험을 위해 노력할 것이며, 그 과정과 경험을 함께 나눌 수 있도록 하겠습니다.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.