23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요! 👋
저희는 SKT AI Fellowship 7기에서 "LLM 기반 데이터 리니지 활용 Impact Analysis 대화형 에이전트 기술 개발" 과제를 수행하고 있는 IA 팀입니다!
IA는 Impact Analysis의 머릿글자를 따서 지은 이름이에요. 이름처럼 인사이트풀한 문제를 분석하고 풀어내서 영향력 있는 팀이 되겠다는 포부를 담고 있습니다!
다음으로 본격적인 연구 과제를 소개하고 저희 팀이 그 과제를 어떻게 풀어나가려고 하는지에 대해서 자세히 적어보겠습니다.
현대의 데이터 플랫폼에서는 테이블 컬럼 하나만 바꿔도 대시보드가 깨지고, 모델이 실패하고, 그 책임은 누군가에게 돌아갑니다.
실제로 테이블 변경이 가져오는 영향(Impact)은 생각보다 광범위하지만, 이를 미리 예측하고 대응하는 것은 매우 어렵습니다.
기존 메타데이터 플랫폼은 단순한 시각화나 rule-based 검색에 의존하고 있어, 복잡한 데이터 흐름과 의미 기반 질의에는 제대로 대응하지 못하는 상황입니다.
이에 저희는 LLM과 Multi-Agent Framework를 활용한 대화형 Impact Analysis 시스템을 연구하고자 합니다.
저희 IA 팀의 핵심 목표는 PB급 규모의 Data Lake 환경에서 작동하는 LLM 기반 대화형 Impact Analysis Agent를 개발하는 것입니다.
이를 위해 메타데이터, 쿼리 로그, 데이터 리니지 그래프 등 다양한 소스를 활용하고, 이를 RAG(Retrieval-Augmented Generation) 기반 질의 처리로 통합하고자 합니다.
단순한 정적 분석이 아닌, 사용자와의 대화를 통해 점진적으로 정보의 정확도를 높이는 Multi-turn 대화형 분석 기능도 핵심 요소 중 하나입니다.
개발 중인 시스템은 크게 세 가지 주요 기능으로 구성되어 있습니다.
먼저, 자연어 질의응답 기능은 사용자가 “이 대시보드는 어떤 테이블로 만들어졌나요?”처럼 자연스럽게 묻는 질문에 대해, 시스템이 데이터 리니지 정보를 기반으로 적절한 답변을 제공하는 기능입니다.
복잡한 SQL이나 구조를 몰라도, 누구나 데이터를 탐색할 수 있도록 돕습니다.
두 번째는 Impact Analysis 기능입니다. 사용자가 특정 테이블의 변경을 고려하고 있을 때, 그 변경이 다른 자산에 어떤 영향을 줄 수 있는지 자동으로 분석해줍니다.
예를 들어, 테이블이 변경되면 어떤 대시보드가 깨지는지(Downstream 분석), 혹은 이 대시보드가 어떤 테이블에서 유래했는지(Upstream 분석)를 파악할 수 있습니다.
마지막으로, Multi-turn 대화 인터페이스는 단순 질의응답을 넘어, 시스템이 분석 도중 부족한 정보가 있으면 사용자에게 질문을 던지고, 추가 정보를 받아 분석을 이어나가는 구조로 되어 있습니다.
이를 통해 보다 정확하고 정교한 영향도 분석을 실현할 수 있습니다.
저희가 설계한 프레임워크는 총 세 가지 핵심 구성 요소로 이루어져 있습니다.
먼저, Multi-Agent 기반 질의 처리 구조를 통해 사용자의 질문은 하나의 거대한 단일 작업으로 처리되지 않습니다.
대신, 질의를 접수한 Router Agent가 이를 세분화된 JSON Task로 나누고, 각각의 Task를 적절한 역할을 가진 Metadata Agent 또는 Source Agent에게 분배합니다.
만약 사용자 질의에 부족한 정보가 있을 경우, 시스템은 “추가 정보가 필요합니다”와 같은 응답을 통해 대화를 이어갈 수 있도록 설계되어 있습니다.
다음은 Retrieval Tool 모듈 입니다. 정보 검색과 추론에 핵심적인 역할을 하는 Retrieval Agent는 세 가지 도구를 사용합니다.
첫 번째는 Vector Lineage Search로, job 요약 정보를 벡터화한 뒤, 의미 기반으로 유사한 lineage를 검색합니다. 이때 pgvector나 Elasticsearch를 활용합니다.
두 번째는 Text-to-DSL for Query Log로, 자연어 질의를 DSL 형식으로 변환하여 접근 로그에서 필요한 정보를 추출합니다.
세 번째는 Text-to-SQL for Metadata DB이며, 메타데이터 기반의 관계 분석을 위해 자연어를 SQL로 변환하는 기능을 수행합니다.
이렇게 수집된 검색 결과는 Re-Rank 단계를 거쳐 정제되며, 최종적으로 가장 관련성 높은 Top-k 결과만 사용자에게 제공됩니다.
마지막으로, 프레임워크 전반의 통신 및 자원 관리를 담당하는 아키텍처는 MCP + A2A 구조로 이루어져 있습니다.
MCP는 다양한 Tool과 Resource를 JSON 기반의 self-describing metadata 형태로 관리하며, 이로 인해 시스템 간 연동과 유지 보수가 용이해집니다.
A2A는 각 Agent의 역할, 입출력 스펙을 명확히 정의한 AgentCard를 기반으로 작동하며, Agent 간의 통신을 체계적으로 관리합니다.
모든 호출은 OAuth나 API Key 인증을 기반으로 진행되며, RBAC(Role-Based Access Control) 정책에 따라 접근 권한이 제어되어 보안성 또한 확보하고 있습니다.
시스템은 아래와 같은 흐름으로 동작합니다.
사용자가 질의 입력
A2A Server → Router Agent 전달
Router Agent는 Task 분해 및 적절한 Agent에게 분배
Retrieval Agent는 MCP Tool을 통해 정보 수집
응답은 Router Agent를 통해 통합되어 사용자에게 반환
저희 팀 IA는 기본적으로 실무형 프레임워크 설계를 지향합니다
단순 실험이 아니라 실제 서비스 적용을 위한 아키텍처 설계를 목표로 합니다.
연구적 깊이와 실용적 활용을 모두 고려하여 설계합니다.
저희는 연세대학교 BDAI 연구실 소속 석사과정 재학생 임채림, 황혜정과 연세대학교 응용통계학과 학부생 백준호로 이루어진 팀입니다.
팀원 모두 긴밀히 소통하며 연구의 완성도를 높이고자하는 열정을 공유하고 실제 서비스화 하는 것을 목표하고 있습니다.
(팀 IA가 데이터 리니지를 의미하는 밧줄을 들고 있는 이미지를 생성해봤습니다😃)
저희 팀은 단체카톡방 및 노션으로 소통하는 것을 원칙으로 삼고 있습니다!
전체 회의 뿐 아니라 일부 팀원들끼리의 소회의가 있는 경우에도 회의록을 작성하며 언제든지 팔로업 할 수 있도록 운영하고 있고요,
팀원들 각각의 스터디 자료는 따로 볼 수 있도록 리서치 자료를 모아두고 있습니다.
현재는 전체 시스템 구성과 핵심 기능을 설계하고, 각 모듈의 프로토타입을 구현하는 중입니다. 이후에는 실제 로그 데이터를 바탕으로:
Retrieval 정확도 개선
질의 분해(Task Planning) 성능 평가
Lineage 기반 영향도 분석 알고리즘 고도화
Rag 벤치마크 적용
를 단계적으로 수행할 계획입니다.
저희는 단순히 LLM을 호출하는 아키텍처를 설계하는 것이 아닌 UI/UX를 고려한 MultiAgentic 아키텍처를 구현하고자 합니다.
즉 데이터의 흐름을 읽고, 의미를 파악하고, 그로부터 실질적인 '변화'를 제안할 수 있는 Agent module을 만들고자합니다!
앞으로 IA 팀의 여정을 기대해주세요!
감사합니다 🤓
#연구기록 7기 #LLM #ImpactAnalysis #MetadataPlatform #AIF2025 #IA팀
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.