23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
LLM 기반 데이터 리니지 활용 Impact Analysis 대화형 에이전트 기술 개발
Data Metadata, Query Log, Data Lineage 데이터를 External knowledge bases로 한 LLM 어플리케이션 개발
Domain Specific task에 대한 LLM 성능 개선, 비용 개선
Data Lake, Data Warehouse, RDB, OpenSearch 등등 데이터 플랫폼에서 접근 가능한 External Knowledge 들을 바탕으로 사용자 질의에 대한 적합한 응답 제공,
multi-turn 대화, Impact Analysis 제공이 가능한 Agent 개발
PB급 Data Lake의 Metadata Management Platform에서 Impact Analysis가 가능한 대화형 에이전트 기술 개발
PB급의 Data Lake의 Metadata Management Platform에서 동작하는 대화형 에이전트 서비스의 백엔드로 활용하고자 합니다.
Data Platform 운영 Agent 개발 과정에서 A2A 기술 적용을 통해 다른 Agent들과의 연계에 활용할 예정입니다.
LLM Application/Agent 개발 역량
LLM의 성능 개선을 이루어내본 역량(RAG {Naive, Advanced, Modular}, distillation, fine-tuning 등등..)
SQL, Python
Vector DB, Search Engine, 분산처리 시스템에 대한 관심
이름: 고정완
SK R&D 센터, Open AIX Lab, AI Data Platform팀
Data Engineer
MLOps
AI Data Platform 개발, LLMOps 플랫폼 개발
(구) 완성차 기업에서 차량 데이터를 기반으로 한 수집 및 적재 시스템을 설계하고, 안정적인 데이터 파이프라인을 구축한 경험이 있습니다.
(구) 음악 서비스 플랫폼과 음악 검색 엔진 개발에 참여하여, 사용자 중심의 서비스 기능을 구현경험이 있습니다.
이름: 안지훈
SK R&D 센터, Open AIX Lab, AI Data Platform팀
Data Engineer
AI Data Platform 개발, Metadata Management Platform 개발
LLMOps 플랫폼 개발
[배경]
데이터 중심의 의사결정을 가속화하고 정확성을 높이기 위해, 메타데이터 관리 플랫폼(Metadata Management Platform)은 데이터의 발견, 관리, 최적화 과정을 자동화하는 핵심적인 역할을 수행합니다. 하지만 데이터 환경은 끊임없이 변화하며, 특히 테이블 구조 변경과 같은 작업은 예상치 못한 다운스트림 영향(downstream impact)을 초래할 수 있습니다.
저희 프로젝트는 이러한 문제를 해결하기 위해 기존 메타데이터 관리 플랫폼에 LLM(Large Language Model) 기술을 접목하여, 지능적인 'Impact Analysis (영향 분석)' 기능을 제공하는 것을 목표로 합니다.
Impact Analysis 기능 소개
Impact Analysis는 메타데이터 관리 플랫폼 내에서 특정 테이블의 변경(예: 컬럼 추가/삭제, 타입 변경 등)이 발생했을 때, 해당 변경이 데이터 파이프라인, 대시보드, 머신러닝 모델 등 다른 데이터 자산에 미칠 수 있는 잠재적 영향을 자동으로 분석하고 그 결과를 명확하게 설명해 주는 기능입니다. 메타데이터 관리 플랫폼에 연동된 LLM 에이전트는 사용자의 자연어 질의나 특정 테이블 변경 시나리오에 맞춰 심층적인 영향 분석 정보를 제공합니다.
프로젝트의 기대 효과 및 사용자 가치
Impact Analysis 기능을 통해 데이터 플랫폼 사용자들은 다음과 같은 실질적인 가치를 얻을 수 있습니다.
데이터 엔지니어: 테이블 스키마 변경 등 데이터 수정 작업 시, 연결된 데이터 처리 과정이나 리포트 등에 발생할 수 있는 오류나 중단 가능성을 사전에 파악하고 최소화하여 안정적인 데이터 파이프라인 운영을 지원합니다.
데이터 사이언티스트: 모델 학습에 사용되는 데이터의 변경 이력을 추적하고, 이러한 변경이 모델 성능에 미칠 영향을 예측하여 성능 저하를 방지하고 데이터 변화에 신속하게 대응할 수 있도록 돕습니다.
데이터 플랫폼 운영자: 데이터 변경 요청에 대한 승인/거부 결정을 내릴 때, LLM이 생성한 객관적인 영향 분석 보고서를 기반으로 신속하고 정확한 판단을 내릴 수 있으며, 변경 관리 프로세스를 자동화하고 효율화할 수 있습니다.
궁극적으로 본 프로젝트는 데이터 변경에 따른 위험을 선제적으로 관리하고 데이터 자산의 신뢰도를 높여, 사용자들이 더욱 안심하고 데이터를 활용하며 데이터 기반 의사결정의 속도와 품질을 향상시키는 데 기여할 것입니다.
[목표]
데이터 메타데이터, 쿼리 로그, 리니지 정보와 LLM을 연동
데이터 리니지 기반의 자동화된 Impact Analysis(영향도 분석) 기능 제공
메타데이터 관리 플랫폼 내 Impact Analysis 대화형 에이전트 통합
[프로젝트 세부내용]
아래 그림은 제안하는 에이전트의 개념적 아키텍처를 보여줍니다.
핵심기능
자연어 질의응답: 사용자가 데이터 자산, 리니지 경로, 데이터 처리 과정 등에 대해 자연어로 질문하고 답변을 받을 수 있습니다.
RAG를 통해 Knowledge Base의 정보를 기반으로 답변을 생성합니다.
Impact Analysis:
Downstream Analysis: 특정 데이터 변경 시 영향을 받는 하위 데이터셋, 대시보드, 사용자 등을 식별합니다. (예: "이 테이블 변경 시 어떤 리포트가 깨지나요?")
Upstream Analysis: 특정 데이터가 어떤 원천 데이터로부터 어떻게 변환되어 생성되었는지 역추적합니다. (예: "이 대시보드 지표는 어떤 소스 테이블들로 만들어졌나요?")
Lineage Graph를 주 정보원으로 사용하며, RAG로 검색된 리니지 정보를 Impact Analysis Logic 또는 LLM의 추론 능력을 통해 분석합니다.
Multi-turn 대화: 복잡한 분석 요청 시, 에이전트가 사용자에게 추가 정보를 질문하거나 중간 분석 결과를 제시하며 대화를 통해 최종 목표를 명확히 합니다.
데이터 관리/분석 Domain Specific Task에 대한 LLM 성능 최적화
[본 프로젝트를 통해 Fellows 분들이 얻어 갈 수 있는 것]
성장의 기회
AI Application, AI Agent를 개발하고 실 서비스에 적용하는 과정에서 AI에 대해서 더 deep dive 하실 수 있습니다.
Agile 소프트웨어 개발 프로세스를 경험하실 수 있습니다.
명확한 목표가 존재하기 때문에 방법론 연구 및 실제 개발에 집중 할 수 있습니다.
실 서비스에 리서치 결과물 적용
실제 사내, 사외에서 운용중인 데이터플랫폼에 Fellows분들과 개발한 에이전트가 신규 기능으로 추가 될 예정입니다.
논문 투고
다양한 External Knowledge를 바탕으로 창의적인 RAG 방식 고안 또는 LLM 성능 개선을 시도해 보실 수 있습니다. 이 과정에서 리서치 결과물을 논문으로 작성해 투고할 수 있습니다.
현업 개발자들과 함께 문제를 풀어나가는 경험
AI 생태계는 하루가 다르게 빠르게 발전하고 있습니다. 그렇기 때문에 Fellows 분들이 멘토들 보다 더 많이 알고 더 최신의 지식을 알고 있을 수 있습니다.
AI Fellowship 과정을 통해 멘토인 저희도 Fellows 분들에게 많이 배우는 기회로 삼고 싶습니다.
단순히 멘토-멘티의 관계가 아닌 함께 어려운 문제를 해결해나가는 동료로써 이번 AI Fellowship 과정을 진행하고 싶습니다.
LLM Application/Agent 개발 경험이 있거나 관심이 있으신 분
창의적인 방법을 통해서 LLM 모델의 성능을 끌어올리는데 관심이 있으신 분
도메인 Specific 한 Task에 대해서 LLM의 성능을 높이는데 관심이 있으신 분.
Python, SQL을 활용할 수 있으신 분.
논문 투고 및 해외 학술지 게재 경험 보유.
내가 진행한 연구가 실제 서비스에 적용되고 사용자에게 Value를 제공하는 경험을 해보고 싶으신 분
[우대사항]
Vector DB, Search Engine, 분산처리 시스템에 대해서 높은 관심을 가지신 분.
데이터 파이프라인 구성 및 운영에 관심이 많으신 분.
개발을 위한 데이터는 제공 되나요?
→ 네 제공 됩니다. 또한 로그가 생성되는 클라우드 환경에 Fellows 분들이 엑세스 하실 수 있도록 조치할 예정입니다.
Fellows (참여자)에게 기대하는 주요 역할은 무엇인가요?
→ Fellows 분들의 주요 역할은 제공된 메타데이터와 LLM 기술을 활용하여 핵심적인 Impact Analysis 로직을 설계하고 개발하는 것입니다. 메타데이터 관리 플랫폼과의 연동, LLM 에이전트 구현, 그리고 생성된 분석 결과의 유효성 검증 및 개선 작업 등을 수행하게 됩니다.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.