23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
링크드인을 스크롤하다 우연히 2컷 만화를 마주쳤습니다. 데이터라는 지옥, AI 라는 천국이라는 컨셉의 이 만화는 단순하면서도 강렬한 메시지를 전달했습니다.
첫 번째 컷에서는 구름이 가득한 하늘을 배경으로 사람이 편안하게 계단을 내려오고 있었습니다. 마치 천국에서 내려오는 듯한 이 모습은 AI를 활용하며 느끼는 행복감을 표현한 것 같았습니다.
두 번째 컷은 불지옥 배경에서 사람이 힘겹게 계단을 올라가는 모습이었습니다. 데이터라는 세계에서 고생하는 사람의 모습을 담아냈습니다.
링크드인에서 봤던 이미지는 간단한 그림체로 명확하게 의미 전달했는데 기억을 되살려 GPT-4o로 재현해보니 원본보단 강렬한 이미지가 만들어진 것 같습니다.
이 만화는 제 여정과 묘하게 겹쳐집니다. 현재 AI 플랫폼 개발을 담당하고 있지만, 이전에는 AccuInsight+ 빅데이터 플랫폼 개발을, 그 전에는 CRM / BI 솔루션 개발을 했습니다.
지금은 AI를 모든 업무에 적용하려 노력하고 있지만 AI만으로는 충분하지 않다는 것을 깨달았습니다.
AI가 제대로 작동하기 위해서는 그 기반이 되는 데이터에 대한 깊은 이해가 필수적입니다.
우선 업무 프로세스를 이해해야 하고 그 업무에서 생성되는 데이터의 본질을 파악해야 하며, 이를 효과적으로 활용할 수 있는 단계까지 나아가야 합니다.
프롬프트:
다음 문구를 표현해주세요. 만화풍으로 이미지를 만들고 싶습니다.
"결국, AI는 마법처럼 보이지만, 그 마법의 원천은 결국 양질의 데이터입니다."처음 프로젝트에서는 더미 데이터로 AI를 활용해 목업 화면, 자동 코드 생성, 차트 구성 등 아이디어를 확장하는 과정이 흥미로웠습니다.
하지만 곧 현실의 벽에 부딪혔습니다. AI는 보편적 용어를 사용하는 반면, 프로젝트에서는 전문화된 용어가 사용되었습니다.
"현재 내용과 맞지 않는데?"라는 피드백이 이어졌고, 프롬프트에 메타 정보를 지속적으로 입력해야 했습니다.
이 경험을 통해 AI에게 프로젝트 관련 정보성 데이터를 우선 구성하고, 원천 DB가 아닌 중간지 DB를 구성해야 한다는 필요성을 인식했습니다.
Microsoft Copilot과 유사한 sLLM 기반 AI 코딩 개발 과정에서도 새로운 도전이 있었습니다.
자연어 기반 쿼리 생성(Text2SQL)과 NEXCORE 프레임워크 기반 코드 생성이 실제 업무 수준에 완전히 부합하지 않았습니다.
금융권에서는 메타정보를 별도 관리하고 있었고, SQL 개발 가이드와 프레임워크 운영 가이드 준수가 필수였습니다.
해결책으로 RAG를 통한 가이드 지식화와 MetaStore를 도입한 도메인 특화 메타데이터 통합 관리 시스템 구축이 필요했습니다.
입찰심사 파트에서 데이터 이행 과정 중 "데이터 지옥"을 경험했습니다.
AS-IS에서 TO-BE로의 마이그레이션에서 데이터 구조 차이, 맥락 파악 불가능한 불완전한 데이터, 잦은 법령 변경으로 인한 테이블 구조와 코드 체계 변경이 주요 문제였습니다.
매핑 정의서만으로는 데이터 관계 파악과 무결성 유지가 어려웠고, 업무 담당자들의 잦은 변경으로 오래된 데이터의 생성 배경이나 특수 처리 로직을 아는 사람이 없는 경우도 많았습니다.
결국 특정 시점의 일부 데이터만 이행하는 절충안을 채택했으며, 이 과정에서 데이터 이행이 단순 기술 문제가 아닌 업무 이해, 법규 변화, 조직 문화가 얽힌 총체적 도전임을 깨달았습니다.
"언어"라는 문제가 있습니다. AI가 이해하는 보편적, 사전적 언어는 비즈니스 도메인의 언어와 다릅니다.
시스템마다 동일한 개념을 다른 용어로 표현하고 있으며 같은 용어라도 맥락에 따라 완전히 다른 의미를 가집니다. 이 언어의 장벽은 단순한 용어 사전으로는 해결되지 않습니다.
용어의 의미는 컨텍스트에 의존하고 도메인 지식과 비즈니스 규칙이 복잡하게 얽혀있기 때문입니다.
도메인의 개념과 관계를 포함한 종합적인 메타데이터 관리 체계가 필수적입니다.
원천 데이터의 기술적 구조와 비즈니스 의사결정에 필요한 데이터 사이에서 간극이 존재합니다.
원천 데이터베이스는 주로 트랜잭션 처리와 운영 효율성을 위해 설계되어 있어 분석과 의사결정에 직접 활용하기 어려운 구조를 가집니다. 특히 LLM과 연계할 때 이 문제는 두드러집니다.
원천 데이터를 직접 조회하여 컨텍스트로 제공하려 할 경우 데이터 양이 방대하여 입력 토큰 제한을 초과하는 문제가 발생합니다.
또한 필터가 없는 원본 데이터는 불필요한 정보가 많아 토큰을 낭비하고 AI의 이해를 방해합니다.
원천 데이터와 활용 지점 사이에 비즈니스 관점으로 재구성된 중간 계층이 필요하고, OLAP 데이터 마트와 같은 주제 중심적 접근이 AI와의 통합에 효과적임을 확인했습니다.
사용자들이 정보를 검색할 때, 이미 마음속에 '정답'을 가지고 검색하는 경향과 시스템이 제공하는 결과 사이의 근본적 불일치가 발생합니다.
검색 시스템이 판단하기에 객관적인 관련성에 기반하여 결과를 제공하지만, 사용자들은 자신이 기대하는 특정 답변이나 정보를 찾고자 합니다.
이러한 기대는 사용자마다 다르고 시간이 지남에 따라 변합니다. 동일한 검색어도 사용자의 역할, 부서, 업무 맥락에 따라 전혀 다른 기대를 담고 있습니다.
이 패턴은 단순히 검색 알고리즘을 개선하는 것을 넘어 각 사용자의 개인적인 특징을 고려한 맥락 파악과 과거 사용 패턴을 이해하고 학습하는 메커니즘이 필요합니다.
시스템은 "무엇이 객관적으로 이 질의와 관련있는가"가 아니라 "사용자는 이 질의로 무엇을 찾고자 하는가"를 이해해야 합니다.
데이터와 AI 통합의 핵심은 메타데이터의 효과적인 관리에 있습니다. Apache Atlas의 아키텍처를 참고해 도메인 특화 메타스토어를 구축했습니다.
메타스토어는 LLM이 실제로 필요로 하는 메타데이터만을 선택적으로 관리하는 컨셉으로 설계되었습니다.
주요 기능으로는 테이블/컬럼 상세 설명과 DB 접속정보를 관리하는 '데이터베이스 객체 관리', 용어와 공통코드를 수집하고 관리하는 '메타데이터 수집',
그리고 시스템 화면 정보를 메타데이터화하여 검색 기능을 제공하는 '화면 메타 정의' 기능이 있습니다.
이를 통해 도메인별 메타데이터의 통합 관리, 표준화, 일관성 유지가 가능해졌고, AI가 필요한 메타데이터를 효과적으로 활용할 수 있는 기반을 마련했습니다.
향후 데이터 흐름을 추적하고 관리하는 '데이터 계보 관리' 기능도 구축할 예정입니다.
원천 데이터와 AI 활용 사이의 간극을 해소하기 위해, 중간지 DB 컨셉을 도입하여 LLM의 효율적인 데이터 활용을 지원했습니다.
중간지 DB의 핵심은 필요한 데이터만 선별적으로 제공하는 것입니다.
원천 데이터의 모든 행과 열을 LLM에 제공하는 대신, 필수적인 레코드만 추출하고 불필요한 컬럼을 제거하여 토큰 수를 최적화했습니다.
이는 마치 오라클의 VIEW 테이블과 유사한 개념으로, 원본 데이터는 그대로 두면서 LLM이 효율적으로 접근할 수 있는 중간 레이어를 제공합니다.
OLAP 큐브 형식의 접근법도 부분적으로 활용했습니다. 업무 도메인별 핵심 정보를 집약하고 데이터 간의 관계를 단순화하여, LLM이 보다 직관적으로 데이터를 이해하고 처리할 수 있도록 했습니다.
이러한 중간지 DB는 LLM의 프롬프트에 포함될 데이터의 양을 효과적으로 제어하고, 비즈니스 관점에서 의미 있는 구조를 제공함으로써 LLM이 더 정확하고 관련성 높은 응답을 생성할 수 있게 했습니다.
기본 RAG 시스템에서 한 단계 더 나아가 사용자 의도를 정확히 파악하는 접근법을 도입했습니다.
RAG 구조만으로는 사용자가 명확히 표현하지 않은 의도나 맥락을 파악하는 데 한계가 있었습니다.
이를 개선하기 위해 LangChain의 Memory기능을 활용했습니다. 대화 기록을 유지하고, 사용자 검색 패턴을 분석하며, 피드백을 기반으로 검색 결과를 최적화했습니다.
이 접근법은 단순 질의응답을 넘어 사용자의 실제 의도 파악에 중점을 둡니다. 시스템이 맥락을 이해하고 학습함에 따라 검색 결과의 정확성과 관련성이 점진적으로 향상됩니다.
현재 차세대 경영정보 시스템 구축 프로젝트를 수행하며, AI 시스템의 명확한 진화 단계를 인식하게 되었습니다.
Assistant: 사용자 질의에 응답하고 요청에 반응하는 단계
Advisor: 맥락을 이해하고 사용자 의도에 따라 지능적인 제안을 제공하는 단계
Agent: 시스템이 자율적으로 판단하고 행동하며, 사용자를 대신해 복잡한 작업을 수행하는 단계
현재 우리는 Assistant에서 Advisor로 전환되는 과정에 있으며, 궁극적으로는 Agent 단계의 완전한 구현을 목표로 하고 있습니다.
단순히 요청에 응답하는 시스템이 아닌, 사용자의 의도를 깊이 이해하고 자율적으로 행동하는 진정한 지능형 조력자를 만들고자 합니다.
데이터와 AI는 별개의 영역이 아닌, 함께 발전해야 할 상호보완적 요소임을 경험을 통해 깨달았습니다. 앞으로 초점을 맞추고자 하는 두 가지 핵심 영역은 다음과 같습니다.
다중 에이전트 협업 - 각각 전문 영역을 가진 여러 AI가 함께 문제를 해결하는 시스템을 구축하여 보다 복잡한 비즈니스 문제에 대응하고자 합니다.
지능형 데이터 관리 - 데이터 품질과 메타데이터를 지속적으로 개선하고, 사용자와 시스템이 함께 학습하며 발전하는 체계를 구현하고자 합니다.
저는 앞으로의 목표를 최종 목적지에 도달하는 것 보다 여정을, 답보다 질문을, 완벽함보다 지속적 학습을 추구하는 마음가짐으로 데이터 지옥과 AI 천국 사이를 오가려 합니다.
앞으로도 발견한 통찰과 경험을 블로그를 통해 계속 공유할 예정입니다.
용어 | 카테고리 | 설명 |
|---|---|---|
AI (Artificial Intelligence) | 기술 | 인간의 학습, 추론, 자기 개선 능력 등을 컴퓨터로 구현하는 기술 |
LLM (Large Language Model) | 기술 | GPT 등과 같이 대규모 텍스트 데이터로 학습된 언어 모델 |
RAG (Retrieval-Augmented Generation) | 기술 | 외부 지식을 검색하여 LLM의 응답 생성을 보강하는 기술 |
Text2SQL | 기술 | 자연어를 SQL 쿼리로 변환하는 기술 |
메타스토어(MetaStore) | 데이터 관리 | 메타데이터를 체계적으로 저장하고 관리하는 시스템 |
중간지 DB | 데이터 아키텍처 | 원천 데이터와 AI 사이의 간극을 해소하기 위한 중간 계층 데이터베이스 |
OLAP (Online Analytical Processing) | 데이터 분석 | 다차원 데이터 분석을 위한 처리 방식 |
도메인 지식(Domain Knowledge) | 지식 관리 | 특정 분야나 업무에 특화된 전문적 지식 |
Apache Atlas | 플랫폼 | 기업 데이터 거버넌스를 위한 오픈소스 메타데이터 관리 플랫폼 |
LangChain | 플랫폼 | 대형 언어 모델 기반 애플리케이션 개발을 위한 프레임워크 |
NEXCORE | 플랫폼 | 금융권에서 사용되는 개발 프레임워크 |
나라장터 | 시스템 | 조달청의 전자조달시스템 |
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.