데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      데이터 지옥과 AI 천국을 오가는 여정

      chu 25.04.15
      1,777 7 1
      DEVOTEE 요약
      본 블로그는 AI와 데이터의 관계를 다루며, AI의 성공적인 활용은 높은 품질의 데이터를 필요로 한다는 점을 강조합니다. 데이터와 AI를 통합하는 과정에서 메타데이터 관리, 비즈니스 중심 중간지 DB 구축, RAG와 메모리 통합 접근 등 다양한 실험과 기법들이 시도되고 있습니다. 미래에는 AI가 단순한 어시스턴트 단계를 넘어 보다 자율적이고 지능적인 에이전트로 발전하도록 하는 것을 목표로 합니다.
      DEVOTEE 추천 블로그

      1. 천국과 지옥 사이: AI와 데이터 사이의 여정

      우연히 마주친 상징적 만화

      링크드인을 스크롤하다 우연히 2컷 만화를 마주쳤습니다. 데이터라는 지옥, AI 라는 천국이라는 컨셉의 이 만화는 단순하면서도 강렬한 메시지를 전달했습니다.

      첫 번째 컷에서는 구름이 가득한 하늘을 배경으로 사람이 편안하게 계단을 내려오고 있었습니다. 마치 천국에서 내려오는 듯한 이 모습은 AI를 활용하며 느끼는 행복감을 표현한 것 같았습니다.

      두 번째 컷은 불지옥 배경에서 사람이 힘겹게 계단을 올라가는 모습이었습니다. 데이터라는 세계에서 고생하는 사람의 모습을 담아냈습니다.

      링크드인에서 봤던 이미지는 간단한 그림체로 명확하게 의미 전달했는데 기억을 되살려 GPT-4o로 재현해보니 원본보단 강렬한 이미지가 만들어진 것 같습니다.

      나의 여정

      이 만화는 제 여정과 묘하게 겹쳐집니다. 현재 AI 플랫폼 개발을 담당하고 있지만, 이전에는 AccuInsight+ 빅데이터 플랫폼 개발을, 그 전에는 CRM / BI 솔루션 개발을 했습니다.

      지금은 AI를 모든 업무에 적용하려 노력하고 있지만 AI만으로는 충분하지 않다는 것을 깨달았습니다.

      AI가 제대로 작동하기 위해서는 그 기반이 되는 데이터에 대한 깊은 이해가 필수적입니다.

      우선 업무 프로세스를 이해해야 하고 그 업무에서 생성되는 데이터의 본질을 파악해야 하며, 이를 효과적으로 활용할 수 있는 단계까지 나아가야 합니다.

      AI의 마법의 원천은 양질의 데이터라는 개념을 표현한 이미지

      프롬프트:
      다음 문구를 표현해주세요. 만화풍으로 이미지를 만들고 싶습니다.
      "결국, AI는 마법처럼 보이지만, 그 마법의 원천은 결국 양질의 데이터입니다."


      2. 프로젝트로 보는 데이터의 다양한 모습

      차세대 경영정보 시스템 구축: AI의 매력과 현실

      처음 프로젝트에서는 더미 데이터로 AI를 활용해 목업 화면, 자동 코드 생성, 차트 구성 등 아이디어를 확장하는 과정이 흥미로웠습니다.

      하지만 곧 현실의 벽에 부딪혔습니다. AI는 보편적 용어를 사용하는 반면, 프로젝트에서는 전문화된 용어가 사용되었습니다.

      "현재 내용과 맞지 않는데?"라는 피드백이 이어졌고, 프롬프트에 메타 정보를 지속적으로 입력해야 했습니다.

      이 경험을 통해 AI에게 프로젝트 관련 정보성 데이터를 우선 구성하고, 원천 DB가 아닌 중간지 DB를 구성해야 한다는 필요성을 인식했습니다.

      경영정보 시스템 목업 이미지

      금융향 AI Coding Assistant: 도메인 지식의 중요성

      Microsoft Copilot과 유사한 sLLM 기반 AI 코딩 개발 과정에서도 새로운 도전이 있었습니다.

      자연어 기반 쿼리 생성(Text2SQL)과 NEXCORE 프레임워크 기반 코드 생성이 실제 업무 수준에 완전히 부합하지 않았습니다.

      금융권에서는 메타정보를 별도 관리하고 있었고, SQL 개발 가이드와 프레임워크 운영 가이드 준수가 필수였습니다.

      해결책으로 RAG를 통한 가이드 지식화와 MetaStore를 도입한 도메인 특화 메타데이터 통합 관리 시스템 구축이 필요했습니다.

      조달청 차세대 나라장터: 데이터 이행의 미로

      입찰심사 파트에서 데이터 이행 과정 중 "데이터 지옥"을 경험했습니다.

      AS-IS에서 TO-BE로의 마이그레이션에서 데이터 구조 차이, 맥락 파악 불가능한 불완전한 데이터, 잦은 법령 변경으로 인한 테이블 구조와 코드 체계 변경이 주요 문제였습니다.

      매핑 정의서만으로는 데이터 관계 파악과 무결성 유지가 어려웠고, 업무 담당자들의 잦은 변경으로 오래된 데이터의 생성 배경이나 특수 처리 로직을 아는 사람이 없는 경우도 많았습니다.

      결국 특정 시점의 일부 데이터만 이행하는 절충안을 채택했으며, 이 과정에서 데이터 이행이 단순 기술 문제가 아닌 업무 이해, 법규 변화, 조직 문화가 얽힌 총체적 도전임을 깨달았습니다.

      조달청 나라장터 업무흐름도


      3. 반복되는 패턴: 데이터 지옥의 공통점

      언어의 장벽: 도메인 지식과 메타데이터의 불일치

      "언어"라는 문제가 있습니다. AI가 이해하는 보편적, 사전적 언어는 비즈니스 도메인의 언어와 다릅니다.

      시스템마다 동일한 개념을 다른 용어로 표현하고 있으며 같은 용어라도 맥락에 따라 완전히 다른 의미를 가집니다. 이 언어의 장벽은 단순한 용어 사전으로는 해결되지 않습니다.

      용어의 의미는 컨텍스트에 의존하고 도메인 지식과 비즈니스 규칙이 복잡하게 얽혀있기 때문입니다.

      도메인의 개념과 관계를 포함한 종합적인 메타데이터 관리 체계가 필수적입니다.

      구조적 간극: 원천 데이터와 비즈니스 관점의 불일치

      원천 데이터의 기술적 구조와 비즈니스 의사결정에 필요한 데이터 사이에서 간극이 존재합니다.

      원천 데이터베이스는 주로 트랜잭션 처리와 운영 효율성을 위해 설계되어 있어 분석과 의사결정에 직접 활용하기 어려운 구조를 가집니다. 특히 LLM과 연계할 때 이 문제는 두드러집니다.

      원천 데이터를 직접 조회하여 컨텍스트로 제공하려 할 경우 데이터 양이 방대하여 입력 토큰 제한을 초과하는 문제가 발생합니다.

      또한 필터가 없는 원본 데이터는 불필요한 정보가 많아 토큰을 낭비하고 AI의 이해를 방해합니다.

      원천 데이터와 활용 지점 사이에 비즈니스 관점으로 재구성된 중간 계층이 필요하고, OLAP 데이터 마트와 같은 주제 중심적 접근이 AI와의 통합에 효과적임을 확인했습니다.

      진화의 필요성: 사용자 기대와 검색 결과의 불일치

      사용자들이 정보를 검색할 때, 이미 마음속에 '정답'을 가지고 검색하는 경향과 시스템이 제공하는 결과 사이의 근본적 불일치가 발생합니다.

      검색 시스템이 판단하기에 객관적인 관련성에 기반하여 결과를 제공하지만, 사용자들은 자신이 기대하는 특정 답변이나 정보를 찾고자 합니다.

      이러한 기대는 사용자마다 다르고 시간이 지남에 따라 변합니다. 동일한 검색어도 사용자의 역할, 부서, 업무 맥락에 따라 전혀 다른 기대를 담고 있습니다.

      이 패턴은 단순히 검색 알고리즘을 개선하는 것을 넘어 각 사용자의 개인적인 특징을 고려한 맥락 파악과 과거 사용 패턴을 이해하고 학습하는 메커니즘이 필요합니다.

      시스템은 "무엇이 객관적으로 이 질의와 관련있는가"가 아니라 "사용자는 이 질의로 무엇을 찾고자 하는가"를 이해해야 합니다.


      4. 데이터와 AI의 공존: 현재 진행 중인 실험과 접근법

      메타데이터 중심 접근: 메타스토어 구축

      데이터와 AI 통합의 핵심은 메타데이터의 효과적인 관리에 있습니다. Apache Atlas의 아키텍처를 참고해 도메인 특화 메타스토어를 구축했습니다.

      메타스토어는 LLM이 실제로 필요로 하는 메타데이터만을 선택적으로 관리하는 컨셉으로 설계되었습니다.

      주요 기능으로는 테이블/컬럼 상세 설명과 DB 접속정보를 관리하는 '데이터베이스 객체 관리', 용어와 공통코드를 수집하고 관리하는 '메타데이터 수집',

      그리고 시스템 화면 정보를 메타데이터화하여 검색 기능을 제공하는 '화면 메타 정의' 기능이 있습니다.

      이를 통해 도메인별 메타데이터의 통합 관리, 표준화, 일관성 유지가 가능해졌고, AI가 필요한 메타데이터를 효과적으로 활용할 수 있는 기반을 마련했습니다.

      향후 데이터 흐름을 추적하고 관리하는 '데이터 계보 관리' 기능도 구축할 예정입니다.

      Apache Atlas 아키텍처

      비즈니스 중심 중간지 DB 설계: 효율적인 데이터 활용을 위한 접근

      원천 데이터와 AI 활용 사이의 간극을 해소하기 위해, 중간지 DB 컨셉을 도입하여 LLM의 효율적인 데이터 활용을 지원했습니다.

      중간지 DB의 핵심은 필요한 데이터만 선별적으로 제공하는 것입니다.

      원천 데이터의 모든 행과 열을 LLM에 제공하는 대신, 필수적인 레코드만 추출하고 불필요한 컬럼을 제거하여 토큰 수를 최적화했습니다.

      이는 마치 오라클의 VIEW 테이블과 유사한 개념으로, 원본 데이터는 그대로 두면서 LLM이 효율적으로 접근할 수 있는 중간 레이어를 제공합니다.

      OLAP 큐브 형식의 접근법도 부분적으로 활용했습니다. 업무 도메인별 핵심 정보를 집약하고 데이터 간의 관계를 단순화하여, LLM이 보다 직관적으로 데이터를 이해하고 처리할 수 있도록 했습니다.

      이러한 중간지 DB는 LLM의 프롬프트에 포함될 데이터의 양을 효과적으로 제어하고, 비즈니스 관점에서 의미 있는 구조를 제공함으로써 LLM이 더 정확하고 관련성 높은 응답을 생성할 수 있게 했습니다.

      지식 DB의 지속적 진화: RAG와 메모리의 통합 접근

      기본 RAG 시스템에서 한 단계 더 나아가 사용자 의도를 정확히 파악하는 접근법을 도입했습니다.

      RAG 구조만으로는 사용자가 명확히 표현하지 않은 의도나 맥락을 파악하는 데 한계가 있었습니다.

      이를 개선하기 위해 LangChain의 Memory기능을 활용했습니다. 대화 기록을 유지하고, 사용자 검색 패턴을 분석하며, 피드백을 기반으로 검색 결과를 최적화했습니다.

      이 접근법은 단순 질의응답을 넘어 사용자의 실제 의도 파악에 중점을 둡니다. 시스템이 맥락을 이해하고 학습함에 따라 검색 결과의 정확성과 관련성이 점진적으로 향상됩니다.

      LangChain Memory 서비스 플로우

      5. 천국과 지옥을 오가는 앞으로의 여정

      진화의 단계: Assistant에서 Agent로

      현재 차세대 경영정보 시스템 구축 프로젝트를 수행하며, AI 시스템의 명확한 진화 단계를 인식하게 되었습니다.

      • Assistant: 사용자 질의에 응답하고 요청에 반응하는 단계

      • Advisor: 맥락을 이해하고 사용자 의도에 따라 지능적인 제안을 제공하는 단계

      • Agent: 시스템이 자율적으로 판단하고 행동하며, 사용자를 대신해 복잡한 작업을 수행하는 단계

      현재 우리는 Assistant에서 Advisor로 전환되는 과정에 있으며, 궁극적으로는 Agent 단계의 완전한 구현을 목표로 하고 있습니다.

      단순히 요청에 응답하는 시스템이 아닌, 사용자의 의도를 깊이 이해하고 자율적으로 행동하는 진정한 지능형 조력자를 만들고자 합니다.

      데이터와 AI의 균형: 앞으로의 여정

      데이터와 AI는 별개의 영역이 아닌, 함께 발전해야 할 상호보완적 요소임을 경험을 통해 깨달았습니다. 앞으로 초점을 맞추고자 하는 두 가지 핵심 영역은 다음과 같습니다.

      1. 다중 에이전트 협업 - 각각 전문 영역을 가진 여러 AI가 함께 문제를 해결하는 시스템을 구축하여 보다 복잡한 비즈니스 문제에 대응하고자 합니다.

      2. 지능형 데이터 관리 - 데이터 품질과 메타데이터를 지속적으로 개선하고, 사용자와 시스템이 함께 학습하며 발전하는 체계를 구현하고자 합니다.

      저는 앞으로의 목표를 최종 목적지에 도달하는 것 보다 여정을, 답보다 질문을, 완벽함보다 지속적 학습을 추구하는 마음가짐으로 데이터 지옥과 AI 천국 사이를 오가려 합니다.

      앞으로도 발견한 통찰과 경험을 블로그를 통해 계속 공유할 예정입니다.


      부록

      참고 자료

      핵심 용어 정리

      용어

      카테고리

      설명

      AI (Artificial Intelligence)

      기술

      인간의 학습, 추론, 자기 개선 능력 등을 컴퓨터로 구현하는 기술

      LLM (Large Language Model)

      기술

      GPT 등과 같이 대규모 텍스트 데이터로 학습된 언어 모델

      RAG (Retrieval-Augmented Generation)

      기술

      외부 지식을 검색하여 LLM의 응답 생성을 보강하는 기술

      Text2SQL

      기술

      자연어를 SQL 쿼리로 변환하는 기술

      메타스토어(MetaStore)

      데이터 관리

      메타데이터를 체계적으로 저장하고 관리하는 시스템

      중간지 DB

      데이터 아키텍처

      원천 데이터와 AI 사이의 간극을 해소하기 위한 중간 계층 데이터베이스

      OLAP (Online Analytical Processing)

      데이터 분석

      다차원 데이터 분석을 위한 처리 방식

      도메인 지식(Domain Knowledge)

      지식 관리

      특정 분야나 업무에 특화된 전문적 지식

      Apache Atlas

      플랫폼

      기업 데이터 거버넌스를 위한 오픈소스 메타데이터 관리 플랫폼

      LangChain

      플랫폼

      대형 언어 모델 기반 애플리케이션 개발을 위한 프레임워크

      NEXCORE

      플랫폼

      금융권에서 사용되는 개발 프레임워크

      나라장터

      시스템

      조달청의 전자조달시스템

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      chu 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기