23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요 OpenLab-Knowledge Graph 참여하고 있는 김지영입니다😃
저는 대학원에서 자연어처리를 공부하고 있는데요.
지식그래프(온톨로지)를 이용해 언어 모델의 정확도를 높일 수 있을지에 관해 관심을 가지고 스터디에 참여하게 되었습니다!
관심 있다고는 했지만 사실 지식그래프에 대해 자세히 배워본 적이 없어서 걱정이 많았는데요.
마침 저희 팀 홍수님께서 OT 느낌으로 지식그래프가 무엇인지에 대해 발표해주셨습니다.
저는 이 설명이 지식그래프를 이해하는 데 도움이 많이 돼서 제가 이해한 내용을 바탕으로 발표 내용을 포스팅을 해보겠습니다
제가 잘못 이해한 부분이 있다면 편하게 말씀해주세요! 피드백은 언제나 환영입니다🙌🏻
다양한 출처의 지식을 통합하기 위해서는 지식 표현 체계가 필요합니다.
그럼 어떻게 지식을 표현해야지 사람들이 지식을 공유해서 같이 쓸 수 있을까에 대한 고민을 하게 되는데, 이것을 하기 위한 도구가 바로 지식그래프입니다.
즉, 지식그래프는 다양한 지식을 통합하기 위한 도구로 정의할 수 있습니다.
그렇다면 저희는 다양한 지식을 통합해서 무엇을 하려고 했을까요? 아래 홍수님의 PPT인 Fig 1을 보며 설명드리겠습니다.
Fig 1 Kowledge Graph PPT
KRR이란 정보를 기계가 이해할 수 있도록 표현(Representation)하고, 추론(Reasoning)을 통해서 새로운 지식을 발견하고자 하는 연구입니다.
이 개념을 보면 AI가 하고자 하는 일이 바로 KRR임을 떠올릴 수 있습니다.
그래서 지금 많이 사용하고 있는 ML 이전 심볼릭 AI를 사용할 때부터 AI에서 지식을 표현하는 것이 중요하다는 사실을 인지했었고,
KRR을 통해 지식을 통합해서 새로운 지식을 얻고 활용하려고 노력했었습니다.
그럼 이제 Fig 1 왼쪽 상단에 KRR과 연결된 개념들에 대해 설명해보겠습니다.
먼저 온톨로지는 데이터베이스, 인공지능, 자연어 처리 등 다양한 분야에서 지식을 효율적으로 관리하기 위해 개체들 간의 관계를 정의하는 기술입니다.
온톨로지라는 용어는 20세기 초반 아니 그보다 훨씬 전부터 사용 왔다고 합니다. 지금과는 다른 개념으로 사용되었다고 합니다.
그러다 1990년대 WEB의 등장으로 IT 세계가 크게 변화하기 시작했는데요. 온톨로지 또한 웹을 만나고 변혁이 되기 시작했습니다.
그전까지는 로직 기반의 구문 온톨로지였다면, WEB 등장 이후로는 마크업 언어(XML, HTML..) 기반의 온톨로지가 만들어지기 시작했습니다.
이러한 온톨로지의 변화로 우리는 RDF라는 지식 표현 체계를 사용하게 되었습니다.
참고로 RDF(Resource Description Framework)는 지식을 표현하기 위한 프레임워크입니다. 요즘 온톨로지로 표현하는 것들은 대부분 RDF 형태로 나오고 있습니다.
KRR이 쭉 이어져 오다가 어느 순간 Linked Data라는 개념이 등장하게 됩니다.
Linked Data는 웹상에 존재하는 데이터를 개별 URI(Uniform Resource Identifier)로 식별하고, 각 URI에 링크 정보를 부여함으로써 상호 연관된 웹을 만드는 모형입니다.
WEB은 문서 중심이 아닌 데이터 중심으로 연결되어, 하나의 글로벌하고 거대한 데이터베이스가 되기를 지향하며 탄생한 개념입니다.
그래서 Fig 1 오른쪽 상단에 Linked Data와 WEB이 연결된 모습을 볼 수 있습니다.
Linked Data와 연결된 나머지 개념들도 설명하겠습니다. RDF는 WEB에서 나온 온톨로지, 지식, 또는 정보를 표현하기 위한 언어입니다.
이러한 RDF로 표현한 Linked Data를 사용함으로써, 사람들은 서로 다른 데이터를 접근, open, 활용할 수 있게 됩니다.
이때부터 데이터 활용에 대한 관점이 변화하기 시작했으며, 2010부터 Linked Data를 공공적으로 많이 사용하기 시작했다고 합니다.
여기까지 정리하면 KRR, Linked Data는 다양한 출처의 데이터를 통합하기 위해 등장한 기술임을 알 수 있습니다.
FAIR Data는 검색, 접근, 상호운영, 그리고 재사용이 가능해야 한다는 데이터 원칙에 대해 얘기하는 데이터입니다.
이러한 원칙은 결국 모두가 데이터를 공유할 수 있게 만드는 데에 목적이 있습니다. FAIR와 연결된 node로는 접근, 활용, 공유, 데이터 확장 등이 있는데요.
FAIR Data의 원칙을 생각하면 자연스러게 이해가 되실거래 생각합니다.
RDF와 공유가 연결된 이유는 데이터를 공유하려고 하면 데이터를 동일한 의미로 이해하고 사용하게끔 만들 수 있는 언어가 필요한데,
이때 RDF를 주로 사용하기에 두 node가 서로 연결되었습니다. XML도 훌륭한 언어이긴 하지만 이를 많이 보완한 것이 RDF라고 합니다.
Network Analysis는 수학적인 그래프 기술을 사용하여 연결된 항목들 간의 상호작용을 이해하고 모델링하는 과정입니다.
데이터 활용에 앞서 데이터를 저장하는 DBMS(Database Management System)라는 기술이 있는데,
RDB(Relational Database)는 DBMS의 한 유형으로 데이터 저장의 대부분을 차지했었습니다.
그러다 다양한 출처의 데이터를 분석, 통합하기 위해서 그래프가 RDB보다는 뛰어나다는 것을 인지하기 시작했고,
그래프 구조의 데이터를 그래프 데이터베이스에 넣어서 관계를 생성하고 사용하기 시작했다고 합니다.
LLM이란 대규모의 데이터를 학습하여 인간의 언어를 이해하고 생성할 수 있는 머신 러닝 모델입니다.
ChatGPT를 사용해보신 분들은 아시겠지만 LLM은 부정확하거나 조작된 답변을 생성하는 환각(Hallucination) 문제를 갖습니다.
그래서 이러한 부정확한 답변을 개선하는 것이 중요한 과제입니다.
정확한 사실에 기반한 답변을 얻기 위한 방법으로 RAG등장했으며, 관계를 기반으로 더 정확한 대다을 이끌어낼 수 있는 GraphRAG를 생각하게 되었습니다.
관계를 기반으로 context 증강을 사용하면 연결된 정보만을 사용할 수 있으니 주제에서 벗어나지 않고, 조작되지 않은 답변을 생성할 수 있을 것입니다.
여기까지 홍수님의 발표였는데요. 시간이 지날수록 배가 고파져서,,,, 집중력이 좀 떨어졌습니다. 뒷부분 갈수록 내용이 부실하네요🥲
그래도 홍수님 덕에 지식그래프가 무엇인지, 지식그래프와 연관된 개념으론 무엇이 있는지 정리할 수 있어서 정말 도움이 많이 되었습니다!!!
발표가 다 끝나고 다 같이 햄버거 먹으면서 사담도 나눴는데요. 다들 너무 멋지시고, 친절하시고,,,, 너무 힐링되는 시간이었습니다.
아래는 제가 도촬한 홍수님 사진 ㅎㅎ 유익한 발표 해주셔서 감사합니다 홍수님😊
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.