23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요, SKT AI Fellowship 6기 ‘AI 디바이스 기반 특화 서비스 발굴 및 개발’ 과제를 수행 중인 팀 Metaphor 입니다.
팀 이름으로는 메타버스를 통해 공부하다가 모르는 내용을 비유와 시각적인 자료로 해결해준다는 의미로, Metaverse + Metaphor의 단어를 합성했습니다 :)
우리는 이미 LLM의 시대에 살고 있습니다. 이제는 GPT를 사용하지 않는 학생들을 찾아보기 힘들 정도입니다. 실제로 여러 RAG와 Fine Tune된 모델들을 통해 LLM은 세부적인 분야에서 활약하고 있습니다. 저희 팀은 이런 LLM을 증강현실 기기에 탑재하여 보다 직관적인 학습 어시스턴트를 개발하고자 합니다.
RAG(회귀 강화 학습, Retrieval-Augmented Generation)는 정확하고 신뢰할 수 있는 답변을 제공하기 위해 다양한 데이터베이스(관계형, 그래프, 벡터 데이터베이스)를 활용하는 기법으로 LLM의 Hallucination 문제를 해결하는 용도로 사용할 수 있습니다.
데이터베이스를 활용하는 방식은 다음과 같습니다.
(1) 질문의 형태와 의미적 유사성을 고려하여 SQL과 같은 구조화된 쿼리 언어를 사용하여 데이터베이스에서 정보 검색
(2) Cypher와 같은 그래프 쿼리 언어를 사용하여 네트워크 구조의 데이터베이스에서 정보 검색
(3) 데이터에서 자동으로 쿼리 벡터와 필터를 생성하여 검색
RAG 시스템은 질문의 유형에 따라 적절한 데이터베이스를 선택하거나, 질문을 임베딩하여 의미적으로 유사한 데이터베이스를 선택한 뒤, 검색된 문서들의 순위를 매기고 이를 바탕으로 최적의 답변을 생성해냅니다. 이 과정에서 질문을 더 작은 단위로 나누거나 문서를 요약하는 등 기법을 사용하여 성능을 높일 수 있습니다.
텍스트 및 이미지를 기반으로 3D 모델을 생성하는 연구는 다양한 접근 방식을 통해 빠르게 발전하고 있습니다. 초기에는 NeRF(Neural Radiance Fields)가 주로 사용되었으나, 계산 비용과 최적화 시간의 한계로 인해 Diffusion 모델과 3D Gaussian Splatting 등의 새로운 기법이 등장하게 되었습니다.
NeRF의 한계:
계산 복잡도: NeRF는 고해상도의 3D 장면을 재구성하기 위해 수천 개의 광선을 추적해야 하므로 계산 비용이 매우 높습니다. 이는 주로 볼륨 렌더링에서 기인하며, 각 픽셀마다 광선 샘플링과 밀도 함수의 평가가 요구됩니다.
최적화 시간: NeRF의 학습 과정은 복잡한 최적화 문제를 포함하며, 이는 각 장면마다 몇 시간에서 며칠이 소요됩니다. 특히, 실시간 응용이나 대규모 데이터셋을 다루기에는 부적합합니다.
Diffusion 모델 도입:
Diffusion 모델은 고차원 데이터의 복잡한 분포를 학습하는 데 효과적인 접근 방식입니다. 이는 데이터의 분포를 점진적으로 변화시키는 과정을 통해 학습하며, 노이즈를 추가하고 제거하는 과정에서 데이터의 구조를 복원합니다.
작동 원리: Diffusion 모델은 두 단계로 작동합니다. 첫 번째는 순방향 확산 과정(Forward Diffusion)으로, 데이터에 점진적으로 노이즈를 추가하여 고차원 분포로 변환합니다. 두 번째는 역방향 확산 과정(Reverse Diffusion)으로, 노이즈를 제거하면서 데이터의 원래 구조를 복원합니다.
주로 input으로 text 또는 image가 들어오는 경우, Diffusion 모델을 활용하여 다양한 각도의 이미지를 생성할 수 있습니다. 그렇게 생성된 이미지를 통합하여 3D 오브젝트를 생성합니다.
3D Gaussian Splatting의 등장:
3D Gaussian Splatting은 3D 장면의 각 점을 가우시안 분포로 표현하여 최적화 및 렌더링 시간을 단축하는 방법입니다. 이는 각 점을 가우시안 함수로 모델링하여 연산을 단순화하고, 전체 장면을 빠르게 구성할 수 있게 합니다.
Initialization : COLMAP과 같은 SfM알고리즘은 Camera Pose뿐만 아니라 Point Cloud 정보도 같이 얻을 수 있습니다. 이 Point Cloud들이 3D Gaussian의 초기 값으로 사용됩니다.
Projection : 3D Gaussian이 (Camera에서 z축으로 거리가 1만큼 떨어진) Image Plane으로 Projection되어 2D Gaussian형태가 됩니다. 이 과정은 GT 입력 이미지와 비교하여 parameter를 업데이트하기 위함입니다.
Differentiable Tile Rasterizer : 미분 가능한형태의 Tile Rasterization을 통해 2D Gaussian들을 하나의 Image로 생성합니다.
Gradient Flow : 생성된 이미지와 GT 이미지의 Loss를 계산하고 Loss만큼 Gradient를 전파합니다.
Adaptive Density Control : Gradient를 기반으로 Gaussian의 형태를 변화시킵니다.
먼저, 우리는 크롤링을 통해 수집한 학습 자료와 이미 임베딩된 학습 자료들 중에서 더 적절한 설명을 평가하는 모델을 사용합니다. 이 모델은 두 종류의 자료를 비교하여 어느 쪽이 학습에 더 유용한지 판단합니다. 임베딩된 학습 자료가 더 적절하다고 판단될 경우, RAG 기법을 이용하여 해당 자료를 불러오고, 이를 기반으로 학습을 진행합니다. 이 과정을 통해 LLM은 최신의 크롤링 자료와 잘 정제된 임베딩 자료 중 가장 적합한 내용을 불러오게 됩니다.
또한, 이 모델은 특정 개념 키워드를 설명하기 위해 구체적인 예시를 출력하거나, 비슷한 개념을 연상시키는 기능도 제공할 예정입니다. 예를 들어 미분에 대해 질문을 한다면, 기울기를 설명해줄 수 있는 상황(예: 자동차의 이동 거리와 속도)을 만들어 시각 자료와 함께 보여주고, 미분이 실생활에서 쓰이는 사례를 같이 띄워주는 방식입니다. 그리고 이와 더불어 극한, 적분 등과 같이 미분에서 연상될 수 있는 비슷한 개념 키워드들을 뽑아내 학습자로 하여금 새로운 호기심을 가지고 학습을 확장해나갈 수 있는 기능을 제공하고자 합니다.
다음과 같은 Diffusion Model과 3DGS을 적용한 모델들 중 Inference Code가 공개된 모델들을 위주로 Inference Time 및 성능 비교를 시도 해보려 합니다. 그 중 가장 적합한 모델을 최종적으로 Meta Quest에서 구동 가능하도록 Deploy 하는데 목적이 있습니다.
해당 연구주제가 흥미로운 것은 사실이나 에탄올의 분자모형과 같은 복잡한 설명에 여러 객체가 존재하는 이미지에 대해서는 성능이 급격히 저하되는 것을 확인했습니다. 이에 이미지의 배경화면을 제거하는 방향으로 단순한 단일 객체의 시각화 성능의 향상을 우선순위로 삼았습니다. 가능하다면 다수의 객체 역시 준수한 성능을 낼 수 있는 방향성을 찾아보려 합니다.
기존의 오픈소스를 최대한 활용하여 실제 Meta Quest를 착용했을때 학습 어시스턴트가 작동하는 것을 목표로 삼고 있습니다. 도움이 필요한 상황을 사진으로 캡쳐하여 증강현실에서 언어 및 시각화 모델의 도움을 받을 수 있는 실제 서비스를 구현하는 것이 최종 목표입니다.
저희는 한동대 컴퓨터공학 학사과정 박경륜, 고려대 전기전자공학부 학사과정 박경빈, 고려대 전기전자공학부 학사과정 임도현으로 이루어진 팀입니다.
매주 온라인 미팅
매달 오프라인 미팅
노션과 깃허브로 소통
저희 팀은 단체카톡방 및 노션으로 소통하는 것이 원칙이며, 전체 회의 뿐 아니라 일부 팀원들끼리의 소회의가 있는 경우에도 반드시 회의록을 작성해야하는 원칙을 지키고 있습니다. 또한 연구하다가 찾아본 논문 및 관련 기사들은 전부 Wiki에 저장해두어 팀원 모두가 공유할 수 있도록 하고 있습니다.
허영민, 방종현 멘토님과 함께 열정적으로 프로젝트를 완성해보도록 하겠습니다.
감사합니다 🤗
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.