데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      AR 기반 생성AI 학습 어시스턴트 - 연구계획(1)

      dohyun11111m 24.06.16
      520 2 0
      DEVOTEE 요약
      안녕하세요, 저희 팀 Metaphor는 메타버스를 통해 공부하는 도중 모르는 내용을 비유와 시각화 자료로 해결해주는 서비스를 개발하고 있습니다. 연구 목표는 LLM을 증강현실 기기에 탑재하여 학습 어시스턴트를 개발하는 것입니다. 주요 기술로는 RAG와 Text/Image to 3D 모델이 포함되며, 이를 통해 보다 직관적이고 효율적인 학습 환경을 조성하고자 합니다.
      DEVOTEE 추천 블로그

      안녕하세요, SKT AI Fellowship 6기 ‘AI 디바이스 기반 특화 서비스 발굴 및 개발’ 과제를 수행 중인 팀 Metaphor 입니다.

      팀 이름으로는 메타버스를 통해 공부하다가 모르는 내용을 비유와 시각적인 자료로 해결해준다는 의미로, Metaverse + Metaphor의 단어를 합성했습니다 :)

      연구 배경

      스크린샷 2024-06-16 오후 11.22.48.png

      우리는 이미 LLM의 시대에 살고 있습니다. 이제는 GPT를 사용하지 않는 학생들을 찾아보기 힘들 정도입니다. 실제로 여러 RAG와 Fine Tune된 모델들을 통해 LLM은 세부적인 분야에서 활약하고 있습니다. 저희 팀은 이런 LLM을 증강현실 기기에 탑재하여 보다 직관적인 학습 어시스턴트를 개발하고자 합니다.

      기술 개요

      1) RAG 기본 개념

      RAG(회귀 강화 학습, Retrieval-Augmented Generation)는 정확하고 신뢰할 수 있는 답변을 제공하기 위해 다양한 데이터베이스(관계형, 그래프, 벡터 데이터베이스)를 활용하는 기법으로 LLM의 Hallucination 문제를 해결하는 용도로 사용할 수 있습니다.


      데이터베이스를 활용하는 방식은 다음과 같습니다.


      (1) 질문의 형태와 의미적 유사성을 고려하여 SQL과 같은 구조화된 쿼리 언어를 사용하여 데이터베이스에서 정보 검색


      (2) Cypher와 같은 그래프 쿼리 언어를 사용하여 네트워크 구조의 데이터베이스에서 정보 검색


      (3) 데이터에서 자동으로 쿼리 벡터와 필터를 생성하여 검색


      RAG 시스템은 질문의 유형에 따라 적절한 데이터베이스를 선택하거나, 질문을 임베딩하여 의미적으로 유사한 데이터베이스를 선택한 뒤, 검색된 문서들의 순위를 매기고 이를 바탕으로 최적의 답변을 생성해냅니다. 이 과정에서 질문을 더 작은 단위로 나누거나 문서를 요약하는 등 기법을 사용하여 성능을 높일 수 있습니다.스크린샷 2024-06-16 오후 11.26.17.png

      2) Text to 3D 및 Image to 3D 연구 동향

      텍스트 및 이미지를 기반으로 3D 모델을 생성하는 연구는 다양한 접근 방식을 통해 빠르게 발전하고 있습니다. 초기에는 NeRF(Neural Radiance Fields)가 주로 사용되었으나, 계산 비용과 최적화 시간의 한계로 인해 Diffusion 모델과 3D Gaussian Splatting 등의 새로운 기법이 등장하게 되었습니다.


      NeRF의 한계:

      • 계산 복잡도: NeRF는 고해상도의 3D 장면을 재구성하기 위해 수천 개의 광선을 추적해야 하므로 계산 비용이 매우 높습니다. 이는 주로 볼륨 렌더링에서 기인하며, 각 픽셀마다 광선 샘플링과 밀도 함수의 평가가 요구됩니다.

      • 최적화 시간: NeRF의 학습 과정은 복잡한 최적화 문제를 포함하며, 이는 각 장면마다 몇 시간에서 며칠이 소요됩니다. 특히, 실시간 응용이나 대규모 데이터셋을 다루기에는 부적합합니다.

      Diffusion 모델 도입:

      Diffusion 모델은 고차원 데이터의 복잡한 분포를 학습하는 데 효과적인 접근 방식입니다. 이는 데이터의 분포를 점진적으로 변화시키는 과정을 통해 학습하며, 노이즈를 추가하고 제거하는 과정에서 데이터의 구조를 복원합니다.스크린샷 2024-06-16 오후 11.27.13.png

      • 작동 원리: Diffusion 모델은 두 단계로 작동합니다. 첫 번째는 순방향 확산 과정(Forward Diffusion)으로, 데이터에 점진적으로 노이즈를 추가하여 고차원 분포로 변환합니다. 두 번째는 역방향 확산 과정(Reverse Diffusion)으로, 노이즈를 제거하면서 데이터의 원래 구조를 복원합니다.

      • 주로 input으로 text 또는 image가 들어오는 경우, Diffusion 모델을 활용하여 다양한 각도의 이미지를 생성할 수 있습니다. 그렇게 생성된 이미지를 통합하여 3D 오브젝트를 생성합니다.

      3D Gaussian Splatting의 등장:

      3D Gaussian Splatting은 3D 장면의 각 점을 가우시안 분포로 표현하여 최적화 및 렌더링 시간을 단축하는 방법입니다. 이는 각 점을 가우시안 함수로 모델링하여 연산을 단순화하고, 전체 장면을 빠르게 구성할 수 있게 합니다.스크린샷 2024-06-16 오후 11.27.42.png

      • Initialization : COLMAP과 같은 SfM알고리즘은 Camera Pose뿐만 아니라 Point Cloud 정보도 같이 얻을 수 있습니다. 이 Point Cloud들이 3D Gaussian의 초기 값으로 사용됩니다.

      • Projection : 3D Gaussian이 (Camera에서 z축으로 거리가 1만큼 떨어진) Image Plane으로 Projection되어 2D Gaussian형태가 됩니다. 이 과정은 GT 입력 이미지와 비교하여 parameter를 업데이트하기 위함입니다.

      • Differentiable Tile Rasterizer : 미분 가능한형태의 Tile Rasterization을 통해 2D Gaussian들을 하나의 Image로 생성합니다.

      • Gradient Flow : 생성된 이미지와 GT 이미지의 Loss를 계산하고 Loss만큼 Gradient를 전파합니다.

      • Adaptive Density Control : Gradient를 기반으로 Gaussian의 형태를 변화시킵니다.

      연구 수행 계획 및 목표

      스크린샷 2024-06-16 오후 11.28.44.png1) RAG, LLM

      먼저, 우리는 크롤링을 통해 수집한 학습 자료와 이미 임베딩된 학습 자료들 중에서 더 적절한 설명을 평가하는 모델을 사용합니다. 이 모델은 두 종류의 자료를 비교하여 어느 쪽이 학습에 더 유용한지 판단합니다. 임베딩된 학습 자료가 더 적절하다고 판단될 경우, RAG 기법을 이용하여 해당 자료를 불러오고, 이를 기반으로 학습을 진행합니다. 이 과정을 통해 LLM은 최신의 크롤링 자료와 잘 정제된 임베딩 자료 중 가장 적합한 내용을 불러오게 됩니다.


      또한, 이 모델은 특정 개념 키워드를 설명하기 위해 구체적인 예시를 출력하거나, 비슷한 개념을 연상시키는 기능도 제공할 예정입니다. 예를 들어 미분에 대해 질문을 한다면, 기울기를 설명해줄 수 있는 상황(예: 자동차의 이동 거리와 속도)을 만들어 시각 자료와 함께 보여주고, 미분이 실생활에서 쓰이는 사례를 같이 띄워주는 방식입니다. 그리고 이와 더불어 극한, 적분 등과 같이 미분에서 연상될 수 있는 비슷한 개념 키워드들을 뽑아내 학습자로 하여금 새로운 호기심을 가지고 학습을 확장해나갈 수 있는 기능을 제공하고자 합니다.

      (2) text, image to 3D 모델

      다음과 같은 Diffusion Model과 3DGS을 적용한 모델들 중 Inference Code가 공개된 모델들을 위주로 Inference Time 및 성능 비교를 시도 해보려 합니다. 그 중 가장 적합한 모델을 최종적으로 Meta Quest에서 구동 가능하도록 Deploy 하는데 목적이 있습니다.


      스크린샷 2024-06-16 오후 11.29.12.png


      해당 연구주제가 흥미로운 것은 사실이나 에탄올의 분자모형과 같은 복잡한 설명에 여러 객체가 존재하는 이미지에 대해서는 성능이 급격히 저하되는 것을 확인했습니다. 이에 이미지의 배경화면을 제거하는 방향으로 단순한 단일 객체의 시각화 성능의 향상을 우선순위로 삼았습니다. 가능하다면 다수의 객체 역시 준수한 성능을 낼 수 있는 방향성을 찾아보려 합니다.

      (3) Meta Quest 가상현실 환경에서의 서비스 구현

      기존의 오픈소스를 최대한 활용하여 실제 Meta Quest를 착용했을때 학습 어시스턴트가 작동하는 것을 목표로 삼고 있습니다. 도움이 필요한 상황을 사진으로 캡쳐하여 증강현실에서 언어 및 시각화 모델의 도움을 받을 수 있는 실제 서비스를 구현하는 것이 최종 목표입니다.

      (4) UseCase 정리

      스크린샷 2024-06-16 오후 11.30.29.png스크린샷 2024-06-16 오후 11.30.43.png스크린샷 2024-06-16 오후 11.30.55.png


      스크린샷 2024-06-16 오후 11.31.13.png

      연구 일정

      스크린샷 2024-06-16 오후 11.31.44.png

      팀 소개

      저희는 한동대 컴퓨터공학 학사과정 박경륜, 고려대 전기전자공학부 학사과정 박경빈, 고려대 전기전자공학부 학사과정 임도현으로 이루어진 팀입니다.

      Ground Rule

      • 매주 온라인 미팅

      • 매달 오프라인 미팅

      • 노션과 깃허브로 소통

      팀 소통 방법

      저희 팀은 단체카톡방 및 노션으로 소통하는 것이 원칙이며, 전체 회의 뿐 아니라 일부 팀원들끼리의 소회의가 있는 경우에도 반드시 회의록을 작성해야하는 원칙을 지키고 있습니다. 또한 연구하다가 찾아본 논문 및 관련 기사들은 전부 Wiki에 저장해두어 팀원 모두가 공유할 수 있도록 하고 있습니다.

      스크린샷 2024-06-16 오후 11.32.55.png


      허영민, 방종현 멘토님과 함께 열정적으로 프로젝트를 완성해보도록 하겠습니다.


      감사합니다 🤗

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      dohyun11111m 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기