23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요!
저희는 이번 SKT AI Fellowship 5기에서 “Deep Learning 기반 Depth Estimation with Mono Camera” 연구 과제를 수행했던 IDE 팀입니다.
벌써 6개월이 지나 마무리를 하게 되었네요
비전공자로써 다양한 연구들을 보며 시야를 넓히고 저희의 역량을 기를 수 있었던 소중한 시간이었습니다:)
연구 결과에 대한 이야기로 마지막 포스트를 올리며 마무리 하고자 합니다
지난 포스트에서도 말씀드렸듯이 기존 모노 뎁스 모델의 경우,
크게 (1) 딥러닝 방식 / (2) 삼각측량법을 적용한 방식으로 나눌 수 있습니다.
각각의 방식에 대한 문제점은 다음과 같습니다.
-단일 이미지에서 픽셀 단위의 깊이 정보 학습
->[한계점] :학습에 이용된 이미지(상황) 에 따라 깊이를 추정하기 때문에 정확한 절대 깊이를 추정하는 것이 불가능함
-두 개 이상의 카메라 뷰에서 얻은 이미지를 사용해 수학적으로 깊이를 측정하는 방법
-두개 이상 이미지에서 특징점들을 추출하고, Matching된 특징점의 정확한 3D 위치 (depth) 를 추정하는 방식
->[한계점] : 두모든 pixel이 아닌 특징점에 대해서만 추정하기 때문에, 추후 3D reconstruction 시 density가 낮은 문제가 존재함
그래서 저희는 아래와 같은 컨셉의 딥러닝 모델을 통해 위의 두가지 문제를 해결했습니다.
삼각측량법의 아이디어를 사용해 기존보다 깊이를 정확하게 추정하는 딥러닝 모델 개발
IMU 데이터를 함께 사용함으로써 두 장의 Image 만으로 부족한 거리 정보를 보완
딥러닝 모델을 사용해 pixel단위의 depth를 추정 가능
삼각측량법의 개념을 학습한 딥러닝 모델이 기존 딥러닝 모델보다 정확한 depth를 추정
->IMAGE와 IMU 활용 트랜스포머 인코더 기반 퓨전 모델
Input: 특정 시간 차의 이미지 쌍과 IMU 데이터를 사용
Output: Pose 및 Depth를 출력으로 하여 모델에 보다 정확한 스케일 정보 부여 가능
Time series Transformer 모델 기반의 Relative Pose를 예측하는 Pretrain 모델 구축
Input으로 IMU 데이터(Linear Acceleration, Gyro, 시간 편차) 사용하여 Relative Pose 예측
저희는 이미지 처리 모델을 위하여 iDiSC라는 모노 뎁스 추정 기반의 딥러닝 모델을 활용했습니다.
해당 모델은 semantic 을 고려하여 뎁스를 추정하기 때문에 보다 세밀하고 정교한 뎁스추정이 가능하다는 장점이 있습니다
영상을 depth scale별로 다른 영역들로 분할하고 region query를 학습
학습된 region query들로 pixel embedding을 업데이트
prediction head를 통해 최종 깊이 추정
위의 모델처럼 비전부분의 경우 iDisc 기반으로 모델을 구성하였고 IMU 인코더로 추출한 시계열 피쳐를 융합하여 Depth 를 추정하였습니다.
포즈 추정은 다음과 같습니다.
시계열 피쳐로부터 FC layers 로 구성된 decoder 2개로 부터 각각 Reltaive pose의 값을 예측했습니다.
뎁스 추정은 다음과 같습니다.
기존에는 디테일이 잘 표현되지 않았었지만 iDisc의 semantic 성과 Pose 추정 개선의 효과로써 성능이 개선됨을 확인할 수 있었습니다.
해당 결과들을 종합하여 3D 공간상에 맵핑하여 시각화 하였습니다.
예측한 Depth 정보와 Camera Matrix를 통해 3d pointcloud 형태의 데이터 생성
Structure from motion의 Bundle Adjustment 과정을 이용하여 3d structure을 복원
Depth 추정 결과를 정성적으로 확인하기 위하여 3d reconstruction을 수행
‘Desktop’ set 으로, 결과의 컴퓨터 화면과 빨간 물체를 기준으로 얼마나 잘 3d 복원이 되었는지 육안으로 확인할 수 있었음
모든 sequence set에 대하여 3d reconstruction 분석
마지막으로는 데이터를 취득할 수 있는 아이폰 앱을 개발했습니다.
비록 최종 발표에는 시간이 부족하여 실데이터로 검증하지는 못했지만, 향후 핸드폰에 적용할 수 있도록 실험 계획입니다.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.