데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      From One to Ten: YOLO 시리즈 변천사

      Ross 24.11.12
      12,604 16 3
      DEVOTEE 요약
      YOLO(You Only Look Once)는 객체 탐지 분야에서 빠른 속도와 정확도로 주목받은 딥러닝 모델입니다. 창시자인 Joseph Redmon은 윤리적 이유로 연구를 중단했으나 이후 Alexey Bochkovskiy와 Ultralytics 등의 연구자들이 YOLOv4, YOLOv5 등을 개발하며 모델의 개발을 이어갔습니다. YOLO의 다양한 버전들은 개선된 정확도와 속도를 통해 여러 분야에서 객체 탐지에 활용되고 있습니다.

      들어가며

      “YOLO(You Only Live Once)”. 수 년 전 국내외에서 시대를 풍미한 슬로건이지요. “한 번 사는 인생 (즐겨라)!”

      하지만 이 글을 읽는 분들에겐 약자는 같지만 뜻은 다른, 이런 화면으로 더 익숙하실겁니다.


      "You Only Look Once”


      실시간 객체 탐지(Real-time object detection) 기술의 대명사와도 같은 딥러닝 모델입니다.

      첫 발표 당시 기존 모델들 대비 월등히 빠른 속도와 준수한 정확도로 단번에 주목을 받은 YOLO 모델과 이후의 시리즈는,

      자율주행, 보안/감시 시스템, 의료 영상 분석, AR 및 스마트 팩토리 등 여러 분야에 끼친 그 기술적 영향력만큼이나 그 저자, 개발자들에 얽힌 이야기 또한 흥미롭습니다.

      2016년 YOLO의 첫 발표 이후, 올해 v10까지 무려 10개 버전의 YOLO가 발표되었습니다.

      (그 외에도 YOLOv[N] 방식 작명이 아닌 PP-YOLO, YOLOR, YOLOX, YOLO-NAS 등 여러 의미있는 모델들이 있습니다.)

      그간 모델들의 변화와, 이에 얽힌 이야기들을 함께 다뤄보고자 합니다.


      전설의 시작: YOLOv1-v3

      2015-16년 당시 딥러닝을 활용한 객체 탐지에는 R-CNN 계열을 필두로 한 two-stage 방식의 모델들이 주류를 이루고 있었습니다.

      1단계에서 이미지 내 객체 후보 박스들을 먼저 추출하고, 2단계에서 박스마다 CNN 기반 이미지 분류기를 각각 실행해 객체를 분류하는 방식으로 작동했습니다.

      동작 원리가 직관적이고 정확도가 높았지만, 많은 계산량을 요구하기에 속도가 느려(ex: 1초에 7프레임) 실시간 태스크에 투입되기는 어려웠습니다.

      당시 객체 탐지 모델 연구들은 대체로 이 two-stage 구조 안에서 속도를 개선하는 방법을 찾는데에 집중되어 있었지요.


      CVPR2016에 발표된 YOLO(v1)는 이와 전혀 다른, one-stage 접근법을 제시했습니다.

      객체 후보군 선정 단계와 클래스 분류 단계가 분리된 형태가 아니라, 두 작업을 한 번의 신경망 패스로 처리하는 것입니다.

      이미지를 격자 형태 작은 셀들로 나누고, 각 셀에서의 후보 박스 정보 (x,y 좌표와 w,h 크기 및 confidence)와 객체 분류 정보(Pascal VOC 2007 기준 20 class)를 한번에 최종 텐서로 출력하는 네트워크 구조입니다.


      YOLO 구조 소개 | 출처: You Only Look Once: Unified, Real-Time Object Detection


      또한 당시 이미지 분류기의 표준처럼 쓰이던 ResNet 백본이 아닌, GoogLeNet에서 영감을 받아 새롭게 구성한 커스텀 CNN아키텍처를 백본으로 사용했습니다.

      이런 새로운 구조와 접근법을 바탕으로, YOLOv1은 Pascal VOC 2007 기준 정확도는 mAP 63.4, 속도는 45 FPS를 보입니다.

      직전 SOTA인 Faster R-CNN이 mAP 73.2 & 7 FPS 혹은 mAP 62.1 & 18 FPS를 기록한 것과 비교하면, 정확도-속도 trade-off를 감안할 때 매우 뛰어난 성능이지요.

      크기가 작은 객체나 몰려있는 비슷한 객체들에 대한 정확도가 떨어진다는 약점이 있었으나, 전반적으로 혁신적인 모델의 출현이었습니다.


      이듬해 CVPR 2017에서 YOLO의 개선 버전이 발표됩니다. 9000 종류 이상의 객체를 분류할 수 있다는 의미로 “YOLO9000”이라고 명명되었으나, 흔히 YOLOv2로 지칭됩니다.

      YOLOv2는 Anchor Box 도입으로 다양한 크기의 객체(특히 약점이었던 소형 객체)들을 처리하며,

      Batch Normalization과 더 깊은 네트워크 구조(Darknet-19)를 도입해, 학습 속도와 안정성 향상 및 고해상도 이미지 대응을 꾀했습니다.


      이어서 2018년에 발표된 YOLOv3는 다중 스케일(feature pyramid networks) 기법을 통해 다양한 크기의 객체를 효과적으로 탐지하며,

      ResNet의 Residual block을 포함시킨 Darknet-53 백본을 도입해 더 깊고 효율적인 네트워크 구조로 성능을 향상시켰습니다.

      또한, Softmax 대신 sigmoid 함수를 사용하여 각 클래스의 확률을 독립적으로 계산하는 방식을 적용해 MS COCO 데이터셋과 같은 다중 클래스 문제에서도 효율적으로 학습할 수 있도록 개선되었습니다.

      이를 통해 YOLOv3는 COCO 기준 mAP@0.5 55.3, 34FPS를 기록해, 당시 경쟁 모델인 RetinaNet (mAP@0.5 53.1, 11FPS) 대비 정확도를 유지하며 훨씬 빠른 속도를 보여주었습니다.


      YOLO의 창시자: Joseph Redmon

      YOLO 발표 당시 University of Washington 박사과정 중이었던 저자 Joseph Redmon은 범상치 않은 사람입니다.

      그의 비범함은 그가 설계한 신경망 구조나 소스코드, 작성한 논문 등에도 드러나지만, 의외로 기술적 지식이 전혀 없는 사람도 그의 특별함을 단번에 파악할 수 있는 것이 있습니다.


      Joseph Redmon 이력서 | 출처: Joseph Redmon 웹사이트


      네, 맞습니다. YOLO 저자의 “이력서”입니다.

      (아마도 여러분과 같이) 저도 처음 그의 웹사이트에서 “résumé”를 클릭한 직후, ‘내가 뭘 잘못 눌렀나?’ 하는 생각에 닫고 다시 열어봤습니다.

      장난삼아 올려둔 것이 아니고, 도처의 전문가(?)들로부터 “이건 이력서가 아니다” 라는 수많은 비난을 받으면서도 꿋꿋이 실제로 제출한 구직용 이력서입니다.


      ˹My Little Pony˼ 테마의 휘황찬란한 디자인에 가려진 그 내용 역시 예사롭지 않습니다.

      학부시절 NIST, IBM에서 인턴을 지낸 실력파 소프트웨어 개발자가, 갑자기 “라디오 DJ를 하러” 알래스카로 갑니다.


      또한 논문과 그의 코드에서도 Joseph의 넘치는 개성은 숨겨지지 않습니다.

      YOLOv3 기술 리포트의 그래프는 마치 “outstanding”이라는 단어의 정의라도 보여주듯 “그래프 축을 뚫고” 나오는 성능을 보여주기도 했고,


      UC Berkeley의 딥러닝 프레임워크인 Caffe가 주축이던 시절, 학계 주류를 따르지 않고 독자적으로 개발한 Darknet 프레임워크를 사용해 YOLO를 개발하기도 합니다.

      물론 "Darknet" 이름에 걸맞는 흑마법진 로고를 빼놓지 않았죠.



      YOLOv3 성능 비교 그래프

      Darknet 로고

      당시 객체 탐지 모델의 ‘정석’이었던 two-stage 방식의 틀을 깬 새로운 one-stage 접근법도,

      앞으로 일어나는 일련의 사건들과 그에 따른 YOLO 시리즈의 흥미로운 역사도, 모두 Joseph의 이러한 ‘비범함’에서 비롯되었다고 생각해볼 수 있습니다.


      YOLO9000 논문으로 CVPR 2017 Best Paper Honorable Mention Award를 수상하고,

      TED에서 실시간 YOLO 데모를 보여 전세계를 놀라게 하는 등 업계 안팎에서 주목받던 젊은 인재 Joseph은, YOLOv3 발표 이후 뜻밖의 폭탄 선언을 합니다.


      TED에서 YOLO 실시간 데모 시연중인 Joseph Redmon | 출처: TED.com


      2020년 2월, Joseph은 윤리적인 이유로 Computer Vision 분야 연구를 그만둘 것임을 트위터(현 X)에 공표합니다.

      자신이 개발한 기술이 사생활 침해나 군사적 목적 등, 도덕적으로 문제가 될 수 있는 분야에서 사용될 수 있다는 우려를 표명하며, AI 연구의 영향력에 대해 회의를 느낀다고 밝혔죠. [링크]

      흔한 연구자나 엔지니어 한 명이 아닌, 객체 탐지라는 큰 분야에서 기존 연구의 틀을 깨고 새 방향을 제시한 모델의 창시자로,

      전도유망한 젊은 연구자인 그의 갑작스런 은퇴는 업계에 큰 충격을 주었고, ML관련 Reddit과 YouTube 채널 등 많은 곳에서 회자되었습니다.


      사실 그의 이러한 행보는 이미 예고되어 있었는데요, 2018년 발간한 YOLOv3 리포트 말미에서 자신이 개발한 기술의 ‘대기업의 사생활 침해’나 ‘군사적 목적의 사용’에 대한 우려를 가지고 있으면서도,

      “Google”과 “미 해군연구소”의 펀딩을 받으며 연구하고 있는 자신의 위치에 대해 자조적인 농담과 함께 언급한 바 있습니다.


      어쨌든 그렇게 ML/CV업계는 소중한 인재를 잃었고, 창시자가 떠나간 YOLO 시리즈는 v3를 끝으로 자연스레 명맥이 끊어지는 듯 보였습니다.

      하지만..!


      뜻밖의 후계자: YOLOv4

      2020년 4월, 한층 업그레이드 된 성능의 YOLOv4가 발표됩니다. 그런데 그 저자는 기존 YOLO 논문에 이름이 전혀 없었던 Alexey Bochkovskiy라는 인물이지요.

      Alexey는 Joseph의 Darknet github 리포지토리를 포크, YOLOv2/v3의 윈도우 버전을 개발해 공개했고, Joseph에 이어 계속해서 YOLO 및 Darknet을 개발, 유지보수 해왔습니다.


      Joseph의 은퇴 이후에도 YOLO 관련 기술의 연구개발이 지속된다는 것은 정말 다행이지만, 업계에서는 자연스레 의문이 들었습니다.

      원저자인 Joseph과 함께 YOLO를 연구한 이력이 없는 제 3자가, YOLO의 명칭을(유명세를) 사용해도 되는가?

      그런 일각의 우려에 대해 저작권자(?)인 Joseph이 명쾌하게 답합니다.


      Alexey는 Joseph의 은퇴 선언 이전부터 YOLO관련 오픈소스 생태계에 기여해왔고, 많은 개발자들이 YOLO를 접하고 사용하는데에 Alexey의 도움을 받았기에,

      업계를 떠난 Joseph도 Alexey에게 흔쾌히 YOLO 이름을 쓰라고 허락해준 것이지요.


      그리고 그에 답하듯, Alexey는 트위터에 자신이 “YOLO를 완성하라고 Joseph이 개발한 AI”라는 유머까지 올립니다.


      Alexey의 YOLOv4는 추론시간 증가 없이 정확도를 향상시키는 Bag of Freebies(BoF)와,

      추론시간을 약간 증가시키면서 정확도를 크게 향상시키는 Bag of Specials(BoS)라는 두 기법을 도입, 정확도-속도 간 균형을 이루며

      YOLOv3 모델 대비 정확도(55.3→62.8)와 속도(34→54)모두 향상된 결과를 보였습니다.


      논란의 루키: YOLOv5의 등장

      YOLOv4 발표 이후 또 두 달이 지나, Glenn Jocher가 대표로 있는 Ultralytics가 YOLOv5를 발표합니다. YOLOv5는 YOLO 시리즈 중 가장 논란이 되었던 버전입니다.

      일단 YOLO 커뮤니티 공헌을 기반으로 원저자로부터 간접적으로 ‘YOLO’ 브랜드 사용권(?)을 허가받은 Alexey가 개발한 모델이 아니고,

      또 YOLOv4 대비 성능이 개선되었다고 주장하면서도 논문으로 발표하지는 않았기에 모델 구조와 성능이 검증되지도 않았으며, (실제로 YOLOv4보다 성능이 높지 않음, 성능비교 참고)

      YOLO의 아키텍처와 네이밍을 사용하면서도 YOLOv1~v4와 같이 all-permissive 라이선스를 따르지 않고 상업화 목적으로 AGPL 3.0*으로 공개했다는 것 등의 이유가 있었지요.

      (*무료로 상업 프로젝트에 사용할 수는 있으나, 프로젝트 코드를 전부 공개해야하는 라이선스)


      하지만 그런 여러 논란거리를 뒤로하고, YOLOv5는 업계 전반에서 상당한 인기를 얻습니다.

      C언어 기반의 Darknet이 아닌 PyTorch 기반으로 구현되어 Python에 익숙한 딥러닝 연구자들이 쉽게 접근할 수 있었고,

      n/s/m/l/x 등 여러 사이즈의 pre-trained 모델을 제공해 목적에 맞게 속도-정확도 균형을 선택할 수 있으며,

      이미지/동영상 파일 혹은 폴더, 웹캠 스트리밍 등 다양한 입력 포맷과 iOS/안드로이드 등 모바일을 포함한 많은 OS들을 지원하고,

      Mosaic 방식의 데이터 증강 기법을 도입해 적은 데이터로도 준수한 성능을 낼 수 있는 등, 실사용 측면에서 상당한 개선을 이뤄냈기 때문입니다.


      YOLO 모델이 YOLOv3와 v4를 거치며 성숙한 구조의 토대를 이루었다면,

      YOLOv5는 완성도 있게 구현된 Python 패키징과 다양한 플랫폼 지원으로 실용성과 접근성을 높여 YOLO의 폭넓은 보급에 이바지했다고 볼 수 있습니다.


      춘추 전국 시대: YOLO 모델들의 각축전

      YOLOv5 발표를 필두로 v6, v7, v8, v9, 10 모델들은 숫자가 바뀔때마다 모두 저자가 바뀝니다.

      v4 연구팀이 v7과 v9을, 그리고 v5 개발팀이 v8을 발표한 것이긴 하지만 말이죠.


      이미 v4-v5의 케이스에서 보였듯, 버전의 숫자는 ‘발표된 순서’를 나타내지만, 반드시 ‘성능의 우열’을 나타내지는 않습니다.

      동일 저자가 동일 모델 베이스로 점차 발전시킨 것이 아닌, 서로 다른 저자들이 이전 YOLO 모델을 베이스로 각자의 방식으로 개선을 이루어 발표한 것이기 때문이지요.

      물론 공식 데이터셋(MS COCO) 비교로 이전 버전보다 성능 개선이 확인된 모델 경우에 다음 버전을 매겨 발표하기는 하지만,

      단순 벤치마크가 아닌 real-world application에서는 나중 버전 모델이 항상 더 좋은 성능을 보이지는 않습니다.

      버전 간 파편화를 보여주는 단적인 예로, Ultralytics의 YOLOv5와 Meituan의 YOLOv6의 경우,

      “YOLO”가 아닌 “YOLOv5”, “YOLOv6” 자체가 각각 브랜드가 되어, 최신 모델의 명칭이 무려 “YOLOv5 v7.0 (22년 11월)”, “YOLOv6 v3.0 (23년 1월)”이고,

      둘 다 YOLOv7(2022년 7월) 보다 이후에 릴리즈되었습니다.


      v6~v10 저자들은 각각 네트워크 구조 최적화, anchor 사용 방식 변경, 학습을 통한 BoF 개선, 스케일링 방식 변경, GPU 계산 방식 최적화 등 각자의 방법들로

      각 버전의 모델 속도/정확도를 개선하기도 하고, 확장성을 넓히기도 했습니다.


      그 중 Ultralytics의 YOLOv8은 이전 버전인 v5와 마찬가지로, 논문 없이 코드로만 발표되었습니다.

      공개된 패키지의 명칭도 “yolo”나 “yolov8”이 아닌 “ultralytics”로, 단순 YOLO 시리즈를 벗어나 다른 Vision 모델들도 포함시키며 Computer Vision 종합 소프트웨어 패키지를 목표로 확장하고 있습니다.

      YOLOv8의 API는 사용성과 확장성이 v5보다 훨씬 개선되어, 다양한 시나리오에 활용되고 있습니다.


      다만, 앞서 언급되었듯 오픈소스 라이선스 중 비교적 폐쇄적인 AGPL 3.0 라이선스를 채택했고, Ultralytics 프레임워크 기반으로 개발된 v9, v10 모델 구현체들도 같은 라이선스를 따르게 되어,

      v8 이후 모든 YOLO 모델들이 초기 YOLO와 달리 연구 외 상업적 이용에 제약(소스코드 공개 의무)이 생긴 부분은 아쉬운 것으로 회자됩니다.


      이후 YOLOv7의 저자 Chien-Yao Wang의 그룹에서 v7의 개선버전인 YOLOv9을 발표합니다.

      PGI(Programmable Gradient Information) 도입으로 정보 병목 현상 해결, GELAN 아키텍처로 파라미터 활용도를 최적화, v7/v8 대비 적은 계산량(+짧은 추론시간)으로 정확도를 유지하는것이 특징입니다.


      가장 최신의 모델인 YOLOv10은 그간 YOLO 모델 발표 이력이 없었던 Tsinghua University에서 NeurIPS 2024에 발표했습니다.

      초기 YOLO모델부터 항상 있었던 NMS(Non-Maximum Suppression) 단계를 제거하고,

      분류 헤드와 특징 추출을 포함하여 모델 구조 전반의 효율화를 통해 속도와 정확도 모두 개선을 이룬 YOLOv10은,

      COCO 데이터셋 뿐 아니라 real-world application에서도 대체로 일관적인 성능 개선이 있는 것으로 평가됩니다.


      YOLOv10 성능 그래프 | 출처: YOLOv10 paper


      그 밖의 각 모델들에 대한 자세한 정보는 아래 요약 테이블과 원저자 논문, github 등을 참고하시기 바랍니다.


      저자

      발표시점

      단체

      출간처

      특징

      정확도(mAP)

      속도 (fps)

      논문/github

      코드 베이스

      라이선스

      YOLOv1

      Joseph Redmon, et al.

      2016년 5월

      University of Washington

      CVPR 2016

      Single neural network approach to object detection as a regression problem

      63.4% (VOC 2007)

      45 fps (Titan X)

      paper

      github

      Darknet

      "YOLO" license (All-permissive)

      YOLOv2

      Joseph Redmon, Ali Farhadi

      2016년 12월

      University of Washington

      CVPR 2017

      Anchor box, Batch normalization

      78.6% (VOC 2007)

      67 fps (Titan X)

      paper

      github

      Darknet

      "YOLO" license

      YOLOv3

      Joseph Redmon, Ali Farhadi

      2018년 4월

      University of Washington

      arXiv

      Feature Pyramid Network(FPN), Multi-Scale Prediction

      33.0% (COCO)

      35 fps (Titan X)

      paper

      github

      Darknet

      "YOLO" license

      YOLOv4

      Alexey Bochkovskiy, et al.

      2020년 4월

      (2,3저자) National Taiwan University

      arXiv (YOLOv4)/

      CVPR 2021 (Scaled-YOLOv4)

      Bag of Freebies (BoF), Bag of Specials (BoS)

      43.5% (COCO)

      65 fps (V100)

      paper

      paper(scaled)

      github (darknet)

      github(pytorch)

      Darknet

      "YOLO" license

      YOLOv5

      Glenn Jocher

      2020년 6월

      Ultralytics

      -

      PyTorch Implementation, CSP backbone

      50%(COCO)

      93 fps (RTX4090)

      github

      PyTorch

      AGPL 3.0

      YOLOv6

      Chuyi Li, et al.

      2022년 6월

      Meituan

      arXiv

      Bi-directional Concatenation(BiC) module, Anchor-aided training(AAT) strategy

      52.8%

      (COCO)

      116 fps (T4)

      paper(v1.0)

      paper(v3.0)

      github

      PyTorch

      GPL 3.0

      YOLOv7

      Chien-Yao Wang*, et al.

      (*v4 논문의 2저자)

      2022년 7월

      Academia Sinica

      CVPR 2023

      Extended-ELAN, Model Reparameterization

      55.9%

      (COCO)

      56 fps (V100)

      paper

      github

      YOLOv5 (PyTorch)

      GPL 3.0

      YOLOv8

      Glenn Jocher, et al.

      2023년 1월

      Ultralytics

      -

      Anchor-free, Multi-task application

      53.9%

      (COCO)

      78 fps (T4)

      website

      PyTorch

      AGPL 3.0

      YOLOv9

      Chien-Yao Wang, et al.

      2024년 2월

      Academia Sinica

      arXiv

      Programmable Gradient Information (PGI), Generalized ELAN

      55.6%

      (COCO)

      73 fps (T4)

      paper

      github

      YOLOv5

      (PyTorch)

      YOLOv10

      Ao Wang, et al.

      2024년 5월

      Tsinghua University

      arXiv / NeurIPS 2024 poster

      NMS-free training, spatial-channel separate downsampling

      54.4%

      (COCO)

      94 fps(T4)

      paper

      github

      Ultralytics(YOLOv8/PyTorch)

      AGPL 3.0

      ※ mAP 및 fps는 640x640 이미지 입력/최대 모델 기준이며, 사용 GPU/양자화 여부 등 여러 변수에 따라 성능이 달라지기에, 단순 참고치로 기재되었음을 알려드립니다.


      마치며

      첫 YOLO 모델이 탄생한 2016년부터 현재까지, 딥러닝 업계 전반에는 많은 변화가 있었고,

      실시간 객체 탐지 모델들의 사용처는 자동차 주행 보조, 스포츠 분석, 농업, 헬스케어 등 매우 넓은 분야로 확대되었습니다.

      그동안 YOLO 모델 시리즈는 여러 연구·개발 그룹에서 다양한 버전으로 발전하며 지속적으로 성능이 개선되어 왔습니다.

      또한 YOLO를 기반으로 객체 탐지뿐만 아니라 인체 포즈 인식, 인스턴스 분할(segmentation), 3D 객체 인식 등 다양한 응용 분야로 확장되어 사용되고 있습니다.


      최근 빠르게 발전하며 세상을 뒤흔들고 있는 생성AI에 비해, 성숙기에 이른 실시간 객체 탐지 기술에 관한 업계의 관심은 조금 떨어진 듯 하지만,

      여전히 현실 세계에 적용될 컴퓨터의 '눈'이 되어주는 기술로서 YOLO의 활용처는 무궁무진합니다.

      이렇게 이미 기술적 성숙을 이룬 YOLO 모델들이, 현재 빠르게 발전중인 LLM, Multi-modal 모델 및 로봇 제어 기술 등과 시너지를 이루어 어떻게 우리의 삶을 바꿔나갈지, 앞으로도 기대가 됩니다.


      짧지 않은 글이었지만, 독자분들께 정보와 재미를 함께 드렸기를 바라며, YOLO 시리즈 변천사에 대한 포스팅을 마치겠습니다.


      ※ YOLO 모델들을 직접 체험해보고 싶으신 분들을 위해, 온라인에서 테스트 해볼 수 있는 링크를 준비했습니다.

      딥러닝에 대한 배경 지식 없이도, 이미지 파일을 업로드하거나 PC 웹캠의 실시간 영상을 전달해 일부 YOLO 모델들의 동작을 확인할 수 있습니다.

      Model

      Demo link

      YOLOv8

      https://huggingface.co/spaces/Ultralytics/YOLOv8

      YOLOv9

      https://huggingface.co/spaces/prithivMLmods/YOLOv9-Object-Detection

      YOLOv10

      https://huggingface.co/spaces/kadirnar/Yolov10

      ※ 이 문서를 작성하는 동안, Ultralytics에서 YOLO11을 (물론, 논문 없이) 발표했습니다.

      YOLOv8과 동일한 ‘ultralytics’ python 패키지로 제공되며, v8 대비 소폭의 성능 향상이 있으나 API 전반적으로 기능에는 큰 차이가 없습니다.

      Tsinghua University의 YOLOv10 모델이 v6~v9 대비 상당한 성능 향상을 보였기에, Ultralytics 제품이 ‘최신 모델’임을 표방하려는 의도로 버전 넘버를 올려 출시한 것으로 보입니다.


      ※ 그런데, 우리의 비범한 YOLO 모델 창시자 Joseph Redmon은, Computer Vision 연구를 중단한 뒤 어디에서 어떤 일을 하고 있을까요?

      2022-23년 본인의 트위터와 인스타그램에서 ‘서커스 공연’을 하고 있음을 밝힌 바 있습니다. 여기에 가면 YOLO 창시자의 식스팩 공연을 볼 수 있습니다

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      Ross 님의 최신 블로그

      더보기
      동영상 기고하기