데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      [전문가 밋업#1] GTC 2025 이후, 오픈소스 LLM은 어디까지 왔나?

      DevRel 25.04.03
      2,454 14 2
      DEVOTEE 요약
      래블업 신정규 대표와 SKT의 AI 전문가들이 2025년 GTC에서 주목한 기술들과 LLM 인프라 및 오픈소스 모델의 가능성을 논의했습니다. GPU가 연산과 스토리지 결합을 통해 데이터 처리를 가속화하는 기술과 vLLM 런타임의 인기를 강조하며, 인퍼런스가 새로운 수익 포인트로 떠오름을 설명했습니다. 또한, 오픈소스 LLM의 발전과 한국 기업들의 모델 공개 필요성을 언급하며 AI 시대의 흐름을 잘 활용하는 것이 중요하다고 전했습니다.
      DEVOTEE 추천 블로그

      25년 3월 27일, 래블업 신정규 대표와 SKT의 AI 전문가 3인이 한자리에 모였습니다.

      GTC 2025 직후의 생생한 인사이트부터, LLM 인프라와 오픈소스 모델의 미래까지. 기술과 현실, 전략이 교차한 112분간의 대화를 정리했습니다.

      KakaoTalk_Photo_2025-04-02-19-17-55 002.png


      ☕ 오프닝: 각자의 소개와 최근 관심사

      신정규 대표는 NVIDIA GTC 2025에 직접 참석하고 돌아온 직후였다.

      참석자들은 간단한 자기 소개와 함께 최근 기술적으로 관심 갖고 있는 분야를 공유했다. 주제는 자연스럽게 '추론 서버'와 '오픈소스 LLM의 부상'으로 이어졌다.

      KakaoTalk_Image_2025-04-01-11-20-55_001.jpeg


      🎯 GTC 2025에서 주목한 기술은?

      Q: 이번 GTC에서 인상 깊었던 기술은 무엇이었나요?

      A: 이번 GTC에서는 인상적인 다양한 기술들이 많았습니다. 

      그 중 다른 분들이 이야기를 잘 하지 않는 내용을 하나 꼽아보자면, GPU가 계산 노드에서 연산만 담당할 뿐만 아니라 스토리지와 결합되는 모습이었습니다.

      GPU가 직접 스토리지와 연결되어 데이터를 빠르게 읽고 처리하는 'GPUDirect Storage'가 본격화된지 3년 정도가 되었습니다. 

      예전에는 CPU를 거쳐야 했던 데이터 경로를 생략하고, GPU가 곧바로 데이터를 받아 처리하게 된 거죠.

      • 특히 비전 모델의 경우, 데이터가 크기 때문에 IO 병목이 생기기 쉬운데, 이런 구조가 해결책으로 받아들여 졌습니다.

      그런데 이제 임베딩과 벡터 스토어도 컴퓨트 노트에서 스토리지로 옮기려고 준비하고 있습니다.

      • 이번 GTC 발표에서도 CUDA를 포함하여 벡터 서치나 머신러닝 알고리즘 기반 기능을 가속하고 아예 스토리지 단에서 처리하려는 시도들이 소개됐고, 

        관련 하여 초고속 스토리지 솔루션 업체들과의 협업이 키노트에서도 소개되었습니다.


      🔄 VLLM과 추론 서버, 그리고 인퍼런스의 부상

      Q: 요즘 vLLM이 대세인 것 같은데, 이유가 뭘까요?

      A: vLLM은 원래 버클리에서 논문 구현체로 만든 프로젝트예요.

      PagedAttention을 활용해서 GPU 메모리 효율을 극대화하며 등장했는데, 데스크탑 GPU 의 작은 메모리로도 여러 모델을 돌릴 수 있게 되며 각광받았죠. 

      최근엔 사실상 표준처럼 자리 잡았어요.

      • 새로운 LLM이 나올 때마다 vLLM 런타임도 함께 공개되고 있을 정도죠.

      • 단점은 조금 느리다는 건데, GPU 메모리 절약이 그만큼 매력적인 겁니다.

      Q: 인퍼런스가 갑자기 왜 이렇게 중요한 위치로 올라온 건가요?

      A: 간단해요. "인퍼런스는 돈이 되니까요." 모델 학습은 돈을 써야 하지만, 인퍼런스는 서비스를 통해 돈을 벌 수 있어요. 

      실제로 GTC에서도 인퍼런스 관련 기술에 투자가 집중되고 있다는 게 느껴졌어요.

      • 과거엔 GPU 대부분이 학습용으로 쓰였다면, 요즘은 3~4배 또는 그 이상이 인퍼런스용으로 사용되고 있는 상황입니다.


      KakaoTalk_Image_2025-04-01-11-20-56_002.jpeg


      🧱 인프라의 변화: 트레이닝 서버와 인퍼런스 서버는 다르다

      Q: 트레이닝 서버와 인퍼런스 서버는 어떻게 다르죠?

      A: 트레이닝 서버는 GPU 간 네트워크 연결이 모든 GPU가 서로 접속될 수 있도록 빽빽해야 해요. 텐서 병렬, 파이프라인 병렬 같은 분산 학습 기법을 쓰려면 GPU-GPU 간 연결 속도가 중요하거든요.

      • 반면 인퍼런스 서버는 GPU들이 2~16대 정도의 상대적으로 작은 단위에서 서로 연결되고, 단위별로는 독립적으로 작동해도 되기 때문에 네트워크 구성을 단순화할 수 있어요.

      • 그래서 인퍼런스팜은 상대적으로 저렴하게 구성할 수 있고, 실제로 기업들이 그렇게 하고 있어요.


      🏭 디지털 트윈과 LLM의 접점은?

      Q: 디지털 트윈 분야에서도 LLM 기반 추론 서버가 의미가 있을까요?

      이상탐지 같은 부분에 LLM을 쓰면 좋겠다는 생각이 들었어요.

      예전엔 딥러닝으로 처리했겠지만, 이제는 LLM을 통해 더 유연하게 접근할 수 있지 않을까 해서요.

      A: 맞습니다. 다만 수치 데이터 자체를 LLM으로 처리하는 건 비효율적일 수 있어요. 대신, 정형 데이터 + 인스트럭션 기반 판단 같은 조합은 충분히 유의미하다고 봅니다.

      • 예: CCTV 이미지가 들어오면, "이 장면이 위험한지, 위험하다면 이유는?" 같은 지시형 질의를 하는 식이죠.


      🌏 오픈소스 LLM, GPT를 넘어서다?

      Q: 오픈소스 모델이 GPT 수준을 따라잡을 수 있을까요?

      A: 어느 수준에서는 이미 따라잡았습니다. Deepseek-V3 모델의 최근 3월 24일 공개 모델의 경우 일부 벤치마크에서는 GPT-4.5를 넘어섰다고도 합니다.

      • 메타의 LLaMA 시리즈는 원래 공개 예정이 아니었는데, 유출되면서 오히려 오픈소스 붐을 일으켰죠.

      • 중국은 더 극적이에요. 알리바바의 Qwen 모델은 큰 기대 없이 허깅페이스에 올라왔다가 엄청난 인기를 끌어서, 중국 정부가 아예 정책을 바꿨어요. 지금은 대부분의 중국 모델이 오픈소스로 나옵니다.

      Q: 우리나라 LLM들은 어디쯤 있나요?

      • 네이버, KT, 카카오 모두 모델은 있는데 일부 소형 테스트 모델을 제외하면 공개가 안 된 경우가 많아요.

      • 크긴 큰데, 크기만큼 기대되는 성능이 안 나와서가 아닐까 싶습니다. 또는 사업적인 고려도 있을거에요. 우리나라에서는 직접 서비스가 아니면 모델을 돈으로 만들 방법이 없거든요.

      무제 3.jpg


      🎲 모델 학습은 결국 '뽑기 게임'

      Q: 성능 좋은 LLM을 만들기 위해 중요한 건 뭐라고 보시나요?

      A: 현재는 자본이죠. 자본이 많을 수록 대규모의 시도를 반복할 수 있습니다. 중간중간 단계는 ‘뽑기‘랑 비슷합니다. 

      같은 환경, 같은 데이터로 학습해도 수렴하는 패턴이 달라요. 랜덤 초기값, GPU 연산 방식 차이, 하드웨어 설정 등 수많은 요소들이 결과에 영향을 줍니다.

      • 자본이 많으면 잘못된 길을 갔을 때 중간부터 다시 여러 번 돌릴 수 있고, 좋은 모델로 수렴한 결과물을 고를 수 있어요. 딥시크는 훈련에 드는 자본을 기술을 통해 줄인 대표적인 사례고요.

      • 메타도 라마3 만들 때 각 사이즈당 모델을 GPU 팜 두 개를 이용해 훈련해서 돌려서 모델 실패 확률을 줄였다고 하더라고요.


      🧩 마무리: 오픈소스가 정답은 아니지만 현실이다

      Q: 최종적으로 오픈소스 LLM은 어디까지 확장될까요?

      A: 올해 안에 한국 기업들도 대부분 오픈모델들을 내놓을 거라고 봐요. 비공개 모델로 승부하려고 해봤자, 이미 공개된 모델보다 성능이 떨어지면 소용이 없거든요.

      • 오히려 모델을 공개하고, 생태계 안에서 함께 키우는 방향이 장기적으로 더 유리하다고 봅니다.


      🎤 "이제는 모델을 '만드는' 시대가 아니라, '잘 쓰는' 시대입니다."

      – 신정규 대표 (래블업)

      KakaoTalk_Photo_2025-04-03-18-37-54.png

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      DevRel 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기