데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      OpenLab - LLMOps, HyDE(Hypothetical Document Embeddings)

      sysmoon 24.05.26
      8,093 0 1
      DEVOTEE 요약
      HyDE(Hypothetical Document Embeddings)는 사용자의 질문에 대한 가상의 문서를 생성해 검색 성능을 향상시키는 방법입니다. 이러한 가상의 문서는 LLM을 이용해 생성되며, 벡터 공간에서 유사도 검색을 통해 RAG에 필요한 맥락 정보를 제공합니다. HyDE는 특히 새로운 도메인 데이터 검색에서 효과적이며, RAG 파이프라인의 성능이 충분하지 않을 때 도움이 될 수 있습니다.
      DEVOTEE 추천 블로그

      소개

      Better RAG를 위한 여러가지 방법중 Query Expantion 방법중 하나인 HyDE(Hyphothetical Document Embeddings) 에 대해 소개합니다.


      아이디어



      **

      HyDE(Hypothetical Document Embeedings)는 검색을 개선하기 위한 여러 Query Expantion 방법중 하나의 접근 방식으로,

      사용자 입력 질문에 대한 답변에 사용할 수 있는 가상의 문서를 생성합니다.

      이러한 가상의 문서는 LLM 을 이용하여 생성하고, 워드 임베딩하여 vector store 공간에서 유사도 검색을 수행하여 RAG에 필요한 맥락(Context) 정보를 제공합니다.

      이 아이디어의 핵심은 가상의 문서가 실제 사용자 질문보다 유사도 검색 정확도 측면에서 더 정확할 수 있다는 것에서 출발합니다.


      동작방식

      Concept


      Standard 방식은 사용자 질의에 대해 워드 임베딩하여 벡터 공간에서 유사도 검색한 결과를 RAG 를 위해 필요한 맥락 정보로 제공합니다.

      이에 반해 HyDE는 사용자 질의 대신에 사용자 질의를 LLM (GTP Instruction) 이용하여 가상의 문서를 생성하고, 이를 Vector DB 유사도 검색한 결과를 RAG의 맥락 정보로 활용합니다.


      위 예제를 살펴보면, User Prompt 에 보통 사용자 질의를 그대로 Retrieval 에 전달하여 유사도 검색을 수행하지만,

      여기서는 HyDE가 사용자 쿼리에 대한 가상 문서를 생성하여 Retrieval로 전달하게 됩니다.


      사용자 쿼리

      How to use multi-modal models in a chain and turn chain into a rest api

      가상문서

      To use multi-modal models in a chain and turn the chain into a REST API, you can leverage the capability ...


      Precise Zero-Shot Dense Retrieval without Relevance Labels

      illustration of the HyDE model

      많은 Embedding Retriever 가 유사도 검색이 되지 않는 새로운 도메인 데이터에 대해서는 일반화가 되어있지 않습니다.

      이를 위해 HyDE 접근 방식을 이용하여 문제를 해결할 수 있습니다.

      사용자 쿼리가 주어지면 가상 문서 임베딩(HyDE)은 먼저 Zero-Shot으로 Instrcut GPT 방식으로 초기 사용자 쿼리에서 관련 텍스트 패턴을 캡처하는 '가짜(fake)' 가상의 문서를 생성합니다.

      실제로는 이 작업은 각 사용자 쿼리에 대해 5번 수행합니다.

      그런 다음 각 가상의 문서를 워드 임베딩하고 평균값을 계산한 단일 임베딩 값을 유사도 검색 알고리즘(ANN)을 이용하여 이웃 임베딩 문서들을 검색하여 가져옵니다.

      다른 검색기와 마찬가지로 이렇게 검색된 문서는 파이프라인의 다운스트림(예: RAG용 생성기)에서 사용할 수 있습니다.

      더 자세한 정보는 “Precise Zero-Shot Dense Retrieval without Relevance Labels” 논문에서 확인 가능합니다.


      위 논문의 An illustration of the HyDE model 그림을 요약하면

      1. 주어진 유저 질의를 LLM(Instruction GTP)에게 주입하여 n 개의 hypothetical document 형태의 (fake) answer를 생성합니다.

      2. n개의 document 를 unsupervised encoder 를 활용해 embedding합니다.

      3. embedding 한 결과값들을 mean 하여 나온 벡터값을 기반으로 vector store 의 real document 와 유사도를 비교한 뒤, RAG을 위한 context로 활용 합니다.

        (Hallucination을 막기 위해 평균을 취하는 방식으로 진행하고 있음)


      HyDE 는 언제 도움이 되나요?

      HyDE 이럴때 사용하면 유용합니다.

      • RAG 파이프라인에서 Retriever 성능이 충분하지 않은 경우 (예: 낮은 Recall Metric).

      • 검색 단계에서는 쿼리를 입력으로 사용하여 더 큰 문서를 기반으로 문서를 반환합니다.

      • 특히 데이터(문서 또는 쿼리)가 retriever가 학습하는 일반적인 데이터 세트와는 매우 다른 특수한 도메인에서 온 경우 시도해 볼 가치가 있습니다.


      Ref

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      sysmoon 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기