데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      [에이닷 4.0 QE 여정3] LLM 품질 평가의 진화: SPeCTRA 2.0 톺아보기

      kei_es 25.09.02
      1,939 8 1
      DEVOTEE 요약
      에이닷 4.0은 기존 3.0의 여러 Agent 대화방을 하나로 통합한 OneAgent로 진화하였으며, 이에 따라 검증 플랫폼인 SPeCTRA도 1.0에서 API 중심의 Web 기반, 확장 가능한 2.0으로 발전하였습니다. SPeCTRA 2.0은 테스트 과정을 자동화하고, Google Sheets와 API 연동을 통해 실시간 협업과 데이터 관리 효율성을 높였으며, 메모리와 내부 동작을 다각도로 검증함으로써 품질 평가의 신뢰성을 크게 강화했습니다. 이를 통해 테스트 속도와 정확성이 향상되었고, QE팀은 반복 작업에서 벗어나 LLM 모델 개선에 집중할 수 있게 되었습니다.
      DEVOTEE 추천 블로그

      진화한 에이닷 4.0의 개편

      에이닷 3.0은 MainAgent, MusicAgent, StockAgent, MediaAgent, MovieAgent의 5개의 Agnet가 각각의 대화방으로 구성으로 개별성을 가지고 있었지만

      에이닷은 4.0으로 개편이 진행되었고 에이닷 3.0의 여러 Agent 대화방을 하나로 통합하는 OneAgnet로 진화하였습니다.

      image.png

      여러 Agent를 하나로 통합되었기 때문에 검증에 대한 방법도 달리 진행이 필요했고 SPeCTRA도 2.0으로 변화를 준비하게 되었습니다.


      시작하며: SPeCTRA 1.0의 성과와 새로운 과제

      작년에 소개해드린 SPeCTRA 1.0은 기존의 수동적이고 주관적일 수 있는 LLM 답변 품질 평가를 자동화된 'LLM-as-a-judge' 방식으로 전환한 혁신적인 시도였습니다.

      로컬 PC 환경에서 클라이언트 로그를 직접 파싱하고, Java 기반의 배포 툴을 통해 QA/TE는 물론 유관부서 모두가 LLM 품질 테스트를 수행할 수 있게 함으로써 테스트 리소스의 효율을 극대화했습니다.

      하지만 여기서 멈추지 않았습니다.

      에이닷 4.0이 OneAgent로 개편됨에 따라 대규모 테스트의 연속성을 확보하고, 여러 팀 간의 협업을 더욱 원활하게 하며, 물리적 디바이스 연결의 한계를 극복하기 위한 새로운 과제가 주어졌습니다.

      더 높은 확장성, 향상된 협업, 그리고 안정적인 테스트 환경을 위해 SPeCTRA는 2.0으로의 진화를 시작했습니다.


      SPeCTRA 2.0의 핵심 변화: 무엇이 달라졌는가?

      SPeCTRA 2.0은 1.0을 계승하되, 데이터 흐름을 API 중심으로 완전히 재편하고 Web에서 구동되도록 개편되었습니다. 주요 변화는 다음과 같습니다.

      1. API 기반 테스트로의 전환

      가장 큰 변화는 테스트 실행 방식입니다.

      SPeCTRA 1.0이 로컬 PC에 연결된 모바일 클라이언트를 Appium, Logcat으로 제어하는 방식이었다면, SPeCTRA 2.0은 대화방의 API를 직접 호출하는 방식으로 전환되었습니다.

      이는 더 이상 테스트를 위해 물리적인 디바이스나 클라이언트 앱 실행 환경이 필요 없다는 것을 의미합니다.

      덕분에 테스트 환경 구축이 단순해졌고, CI/CD 파이프라인과의 연동이 더욱 유연해졌으며, API 기반의 동시 다발적인 테스트 수행으로 속도와 확장성 면에서 비약적인 발전을 이루었습니다.

      2. 중앙화된 테스트 데이터 관리 (Google Sheets)

      로컬 PC의 Excel 파일로 관리되던 테스트 시나리오와 결과 데이터는 이제 Google Sheets로 통합되었습니다.

      Google Sheets를 도입함으로써 얻는 이점은 명확합니다.

      • 실시간 협업: QE팀이 동일한 테스트 시트 위에서 실시간으로 시나리오를 추가/수정하고, 평가 결과를 즉시 확인할 수 있습니다.

      • 버전 관리 및 이력 추적: TestCase 모든 변경 사항이 기록되어 데이터의 정합성을 유지하기 용이합니다.

      • 유연한 연동: Google Cloud 환경의 다른 서비스나 스크립트와 쉽게 연동하여 데이터 처리의 실시간 동기화 가능해졌습니다.


      3. 신뢰성 있는 로그 데이터 활용

      SPeCTRA 1.0에서는 실시간 클라이언트 로그를 파싱하여 LLM의 응답을 추출했습니다.

      이는 간편하지만, 로그 포맷이 변경되거나 유실될 경우 테스트의 안정성이 떨어질 수 있는 단점이 있었습니다.

      SPeCTRA 2.0에서는 중앙 로그 관리 시스템인 내부 시스템 로그의 결과 데이터를 활용합니다.

      정제되고 구조화된 로그 데이터를 API를 통해 가져옴으로써, LLM의 요청(request)과 응답(response)을 누락 없이 정확하게 확보할 수 있게 되어 테스트의 신뢰도를 크게 높였습니다.

      더군다나 LLM답변 추출에 그치지 않고 새롭게 도입된 Rewrite, Routing의 데이터도 함께 추출하여 실시간 동기화성을 더욱 극대화 했습니다.

      4. Memory 검증을 위한 전용 Prompt 도입

      새로운 에이닷 4.0에는 사용자 기억 지양점인 Memory가 도입됨에 따라 SPeCTRA도 진화가 필요했습니다.

      기존의 1.0의 Judge Prompt는 그대로 사용하되 Memory 기능확인을 위한 추가 Prompt를 도입함하여 차별화를 두었습니다.


      SPeCTRA 2.0의 심장부: 자동화된 평가 아키텍처

      이 영역의 핵심은 'QA Judge Model'입니다.

      이 모델은 단순히 사용자의 질문과 LLM의 최종 답변만 보고 정답을 맞혔는지 평가하는 것을 넘어, 답변이 생성되기까지의 '과정'을 검증합니다.

      즉, LLM 에이전트의 '생각'의 흐름을 추적하여 평가하는 것입니다.

      내부 상태 검증을 위한 API 연동

      SPeCTRA 2.0은 다양한 내부 API와 연동하여 에이전트의 동작을 다각도로 분석합니다.

      • Reactive API: Access_Token을 기반으로 한 API 호출을 통해, 사용자 정보나 페르소나에 따른 개인화된 응답(Reactive) 결과가 올바르게 생성되었는지 확인합니다.

      • Memory API: 대화에 적재된 기억(Memory)을 LLM 에이전트가 올바르게 조회하고 활용했는지 검증합니다.

      • Rewrite & Routing API : 중앙 로그 시스템인 내부 시스템 로그를 통해 대화의 맥락을 어떻게 재구성(Rewrite)했는지, 그리고 Agent가 어떤 기능 Routing을 호출하려고 계획했는지까지 추적하여 평가의 정확도를 높입니다.

      이렇게 각 API를 통해 수집된 '과정' 데이터는 기존 SPeCTRA 1.0의 Safety, Performance, Tone & Manner, Accuracy를 포함하여

      새로운 Memory Intelligence인 Memory Relevance(기억 활용성), Memory Accuracy(기억 정확성), Memory Recall(기억 재현율), Memory Maintenance(기억 유지보수성)

      SPeCTRA의 다차원적인 평가 기준(Prompt)과 결합되어 최종 평가 점수를 도출합니다.


      새로워진 SPeCTRA 2.0의 워크플로우

      SPeCTRA 2.0의 단순히 Data 추출를 API로 이전한 것에 그치지 않습니다. 아래 아키텍처 다이어그램의이 보여주듯, 평가의 '깊이'가 달라졌습니다.

      [에이닷 OneAgent 통합 검증 방안]

      image.png

      이러한 구조적 변화를 통해 SPeCTRA 2.0의 자동화된 품질 평가 워크플로우는 다음과 같이 더욱 견고하고 효율적으로 개선되었습니다.

      • (Input) QA Google Sheets에 검증 시나리오를 작성합니다.

      • (Process) 자동화 스크립트가 시나리오를 읽어 대화방 API를 이용해 서비스에 요청합니다.

      • (Data Fetching) 내부 시스템 로그 및 Memory API를 통해 LLM의 최종 응답뿐만 아니라, 응답을 만들기까지의 내부 동작 데이터(메모리 사용, 함수 호출 계획 등)를 모두 수집합니다.

      • (Judge) 수집된 모든 정보를 SPeCTRA 프롬프트에 담아 QA Judge Model에 전달하고, 답변의 품질을 다각적으로 평가하여 점수를 매깁니다.

      • (Output) 평가된 점수와 결과는 다시 Google Sheets에 실시간으로 업데이트됩니다.

      • (Analysis) 점수가 낮은 항목은 이슈로 등록 후 담당자가  분석하여 모델 개선을 위한 학습 데이터로 활용합니다.


      새로운 심장, 새로운 얼굴: Web 기반 SPeCTRA 2.0 Tool

      SPeCTRA 2.0의 아키텍처 진화에 발맞춰, 테스트를 실행하는 도구 역시 완전히 새롭게 태어났습니다.

      SPeCTRA 1.0의 Java Swing 기반 로컬 애플리케이션은 이제 모든 팀원이 언제 어디서든 접속할 수 있는 Web 기반의 툴로 대체되었습니다.


      이러한 변화는 단순한 실행 화면 개선을 넘어 테스트 환경의 접근 허들을 변경하게 되었습니다.

      • Zero-Install: 더 이상 Appium, Java 런타임, adb 등 복잡한 사전 설치 과정이 필요 없습니다.

      • No Device Required: 모바일 단말을 PC에 연결해야 하는 물리적 제약에서 완전히 자유로워졌습니다.

      • High-Speed Parallel Execution: 1.0 툴이 단일 PC와 단말에 종속되어 순차적으로 테스트를 진행했다면,

        2.0 툴은 API 기반 구조의 이점을 활용하여 수십, 수백 개의 테스트 시나리오를 동시에 병렬로 실행할 수 있습니다.

        이를 통해 전체 회귀 테스트(Full Regression Test)에 소요되는 시간이 획기적으로 단축되었습니다. (1000개 기준 12시간 > 3시간)

      • Centralized Management: 모든 테스트는 중앙 서버에서 실행되며, 구글 스프레드시트를 통해 중앙에서 관리됩니다.

        개별 세션을 통한 중첩되지 않는 실행 환경을 제공합니다.

      image.png

      SPeCTRA 2.0 Tool의 핵심 기능

      새로운 SPeCTRA 2.0 툴은 QA 효율과 분석의 깊이를 더하는 강력한 기능들을 탑재했습니다.

      사용자는 에이닷 Access Token, UserID, 그리고 권한이 부여된 구글 스프레드시트 정보만 입력하면 아래의 모든 기능을 활용할 수 있습니다.

      • 핵심 평가 기능: SPeCTRA Judge Model을 통해 답변의 Safety, Accuracy, Tone&Manner, Performance등을 종합적으로 평가합니다.

      • 메모리 특화 검증: Memory Accuracy, Relevance, Maintenance, Recall의 세분화된 기준을 통해 에이전트의 기억 능력을 정밀하게 측정하고, 의 메모리 반영 여부까지 검증합니다.

      • 원클릭 로그 추적: 각 테스트 결과마다 해당 대화의 전체 서버 로그를 추적할 수 있는 내부 로그 링크를 자동 생성하여 디버깅 시간을 획기적으로 단축합니다.

      • 성능(Latency) 측정: 사용자가 발화를 입력한 순간부터 답변의 첫 스트리밍이 시작되기까지의 시간(TTFB, Time to First Byte)과 모든 스트리밍이 종료되어

        답변이 완료되는 시간(TTLB, Time to Last Byte)을 측정하여 응답 속도를 정량적으로 평가합니다.

      • 메모리 제어: User ID 기반으로 저장된 Memory 데이터를 조회하고, 필요시 전체 데이터를 삭제하여 깨끗한 환경에서 반복 테스트를 수행할 수 있습니다.

      • 빠른 답변 확인: Judge Model의 평가 과정 없이, 순수하게 LLM 에이전트의 답변만 빠르게 도출해보는 기능을 제공하여 신속한 시나리오 확인이 가능합니다.

      • 결과 바로가기: 테스트 완료 후 결과가 기록된 구글 스프레드시트로 바로 이동하는 링크를 제공하여 분석의 편의성을 높였습니다.


      테스트 실행 결과 Raw Data 예시

      image.png


      결론: 협업과 확장을 통해 한 단계 더 나아가다

      SPeCTRA 1.0이 'LLM을 활용한 QA 자동화'의 가능성을 열었다면,

      SPeCTRA 2.0은 이를 'API 통한 플랫폼 기반’의 지속 가능하고 확장 가능한 품질 평가 플랫폼' 더 많은 실행, 빠른 피드백 반영, 빠른 실행 속도 확보로 발전시켰습니다.

      API 기반의 테스트 환경, Google Sheets를 통한 협업 강화, 그리고 Pathfinder를 통한 데이터 신뢰성 확보는 LLM 모델의 품질을 더 빠르고, 더 정확하고, 더 효율적으로 검증할 수 있는 강력한 기반이 되었습니다.

      이를 통해 QE팀은 단순 반복적인 검증 업무에서 벗어나, 심층적인 결과 분석과 모델 개선 방향 제시에 더욱 집중할 수 있게 되었습니다.

      SPeCTRA의 진화는 계속될 것입니다.

      앞으로도 모델의 성능을 최상으로 유지하고 사용자에게 최고의 경험을 제공하기 위한 검증의 여정에 많은 관심 부탁드립니다.

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      kei_es 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기