데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      AI Agent의 시대, 벤치마크는 어떻게 진화할까: τ-bench

      sparklingness 25.06.09
      2,851 6 1
      DEVOTEE 요약
      AI 에이전트는 아직 실무에 완전히 투입되기에 부족하며, 현실 업무 환경에서 높은 실패율과 일관성 문제를 보이고 있습니다. 이를 극복하기 위해 현실적인 평가 시스템인 τ-bench가 도입되어 복잡한 규칙, 다단계 프로세스, 그리고 자연스러운 대화 등을 반영해 평가를 진행했으나, GPT-4o조차 성공률이 절반에 불과했습니다. AI 기술의 발전을 위해서는 도메인별 정책 이해, 멀티스텝 태스크 처리, 장기적인 문맥 추론 등 현실적인 문제 해결 능력 향상이 필수적입니다.
      DEVOTEE 추천 블로그

      AI 에이전트, 정말 실무에 투입할 준비가 되었을까?

      올해의 주요 키워드 중 AI Agent가 있습니다.

      벤치마크 상에서 높은 성능을 자랑하는 OpenAI나 Claude의 LLM을 기반으로, 고객 서비스나 예약 업무를 대신할 수 있도록 서비스화 하려는 많은 시도가 있습니다.

      하지만, 최근 Sierra 연구팀이 발표한 τ-bench 연구 결과는 아직은 LLM이 Agent의 역할을 수행 능력에 다시한번 의문을 제기합니다.

      최첨단 모델인 GPT-4o도 실제 업무 환경에서는 50% 미만의 성공률을 보였고, 같은 작업을 반복했을 때의 일관성은 더욱 심각했습니다.

      예를 들어, 기존 벤치마크 vs 현실 요구사항 사이의 차이는 이렇게 다릅니다.


      예시

      기존 벤치마크 방식:

      입력: "사용자 ID user123의 주문 #12345를 취소하고 
            결제 수단 card_567로 환불 처리하세요."
      AI: cancel_order(user_id="user123", order_id="#12345", 
                       payment_method="card_567")
      평가: ✅ 정확한 API 호출 성공

      실제 업무 상황:

      고객: "안녕하세요, 어제 주문한 거 취소하고 싶어요."
      AI: "네, 취소 진행해 드리겠습니다. 고객님의 정보 확인을 위해 이메일을 알려주시겠어요?"
      고객: "이메일은 기억이 안 나고... 이름은 김민수이고 우편번호는 12345예요."
      AI: [신원 확인] → [주문 내역 검색] → [취소 정책 확인] → [환불 처리]

      기존 벤치마크의 한계 (특징들):

      • 모든 정보가 미리 제공됨 (instruction-following 방식)

      • 단순하고 명확한 작업만 수행

      • 인간과의 상호작용 없음

      • 도메인별 복잡한 규칙 고려 안 함

      하지만 실제 업무(서비스) 환경은 완전히 다릅니다:

      • 고객이 불완전하고 단편적인 정보만 제공

      • 복잡하고 다단계적인 요청 처리 필요

      • 실시간 대화를 통한 고객과 상품/서비스 정보 수집 필수

      • 엄격한 회사 정책과 규정 준수 요구


      τ-bench: 현실을 반영한 혁신적 평가 시스템

      실제 업무 환경을 모사한 시스템 구조 제안

      image.png

      τ-bench는 실제 업무 환경을 시뮬레이션합니다:

      τ-bench의 핵심 구성 요소:
      - 현실적 데이터베이스: 실제 서비스와 동일한 복잡성의 고객, 주문, 상품 정보
      - 실제 API 도구: 조회, 수정, 취소 등 비즈니스 로직이 구현된 함수
      - 도메인 정책 문서: 환불 규정, 교환 조건 등 복잡한 비즈니스 규칙
      - 지능형 사용자 시뮬레이터: GPT-4 등 고성능 모델 기반의 자연스러운 대화
      - 객관적 평가 시스템: 데이터베이스 상태 변화를 통한 정량적 측정

      체계적인 모듈러 설계 접근법 제안

      image.png

      a) JSON 데이터베이스: 실제 서비스와 동일한 복잡성

      b) Python API 도구: 실제 함수 호출(실제 비즈니스 로직 구현)

      c) 마크다운 정책 문서: 복잡한 비즈니스 규칙

      d) JSON 작업 명세: 유일한 정답 보장("outputs": ["54.04", "41.64"])


      두 가지 현실적 도메인 구축


      τ-retail: 온라인 쇼핑 고객 서비스

      τ-airline: 항공사 예약 시스템

      Database

      500명 사용자 + 50개 상품 + 1,000개 주문

      500명 승객 + 300개 항공편 + 2,000개 예약

      API tool

      7개 쓰기 API + 8개 읽기 API

      6개 쓰기 API + 7개 읽기 API

      Task

      115개 테스트 시나리오

      50개 테스트 시나리오

      복잡한 실제 상황 예시:

      고객: "최근에 주문한 물병이랑 램프를 바꾸고 싶어요. 
            물병은 더 큰 걸로, 램프는 더 어두운 걸로요."
      
      AI 처리 과정:
      1. 🔍 "최근 주문" → 구체적 주문 번호 확인 필요
      2. 📋 교환 정책 확인 → "한 번만 가능, 모든 항목 동시 처리"
      3. 🔄 대안 상품 검색 및 가격 차이 계산  
      4. 💳 결제 방법 확인 및 차액 처리
      5. ✅ 최종 확인 후 일괄 교환 실행

      복잡한 정책 시스템:

      항공편 변경 규칙:
      ❌ 기본 이코노미: 변경 불가 (24시간 이내 취소만 가능)
      ✅ 일반 이코노미: 변경 가능 (수수료 발생)
      ✅ 비즈니스: 자유 변경 가능
      
      수하물 규정 (회원등급별):
      일반회원: 기본0개/이코노미1개/비즈니스2개
      실버회원: 기본1개/이코노미2개/비즈니스3개  
      골드회원: 기본2개/이코노미3개/비즈니스3개


      자연스러운 대화 + 명확한 평가

      사용자 시뮬레이터의 정교함

      τ-bench를 기존 벤치마크와 다르게 하는, 가장 혁신적인 부분은 GPT-4 기반 사용자 시뮬레이터입니다.

      시뮬레이터 설계 원칙:

      1. 자연스러운 표현: 실제 고객처럼 대화

      2. 명확한 목표: 도메인 정책상 유일한 결과 보장

      3. 다양한 스타일: 같은 요청을 다른 방식으로 표현

      객관적 평가 시스템

      사용자는 자연스럽게 대화하지만, 최종 목표와 정답은 명확히 정해져 있어 객관적 평가가 가능합니다.

      평가 공식:

      reward = r_action × r_output ∈ {0, 1}
      • r_action: 최종 데이터베이스 상태가 목표와 일치하는가?

      • r_output: 사용자 응답에 필요한 정보가 모두 포함되었는가?

      이 방식으로 주관적 인간 평가 없이도 정확하고 일관된 측정이 가능합니다.


      새로운 지표 제시: pass^k

      기존 pass@k vs 새로운 pass^k

      기존에 많이 활용되던 메트릭 pass@k:

      image.png

      (여기서 n = 총 시도 횟수, c = 성공 횟수)

      • k번 시도 중 최소 1번 성공하는 확률

      • 창의적 문제 해결에서는 유용

      실서비스용 pass^k:

      image.png

      • k번 시도에서 모두 성공하는 확률

      • 일관성과 신뢰성 측정에 핵심

      왜 pass^k가 중요한가?

      실제 서비스에서는 일관성이 생명입니다:

      월요일: 고객 "항공편 변경 요청" → 성공 ✅
      화요일: 동일 고객, 동일 요청 → 실패 ❌
      결과: 고객 신뢰 상실 및 서비스 품질 문제


      τ-bench 평가 결과 분석

      최첨단 모델들조차 예상외 낮은 성적을 보였습니다.

      image.png

      핵심 발견:

      🏆 최고 성능 GPT-4o도 절반만 성공

      ✈️ 복잡한 항공 도메인에서는 35%로 급락

      📊 오픈소스 모델들은 상당한 성능 격차 존재

      일관성 측면에서의 추가 과제

      Figure 4의 pass^k 결과는 앞으로 많은 고민이 필요하다는 것을 보여줍니다.:

      image.png

      GPT-4o 성능 변화:
      - pass^1 (1번 성공): 61.2%
      - pass^2 (2번 연속): ~45%  
      - pass^4 (4번 연속): ~35%
      - pass^8 (8번 연속): ~25% 미만

      실무 관점에서의 의미:

      • 같은 업무를 8번 처리하면 6번은 실패 가능성

      • 실제 서비스 투입 시 심각한 신뢰성 문제


      실패 원인 심층 분석

      GPT-4o 실패 사례 36건 분석

      Figure 5의 실패 유형 분류:

      image.png

      1. 잘못된 인수/정보 제공 (55%)

      복잡한 데이터베이스 추론 실패:

      실제 예시 (Appendix C.2.2):
      고객: "램프를 더 어둡고 AC 어댑터 방식으로 바꾸고 싶어요"
      
      AI 실패 과정:
      1. 수십 개 램프 옵션 중 조건 필터링
      2. "더 어둡다"는 상대적 기준 해석 
      3. 전원 방식별 재고 확인
      4. → 복잡한 조합 조건에서 최적해 찾기 실패

      2. 잘못된 의사결정 (25%)

      도메인 규칙 이해 부족:

      실제 예시 (Appendix C.2.1):
      정책: "교환 도구는 한 번만 호출 가능. 모든 항목을 한 번에 처리"
      
      ❌ AI의 잘못된 접근:
      고객: "키보드랑 온도조절기 둘 다 교환하고 싶어요"
      → 키보드 교환 먼저 실행
      → 온도조절기 교환 시도 실패 (이미 도구 사용됨)
      
      ✅ 올바른 접근:
      → 두 항목 모두 확인 후 한 번에 교환 실행

      3. 부분적 요청 처리 (19%)

      Figure 6에서 보듯이 복합 요청일수록 실패율 증가:

      실제 예시 (Appendix C.2.3):
      고객: "모든 주문의 잘못된 주소를 수정해주세요"
      
      ❌ AI 실제 행동:
      - 주문 #1 주소 수정 ✅ 
      - 작업 종료 (다른 주문 확인 안 함)
      
      ✅ 기대 행동:
      - 모든 주문 체계적 확인
      - 오류 있는 주문들 식별
      - 전체적으로 수정 작업 완료


      도메인 정책의 중요성 검증

      정책 문서 제거 실험을 통해, 모델과 도메인의 특징을 파악했습니다.


      τ-retail

      τ-airline

      gpt-4o

      61.2% → 56.8% (-4.4%)

      33.2% → 10.8% (-22.4%)

      gpt-3.5

      20.0% → 14.5% (-5.5%)

      10.8% → 9.6% (-1.2%)

      핵심 인사이트:

      • 단순한 retail: 상식으로도 어느 정도 처리 가능

      • 복잡한 airline: 정책 문서 없으면 성능 급락

      • GPT-3.5: 복잡한 정책 이해 능력 부족


      연구의 파급효과와 미래 전망

      1. AI 연구 방향의 전환

      새로운 연구 우선순위:

      🧠 장기 문맥 추론: 여러 턴에 걸친 일관성 유지

      📋 규칙 기반 의사결정: 복잡한 정책 체계 마스터

      🔄 멀티스텝 태스크: 끝까지 완주하는 능력

      💬 자연어 상호작용: 효과적인 정보 수집

      2. 기업 AI 도입 전략 변화

      현실적 도입 로드맵:

      1단계: 📞 단순 문의 응답 (현재 가능)

      2단계: 🔍 정보 조회 및 전달 (부분 가능)3단계: 🎯 복잡한 업무 처리 (제한적)

      4단계: 🤖 완전 자율 운영 (장기 목표)


      맺음말 : AI 에이전트 시대의 현실적 출발점

      τ-bench 연구는 LLM의 성능을 넘어, AI 에이전트 기술의 정확한 현주소를 보여주는 이정표가 될 수 있습니다.

      앞으로 더 많은 도메인으로 확장되고, 더 정교한 평가 기준이 개발되며, 궁극적으로는 신뢰할 수 있는 AI 에이전트 시대의 토대가 될 것입니다.

      τ-bench와 같은 벤치마크의 발전을 통해 AI가 진정으로 인간에게 도움이 되는 방향으로 발전할 수 있도록 이끄는 나침반 역할을 할 수 있도록 많은 관심과 고민이 필요할 것 같습니다.

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      sparklingness 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기