23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
올해의 주요 키워드 중 AI Agent가 있습니다.
벤치마크 상에서 높은 성능을 자랑하는 OpenAI나 Claude의 LLM을 기반으로, 고객 서비스나 예약 업무를 대신할 수 있도록 서비스화 하려는 많은 시도가 있습니다.
하지만, 최근 Sierra 연구팀이 발표한 τ-bench 연구 결과는 아직은 LLM이 Agent의 역할을 수행 능력에 다시한번 의문을 제기합니다.
최첨단 모델인 GPT-4o도 실제 업무 환경에서는 50% 미만의 성공률을 보였고, 같은 작업을 반복했을 때의 일관성은 더욱 심각했습니다.
예를 들어, 기존 벤치마크 vs 현실 요구사항 사이의 차이는 이렇게 다릅니다.
예시
기존 벤치마크 방식:
입력: "사용자 ID user123의 주문 #12345를 취소하고
결제 수단 card_567로 환불 처리하세요."
AI: cancel_order(user_id="user123", order_id="#12345",
payment_method="card_567")
평가: ✅ 정확한 API 호출 성공실제 업무 상황:
고객: "안녕하세요, 어제 주문한 거 취소하고 싶어요."
AI: "네, 취소 진행해 드리겠습니다. 고객님의 정보 확인을 위해 이메일을 알려주시겠어요?"
고객: "이메일은 기억이 안 나고... 이름은 김민수이고 우편번호는 12345예요."
AI: [신원 확인] → [주문 내역 검색] → [취소 정책 확인] → [환불 처리]기존 벤치마크의 한계 (특징들):
모든 정보가 미리 제공됨 (instruction-following 방식)
단순하고 명확한 작업만 수행
인간과의 상호작용 없음
도메인별 복잡한 규칙 고려 안 함
하지만 실제 업무(서비스) 환경은 완전히 다릅니다:
고객이 불완전하고 단편적인 정보만 제공
복잡하고 다단계적인 요청 처리 필요
실시간 대화를 통한 고객과 상품/서비스 정보 수집 필수
엄격한 회사 정책과 규정 준수 요구
τ-bench는 실제 업무 환경을 시뮬레이션합니다:
τ-bench의 핵심 구성 요소:
- 현실적 데이터베이스: 실제 서비스와 동일한 복잡성의 고객, 주문, 상품 정보
- 실제 API 도구: 조회, 수정, 취소 등 비즈니스 로직이 구현된 함수
- 도메인 정책 문서: 환불 규정, 교환 조건 등 복잡한 비즈니스 규칙
- 지능형 사용자 시뮬레이터: GPT-4 등 고성능 모델 기반의 자연스러운 대화
- 객관적 평가 시스템: 데이터베이스 상태 변화를 통한 정량적 측정a) JSON 데이터베이스: 실제 서비스와 동일한 복잡성
b) Python API 도구: 실제 함수 호출(실제 비즈니스 로직 구현)
c) 마크다운 정책 문서: 복잡한 비즈니스 규칙
d) JSON 작업 명세: 유일한 정답 보장("outputs": ["54.04", "41.64"])
τ-retail: 온라인 쇼핑 고객 서비스 | τ-airline: 항공사 예약 시스템 | |
|---|---|---|
Database | 500명 사용자 + 50개 상품 + 1,000개 주문 | 500명 승객 + 300개 항공편 + 2,000개 예약 |
API tool | 7개 쓰기 API + 8개 읽기 API | 6개 쓰기 API + 7개 읽기 API |
Task | 115개 테스트 시나리오 | 50개 테스트 시나리오 |
복잡한 실제 상황 예시:
고객: "최근에 주문한 물병이랑 램프를 바꾸고 싶어요.
물병은 더 큰 걸로, 램프는 더 어두운 걸로요."
AI 처리 과정:
1. 🔍 "최근 주문" → 구체적 주문 번호 확인 필요
2. 📋 교환 정책 확인 → "한 번만 가능, 모든 항목 동시 처리"
3. 🔄 대안 상품 검색 및 가격 차이 계산
4. 💳 결제 방법 확인 및 차액 처리
5. ✅ 최종 확인 후 일괄 교환 실행복잡한 정책 시스템:
항공편 변경 규칙:
❌ 기본 이코노미: 변경 불가 (24시간 이내 취소만 가능)
✅ 일반 이코노미: 변경 가능 (수수료 발생)
✅ 비즈니스: 자유 변경 가능
수하물 규정 (회원등급별):
일반회원: 기본0개/이코노미1개/비즈니스2개
실버회원: 기본1개/이코노미2개/비즈니스3개
골드회원: 기본2개/이코노미3개/비즈니스3개τ-bench를 기존 벤치마크와 다르게 하는, 가장 혁신적인 부분은 GPT-4 기반 사용자 시뮬레이터입니다.
시뮬레이터 설계 원칙:
자연스러운 표현: 실제 고객처럼 대화
명확한 목표: 도메인 정책상 유일한 결과 보장
다양한 스타일: 같은 요청을 다른 방식으로 표현
사용자는 자연스럽게 대화하지만, 최종 목표와 정답은 명확히 정해져 있어 객관적 평가가 가능합니다.
평가 공식:
reward = r_action × r_output ∈ {0, 1}r_action: 최종 데이터베이스 상태가 목표와 일치하는가?
r_output: 사용자 응답에 필요한 정보가 모두 포함되었는가?
이 방식으로 주관적 인간 평가 없이도 정확하고 일관된 측정이 가능합니다.
기존에 많이 활용되던 메트릭 pass@k:
(여기서 n = 총 시도 횟수, c = 성공 횟수)
k번 시도 중 최소 1번 성공하는 확률
창의적 문제 해결에서는 유용
실서비스용 pass^k:
k번 시도에서 모두 성공하는 확률
일관성과 신뢰성 측정에 핵심
실제 서비스에서는 일관성이 생명입니다:
월요일: 고객 "항공편 변경 요청" → 성공 ✅
화요일: 동일 고객, 동일 요청 → 실패 ❌
결과: 고객 신뢰 상실 및 서비스 품질 문제최첨단 모델들조차 예상외 낮은 성적을 보였습니다.
핵심 발견:
🏆 최고 성능 GPT-4o도 절반만 성공
✈️ 복잡한 항공 도메인에서는 35%로 급락
📊 오픈소스 모델들은 상당한 성능 격차 존재
Figure 4의 pass^k 결과는 앞으로 많은 고민이 필요하다는 것을 보여줍니다.:
GPT-4o 성능 변화:
- pass^1 (1번 성공): 61.2%
- pass^2 (2번 연속): ~45%
- pass^4 (4번 연속): ~35%
- pass^8 (8번 연속): ~25% 미만실무 관점에서의 의미:
같은 업무를 8번 처리하면 6번은 실패 가능성
실제 서비스 투입 시 심각한 신뢰성 문제
Figure 5의 실패 유형 분류:
1. 잘못된 인수/정보 제공 (55%)
복잡한 데이터베이스 추론 실패:
실제 예시 (Appendix C.2.2):
고객: "램프를 더 어둡고 AC 어댑터 방식으로 바꾸고 싶어요"
AI 실패 과정:
1. 수십 개 램프 옵션 중 조건 필터링
2. "더 어둡다"는 상대적 기준 해석
3. 전원 방식별 재고 확인
4. → 복잡한 조합 조건에서 최적해 찾기 실패2. 잘못된 의사결정 (25%)
도메인 규칙 이해 부족:
실제 예시 (Appendix C.2.1):
정책: "교환 도구는 한 번만 호출 가능. 모든 항목을 한 번에 처리"
❌ AI의 잘못된 접근:
고객: "키보드랑 온도조절기 둘 다 교환하고 싶어요"
→ 키보드 교환 먼저 실행
→ 온도조절기 교환 시도 실패 (이미 도구 사용됨)
✅ 올바른 접근:
→ 두 항목 모두 확인 후 한 번에 교환 실행3. 부분적 요청 처리 (19%)
Figure 6에서 보듯이 복합 요청일수록 실패율 증가:
실제 예시 (Appendix C.2.3):
고객: "모든 주문의 잘못된 주소를 수정해주세요"
❌ AI 실제 행동:
- 주문 #1 주소 수정 ✅
- 작업 종료 (다른 주문 확인 안 함)
✅ 기대 행동:
- 모든 주문 체계적 확인
- 오류 있는 주문들 식별
- 전체적으로 수정 작업 완료정책 문서 제거 실험을 통해, 모델과 도메인의 특징을 파악했습니다.
τ-retail | τ-airline | |
|---|---|---|
gpt-4o | 61.2% → 56.8% (-4.4%) | 33.2% → 10.8% (-22.4%) |
gpt-3.5 | 20.0% → 14.5% (-5.5%) | 10.8% → 9.6% (-1.2%) |
핵심 인사이트:
단순한 retail: 상식으로도 어느 정도 처리 가능
복잡한 airline: 정책 문서 없으면 성능 급락
GPT-3.5: 복잡한 정책 이해 능력 부족
1. AI 연구 방향의 전환
새로운 연구 우선순위:
🧠 장기 문맥 추론: 여러 턴에 걸친 일관성 유지
📋 규칙 기반 의사결정: 복잡한 정책 체계 마스터
🔄 멀티스텝 태스크: 끝까지 완주하는 능력
💬 자연어 상호작용: 효과적인 정보 수집
2. 기업 AI 도입 전략 변화
현실적 도입 로드맵:
1단계: 📞 단순 문의 응답 (현재 가능)
2단계: 🔍 정보 조회 및 전달 (부분 가능)3단계: 🎯 복잡한 업무 처리 (제한적)
4단계: 🤖 완전 자율 운영 (장기 목표)
τ-bench 연구는 LLM의 성능을 넘어, AI 에이전트 기술의 정확한 현주소를 보여주는 이정표가 될 수 있습니다.
앞으로 더 많은 도메인으로 확장되고, 더 정교한 평가 기준이 개발되며, 궁극적으로는 신뢰할 수 있는 AI 에이전트 시대의 토대가 될 것입니다.
τ-bench와 같은 벤치마크의 발전을 통해 AI가 진정으로 인간에게 도움이 되는 방향으로 발전할 수 있도록 이끄는 나침반 역할을 할 수 있도록 많은 관심과 고민이 필요할 것 같습니다.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.