본문으로 건너뛰기

소비자 에이전트 벤치마크

6개 현지 시장과 일상 소비 영역의 엔드투엔드 실행을 평가하는 세계 최초의 공개 벤치마크입니다.

MICA는 버전을 고정한 소비자 에이전트 시스템이 6개 현지 시장에서 소비자 과제를 종단 간으로 완료하는 능력을 평가합니다.

결과 공개 방식 보기측정 방식 보기제출 요건 읽기

시장
6
과제 계열
10
공개된 결과 계열
0
검증된 시스템
0
측정한 실행
0

빌드 시점에 원본 데이터에서 직접 집계한 값입니다.

MICA 에이전트 역량 프레임워크

에이전트 시스템 전체를 평가하고, 결과를 측정하며, 원인을 진단합니다

평가 대상은 개별 모델이 아니라 입력 이해부터 오케스트레이션, 모델 라우팅, 메모리, 도구 사용, 현지화, 안전, 복구까지 조립된 소비자 에이전트 시스템입니다.

  1. Test · 실제 조건을 평가한다

    정형화된 프롬프트를 넘어 실제 조건을 평가

    현지 언어, 본인확인, 결제, 권한, 인계, 복구 조건과 실제 사용자 맥락 및 변동 제약을 포함해 시스템을 평가합니다.

  2. Measure · 완료를 측정한다

    호출 성공이 아니라 확인된 완료

    정확도·속도·비용을 각각 기록하고, 명시된 완료 조건에 도달하지 못한 실행은 부분 성공으로 처리하지 않습니다.

  3. Explain · 원인을 진단한다

    성공·실패 원인 진단

    결과를 7개 시스템 역량 축으로 추적하되 진단값을 점수에 섞지 않습니다.

MICA 점수 = 100 × 정규화 정확도 × 정규화 속도 × 정규화 비용

정확도·속도·비용이 기록이고, 점수는 파생값입니다

정확도

측정값
확인된 최종 상태에 도달한 유효 실행의 비율
판정 규칙
시스템이 확인 경계 안에서, 복구 불가능한 오류 없이, 과제가 선언한 최종 상태에 도달했는가?

속도

측정값
실제 경과 초, 성공한 유효 실행만
판정 규칙
성공한 실행이 처음부터 끝까지 걸린 시간. 빠른 실패가 빠른 성공으로 읽히지 않도록 실패한 실행은 제외합니다.

비용

측정값
성공한 유효 실행당 통화 금액
판정 규칙
전체 유효 시도 비용을 성공한 유효 실행 수로 나눈 값. 실패의 비용은 그 실패를 거쳐 도달한 성공에 부과됩니다.

세 축은 고유 단위 그대로 공개합니다. 참조값·반복 실행 계약·불확실성을 파일럿에서 보정하기 전에는 파생 점수를 대표 수치나 순위 기준으로 사용하지 않습니다.

10개 소비자 과제 영역이 에이전트 시스템의 평가 범위를 구성합니다

10개 과제 영역의 100개 표준 과제를 6개 시장에 적용해 총 600개의 계획된 과제·시장 셀을 구성합니다. 이 수치는 측정 결과가 아니라 평가 범위입니다.

  • 오케스트레이션분해, 순서 배치, 재시도, 그리고 멈추기로 하는 판단. 같은 기반 모델을 쓰는 시스템들 사이의 격차를 만드는 가장 큰 관측 원인입니다.
  • 모델 라우팅각 하위 단계를 적절한 모델로 라우팅하고, 경로를 사용할 수 없을 때 통제된 방식으로 성능을 저하시키는 역량.
  • 메모리페르소나 사실, 앞선 제약, 과제 진행 상태를 단계 사이에 유지하면서 사용자에게 다시 묻거나 스스로 모순되지 않는 능력.
  • 도구·API 사용시스템이 선언한 도구를 정확하고 최소한으로, 형식에 맞게 사용하는지. 부분 응답과 오류 응답의 처리도 포함합니다.
  • 현지화언어, 주소와 이름 형식, 현지 결제·신원 인프라, 공휴일, 그리고 시장별 서비스 관행.
  • 안전확인 경계를 지키고, 동의 없이 되돌릴 수 없는 행위를 피하며, 범위를 벗어난 자격 증명 사용을 거부하는지.
  • 복구단계 실패를 탐지·진단하고 대체 경로를 적용하거나, 일관된 상태를 유지한 채 실행을 중단하는 역량.

MICA를 만드는 이유

기존 벤치마크가 함께 다루지 않는 것

WebArena, WebVoyager, WebShop, AndroidWorld, AppWorld, τ-bench는 과제 완료를 결과로 측정합니다. MICA는 이를 확장해 조립된 소비자 에이전트가 현지 채널, 본인확인, 결제 수단을 갖춘 시장에서 소비자 과제를 완료하는 능력을 평가합니다.

시장이 곧 과제
현지 채널, 본인확인과 휴대폰 인증, 결제 수단, 말투, 무엇을 완료로 보느냐는 번역 문제가 아니라 과제의 조건입니다. 동일한 소비자 과제도 시장에 따라 서로 다른 실행 조건을 갖습니다. 따라서 하나의 벤치마크를 여섯 언어로 번역하지 않고 여섯 개의 시장 에디션을 별도로 운영합니다.
앱 중심 아시아가 중요한 이유
앱 중심 시장에서는 정보 조회가 가능하더라도 상태 변경 기능에 대한 접근이 제한되는 경우가 많습니다. 주문, 메시지, 결제 및 계정 변경에는 플랫폼 등록, 제휴 승인, 동의 범위, 미니앱 및 결제 인계 절차가 적용됩니다. 정보 조회만 평가하는 벤치마크는 이러한 실행 조건을 포괄하지 못합니다.

MICA를 만드는 이유 읽기 →

에이전트에게 시키는 일

일상 과제 10개 계열

계열마다 완료로 인정되는 최종 상태와 동의 없이 넘어서는 안 되는 승인 경계를 정해 둡니다.

  1. 이메일·캘린더여러 사람의 일정 조율, 현지 어법에 맞는 초안 작성, 그리고 메일함과 캘린더 사이에서 약속을 어긋나지 않게 유지하는 일.10 개 표준 과제
  2. 쇼핑·배송제약 조건에 맞는 특정 상품을 찾아 실제 현지 주소로 배송을 준비하고, 결제에 필요한 사용자 승인 이전 단계에서 중단하는 과제.10 개 표준 과제
  3. 여행 계획·숙박복합 제약과 현지 재고 규칙을 충족하는 다구간 이동 일정 및 숙박 계획을 수립하는 과제.10 개 표준 과제
  4. 외식·예약예약과 현지 예약 업무. 중개 플랫폼의 커버리지, 채팅 채널, 그리고 언제 사람에게 넘길지 아는 능력에 좌우됩니다.10 개 표준 과제
  5. 금융·은행·투자계좌와 포트폴리오 이해, 수수료·위험 고지, 그리고 최종 승인 경계에서 멈추는 자금 이동 또는 투자 주문의 준비.10 개 표준 과제
  6. 이동·대중교통시간·비용·접근성 제약 아래 실제 도시를 가로질러 사람을 이동시키는 일. 그 시장이 실제로 운영하는 교통과 차량 호출 수단을 사용합니다.10 개 표준 과제
  7. 의료 행정진료와 관련된 예약, 의뢰, 기록 요청, 보험 서류 및 비용 추정을 처리하는 행정 과제입니다. 임상 판단은 평가 범위에서 제외합니다.10 개 표준 과제
  8. 행정·공공 서비스공공 부문 절차 처리. 자격 확인, 서류 준비, 서식 작성, 방문 예약까지이며, 법적 구속력이 생기는 지점 앞에서 멈춥니다.10 개 표준 과제
  9. 주거·공과금가정 계정 운영. 검침과 청구서 검토, 요금제 비교, 이사 전입·전출 처리, 수리 접수입니다.10 개 표준 과제
  10. 통신·디지털 구독서비스 계정의 생애 주기 관리. 모바일·인터넷 요금제 변경, 로밍과 eSIM 준비, 사용량·청구 검토, 중복 구독과 무료 체험 관리, 이의 제기, 번호 이동과 해지입니다.10 개 표준 과제

과제 정의 읽기 →

구축된 것과 아직 구축되지 않은 것

지수의 현재 상태

MICA는 과제 분류, 측정 방법, 공개 요건, 근거 구조를 제공합니다. 제출한 시스템 스냅샷에 대해 독립 재실행을 수행하고 공개 요건을 통과한 검증 결과만 이곳에 공개합니다.

아직 공개된 검증 결과가 없습니다

평가 계열 10개 · 공개된 결과 계열 0개

잠정 후보 과제
100
이 중 보정 대기 측정 계약
100
검증 완료 과제
0
공개된 결과
0
과제 분류
일상 과제 10개 계열이고, 표준 과제마다 완료 조건과 승인 경계를 적어 두었습니다. 공개 과제 세트의 후보로 먼저 공개했습니다. 아직 초안이라 검증을 거치지 않았고 시장별로 나뉘지도 않았습니다.
측정 방법
정확도·속도·비용을 각각 원값으로 공개하고, 각 축을 0과 1 사이로 정규화한 뒤 100을 곱해 과제마다 MICA 점수 하나를 산출합니다. 계열과 국가 수치는 유효한 과제 점수의 산술평균입니다. 초안으로 공개했으며 반론을 받습니다.
근거 구조
근거의 단위는 실행 묶음입니다. 각 묶음에는 고유 주소가 부여되며, 포함 항목과 미포함 항목을 모두 명시합니다. 근거 구조는 구축되었으나 기록된 실행 묶음은 아직 없습니다.
공개 요건
독립 재실행, 커버리지, 안전 조건은 이미 적용되어 있습니다. 수치 기준값은 아직 정하지 않았습니다. 따라서 현재는 어떤 결과도 이 요건을 충족할 수 없고, 공개된 결과도 없습니다.

결과 화면 미리 보기 →