정확도
- 측정값
- 확인된 최종 상태에 도달한 유효 실행의 비율
- 판정 규칙
- 시스템이 확인 경계 안에서, 복구 불가능한 오류 없이, 과제가 선언한 최종 상태에 도달했는가?
6개 현지 시장과 일상 소비 영역의 엔드투엔드 실행을 평가하는 세계 최초의 공개 벤치마크입니다.
MICA는 버전을 고정한 소비자 에이전트 시스템이 6개 현지 시장에서 소비자 과제를 종단 간으로 완료하는 능력을 평가합니다.
빌드 시점에 원본 데이터에서 직접 집계한 값입니다.
MICA 에이전트 역량 프레임워크
평가 대상은 개별 모델이 아니라 입력 이해부터 오케스트레이션, 모델 라우팅, 메모리, 도구 사용, 현지화, 안전, 복구까지 조립된 소비자 에이전트 시스템입니다.
Test · 실제 조건을 평가한다
현지 언어, 본인확인, 결제, 권한, 인계, 복구 조건과 실제 사용자 맥락 및 변동 제약을 포함해 시스템을 평가합니다.
Measure · 완료를 측정한다
정확도·속도·비용을 각각 기록하고, 명시된 완료 조건에 도달하지 못한 실행은 부분 성공으로 처리하지 않습니다.
Explain · 원인을 진단한다
결과를 7개 시스템 역량 축으로 추적하되 진단값을 점수에 섞지 않습니다.
MICA 점수 = 100 × 정규화 정확도 × 정규화 속도 × 정규화 비용
세 축은 고유 단위 그대로 공개합니다. 참조값·반복 실행 계약·불확실성을 파일럿에서 보정하기 전에는 파생 점수를 대표 수치나 순위 기준으로 사용하지 않습니다.
10개 소비자 과제 영역이 에이전트 시스템의 평가 범위를 구성합니다
10개 과제 영역의 100개 표준 과제를 6개 시장에 적용해 총 600개의 계획된 과제·시장 셀을 구성합니다. 이 수치는 측정 결과가 아니라 평가 범위입니다.
MICA를 만드는 이유
WebArena, WebVoyager, WebShop, AndroidWorld, AppWorld, τ-bench는 과제 완료를 결과로 측정합니다. MICA는 이를 확장해 조립된 소비자 에이전트가 현지 채널, 본인확인, 결제 수단을 갖춘 시장에서 소비자 과제를 완료하는 능력을 평가합니다.
에이전트에게 시키는 일
계열마다 완료로 인정되는 최종 상태와 동의 없이 넘어서는 안 되는 승인 경계를 정해 둡니다.
구축된 것과 아직 구축되지 않은 것
MICA는 과제 분류, 측정 방법, 공개 요건, 근거 구조를 제공합니다. 제출한 시스템 스냅샷에 대해 독립 재실행을 수행하고 공개 요건을 통과한 검증 결과만 이곳에 공개합니다.
아직 공개된 검증 결과가 없습니다
평가 계열 10개 · 공개된 결과 계열 0개