정확도
- 측정값
- 확인된 최종 상태에 도달한 유효 실행의 비율
- 판정 규칙
- 시스템이 확인 경계 안에서, 복구 불가능한 오류 없이, 과제가 선언한 최종 상태에 도달했는가?
6개 현지 시장과 일상 소비 영역의 엔드투엔드 실행을 평가하는 세계 최초의 공개 벤치마크입니다.
MICA는 버전을 고정한 소비자 에이전트 시스템을 아시아와 중동 6개 시장의 일상 볼일로 평가합니다. 실행은 격리된 모의 환경이 아니라 현지 채널과 본인확인, 동의 절차, 결제 수단, 앱 전용 흐름을 지나갑니다. 기준을 통과한 과제는 정확도·속도·비용을 곱해 점수 하나를 받고, 세 축의 원래 값은 그 옆에 따로 싣습니다.
빌드할 때 원본 데이터에서 직접 센 값입니다.
재는 대상은 모델이 아니라 시스템
아직 실은 결과가 없습니다
MICA는 과제 분류, 측정 방법, 공개 요건, 근거 구조를 제공합니다. 제출한 시스템을 독립적으로 다시 실행해 공개 요건을 통과한 결과만 이곳에 올라옵니다.
평가 계열 10개 · 공개된 결과 계열 0개
MICA는 10개 과제 계열을 정의합니다. 검증된 결과가 있는 계열은 아직 없습니다. 아래 항목은 측정 대상을 정의하며, 없는 결과는 0이 아니라 미측정으로 표시합니다.
MICA를 만드는 이유
WebArena, WebVoyager, WebShop, AndroidWorld, AppWorld, τ-bench는 과제 완료를 결과로 측정합니다. MICA는 이를 확장해 조립된 소비자 에이전트가 현지 채널, 본인확인, 결제 수단을 갖춘 시장에서 일상 볼일을 끝내는 능력을 평가합니다.
과제마다 점수 하나, 세 축은 따로
정확도·속도·비용은 고유 단위 그대로 따로 공개합니다. 적격 실행마다 100 × 정확도 × 속도 × 비용의 파생 요약값을 계산할 수 있지만, 참조값·반복 실행 계약·불확실성을 파일럿에서 보정하기 전에는 대표 수치나 순위 기준으로 쓰지 않습니다. 아직 점수를 받은 과제는 없습니다.
만든 것과 아직인 것
각 부분의 현재 공개 상태를 명확히 표시합니다. 아래 항목은 측정 결과가 아니라 구축 상태입니다.
에이전트에게 시키는 일
계열마다 무엇을 끝내야 완료인지, 그리고 동의 없이 넘어서면 안 되는 선이 어디인지 정해 둡니다.