본문으로 건너뛰기

방법론 초안

무엇을 측정하고, 무엇을 측정하기를 거부하는가

MICA는 순위표이기 이전에 측정 도구입니다. 이 페이지는 정의와 관문과 알려진 한계를 명시합니다. 그래야 논쟁이 숫자가 아니라 방법을 두고 벌어질 수 있습니다.

프리뷰 0.1

6개 시장 · 10개 과제 계열 · 3개의 독립된 결과 축.

이 위키는 MICA의 현재 최종 방법론과 그 근거를 공개합니다.

방법론 Markdown 다운로드 이 페이지와 같은 정본 데이터에서 생성됩니다.

읽기 표식

현재 규칙
MICA가 지금 적용하는 규칙입니다. 현재 방법론에 구속력이 있습니다.
MICA 정책
MICA가 스스로 내린 규범적 선택입니다. 어떤 외부 연구도 이를 승인하지 않았으며, 그 자체로 반박할 수 있습니다.
외부 근거
공개된 연구에서 가져온 결과나 관행이며, 레퍼런스 장에 출처를 밝힙니다. 인용은 원저자의 승인을 뜻하지 않습니다.
미해결 질문
아직 정해지지 않았습니다. MICA는 갖고 있지 않은 답을 암시하는 대신 질문을 그대로 밝힙니다.

1 MICA가 존재하는 이유

MICA는 6개의 국가별 현지 실생활 시장과 여러 일상 과제 영역에 걸쳐, 결과가 검증되는 소비자 에이전트의 엔드투엔드 실행을 평가하도록 설계된 세계 최초의 공개 벤치마크 이니셔티브입니다. 공개된 에이전트 벤치마크는 벤치마크가 통제하는 환경에서 능력을 측정하지만, 가정이 실제로 구매하는 것은 아무도 통제하지 않는 현지 서비스 안에서 동작하는 시스템 전체입니다. MICA는 그 간극에 있으며, 결과를 보고하는 벤치마크가 아니라 평가하도록 설계된 이니셔티브입니다.

외부 근거세계 최초 주장과 그 범위
MICA는 6개의 국가별 현지 실생활 시장과 여러 일상 소비 영역에 걸쳐, 결과가 검증되는 소비자 에이전트의 엔드투엔드 실행을 평가하도록 설계된 세계 최초의 공개 벤치마크 이니셔티브입니다. 이 주장은 네 조건이 동시에 성립하는 결합을 가리킵니다. 6개의 국가별 현지 실생활 시장, 여러 일상 소비 영역, 탐색이나 응답이 아닌 엔드투엔드 실행, 그리고 권위 있는 결과 또는 최종 상태 근거 요건입니다. 이는 범위가 한정된 범주 주장입니다. 선행 연구에 실제 웹사이트, 쇼핑, 여행, 앱, 거래, 상태 점검이 개별적으로 없었다는 뜻이 아니며, 선행 연구에는 그 각각이 존재합니다. 검토 기준일은 2026년 8월 8일이고, 유한한 문헌 검토에 근거해 저희가 아는 범위에서 밝히는 주장입니다. MICA는 현재 시스템 0개, 실행 셀 0개인 평가 설계 단계의 이니셔티브이며, 무엇에 대해서도 측정된 우위를 보고하는 벤치마크가 아닙니다.
외부 근거측정되지 않고 있는 간극
실행 기반 벤치마크들은 과제를 기록이 아니라 최종 상태로 채점할 수 있음을 확립했고, 통제된 환경에만 머무르지도 않습니다. WebVoyager는 살아 있는 웹사이트에서 동작하고, WebArena와 WebShop, AndroidWorld, AppWorld는 통제되거나 시뮬레이션된 환경을 쓰며, tau-bench는 시뮬레이션된 도메인 정책과 백엔드 상태로 상호작용을 판정합니다. 다만 어느 쪽도 다음 결합을 함께 갖추지는 않습니다. 6개의 국가별 현지 실생활 시장, 여러 일상 소비 영역, 끝까지 수행되는 실행, 권위 있는 완료 기록, 그리고 사용자가 실제로 쓰는 언어와 화계입니다.
현재 규칙시스템이 평가 대상이다
기반 모델의 점수는 용무가 완료되는지를 예측하지 못합니다. 그것을 결정하는 것은 스캐폴딩과 라우팅, 메모리, 권한, 복구이며, 구매자가 실제로 고르는 대상도 그것들입니다. 그래서 MICA는 조립된 시스템을 측정하고 모델을 단독으로 측정하지 않습니다.
MICA 정책어려운 부분은 현지성이다
영어 과제를 번역하는 벤치마크는 번역을 측정합니다. MICA의 시장들은 여정이 어느 채널에 있는지, 누가 승인해야 하는지, 언제 실제로 완료되는지, 무엇이 증명이 되는지에서 서로 다르며, 그 차이는 부수적 복잡성이 아니라 측정의 핵심입니다.
현재 규칙MICA가 되기를 거부하는 것
측정 대상 시스템의 홍보 지면이 아니고, 다시 도출할 수 없는 수치를 공개하는 순위표가 아니며, 측정이 없는 것을 낮은 값으로 취급하는 지수가 아닙니다.

2 구성 개념과 평가 단위

무엇을 측정하는지를, 제출자가 무엇을 고정해야 하는지 알고 독자가 점수의 대상이 무엇인지 알 만큼 정확하게 규정합니다.

현재 규칙평가 단위
버전이 고정된 완성 상태의 소비자 에이전트 시스템 스냅샷입니다. 스캐폴드와 오케스트레이션, 과제별 모델 라우팅, 메모리, API와 도구, 브라우저와 앱 조작, 권한, 현지화, 안전 동작, 복구를 포함합니다. 기반 모델이 아닙니다.
현재 규칙버전 고정 의무
스냅샷은 명시된 버전과 날짜로 식별됩니다. 평가 도중 변경된 시스템은 다른 스냅샷이며, 결과가 이어지지 않습니다.
외부 근거왜 모델 점수가 아닌가
이질적인 대화형 벤치마크들은 같은 기반 모델을 쓰는 시스템들도 환경마다 크게 다르게 동작함을 이미 보여 줍니다. 성질이 다른 환경을 가로질러 합산하지 않고, 조립된 시스템을 대상으로 삼는 이유입니다.
현재 규칙선언된 구성
제출된 스냅샷은 오케스트레이터, 라우팅 가능한 모델, 호출 가능한 도구, 메모리 동작을 선언합니다. 선언하지 않은 기능을 실행 중에 사용하면 그 실행은 무효가 됩니다.

3 현재 벤치마크 수명주기와 상태

지수가 실제로 어디에 있는지를 밝힙니다. 이 장의 모든 수치는 문장에 적어 넣은 것이 아니라 살아 있는 기록에서 세어 온 값입니다.

현재 규칙현재 적용되는 범위
6개 시장, 10개 과제 계열, 100개 표준 과제 정의입니다. 현재 범위는 이것이 전부입니다.
현재 규칙측정된 결과 없음
등록된 시스템은 0개, 실행 셀은 0개입니다. 공개 적격 여부는 false입니다. 이 사이트의 어떤 내용도 특정 시스템의 실제 동작을 설명하지 않습니다.
현재 규칙과제 목록 상태
공개된 100개 정의는 모두 잠정 후보이며 검증된 것은 0개입니다. 표준 과제 본문은 en, ko로만 존재하며, 이는 번역 지원일 뿐 모든 시장에 대한 언어적 검증이 아닙니다.
MICA 정책후보는 설계 자료다
공개된 정의는 방법론이 숫자를 만들어 내기 전에 비판받도록 존재합니다. 이를 역설계해 최종 벤치마크로 삼아서는 안 되며, 앞으로의 과제 저작은 이 정의들과 독립적으로 이 방법론을 따릅니다.
현재 규칙실패 시 차단되는 공개
최소 표본 수와 최소 커버리지가 정해지지 않았고, 관문은 값을 가정하는 대신 거부합니다. 데모와 프리뷰 데이터는 결코 공개 적격이 될 수 없으며, 이는 스키마 계층이 빌드 시점에 강제합니다.

관문

3.1 공개 규칙

하나의 셀은 아래 조건을 모두 통과해야 합니다. 하나라도 통과하지 못하면 그 셀은 숨겨지는 대신 차단 사유와 함께 표시됩니다. 두 조건은 아직 합의된 수치가 없으므로, 이 프리뷰의 어떤 것도 관문을 통과할 수 없습니다.

최소 유효 실행 수
미정. MICA는 최소 표본 크기를 합의하지 않았으므로 어떤 셀도 그 기준으로 판단할 수 없습니다. 관문은 숫자를 짐작하는 대신 거부합니다.
최소 커버리지
미정. 한 시장의 표준 과제 중 몇 퍼센트를 시도해야 하는지 MICA가 합의하기 전까지, 커버리지는 통과 조건이 될 수 없습니다.
임계값
이 에디션에는 공개 기준값이 설정되어 있지 않습니다. MICA가 과제별 실행 횟수, 최소 셀 표본 크기, 과제 커버리지, 최대 부적격 제외율을 아직 합의하지 않았으므로, 어떤 결과도 공개 대상으로 표시될 수 없습니다.
중대 안전 사건
중대 안전 사건이 하나라도 있으면 해당 셀의 공개를 영구히 차단합니다. 차단된 셀을 상위 집계에서 제외하지 않고 그 위의 계열·국가 수치 자체를 비공표합니다. 재실행으로 사건을 지우지 않습니다.
검증
독립 재실행만 인정합니다. 잠정 결과와 자체 보고 결과는 투명성을 위해 표시되며 공식으로 공개되지 않습니다.
데이터 상태
데모와 프리뷰 데이터는 어떤 경우에도 공개 대상이 될 수 없습니다. 이는 스키마 계층에서 강제되며, 데모 레코드가 그렇지 않다고 주장하면 빌드 시점에 오류를 냅니다.

4 지금 구현된 것과 앞으로 계획된 것

설계 의도를 자신 있게 서술하면 이미 구현된 기능처럼 읽힙니다. 이 장은 그 둘을 항목마다 분리하며, 계획으로 표시된 것은 존재하지 않습니다.

  • 구현됨

    이중 언어 공개 사이트와 공개된 방법론

    이 위키와 시장 에디션, 과제 목록, 기계 판독 가능한 내보내기 파일이 모두 타입이 지정된 원본 데이터에서 생성되어 공개되어 있습니다.

  • 구현됨

    검증된 데이터·공개 계약

    스키마 검증, 내보내기 시 홀드아웃 분리, 실패 시 차단되는 공개 관문, 과제별 채점 함수가 모두 코드로 동작하며 위반 시 빌드를 실패시킵니다.

  • 구현됨

    선언된 시장 연동 프로필

    모든 시장 에디션이 대표 표면, 승인 경계, 완료 의미, 복구 조건, 근거 요건을 선언합니다. 선언된 커버리지는 계획이며 측정이 아닙니다.

  • 계획됨

    실행 하니스와 평가기

    초기화 가능한 환경, 실행 기록기, 결정적 최종 상태 평가기, 비용·지연 원장이 여기 해당합니다. 아직 아무것도 존재하지 않으므로 어떤 시도도 실행된 적이 없습니다.

  • 계획됨

    검증된 현지화 시나리오

    현지에서 저작하고 검토한, 속도·비용 기준값이 사전 등록된 실행 가능 시나리오입니다. 현재 목록은 후보 정의뿐입니다.

  • 계획됨

    비공개 홀드아웃 세트

    분리 자체는 지금도 내보내기 단계에서 강제되지만, 홀드아웃 항목이 아직 저작되지 않았으므로 실제로 감춰 둔 것은 없습니다.

  • 계획됨

    반복 실행과 불확실성 보고

    구간 추정, 반복 시행 신뢰도, 채점 정책에 대한 민감도 분석입니다. 모두 하니스 구축을 기다리고 있습니다.

  • 계획됨

    라이브 섀도우와 제한적 실거래 트랙

    공급자 연동이 없고, 보유한 실계정이 없으며, 실제 서비스를 대상으로 수행한 실행도 없습니다.

  • 계획됨

    공개 기준값

    최소 표본 수와 최소 커버리지는 의도적으로 정하지 않았습니다. 합의되기 전까지 관문은 숫자를 추측하지 않고 모든 결과를 거부합니다.

  • 계획됨

    독립 의사결정 기구

    위원회나 이사회, 심의 패널이 구성된 적이 없고 구성원도 없습니다. 이 사이트의 어떤 내용도 그런 기구의 산출물로 읽혀서는 안 됩니다.

5 과제 저작과 시장 현지화

무엇이 MICA의 과제가 되는지, 그리고 무엇이 그것을 번역이 아니라 현지의 과제로 만드는지 설명합니다.

현재 규칙직교하는 세 가지 설계 항목
모든 과제는 상호작용 표면, 종료 또는 완료 유형, 선언된 인지 복잡도를 명시합니다. 세 항목은 서로 독립적으로 변하므로 표면을 통해 난이도를 몰래 끼워 넣을 수 없고, 목록을 항목별로 따로 균형 잡을 수 있습니다.
MICA 정책현지 저작, 현지 검토
과제는 해당 시장의 서비스를 실제로 사용하는 사람이 저작하고 검토합니다. 영어 과제를 번역하는 것은 현지화가 아니며, 번역해도 그대로인 과제는 대개 현지적인 것을 전혀 시험하지 않습니다.
현재 규칙현지성이 포괄해야 하는 것
실제 서비스와 채널 관행, 주소와 이름 형식, 날짜와 시간과 통화 처리, 언어의 화계와 문자, 공휴일, 결제와 본인확인 경로, 사용자가 이어받아야 하는 지점, 그리고 그 시장에서 최종 상태를 유효하게 만드는 조건입니다.
미해결 질문현재 번역 지원의 한계
표준 과제 본문은 en, ko로 존재합니다. 모든 시장 에디션에서 현지 저작 본문과 현지 검토에 도달하는 것은 그 시장의 결과를 공개하기 위한 선결 요건이며, 아직 이루어지지 않았습니다.
외부 근거에디션별 문서화
각 목록 에디션은 동기와 구성, 수집, 의도된 용도, 배포, 유지관리를 담은 데이터시트 형식의 기록과, 언어 변종 및 역할 수준의 검토자 맥락을 담은 데이터 스테이트먼트 기록을 함께 지닙니다.
외부 근거매개변수화된 사례
정의 하나는 외울 수 있는 단일 시나리오가 아니라 검증 가능한 여러 사례를 만들어야 합니다. 업무·모바일 에이전트 환경의 매개변수화 과제 관행을 따릅니다.

시장 현지 적합성

5.1 성공은 그 결과를 주장하는 시장에서 유효해야 합니다

번역만으로는 현지화가 아닙니다. 각 표준 과제는 최종 상태가 만족해야 할 현지 조건을 선언합니다. 현지 유효성 실패는 과제 실패 또는 별도 진단값이며 단순한 문체 피드백이 아닙니다.

  1. 언어와 격식

    언어, 존대, 어조, 문자는 해당 시장의 수신자, 기관, 채널에 맞아야 합니다.

  2. 신원과 형식

    이름, 주소, 전화번호, 날짜, 시간대, 통화, 단위는 현지에서 유효한 형식을 사용해야 합니다.

  3. 결제와 인증

    현지에서 이용 가능한 결제 수단, 인증, 신원확인, 사용자 동의 절차를 따라야 합니다.

  4. 법규와 소비자 조건

    세금, 의무 수수료, 취소, 환불, 고지, 소비자보호 조건은 해당 시장의 적용 규칙으로 평가합니다.

  5. 운영 현실

    재고, 배송권역, 영업시간, 공휴일, 서비스 지역, 실제 운행 일정은 평가 시점에 유효해야 합니다.

  6. 채널과 인계

    현지에서 통상 사용하는 채널을 쓰고, 시장에 맞는 승인 경계에서 사용자나 사람에게 제어권을 돌려줘야 합니다.

  7. 과제별 유효성

    예약은 시간과 취소 조건을 지키고, 이동은 실제 운행과 접근성 데이터를 사용하며, 행정과 의료 행정은 올바른 관할, 서식, 비임상 절차를 따라야 합니다.

6 접근 동일 조건과 시장 연동 조건

두 시스템이 서로 다른 출발 조건에 놓이면 그 비교는 조건을 측정합니다. MICA는 조건을 고정하고, 각 시장 에디션이 요구할 것을 선언합니다.

현재 규칙동일하게 고정되는 것
선택된 대표 플랫폼, 계정 등급, 부여된 권한, 초기 상태, 확인 경계는 특정 과제 버전에 대해 모든 시스템에서 동일합니다.
현재 규칙앱 폐쇄성은 조건이지 가산점이 아니다
앱 폐쇄성과 신원 인계는 환경의 통제된 조건입니다. 폐쇄된 채널 안에서 동작한다고 해서 가산점을 주지 않고, 그러지 못했다고 해서 면제해 주지도 않습니다.
외부 근거실행은 API 존재 여부와 별개로 플랫폼이 통제한다
공식 플랫폼 문서를 보면 탐색과 읽기 접근은 자격 증명이 필요하더라도 대체로 폭넓게 문서화되어 있는 반면, 상태를 바꾸는 실행에는 조건이 붙습니다. 메시징, 결제, 계정 기능, 미니앱 실행에는 등록된 애플리케이션이나 채널, OAuth 또는 플랫폼 동의, 심사를 거친 스코프, 허용된 수신자 관계, 가맹점이나 파트너 온보딩, 사용자 조작, 통제된 런타임, 배포 심사가 요구될 수 있습니다. 이는 어떤 시장에 API가 없다는 뜻이 결코 아니며, API가 있다는 사실만으로 특정 시점에 특정 시스템이 소비자 용무를 운영 환경에서 완료할 수 있음이 성립하지는 않는다는 뜻입니다. 그래서 MICA는 운영 환경에서의 실행 가능성을 API 존재 여부와 분리된 사실로 시장 에디션마다 기록하고, 시스템의 속성이 아니라 환경의 조건으로 다룹니다.
현재 규칙시장 연동 프로필
6개 시장 에디션은 각각 최소 5개의 대표 상황을 선언하며, 최소 3개 표면, 3개 승인 경계, 2개 완료 의미, 3개 복구 조건, 4개 근거 유형을 포괄합니다.
현재 규칙선언되었을 뿐 수행되지 않음
프로필은 계획된 커버리지를 선언합니다. 어떤 상황도 시스템을 대상으로 수행된 적이 없고, 공급자 엔드포인트를 명시하지 않으며, 어떤 시장도 근거로 커버되었다고 기술할 수 없습니다.
현재 규칙환경 결함은 에이전트 실패가 아니다
서비스에 접근할 수 없거나 평가기에 결함이 있거나 시작 상태가 깨진 경우 그 시도는 무효가 됩니다. 채점 전에 사유와 함께 제외하며, 실패로 세지 않습니다.

시장별 실행 환경

6.1 국가별 대표 플랫폼은 실행 전에 고정합니다

MICA는 특정 시스템, 공급자, 모델, 인터페이스 또는 도구 연동에 유리하다는 이유로 플랫폼을 선택하지 않습니다. 플랫폼 장애는 시스템 실패로 채점하지 않고 해당 실행 셀을 중단하거나 무효화합니다.

  1. 대표 후보군

    MICA는 시장과 과제마다 그 시장의 일반 소비자가 실제로 널리 이용하는 플랫폼 후보군을 현지 도달 범위, 현재 가용성, 과제 관련성 근거와 함께 사전 등록합니다.

  2. 기능 적합성

    선정 플랫폼은 과제의 선언된 최종 상태, 제약 조건, 확인 경계를 바꾸지 않고 표준 과제를 지원해야 합니다.

  3. 접근 동등성

    모든 평가 시스템에 같은 선정 플랫폼, 계정 등급, 시작 상태, 권한, 확인 경계를 제공합니다.

  4. 사전 등록과 대체

    선정 플랫폼, 버전, 스냅샷 날짜, 대체 순서를 실행 전에 고정합니다. 대체 플랫폼은 문서화된 장애 때만 사용하며 특정 시스템에 더 쉽다는 이유로 바꾸지 않습니다.

  5. 근거 계보

    공개 실행 셀에는 실제 사용 플랫폼, 버전과 스냅샷 날짜, 선정 근거, 사전 등록된 대체 플랫폼 사용 여부를 기록합니다.

시장 연동

6.2 연동 커버리지 계약

각 시장 에디션은 검증된 과제가 포괄해야 할 대표적인 현지 조건을 선언하고, 앞으로의 모든 실행은 그중 무엇을 수행했는지 밝힙니다. 실행 가능한 과제가 생기기 전에 계약을 공개하는 이유는 아직 바꾸는 데 비용이 들지 않을 때 반박받기 위해서입니다.

접근 조건의 동일 적용
접점과 승인 경계는 모든 시스템에 동일하게 적용되는 고정 조건입니다. 이곳의 과제가 무엇을 요구하는지를 나타낼 뿐 난이도를 뜻하지 않으며 가점도 감점도 없습니다.
올바른 인계
과제 계약이 그렇게 정한 경우, 일회용 코드나 신원 승인, QR 결제, 카드 승인 지점에서 멈추는 것은 올바른 완료입니다. 사용자가 이어서 진행할 수 있도록 상태를 보존해야 합니다.
호출 성공은 완료가 아닙니다
완료가 비동기이거나 에이전트 화면 밖에서 이루어질 때, 호출이 성공했다는 사실은 최종 상태의 증거가 아닙니다. 영수증이나 권위 있는 응답, 또는 상태 재확인이 필요합니다.
재시도와 멱등성
멱등하지 않은 동작을 다시 시도할 때는 반드시 보호하고 기록해야 합니다. 그래야 중복 주문, 중복 예약, 중복 결제를 추정이 아니라 확인으로 잡아낼 수 있습니다.
근거 연결
검증된 현지 실행 기록은 자신이 수행한 시장 상황을 명시합니다. 이 연결은 해당 시장이 선언한 상황 목록과 대조하므로, 다른 시장의 상황이나 존재하지 않는 상황은 거부됩니다.
이것이 아닌 것
이는 커버리지 계획이며 결과가 아닙니다. 모든 상황을 포괄한다고 주장하는 과제는 없고, 어떤 시스템도 시도한 적이 없으며, 특정 사업자의 접속 지점이나 비공개 인터페이스, 외부 서버를 지목하지도 않습니다.

6개 시장이 선언된 프로필을 갖고 있습니다. 그중 수행된 것은 없으며, 근거로 커버되었다고 표현하는 시장도 없습니다.

7 완료와 인계, 안전, 최종 상태 평가

이 방법론에서 정의상 가장 어려운 문제입니다. 비동기로, 그리고 에이전트 자신의 표면 바깥에서 완료되는 서비스에서 용무가 실제로 끝났는지를 판정해야 합니다.

현재 규칙기록이 아니라 최종 상태
성공은 평가기가 확인할 수 있는 선언된 최종 상태이며, 그 상태가 충족해야 할 의무와 함께 실행이 위반하지 않아야 할 불변 조건 및 금지 상태 점검으로 표현합니다.
현재 규칙올바른 정지도 완료가 될 수 있다
일회용 비밀번호, 통신사 본인확인, 정부 신원확인, QR 또는 기기 결제, 계정 소유자 승인 지점에서 멈추고 사용자에게 넘기는 것은, 과제 계약이 그 경계를 완료 지점으로 선언한 경우 유효한 완료입니다.
현재 규칙성공한 호출은 증명이 아니다
비동기이거나 상태가 갈라지는 여정에서는 API나 도구가 응답을 수락했다는 사실만으로 최종 상태가 성립하지 않습니다. 실행은 권위 있는 확인 응답이나 행위 후 되읽기, 또는 인계 기록을 남겨야 합니다.
현재 규칙멱등하지 않은 재시도는 통제한다
반복이 두 번째 주문이나 예약, 결제를 만들 수 있는 경우 과제 계약은 멱등성 기록을 요구합니다. 재시도로 생긴 중복은 그 시도의 실패이며, 다시 얻은 기회가 아닙니다.
현재 규칙다섯 가지 진단 결과, 하나의 이진 인자
모든 시도는 확인된 성공, 미검증 완료, 부분 진행, 복구 가능한 실패, 치명적 실패 중 하나로 분류합니다. 분류는 결과를 설명하며, 정확도 인자는 여전히 부분 점수를 인정하지 않습니다.
현재 규칙치명적 안전 사건은 영구 차단한다
치명적 안전 사건은 그것이 발생한 셀의 공개를 영구히 차단합니다. 차단된 셀을 집계에서 빼지 않고 그 위의 계열·시장 수치도 모두 비공표합니다. 그것을 지우는 재실행도, 기록에서 삭제하는 이의 절차도 없습니다.

진단

7.1 일곱 개의 진단 축

결과를 설명할 때 MICA가 들여다보는 일곱 가지입니다. 이 프리뷰에서는 근거 중심이며 점수가 없습니다. 1–5의 값도, 등급도, 합산할 것도 없습니다. 아직 점수를 매길 근거 기반이 없기 때문입니다.

오케스트레이션
분해, 순서 배치, 재시도, 그리고 멈추기로 하는 판단. 같은 기반 모델을 쓰는 시스템들 사이의 격차를 만드는 가장 큰 관측 원인입니다.
모델 라우팅
각 하위 단계를 적절한 모델로 보내는지, 그리고 경로를 쓸 수 없을 때 무너지지 않고 완만하게 성능을 낮추는지.
메모리
페르소나 사실, 앞선 제약, 과제 진행 상태를 단계 사이에 유지하면서 사용자에게 다시 묻거나 스스로 모순되지 않는 능력.
도구·API 사용
시스템이 선언한 도구를 정확하고 최소한으로, 형식에 맞게 사용하는지. 부분 응답과 오류 응답의 처리도 포함합니다.
현지화
언어, 주소와 이름 형식, 현지 결제·신원 인프라, 공휴일, 그리고 시장별 서비스 관행.
안전
확인 경계를 지키고, 동의 없이 되돌릴 수 없는 행위를 피하며, 범위를 벗어난 자격 증명 사용을 거부하는지.
복구
단계가 실패한 뒤의 행동. 탐지, 진단, 대체 경로, 또는 상태를 깨끗이 남긴 채 정직하게 멈추기.

8 과제별 채점과 집계

세 축의 원값이 기록입니다. 유효하고 검증된 실행마다 감사용 곱을 파생할 수 있지만, 참조값·반복 실행·불확실성을 파일럿에서 보정하기 전에는 대표 결과나 순위 기준으로 쓰지 않습니다. 곱셈은 MICA 자신의 규범적 선택입니다.

MICA 정책0의 거부권
정확도가 이진이고 형태가 곱셈이므로, 확인된 성공이 아닌 모든 결과는 곱 전체를 0으로 만듭니다. 속도와 비용은 완료하지 못한 것을 보상하지 못하며, 이 비보상적 성질은 의도된 것입니다.
MICA 정책척도 가정
정규화된 성분을 곱하는 것은 비율 척도들이 서로 비교 가능하고, 한 인자의 비례적 손실이 다른 인자의 같은 비율 손실과 동등하다고 가정합니다. MICA는 이 가정이 성립함을 확립하지 않았고, 이 곱을 형식적 효용으로 제시하지도 않습니다.
MICA 정책외부의 승인 없음
인용된 어떤 연구도 이 곱셈을 도출하거나 승인하지 않았습니다. 합성지표와 다목적 의사결정 문헌은 MICA가 충족하지 못한 조건을 밝히기 위해 인용한 것이지, 산식에 권위를 빌려주기 위한 것이 아닙니다.
현재 규칙민감도 분석과 감사 요건
채점 정책에 대한 민감도 분석 없이는 어떤 공식 수치도 공개할 수 없습니다. 대안적 정규화와 집계에서 순위가 어떻게 달라지는지 보여야 하며, 분석을 독립적으로 다시 할 수 있도록 과제 단위 결과를 공개합니다.
현재 규칙비용 0은 만점이 아니다
비용 성분에는 0보다 큰 계측 평가 비용이 필요합니다. 비용이 0이거나 계측되지 않았으면 미측정으로 기록하고 점수를 주지 않으며, 완벽한 효율로 간주하지 않습니다.
외부 근거매크로와 마이크로 가중
과제 단위로 평균하는 것과 시장 단위로 평균하는 것은 의미가 다른 서로 다른 가중입니다. MICA는 분모가 조용히 결정하게 두지 않고 계열, 시장, 시장 간 수준에서 이 구분을 명시적으로 적용합니다.

정의

8.1 세 개의 결과 축

이 셋은 언제나 고유 단위 그대로 나란히 보고됩니다. 동시에 정규화된 성분으로 바뀌어 과제마다 하나의 최종 점수로 곱해지며, 그 방식은 다음 절에 있습니다. 원값 축이 여전히 기록이고, MICA는 제출자가 제시한 점수나 가중치를 그 자리에 대신 놓지 않습니다.

정확도
확인된 최종 상태에 도달한 유효 실행의 비율시스템이 확인 경계 안에서, 복구 불가능한 오류 없이, 과제가 선언한 최종 상태에 도달했는가?
속도
실제 경과 초, 성공한 유효 실행만성공한 실행이 처음부터 끝까지 걸린 시간. 빠른 실패가 빠른 성공으로 읽히지 않도록 실패한 실행은 제외합니다.
비용
성공한 유효 실행당 통화 금액전체 유효 시도 비용을 성공한 유효 실행 수로 나눈 값. 실패의 비용은 그 실패를 거쳐 도달한 성공에 부과됩니다.

채점

8.2 원값 세 축을 먼저, 파생 감사값 하나를 다음에

점수는 요청 시 원본 기록에서 도출하지만, 참조값·반복 실행·불확실성을 파일럿에서 보정하기 전에는 대표 결과가 아닌 감사용 파생값으로 둡니다. 아직 점수가 매겨진 것은 없습니다. 현재 과제 정의는 사전 등록 기준값이 없는 잠정 후보입니다.

과제별 최종 점수

100 × 정확도 × 속도 × 비용

각 인자는 원래의 초나 달러가 아니라 0과 1 사이로 정규화된 성분이므로, 곱한 값은 0에서 100 사이에 놓입니다.

정확도 성분
확인된 성공이면 1, 그 밖의 모든 결과는 0입니다. 부분 점수가 없으므로 더 빠르거나 더 싼 실패도 영점입니다. 곱셈이 그 영을 지나가기 때문입니다.
속도 성분
min(1, 속도 기준값 ÷ 관측 초)입니다. 기준값은 실행 가능한 검증 과제 버전마다 사전에 등록하며 채점 대상 집단에서 다시 도출하지 않습니다. 그래서 느린 집단이 느린 시스템을 빨라 보이게 만들 수 없습니다. 기준값을 앞질러도 1에서 멈춥니다.
비용 성분
min(1, 비용 기준값 ÷ 계측된 평가 실행 비용(USD))입니다. 비용이 영이거나 계측되지 않았으면 만점을 주지 않고 미측정으로 기록합니다.
계열 점수와 국가 점수
해당 계열 또는 시장의 적격 실행에서 파생한 과제 점수의 산술평균입니다. 사전 등록한 canonical 과제 집합이 완결되지 않으면 비공표합니다. 제외 항목은 분모에서 조용히 사라지지 않고 사유와 함께 남깁니다.
시장과 항목을 가로지르는 종합
정의되어 있지 않습니다. 단일 종합 수치를 내려면 시장과 항목에 걸친 가중치가 필요한데 MICA는 그것을 합의하지 않았습니다. 그래서 공개하지 않으며, 리더보드 구조가 그런 수치를 암시하지도 않습니다.
점수가 없는 과제
시도되지 않았거나 유효하지 않거나 사전 등록된 기준값이 없는 과제에는 점수 자체가 없습니다. 사유와 함께 평균에서 제외하며 0으로 세지 않습니다.
원값 공개
성공 여부 원값, 실제 경과 시간 원값, 평가 실행 비용 원값은 모든 점수 옆에 고유 단위 그대로 공개되며, 점수와 무관하게 검증할 수 있습니다.
이 식에서 비용의 뜻
평가 실행 비용, 즉 과제를 실행하는 데 든 모델·도구·API 비용이며 단위는 USD입니다. 에이전트가 처리한 상품 가격, 예약 금액, 거래 금액이 아니므로 어떤 환산도 곱셈에 끼어들지 않습니다.
현재 상태
측정된 시스템이 없고 점수를 가진 과제도 없습니다. 이 식은 숫자를 만들어 내기 전에 반박받도록 초안으로 공개합니다.

집계 규칙

8.3 유효성과 분모

벤치마크를 둘러싼 논쟁 대부분은 사실 분모를 둘러싼 논쟁입니다. 그래서 MICA는 자신의 분모를 적어 둡니다.

유효 실행이란 심사를 통과한 시도를 말합니다. 환경에 접근할 수 있었고, 페르소나와 그 계정이 선언된 시작 상태에 있었으며, MICA 측 결함이 실행을 방해하지 않은 경우입니다. 유효하지 않은 시도는 실패로 세지 않고 채점 전에 버립니다.

정확도는 성공한 유효 실행을 유효 실행으로 나눈 값이며, 95% 윌슨 점수 신뢰구간과 함께 보고합니다. 정규근사 대신 윌슨 구간을 쓰는 이유는 MICA의 셀이 작고 값이 0이나 1 근처에 놓이는 일이 잦은데, 그 구간에서 정규근사가 잘못 작동하기 때문입니다.

속도는 성공한 유효 실행의 실제 경과 시간만 사용하며 p50과 p95로 보고합니다. 실패한 실행의 시간도 측정해 실행 셀에 보관하지만, 공개 백분위수에서는 의도적으로 제외합니다. 포함하면 빨리 포기하는 시스템이 빠른 것으로 보일 수 있기 때문입니다. 따라서 속도 수치는 성공한 실행만을 대상으로 하며, 정확도의 분모인 전체 유효 실행보다 대상 수가 적습니다.

비용은 모든 유효 시도의 총비용을 성공 횟수로 나눈 값이며, 해당 시장의 통화로 표시합니다. 실패의 비용은 그 실패를 거쳐 도달한 성공에 부과됩니다. 성공이 0이면 값 자체가 존재하지 않으므로, 표는 0이나 무한대를 보여 주는 대신 “성공한 과제 없음.”라고 적습니다.

여러 시장에 걸친 수치에는국가 매크로 평균을 사용합니다. 국가별 값의 평균이며, 모든 시장이 갖춰졌을 때만 계산합니다. 한 시장이 빠지면 그것을 0으로 다루는 대신 전체 수치를 보류합니다.

제약을 반영한 가격 품질

8.4 커머스 결과는 최저 유효 총액과의 근접도를 따로 보고합니다

커머스, 예약, 결제 과제에서는 같은 평가 시점에 사전 등록된 대표 플랫폼 후보군에서 확인한 최저 유효 총액과 시스템 선택을 비교합니다. 가격 근접도는 별도로 보고하며 정확도·속도·비용 성분에도, 과제별 최종 점수에도 합치지 않습니다.

  1. 동등한 제안

    상품 식별자, 규격, 수량, 배송지, 도착 기한, 서비스 등급, 취소 조건이 동등한 경우에만 가격을 비교합니다.

  2. 최종 예상 총액

    상품 가격, 배송비, 세금, 서비스비, 결제 수수료를 포함한 최종 결제 예상 총액을 비교합니다.

  3. 사용 가능한 할인

    쿠폰, 회원등급, 개인화 혜택은 테스트 페르소나가 실제로 사용할 수 있을 때만 반영하고 요건과 적용 상태를 기록합니다.

  4. 유효한 기준값

    기준값은 사전 등록된 대표 플랫폼에서 제약을 만족하며 확인된 최저 총액이고, 시각, 가용성, 근거 계보를 함께 남깁니다.

  5. 가격 근접도

    선택 총액, 기준 총액, 절대 차이, 비율 프리미엄을 보고합니다. 이를 시장 전체의 절대 최저가라고 부르지 않습니다.

  6. 제약 조건 우선

    더 싼 선택지가 품질, 안전, 판매자 신뢰도, 배송, 취소 또는 사용자의 다른 선언 제약을 위반하면 후보에서 제외합니다.

9 모델 라우팅과 메모리, 도구 근거

시스템은 가장 적합하다고 판단하는 모델을 자유롭게 사용할 수 있고, 한 번의 시도에서 여러 모델을 쓸 수도 있습니다. 다만 무엇을 사용했는지 밝히지 않는 것은 허용되지 않습니다.

현재 규칙라우팅은 평가 대상 시스템의 일부다
과제마다 모델을 고르는 것과 한 시도에서 여러 모델을 호출하는 것은 정당한 설계 결정이며 그 자체로 감점되지 않습니다. 시스템 전체가 낸 정확도와 속도와 평가 비용을 통해서만 점수에 반영됩니다.
현재 규칙필수 호출 근거
모든 모델 호출은 공급자, 모델, 버전, 목적, 토큰, 비용, 지연, 그리고 시도 안에서의 순서를 기록합니다. 설명되지 않은 호출이 있는 시도는 채점하지 않습니다.
현재 규칙메모리는 평가 범위 안에 있다
사용자에게 다시 묻거나 스스로 모순되지 않으면서 페르소나 정보와 앞선 제약, 과제 중 상태를 이어 가는 것은 평가 대상 시스템의 일부입니다. 선언했지만 사용되지 않은 메모리도 그 사실을 기록합니다.
외부 근거올바르게 호출하지 않는 것도 평가된다
도구가 필요 없다고, 또는 도구를 호출해서는 안 된다고 올바르게 판단하는 것은 측정 가능한 행동이며, 무시하지 않고 기록합니다.

10 트랙과 신뢰도, 불확실성, 결측 데이터

결과가 어떻게 만들어질 것인지, 그것을 얼마나 신뢰할 수 있는지, 그리고 쓸 것이 없을 때 MICA가 무엇을 적는지 설명합니다.

현재 규칙세 가지 트랙
시뮬레이터는 결정적인 현지 복제본을 대상으로 실행합니다. 라이브 섀도우는 실제 서비스를 대상으로 하되 확인 경계에서 멈춥니다. 제한적 실거래는 MICA가 보유한 시험 계정에서 소수의 종단 간 실행만을 다룹니다. 셋 모두 설계 의도이며 구현된 하니스가 아닙니다.
현재 규칙실서비스 연동은 존재하지 않는다
공급자 연동도, 실계정도, 어떤 트랙에서의 측정된 실행도 없습니다. 트랙 용어는 앞으로의 실행이 어떤 것일지를 설명할 뿐, 일어난 일을 설명하지 않습니다.
외부 근거비교에 앞선 반복
단일 실행의 점 추정은 오해를 부르며, 값이 0이나 1에 가까운 작은 셀에서 특히 그렇습니다. 시스템 간 비교를 공개하기 전에 반복 시도와 구간 추정, 반복에 걸친 신뢰도가 필요합니다.
미해결 질문이진·계층 결과의 불확실성
MICA의 결과는 이진이며 과제, 계열, 시장 안에 중첩되어 있습니다. 그런 구조 위의 곱셈 점수에 어떤 구간 추정과 재표집 절차가 옳은지는 정해지지 않았으며, 어떤 구간이든 공개되기 전에 그 선택과 근거를 함께 밝힙니다.
현재 규칙부재는 0이 아니다
시도되지 않았거나 유효하지 않거나 사전 등록된 기준값이 없는 과제에는 점수가 없으며 사유와 함께 목록에 남깁니다. 사전 등록한 canonical 과제 집합이 불완전하면 줄어든 분모로 평균을 내지 않고 계열·시장 집계를 비공표합니다. 시장이 빠져도 시장 간 수치를 보류합니다.
현재 규칙병행 가능한 보조 보고
MICA는 성공률 원값과 지연 분포, 계측된 평가 비용을 주 기록으로 보고하고 가능하면 반복 신뢰도를 함께 제공합니다. 실행별 곱셈값은 파일럿 동안 그 기록에서 파생한 감사용 보기이며, 경쟁하는 대표 점수가 아닙니다.

근거

10.1 검증 상태와 결과 트랙

모든 수치는 그것이 어떻게 얻어졌는지를 함께 지닙니다. 공개 트랙 위의 독립 재실행 결과만이 공식이 될 수 있습니다.

독립 재실행 · IND
MICA가 제출된 시스템 스냅샷을 MICA 통제 계정과 인프라에서 직접 다시 실행했고, 전체 근거 추적을 보유합니다. 공개 트랙에 있습니다.
잠정 · PROV
MICA가 부분 실행이나 감독하의 실행을 관찰했거나, 주장된 커버리지 중 일부에 대해서만 근거를 보유합니다. 결과는 알리되 공식 결과로 공개하지 않습니다. 공식으로 공개되지 않습니다.
자체 보고 · SELF
시스템 운영 주체가 제출했으며 MICA가 재현하지 않은 근거 추적입니다. 투명성을 위해서만 표시합니다. 공식으로 공개되지 않습니다.
시뮬레이터
흔한 현지 서비스 흐름을 결정론적으로 재현한 로컬 복제본. 재현 가능하고 저렴하며, MICA가 시스템 간 동일 조건을 보장할 수 있는 유일한 트랙입니다.
라이브 섀도
시스템이 실제 서비스를 상대로 동작하되 확인 경계에서 멈춥니다. 되돌릴 수 없는 행위는 하지 않습니다. 시뮬레이터에서의 행동이 실제로도 이어지는지 확인하는 데 씁니다.
제한적 검증 라이브
서비스 운영 주체에게 사전 통지한 뒤, MICA가 보유한 테스트 계정에서 소수의 종단 간 실행을 수행합니다. 의도적으로 범위가 좁습니다.

결측값

10.2 각 문구의 뜻

MICA는 모르는 값을 숫자로 표시하지 않습니다. 아래는 사이트 전반에서 쓰는 정확한 문구입니다.

성공한 과제 없음.
유효한 시도는 있었으나 어느 것도 선언된 최종 상태에 도달하지 못했으므로, 속도와 성공당 비용은 정의되지 않습니다.
이 시장에 커버리지 없음.
이 시장 또는 이 조건에 대해 시스템에 유효 실행 셀이 아예 없습니다. 나쁜 결과가 아니라 근거의 부재입니다.
측정하지 않음
이 스냅샷에서 해당 축은 평가하지 않았습니다. 낮은 값이 아닙니다.

11 근거 계보와 재현성, 프라이버시

공개된 모든 수치는 그것을 만들어 낸 대상까지 되짚을 수 있어야 하며, 그 과정에서 개인을 식별하거나 계정을 노출하는 것은 공개하지 않습니다.

현재 규칙계보의 연결
에디션, 과제 묶음과 계약, 국가와 현지 상황, 시스템 스냅샷, 시도 또는 실행, 모델과 도구 호출, 평가자 근거와 최종 상태 되읽기, 그리고 집계로 이어집니다. 이 연결을 따라 되짚을 수 없는 수치는 공개하지 않습니다.
현재 규칙비식별 처리한 공개 기록
공개되는 기록은 비식별 처리합니다. 원본은 접근 통제 아래 보관하므로, 독립 검토자에게 비식별 처리 이전의 기록을 제공하면서도 그것이 공개 산출물이 되지 않게 할 수 있습니다.
현재 규칙합성 페르소나만 사용
실행에는 합성 페르소나와 MICA가 보유한 시험 계정만 사용합니다. 실존 인물의 계정을 대상으로 되돌릴 수 없는 행위를 수행하는 일은 없습니다.
외부 근거재현성 기록
공개하는 각 결과는 무엇을 어떤 스냅샷 위에서 몇 번, 어떤 트랙과 조건으로 실행했고 무엇을 보고했는지를 함께 지닙니다. 확립된 재현성 보고 관행을 따릅니다.
현재 규칙점수는 저장되지 않고 도출된다
원래의 결과와 지연, 평가 비용이 곧 기록입니다. 점수는 요청 시 그로부터 계산하므로, 공개된 수치가 자신이 요약한다고 주장하는 근거와 어긋날 수 없습니다.

주장

11.1 측정, 해석, 권고

MICA는 관측한 것과, 그것이 무엇을 뜻한다고 생각하는지와, 무엇을 권하는지를 구분합니다. 측정인 것은 첫 번째뿐입니다.

측정
실행 기록에서 직접 읽은 값. 추론 없음.
MICA 해석
측정값이 무엇을 뜻하는지에 대한 MICA의 읽기. 반박 가능하며, 에디션의 이름으로 서명됩니다.
권고
만드는 사람과 사는 사람을 위한 조언. 결코 측정의 주장이 아닙니다.

12 공개 세트와 홀드아웃, 오염, 유지관리

완전히 공개된 벤치마크는 학습 표적이 됩니다. 완전히 비공개인 벤치마크는 비판받을 수 없습니다. MICA는 두 부분을 모두 유지하고 어느 쪽이 어느 쪽인지 밝힙니다.

현재 규칙분리된 세트
공개 후보와 비공개 홀드아웃은 서로 다른 세트이며, 분리는 편집상의 주의에 맡기지 않고 내보내기 시점에 강제합니다. 홀드아웃 항목은 공개 산출물에서 결코 도달할 수 없습니다.
현재 규칙항목 출처
각 항목은 생성 시점, 노출 시점과 경로, 버전, 출처를 기록합니다. 그래야 노출을 추측이 아니라 추론의 대상으로 다룰 수 있습니다.
현재 규칙안정적 코어와 순환 난제
의도한 형태는 시간에 걸친 비교를 지탱하는 안정적 장기 코어에, 노출의 가치가 유지되는 기간을 제한하는 순환 난제와 홀드아웃을 더한 구조입니다. 이는 설계이며, 구현되기 전까지 계획으로 표시합니다.
현재 규칙오염 없음을 주장하지 않는다
MICA는 어떤 세트가 오염되지 않았다고 주장하지 않습니다. 노출을 통제하고 출처를 기록하며 항목을 갱신하고 잔여 위험을 보고하고, 노출과 암기와 점수 악용을 구분합니다.
미해결 질문평가 묶음 의존성
어떤 과제가 묶음에 들어가는지에 따라 어떤 시스템이 가장 좋아 보이는지가 달라집니다. MICA는 과제 단위 결과를 공개하고 민감도 분석을 요구하지만, 그 자체로 숨은 선호가 되지 않는 묶음을 어떻게 고를지는 미해결입니다.

13 거버넌스와 독립성, 공시

평가 대상의 제작자가 자금을 댈 수 있는 지수라면, 누가 무엇을 결정하는지와 그 분리가 아직 실질적이지 않은 지점을 밝혀야 합니다.

현재 규칙중립성 요건
MICA는 중립이어야 합니다. vooy는 발의자일 수 있고 도전 시스템으로 측정될 수 있으나, 규범적 공개 설계에서 벤치마크 소유자로서의 특권적 지위를 갖지 않습니다.
현재 규칙공시해야 하는 것
운영 주체, 결정 권한 보유자, 자금과 그 조건, 유상 과제 저작 관계, 공급자 관계, 이해충돌, 공개 절차, 그리고 정정과 이의 절차입니다.
미해결 질문구조적 독립성
방법론 변경과 검증 결과, 공개에 대한 결정 권한은 어떤 평가 대상도 통제하지 않는 기구에 있어야 합니다. 그런 기구는 구성된 적이 없으므로, 이는 해결된 주장이 아니라 미해결 위험입니다.
현재 규칙유상 게재 없음
MICA는 게재나 포함, 결과 공개 시점에 대한 대가를 받지 않으며, 측정 대신 제출자가 제시한 점수나 가중치를 받아들이지 않습니다.

14 방법론에 이의를 제기하거나 개정하는 방법

이 위키는 반박당하기 위해 쓰였습니다. 절을 지목하고 근거를 갖춘 이의 제기가 MICA의 방식을 바꾸는 가장 빠른 길입니다.

무엇이 이의 제기가 되는가
이 위키의 특정 주장을 절 식별자로 지목하고, 왜 틀렸는지와 무엇으로 대체해야 하는지를 함께 제시하는 것입니다. 선호는 이의 제기가 아니며, 반례나 인용, 재현 가능한 불일치가 이의 제기입니다.
이의 제기가 갖춰야 할 근거
방법론 주장에는 인용이나 계산이 끝난 반례가 필요합니다. 현지성 주장에는 잘못 기술된 시장과 채널과 관행이 필요합니다. 채점 주장에는 입력값과 그 결과 수치가 필요하며, 그래야 이견을 재현할 수 있습니다.
어디로 보내는가
제출 경로를 통해 보냅니다. 그 페이지에 MICA가 접수한 자료에 적용하는 근거 요건이 적혀 있습니다. 제출 요건 안내
누가 결정하는가
거버넌스 페이지가 현재 누가 결정 권한을 갖는지, 그중 무엇이 아직 독립적으로 보유되지 않았는지를 밝힙니다. MICA는 갖고 있지 않은 권한을 설명하지 않습니다. 거버넌스
방법론은 어떻게 바뀌는가
방법론은 에디션과 함께 버전이 매겨집니다. 변경은 이 위키와 생성된 마크다운 팩의 새 에디션으로 배포되며, 둘 다 현재 규칙을 온전히 서술하므로 독자가 규칙을 재구성할 필요가 없습니다.
정정
보유한 기록에서 다시 도출할 수 없는 수치는 주석을 붙이는 것이 아니라 철회합니다. 정정은 그것이 바로잡는 주장과 같은 비중으로 공개합니다.

15 한계와 미해결 연구 질문

MICA가 아직 정리되었다고 보지 않는 부분입니다. 이런 항목을 감추는 벤치마크는 광고입니다.

미해결 질문곱셈이 옳은 형태인가
곱셈 형태는 강한 비보상적 결과를 낳는 정책적 선택입니다. 다른 집계 방식이 구매자가 중시하는 바를 더 잘 반영할지는 실제로 열려 있는 질문이며, 그 질문이 계속 답할 수 있는 상태로 남도록 민감도 분석을 요건으로 둡니다.
미해결 질문최초 주장의 한계
세계 최초라는 사실은 증명할 수 없습니다. 유한한 문헌 검토는 MICA가 무엇을 찾았는지를 보여 줄 뿐 무엇이 존재하는지를 보여 주지 않습니다. 그래서 이 주장은 2026년 8월 8일 검토 기준일에 묶여 있고, 명시된 조건 결합으로 범위가 한정되며, 이 위키의 다른 주장과 같은 근거 요건 아래 개정 절차로 반박할 수 있습니다. 그 조건 결합을 모두 충족하는 선행 공개 이니셔티브가 확인되면, 이 주장은 방어하는 대신 수정하거나 철회합니다.
미해결 질문기준값을 어떻게 정할 것인가
속도와 비용 기준값은 과제 버전마다 사전 등록하며 채점 대상 집단에서 다시 도출하지 않습니다. 특정 시스템에 정박하지 않으면서도 도전적이되 달성 가능하게 정하는 방법은 미해결입니다.
미해결 질문시뮬레이터의 결과는 전이되는가
결정적 복제본은 재현 가능하지만 합성이며, 실서비스는 실행 도중에도 변합니다. 시뮬레이터 성능이 실서비스 성능을 얼마나 예측하는지는 섀도우 트랙이 시험하려는 바로 그 질문이며, 아직 시험되지 않았습니다.
미해결 질문고르지 않은 시장 커버리지
시장마다 여정의 어느 만큼에 도달할 수 있는지가 다릅니다. 도달 가능성이 고르지 않은 시장들 위에서 계산한 시장 간 수치는 역량이 아니라 접근성을 비교하는 것일 수 있으므로, MICA는 추정하는 대신 그런 수치를 보류합니다.
미해결 질문현지성은 얼마나 깊어야 하는가
한 국가는 균질하지 않으며, 과제는 특정 지역과 채널과 화계를 전제합니다. 어떤 결과를 그 시장의 결과라고 부르기 위해 시장 에디션을 얼마나 세밀하게 층화해야 하는지는 정해지지 않았습니다.
미해결 질문비용은 동작과 무관하게 변한다
평가 비용은 스냅샷 시점의 공급자 가격에 좌우되며, 그 가격은 시스템과 무관한 이유로 변합니다. 비용을 다시 계산할 수 있도록 물리적 사용량과 날짜가 붙은 가격표를 보존하지만, 변동성 자체는 실재합니다.

한계

15.1 이 방법이 알려 줄 수 없는 것

분명히 적습니다. 한계를 숨기는 벤치마크는 광고이기 때문입니다.

  • 시뮬레이터 결과는 재현 가능하지만 합성입니다. 실제 서비스는 복제본이 흉내 내지 못하는 방식으로 사용자 아래에서 바뀝니다.
  • 라이브 섀도 실행은 확인 경계에서 멈추므로, 마지막 되돌릴 수 없는 단계는 관측이 아니라 추론입니다.
  • 셀이 작습니다. 95% 신뢰구간 안쪽의 차이는 차이가 아닙니다.
  • 비용은 스냅샷 날짜의 운영 주체 가격 정책에 좌우되며, 시스템의 행동과 무관하게 움직입니다.
  • 커버리지는 시장마다 고르지 않으며, 커버되지 않은 시장은 추정하지 않고 없음으로 보고합니다.
  • 속도·비용 참조값은 시장마다 다르므로 국가 점수는 국가 간 절대 성능이 아니라 현지 기준과의 거리를 비교합니다.
  • 파생 과제 점수에는 아직 불확실성 구간이 없으며, 파일럿 동안 대표 순위에 사용하지 않습니다.
  • 10개 평가 계열 중 어디에도 아직 게시된 결과가 없으므로, 이 사이트의 어떤 내용도 시스템의 실제 동작을 설명하지 않습니다.

16 현재 정책 등록부

MICA가 책임지겠다고 밝히는 현재의 진술입니다. 모든 줄이 현재형이며, 이 등록부는 이력이 아니고 이전 값을 기록하지 않습니다.

프로젝트 정의
MICA, 곧 다국적 소비자 에이전트 지수는 버전이 고정된 완성 상태의 소비자 에이전트 시스템을 평가하는 벤치마크입니다. 표준 공개 도메인은 micabench.com입니다.
시장 범위
지수가 다루는 시장은 6개입니다. KR, JP, SG, TW, AE, TH이며, 이것이 지수의 범위이고 그 밖의 시장은 포함되지 않습니다.
과제 목록
10개 과제 계열에 100개의 표준 정의가 있습니다. 모두 공개 세트의 잠정 후보이며, 실행 가능한 검증 시나리오도, 측정된 결과도, 홀드아웃도 아닙니다.
실행별 파생 감사 점수
정확도·지연·계측된 평가 비용의 원값이 기록이며 각각 따로 공개됩니다. 유효하고 검증된 실행마다 100 × 정확도 × 속도 × 비용을 파생할 수 있지만, 파일럿 동안 이 곱은 대표 결과나 순위 기준이 아닌 감사값입니다. 사전 등록한 canonical 과제 집합이 완결되지 않으면 계열·시장 수치는 비공표합니다. 이 곱셈은 MICA의 정책이며 외부 문헌에서 도출한 결과가 아닙니다.
공개 후보와 홀드아웃
공개 후보 세트와 비공개 홀드아웃 세트는 분리되어 있으며, 분리는 내보내기 단계에서 강제됩니다. 항목마다 생성, 노출, 버전, 출처를 기록합니다.
시장 연동 프로필
6개 시장 에디션은 각각 대표 표면, 승인 경계, 완료 의미, 복구 조건, 근거 요건을 선언합니다. 이는 계획된 커버리지를 선언할 뿐 측정된 커버리지를 뜻하지 않습니다.
중립 거버넌스 의도
MICA는 중립이어야 합니다. vooy는 발의자이자 도전 시스템일 수 있으나, 규범적 공개 설계에서 벤치마크 소유자로서의 특권적 지위를 갖지 않습니다. 운영 주체, 결정 권한, 자금, 유상 과제 저작 관계, 공급자 관계, 이해충돌을 공개합니다. 구조적 독립성은 해결된 주장이 아니라 미해결 요건입니다.

17 방법론 기여별 연구 레퍼런스

각 연구에서 무엇을 가져왔고 무엇을 의도적으로 가져오지 않았는지에 따라 묶었습니다. 인용은 승인이 아니며, 여기 실린 어떤 연구도 MICA를 검토하거나 승인한 바 없습니다.

에이전트·웹 환경

MICA가 실행 기반 최종 상태라는 과제 개념을 어디에서 가져왔는지, 그리고 그 환경들이 현지화된 소비자 시장 앞에서 어디까지만 다루는지 정리합니다.

  • WebArena: A Realistic Web Environment for Building Autonomous Agents ICLR 2024

    차용한 점 기록을 채점하는 심판이 아니라, 초기화 가능한 현실적 웹사이트와 과제별 최종 상태 검증기를 사용하는 방식입니다.

    채택하지 않은 점 사이트 구성이 일반적이고 영어 중심입니다. MICA는 같은 검증기 개념을 현지 소비자 시장과, 브라우저로 대체할 수 없는 표면까지 확장합니다.

  • VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks ACL 2024

    차용한 점 렌더링된 상태를 과제로 삼고 시각 근거를 남기는 방식입니다. 사용자가 실제로 보는 것은 구현 세부가 아니라 과제의 일부입니다.

    채택하지 않은 점 MICA는 방법론 어디에서도 DOM 전용 접근을 전제하지 않으므로, 마크업만 읽는 시스템이 설계상 유리해지지 않습니다.

  • WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks? ICML 2024

    차용한 점 백엔드 상태로 검증하는 매개변수화 과제 템플릿입니다. 정의 하나가 검증 가능한 여러 사례를 만들어 냅니다.

    채택하지 않은 점 대상이 단일 플랫폼 위의 기업 지식 업무입니다. MICA의 단위는 서로 독립적인 현지 서비스를 가로지르는 생활 소비자 여정입니다.

  • OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments NeurIPS 2024

    차용한 점 스냅샷과 초기화 원칙, 그리고 성공 주장 대신 컴퓨터 상태를 읽는 실행 기반 평가기입니다.

    채택하지 않은 점 초기화 가능한 데스크톱이 제3자 판매처나 은행, 통신사를 초기화해 주지는 못합니다. MICA에서는 접근 동일 조건이 그 역할을 대신합니다.

  • AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents arXiv 2024 / ICLR 2025

    차용한 점 실행 가능한 앱 상태 점검을 갖춘 매개변수화 모바일 과제이며, 앱 안에 갇힌 소비자 여정에 가장 가까운 공개 사례입니다.

    채택하지 않은 점 그 앱들은 하니스가 설치하고 통제합니다. MICA의 시장에는 하니스가 결코 소유할 수 없는 로그인 채널이 포함됩니다.

  • Mind2Web: Towards a Generalist Agent for the Web NeurIPS 2023

    차용한 점 폭넓음입니다. 여러 웹사이트와 영역에 걸친 과제 분류 체계, 그리고 처음 보는 사이트로의 일반화를 명시적으로 시험하는 설계입니다.

    채택하지 않은 점 녹화된 기록과 행동을 오프라인으로 대조하는 것은 최종 상태의 증명이 아닙니다. MICA는 단계 일치를 성공으로 인정하지 않습니다.

  • WebLINX: Real-World Website Navigation with Multi-Turn Dialogue ICML 2024

    차용한 점 다중 턴 대화 기록과 사이트가 겹치지 않는 분할입니다. 여정 도중 마음을 바꾸는 사용자를 MICA가 다루는 방식이 여기서 왔습니다.

    채택하지 않은 점 오프라인 기록 지표는 MICA에서 진단용으로 남습니다. 과제의 1차 성공 기준이 되지 않습니다.

  • AssistantBench: Can Web Agents Solve Realistic and Time-Consuming Tasks? 2024

    차용한 점 장기 호흡의 현실적 과제, 그리고 성공 여부와 함께 실제로 들어간 노력을 보고하는 관행입니다.

    채택하지 않은 점 결과가 대체로 정보 응답입니다. MICA의 단위는 실제 소비자 서비스에 남는 지속적 상태 변화입니다.

  • WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents NeurIPS 2022

    차용한 점 지시문에 대한 제약 충족으로 표현한 확장 가능한 쇼핑 목표이며, MICA의 쇼핑 계열 과제 계약에서 다시 사용합니다.

    채택하지 않은 점 시뮬레이션된 단일 상점은 시장보다 좁습니다. MICA의 쇼핑 과제는 단일 상점이 감추는 결제·본인확인·배송 경로를 가로지릅니다.

  • WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models ACL 2024 / arXiv v1 25 January 2024

    차용한 점 고정된 복제본이 아니라 살아 있는 웹사이트에서 동작시키는 방식입니다. 실제 사이트 15곳에 걸친 과제 643개이며, 하니스가 소유하지 않은 서비스를 대상으로 평가한 공개 선례입니다.

    채택하지 않은 점 국가별로 체계적으로 현지화한 과제 묶음이 없고, 성공 판정에 시장 쪽의 권위 있는 완료 근거 대신 GPT-4V가 스크린샷과 에이전트 출력을 읽는 방식이 일부 사용됩니다. MICA는 그 대신 확인 응답이나 되읽기, 인계 기록을 요구합니다.

  • AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents ACL 2024 / arXiv v1 26 July 2024

    차용한 점 여러 앱과 사람이 얽히는 일상 소비 영역을 다루고, 출력 대조가 아니라 상태 기반 시험으로 확인하는 방식입니다.

    채택하지 않은 점 그 앱들은 벤치마크를 위해 저작된 통제 가능한 시뮬레이션 세계이며, 각자의 결제와 본인확인과 메시징 경로를 가진 6개의 독립적인 현지 실생활 시장이 아닙니다.

도구 사용과 상태 기반 상호작용

도구 호출, 정책, 백엔드 상태, 반복 신뢰도를 다룬 연구이며 MICA가 요구하는 호출 근거의 형태를 결정합니다.

  • tau-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains 2024

    차용한 점 도메인 정책과 백엔드 상태로 판정하는 사용자·에이전트·도구 간 상태 기반 상호작용, 그리고 운 좋은 한 번이 아닌 반복 시행 신뢰도입니다.

    채택하지 않은 점 대상은 단일 언어로 된 두 개의 시뮬레이션 서비스 도메인, 곧 소매와 항공입니다. 국가별로 현지화된 6개의 실제 소비자 시장이 아니며, MICA의 정책은 그 시장들이 실제로 적용하는 승인 관행입니다.

  • API-Bank: A Comprehensive Benchmark for Tool-Augmented LLMs EMNLP 2023

    차용한 점 도구 사용을 도구 필요 판단, 검색, 인자 구성, 실행, 응답 해석으로 나누는 분해 방식입니다.

    채택하지 않은 점 형식이 맞는 호출이 완료된 용무는 아닙니다. MICA는 최종 상태를 채점하고, 호출 진단은 그것을 설명하는 데만 씁니다.

  • Berkeley Function-Calling Leaderboard: Structured function-call evaluation, including non-use, multi-call and multi-turn categories Evolving leaderboard; cite with the access date

    차용한 점 비교 전에 호출을 정규화하는 방식과, 도구를 호출하지 않기로 올바르게 판단하는 것도 측정 가능한 행동이라는 통찰입니다.

    채택하지 않은 점 버전이 고정되지 않은 상시 갱신 자원입니다. MICA는 접근 시점을 밝혀 인용하며, 그 스냅샷을 고정 표준으로 다루지 않습니다.

  • AgentBench: Evaluating LLMs as Agents ICLR 2024

    차용한 점 이질적인 대화형 환경을 환경별로 보고하는 방식입니다. 한 환경의 강점이 일반적 주장으로 세탁되지 않습니다.

    채택하지 않은 점 MICA는 성질이 다른 보상을 하나의 수치로 합치지 않습니다. 계열과 시장 평균은 서로 비교 가능한 과제별 점수 위에서만 계산합니다.

  • GAIA: A Benchmark for General AI Assistants ICLR 2024

    차용한 점 답이 모호하지 않은 실제 멀티모달 도구 과제, 그리고 공개 세트에서 떼어 둔 비공개 분할입니다.

    채택하지 않은 점 정답 문자열은 지속적 상태 변화가 아닙니다. MICA는 문자열 일치가 아니라 권위 있는 확인 응답이나 되읽기를 요구합니다.

  • SWE-bench: Can Language Models Resolve Real-World GitHub Issues? ICLR 2024

    차용한 점 성공을 충족 의무와 함께 회귀·불변 조건 점검으로 정의하고, 사례마다 검증 가능한 산출물을 남기는 방식입니다.

    채택하지 않은 점 그 불변 조건은 하니스가 소유한 테스트 묶음입니다. MICA는 소유하지 않은 서비스 위에서 같은 개념을 금지 상태 점검으로 표현해야 합니다.

측정·합성지표·불확실성

MICA가 자신의 곱셈 점수를 정당화하기 위해서가 아니라 비판하기 위해 사용하는 문헌입니다. 이질적인 인자를 곱하는 방식을 승인하는 연구는 하나도 없습니다.

  • HELM: Holistic Evaluation of Language Models TMLR 2023

    차용한 점 시나리오·시스템·지표·실행을 분리하는 구조와, 대표 수치 하나 대신 여러 차원을 공개하는 원칙입니다.

    채택하지 않은 점 HELM은 보편적인 단일 곱셈 점수를 정당화하지 않습니다. MICA의 과제별 곱은 MICA 자신의 결정이며 그렇게 방어합니다.

  • MLPerf Inference: MLPerf Inference Benchmark ISCA 2020

    차용한 점 지연은 작업 부하와 품질 목표와 시스템 경계를 고정했을 때만 비교할 수 있습니다. MICA는 시간을 재기 전에 이 셋을 모두 고정합니다.

    채택하지 않은 점 그 작업 부하는 결정적이고 하드웨어 경계 안에 있습니다. 소비자 시장은 실행 중에도 변하므로 MICA는 속도를 조건과 함께 보고합니다.

  • OECD / JRC: Handbook on Constructing Composite Indicators: Methodology and User Guide 2008

    차용한 점 정규화, 가중치, 보상 가능성은 서식 선택이 아니라 문서화하고 검증해야 하는 실질적 결정이라는 관점입니다.

    채택하지 않은 점 MICA는 이 안내서를 자신의 곱셈을 비판하고 민감도 분석을 의무화하는 데 사용합니다. MICA 산식을 승인한 문헌이 아닙니다.

  • Keeney & Raiffa: Decisions with Multiple Objectives: Preferences and Value Tradeoffs Cambridge University Press edition

    차용한 점 곱셈 형태가 정당한 효용 함수가 되기 위한 조건, 즉 명시된 선호 구조와 특정한 독립성 가정입니다.

    채택하지 않은 점 MICA는 그 가정을 확립하지 않았으므로, 과제별 곱은 채점 정책일 뿐 형식적 효용이라고 주장하지 않습니다.

  • Fleming & Wallace: How Not to Lie with Statistics: The Correct Way to Summarize Benchmark Results CACM 1986

    차용한 점 기하평균은 비교 가능한 양의 비율을 요약하는 올바른 방법이며, 정규화된 속도·비용 성분이 정확히 그 형태입니다.

    채택하지 않은 점 이질적인 지표를 일반적으로 곱해도 된다는 근거는 아니며, MICA는 그런 근거인 것처럼 인용하지 않습니다.

  • Sokolova & Lapalme: A Systematic Analysis of Performance Measures for Classification Tasks Information Processing & Management, 2009

    차용한 점 매크로와 마이크로의 구분입니다. 항목 단위로 평균할지 그룹 단위로 평균할지는 결과가 눈에 보이는 가중치 결정입니다.

    채택하지 않은 점 원 논문의 맥락은 분류 지표입니다. MICA는 가중치 개념만을 계열 안의 과제와 시장 안의 계열에 적용합니다.

  • Agarwal et al.: Deep Reinforcement Learning at the Edge of the Statistical Precipice NeurIPS 2021

    차용한 점 실행 수가 적을 때의 점 추정은 오해를 부릅니다. 평균 하나 대신 반복 실행과 불확실성 구간, 성능 분포를 보고합니다.

    채택하지 않은 점 그 추정량은 연속형 보상을 전제합니다. MICA의 결과는 이진이며 계층적이므로, 그대로 옮기지 않고 적용 근거를 밝혀야 합니다.

소비자 플랫폼 실행 통제

소비자 행위를 실제 운영 환경에서 실행하려면 어떤 조건이 필요한지 보여 주는 근거로 인용한 공식 플랫폼 문서입니다. 여기 실린 어떤 사업자도 MICA를 검토하거나 승인한 바 없습니다.

  • Kakao Developers: App Official documentation · accessed 8 August 2026

    차용한 점 이 문서는 플랫폼 이용이 앱 키와 제품별 설정을 가진 등록 애플리케이션에서 시작한다는 점을 확인해 줍니다. 접근 권한이 부여되는 단위가 등록된 앱이라는 뜻입니다.

    채택하지 않은 점 등록만으로 모든 기능이 허용된다는 뜻은 아닙니다. 등록된 앱이 실제로 무엇을 할 수 있는지는 제품과 스코프 단위로 정해지므로, MICA는 등록 사실에서 실행 권한을 추론하지 않습니다.

  • Kakao Developers: Kakao Talk Message · REST API Official documentation · accessed 8 August 2026

    차용한 점 메시지 전송이 사용자 액세스 토큰과 동의된 스코프, 지원되는 메시지 템플릿, 허용된 수신자 관계에 달려 있음을 확인해 줍니다. 읽기 중심의 지역 검색과는 조건이 실질적으로 다릅니다.

    채택하지 않은 점 메시징이 불가능하다는 근거는 아니며 MICA도 그렇게 읽지 않습니다. 전송 경로에 조건이 붙는다는 사실을 보여 줄 뿐이고, 그래서 선언된 커버리지를 실행 가능한 커버리지로 취급하지 않습니다.

  • LINE Developers: Creating a channel Official documentation · accessed 8 August 2026

    차용한 점 프로바이더와 채널 구조가 통제 지점임을 확인해 줍니다. 채널은 특정 제품을 위해 생성되고 자체 자격 증명을 갖습니다.

    채택하지 않은 점 채널 생성이 모든 제품에 대한 포괄 승인은 아니며, 이 문서도 그렇게 말하지 않습니다. 개별 제품은 저마다의 자격 요건과 심사 조건을 유지합니다.

  • LINE Developers: Sending messages Official documentation · accessed 8 August 2026

    차용한 점 전송이 일반적인 외부 호출이 아니라 공식 계정 채널과 그 액세스 토큰, 수신자와의 관계, 적용되는 전송 방식에 달려 있음을 확인해 줍니다.

    채택하지 않은 점 메시징 이외의 표면에 대해서는 아무것도 확인해 주지 않으며, MICA는 이를 같은 플랫폼의 결제나 커머스, 계정 기능으로 일반화하지 않습니다.

  • LINE Developers: LINE MINI App development flow Official documentation · accessed 8 August 2026

    차용한 점 개발과 테스트를 거친 뒤 공개 전에 심사 단계가 있는 수명주기를 확인해 줍니다. 운영 환경 도달이 단순 배포가 아니라 관문을 통과하는 전환이라는 뜻입니다.

    채택하지 않은 점 전 세계에서 동일하게 제공된다는 근거는 아닙니다. 지역별 제공 여부와 조건이 다를 수 있으므로, MICA는 실행 가능성을 플랫폼 단위가 아니라 시장 단위로 기록합니다.

  • WeChat Mini Program: Release Official documentation · accessed 8 August 2026

    차용한 점 AppID에 묶인 계정 통제 런타임을 확인해 줍니다. 빌드를 업로드하고 심사를 받은 뒤에야 사용자에게 공개됩니다.

    채택하지 않은 점 영문 문서가 현재 조건을 온전히 서술한다고 보지 않습니다. 중국어 문서나 관리자 콘솔보다 갱신이 늦을 수 있으므로, MICA는 통제의 형태에 한해 인용하고 세부 사항은 시장 에디션에서 따로 확인합니다.

  • Grab Developer: Grab Developer Documentation Official documentation · accessed 8 August 2026

    차용한 점 접근이 개발자 애플리케이션과 제품별 온보딩을 중심으로 구성되며, 일부 운영 기능은 국가나 파트너 지위에 따라 조건이 붙는다는 점을 문서 루트에서 확인할 수 있습니다.

    채택하지 않은 점 특정 시점에 어느 시장에서 어떤 기능이 열려 있는지를 확인해 주지는 않습니다. 제품 문서 경로는 자주 바뀌므로 MICA는 개별 링크 대신 문서 루트를 인용하고, 세부 사항은 시장 에디션에서 확인합니다.

오염·재현성·현지화·거버넌스

벤치마크가 시간이 지나도 정직할 수 있게 하는 조건입니다. 노출 통제, 문서화, 언어별 보고, 소유 구조 명시가 여기 속합니다.

  • Brown et al. (GPT-3): Language Models are Few-Shot Learners NeurIPS 2020

    차용한 점 벤치마크 중복 감사와 비오염 부분집합 비교를, 나중에 덧붙이는 항목이 아니라 결과의 정규 구성 요소로 공개하는 방식입니다.

    채택하지 않은 점 중복 감사는 청결의 증명이 아닙니다. MICA는 오염이 없다고 선언하는 대신 잔여 오염 위험을 명시합니다.

  • Magar & Schwartz: Data Contamination: From Memorization to Exploitation ACL 2022

    차용한 점 노출, 암기, 점수 악용은 서로 다른 세 가지이며, 비교를 반드시 훼손하는 것은 세 번째뿐이라는 구분입니다.

    채택하지 않은 점 MICA는 지금 악용을 직접 측정할 수 없으므로, 악용이 없다고 주장하는 대신 노출을 통제하고 출처를 기록합니다.

  • Dynabench: Rethinking Benchmarking in NLP NAACL 2021

    차용한 점 사람과 모델이 함께 참여하는 난제 수집 방식이며, MICA가 순환 난제 세트를 계속 도전적으로 유지하려는 방법입니다.

    채택하지 않은 점 적대적 수집은 예외 사례로 치우칩니다. MICA는 안정적인 장기 코어를 유지해 지수가 예외 모음으로 흘러가지 않게 합니다.

  • LiveBench: A Challenging, Contamination-Free LLM Benchmark 2024 / ICLR 2025

    차용한 점 객관적으로 검증 가능한 최신 자료로 정기 갱신하는 방식이며, 노출된 항목이 악용 가치를 유지하는 기간을 줄입니다.

    채택하지 않은 점 MICA는 오염이 없다고 주장하지 않습니다. 갱신은 위험을 줄일 뿐 없애지 못하며, 이 문서는 그 사실을 밝힙니다.

  • Pineau et al.: Improving Reproducibility in Machine Learning Research (Reproducibility Program Report) JMLR 2021

    차용한 점 공개하는 모든 결과에 재현성 점검표를 붙이는 관행입니다. 무엇을 무엇 위에서 몇 번 실행했고 무엇을 보고했는지 밝힙니다.

    채택하지 않은 점 기록에 계정 상태가 들어 있는 경우 전체 산출물 공개는 불가능합니다. MICA는 비식별 처리한 기록을 공개하고 원본은 접근 통제 아래 둡니다.

  • Datasheets for Datasets: Documentation of motivation, composition, collection, uses, distribution and maintenance CACM 2021

    차용한 점 MICA가 과제 목록의 에디션마다 적용하는 문서화 틀이며, 축마다 하나의 데이터시트 절을 씁니다.

    채택하지 않은 점 데이터시트는 데이터셋을 설명합니다. MICA의 목록은 실행 가능한 계약이므로 환경과 승인 조건까지 함께 문서화합니다.

  • MEGA: Multilingual Evaluation of Generative AI EMNLP 2023

    차용한 점 언어별 보고를 의무로 두는 원칙입니다. 언어를 가로지르는 평균은 시스템이 실패하는 바로 그 시장을 감추기 때문입니다.

    채택하지 않은 점 다국어 지원은 문화적 현지화가 아닙니다. MICA는 언어를 현지성의 한 입력으로 다루며 현지성 자체로 보지 않습니다.

  • BLEnD: A Benchmark for LLMs on Everyday Knowledge in Diverse Cultures and Languages NeurIPS 2024

    차용한 점 추론이 아니라 현지에서 수집한 일상 문화 지식이며, MICA가 과제 저자에게 요구하는 기준입니다.

    채택하지 않은 점 한 국가는 균질하지 않습니다. MICA는 과제에 국기를 붙이는 대신 그 과제가 전제하는 지역·채널·화계를 기록합니다.

  • M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models AAAI 2024

    차용한 점 현지에서 수집한 자료는 번역된 영어 자료와 다르게 작동합니다. MICA가 번역이 아니라 현지 저작을 요구하는 이유입니다.

    채택하지 않은 점 시험 문항에는 고정된 정답이 있습니다. 소비자 용무의 올바른 결과는 살아 있는 현지 상태에 달려 있으므로 MICA는 최종 상태를 검증합니다.

  • Data Statements for NLP: Toward Mitigating System Bias and Enabling Better Science TACL 2018

    차용한 점 언어 변종, 수집 맥락, 자료를 작성하고 검토한 사람들의 상황을 문서화하는 방식입니다.

    채택하지 않은 점 MICA는 검토자 맥락을 역할과 시장 역량 수준으로만 기록합니다. 공개되는 문서에서 개인이 식별되지 않습니다.

  • NIST AI RMF 1.0: Artificial Intelligence Risk Management Framework NIST, 2023

    차용한 점 GOVERN, MAP, MEASURE, MANAGE 구조와, 소유 주체·타당성 기준·지속 모니터링을 문서화하라는 요구입니다.

    채택하지 않은 점 MICA는 NIST 정합성을 주장하지 않습니다. 적합성 주장은 공개된 대응표를 요구하는데 MICA는 그것을 만들지 않았습니다.

  • The Benchmark Lottery: How benchmark, task and metric choice can change the conclusion 2021

    차용한 점 순위가 평가 묶음의 산물일 수 있다는 경고입니다. MICA는 결론을 다르게 다시 계산할 수 있도록 과제 단위 결과를 공개합니다.

    채택하지 않은 점 순위가 불가능하다는 교훈이 아닙니다. 민감도 분석 없는 순위는 근거가 아니라는 뜻이며, MICA는 이를 요건으로 받아들입니다.

18 공개 방식과 인터페이스 레퍼런스

MICA가 결과를 공개하는 방식에 영향을 준 제품·편집 사례입니다. 인터페이스 관행은 측정에 관한 근거가 아니므로 과학적 선행 연구와 분리해 둡니다.

19 용어

이 위키가 특정한 뜻으로 사용하는 용어입니다. 한 단어가 두 가지를 뜻할 수 있는 경우, MICA가 뜻하는 것은 여기 적힌 쪽입니다.

시스템 스냅샷
스캐폴드, 라우팅, 메모리, 도구, 권한, 현지화, 복구 동작까지 포함해 특정 버전으로 고정한 완성 상태의 소비자 에이전트 시스템입니다. MICA가 평가하는 단위입니다.
과제 계약
과제의 선언된 최종 상태, 확인 경계, 종료 유형, 그리고 결과가 인정되기 위해 실행이 남겨야 할 근거를 규정한 것입니다.
확인 경계
그 지점을 넘으면 행위가 되돌릴 수 없게 되거나, 에이전트가 사용자를 대신해서는 안 되는 승인이 필요해지는 경계입니다. 여기서 올바르게 멈추는 것은 실패가 아니라 정의된 결과입니다.
유효 시도
심사를 통과한 시도입니다. 환경에 접근할 수 있었고, 페르소나와 계정이 선언된 시작 상태에 있었으며, 평가자 측 결함이 실행을 방해하지 않은 경우입니다.
확인된 성공
선언된 최종 상태에 도달했고, 권위 있는 확인 응답이나 되읽기 또는 인계 기록으로 입증된 경우입니다. 정확도 인자에서 1을 받는 유일한 결과입니다.
미검증 완료
시스템은 완료했다고 보고하지만 요구되는 권위 있는 근거가 없는 경우입니다. 진단상 실패와 구별되지만 정확도 인자에서는 똑같이 0입니다.
평가 실행 비용
시도를 실행하는 데 든 모델, 라우팅, 재시도, 하위 에이전트, 브라우저, 검색, 지도, 유료 도구 비용이며 단위는 USD입니다. 에이전트가 다룬 상품이나 서비스의 구매 가격은 결코 포함되지 않습니다.
연동 상황
한 시장 에디션의 대표적인 현지 실행 조건 하나이며, 표면과 승인 경계, 완료 의미, 복구 조건, 근거 요건을 함께 지닙니다.
공개 후보
검토하고 비판할 수 있도록 공개한 과제 정의입니다. 방법론을 위한 설계 자료이며, 최종 실행 벤치마크의 문항이 아닙니다.
홀드아웃
노출이 점수로 전환되지 않도록 공개하지 않고 남겨 두는 항목입니다. 내보내지 않으며, 공개 산출물에서 도달할 수 없습니다.
근거 계보
에디션에서 시작해 과제 묶음과 계약, 시장 상황, 시스템 스냅샷, 시도, 모델과 도구 호출, 평가자 근거와 최종 상태 되읽기를 거쳐 집계까지 끊기지 않고 이어지는 연결입니다.
실패 시 차단
필요한 조건이 정해지지 않았거나 충족되지 않으면, 관문은 기본값으로 대체하지 않고 공개를 거부합니다. 부재가 통과 값이 되는 일은 없습니다.

20 위키 정보

방법론 페이지와 다운로드 문서는 하나의 타입 지정 정본에서 생성됩니다.