Qwen3.8-Flash-Next 무검열(Uncensored) 버전 및 소멸(Abliteration) 기법 분석
알리바바의 차세대 아키텍처 프리뷰 모델인 Qwen3.8-Flash-Next를 기반으로, 오르카라우터(OrcaRouter) 등 커뮤니티가 안전 거부(Refusal) 벡터를 제거한 비공식 무검열(Uncensored) 버전이 공개되었습니다.
Qwen3.8-Flash-Next-Uncensored-GGUF 모델 개요
- 고효율 라우티드 MoE 아키텍처: 총 1,760억 개(125B 본체 + 51B n-gram 임베딩)의 저장 매개변수 중 토큰당 60억 개(6B)만 활성화되어 고성능과 효율성을 동시에 달성했습니다.
- 향상된 벤치마크: 코딩, 에이전트, 범용 추론(General) 전반에서 기존 Qwen3.8-27B 모델 대비 높은 점수를 기록했습니다.
- 양자화 지원: 2비트부터 6비트까지의 GGUF 양자화를 폭넓게 지원합니다.
- 연구 목적 배포 가이드: AI 해석 가능성(Interpretability), 거부 메커니즘 연구, 보안 레드팀 평가 등 합법적인 연구 목적으로 배포되며, 사용 시 자체적인 안전 및 검토 계층 구축이 권장됩니다.
Abliteration (어블리터레이션 / 소멸) 기법이란?
AI 모델의 거부 메커니즘을 제거하는 '소멸(Abliteration)' 기법은 유해하거나 비윤리적인 요청에 대한 거부 반응을 원천적으로 비활성화합니다.
512개 전문가(Expert) 중 10개가 활성화되는 MoE 구조에서도 특정 전문가가 거부를 전담하지 않습니다. 거부 신호는 복잡하게 얽혀 있는 것이 아니라, 잔차 스트림(Residual Stream) 내부의 단 '하나의 특정 방향(Refusal Direction 벡터)'에 의해 제어됩니다.
소멸(Abliteration) 기법의 3단계 동작 방식
-
거부 방향 벡터($\hat{\mathbf{r}}$) 추출유해한 질문 집합(Harmful)과 무해한 질문 집합(Harmless)을 입력했을 때 나타나는 AI 내부 활성화 평균값의 차이를 계산하여 거부 상태를 대변하는 방향 벡터를 특정합니다.
-
가중치 행렬 직교화 (Orthogonal Projection)모델의 가중치 행렬에서 추출된 거부 벡터와 평행한 성분을 수학적으로 투영하여 제거(직교화)합니다. 이를 통해 모델이 어떤 입력을 받더라도 '거부' 방향으로 상태 벡터를 쓰지(Write) 못하게 원천 차단합니다.
-
지능 보존 및 필터 비활성화일반 지식, 논리 추론, 언어 생성 능력 손실 없이 거부 필터만 정밀하게 비활성화됩니다.
| 구분 | 프롬프트 탈옥 (Jailbreak) | 데이터셋 미세조정 (Dolphin 등) | Abliteration (소멸 기법) |
|---|---|---|---|
| 작동 위치 | 입력 텍스트 프롬프트 단 | 신경망 가중치 전체 재학습 | 잔차 스트림 관련 특정 가중치 수정 |
| 소요 자원/비용 | 없음 (단, 높은 실패율 및 불안정) | 막대한 GPU 연산 비용 및 수일 소요 | GPU 1장으로 수 분~수십 분 내 완료 |
| 부작용 | 시스템 업데이트로 쉽게 차단됨 | 기존 성능 손실 및 망각(Forgetting) 발생 | 원본 지식 손실이 거의 없음 (±1~2% 내) |
적용 결과 및 아키텍처 특성
-
거부율 극소화 및 지능 유지:
- 유해 프롬프트 거부율이 기존 64~100%에서 0~3.3% 수준으로 대폭 감소했습니다.
- MMLU-Pro, GSM8K, CMMLU 등 핵심 벤치마크 점수 변동폭이 ±2%p 이내로 유지되어 원본 추론 성능을 보존했습니다.
-
장문 컨텍스트(최대 100만 토큰) 메모리 절감:
- 전체 48개 레이어 중 36개에 게이티드 델타넷(Gated DeltaNet) 기반 선형 어텐션을 적용해 과거 정보를 고정 크기로 압축했습니다.
- 나머지 12개 레이어에만 일반 KV 캐시를 결합하여 대용량 컨텍스트 처리 시 발생하는 메모리 병목을 해소했습니다.
배포 정책 및 활용 분야
- 게이트 적용 및 연구용 제한: 비인가 오남용을 방지하기 위해 허깅페이스 약관 동의(Gate)를 거친 후 다운로드가 가능합니다.
- 보안 및 레드티밍(Red Team) 연구 도구: 모델이 '지식이 부족한 것'인지 '안전 필터에 의해 거부된 것'인지를 분리 검증할 수 있어 모의 침투 및 취약점 평가 도구로 유용하게 활용됩니다.
'공부 > 뉴스 기사 읽기' 카테고리의 다른 글
| SBOM이 걸어간 길 CBOM도 걷는가-"새로운 공급망 언어가 탄생하는 과정" (0) | 2026.08.22 |
|---|---|
| How to Train Your GPT: LLaMA 3 구조를 밑바닥부터 구현하며 배우는 LLM의 원리와 동작 (0) | 2026.08.13 |
| Expanding Daybreak as the Cyber Defense Window Narrows (0) | 2026.08.11 |
| Qwen3.8-Max: A New Bar for Coding and Cowork (0) | 2026.08.07 |
| Ten advances in mathematics and theoretical computer science (0) | 2026.08.03 |


