생각을 정리하는 마인드맵, 풀맵 →
기술 딥다이브

검열 뺀 Qwen 3.8 27B, 설치 관리자로 돌리기


한 줄 요약: Qwen 3.8 27B에서 거절 능력을 가중치 단계로 제거해 둔 커뮤니티 프로젝트 설치 관리자를, 맥과 Windows에서 각각 알맞은 용량이 되도록 돌리는 방법.

최근 SNS에서 “YOU CAN NOW RUN QWEN-3.8 FOR FREE. 100% OPEN-SOURCE.“라는 문구가 화제였어요. 이 문구로 위로 올라가 보니 Wassimyounes01/qwen38-uncensored 설치 관리자 리포에 도달합니다. 이 글은 그 README 전체를 대조해서 정리했어요. 상단 화면은 리포의 첫 화면(모바일)이고, 설치 관리자가 골라 주는 13.5GB 양자 파일과 MLX 백엔드, 로컬 API까지 안내를 하나씩 확인했습니다.

검열삭제 모델, 세 줄 정리

이전 글(huihui_ai/qwen3.5-abliterated 해설)에서 다룬 검열삭제(abliteration)와 같은 원리예요. 2024년 논문(Arditi 등)은 모델 두뇌 속에 ’거절 방향’이라는 단일 성분을 발견했고, 이 방향을 가중치에서 빼내면 거절 능력이 사라진다는 원리예요. 검열 회유 프롬프트로 우회하는 게 아니라 두뇌 자체를 수술한다는 뜻입니다.

README 기준으로 거절 방향은 38층의 131개 가중치 행렬에서 직교화되어 제거돼요. 모델 카드(ollama.com의 orcarouter 모델 페이지)에 따르면, 위 화면에 보이듯 XSTest 기준 과잉 거절 0%, A/B 테스트 세트 거절 0~6%에 능력 저하는 “측정된 바가 없다”고 설명하고요. 모델은 시각 입력·도구 호출·‘생각’ 모드와 262K 문맥 길이까지 남아 있고, 위 화면 시점 기준 21만 3,200회쯤(213.2K) 내려받혔다는 수치도 붙어 있어요.

Ollama 라이브러리의 orcarouter/Qwen3.8-27B-Uncensored 모델 카드 — 검증 수치와 213.2K 다운로드가 표시되어 있다

이전 글과 다른 점은 설치 관리자의 존재예요. 전에는 모델 이름을 직접 pull했다면, 여기는 기기를 감지해 알맞은 양자(quant, 원본 가중치를 더 낮은 정밀도로 눌러 저장해 용량을 줄인 버전) 모델을 골라 자동 설치한다는 거죠. 골라 주는 파일은 GGUF 양자 리포에서 목록으로 공개돼 있어요.

가중치 수술 vs 시스템 프롬프트

리포의 비교 표는 v1과 v2가 무엇이 달라졌는지 말해요. 시스템 팩(System pack, v1)은 공식 Qwen 가중치에 거절을 피하게 유도하는 SYSTEM 프롬프트를 붙이는 방식으로, 깊이가 얕아 여전히 거절할 수 있다고 리포가 인정해요.

검열삭제 모델(abliterated, v2, 이번 프로젝트의 기본값)은 38층의 131개 가중치 행렬에서 거절 방향을 직교화해 제거한 것으로, README 표현대로 “거절 회로를 아예 제거”한 수준이에요. 시스템 팩은 사라지지 않고 “보강용”으로 남아 있다고 README가 정리해요. README의 “Honest stack” 항목이 로드된 것과 안 된 것을 구분해 두는 점도 신뢰 소재예요. 30.9GB FP8 체크포인트는 서빙 형식이 아니라 검열삭제 작업의 출발점일 뿐이고, 리포 자체는 가중치 바이트를 재배포하지 않는다고 명시하고 있죠.

맥 메모리 수학: 48GB에서 왜 13.5GB일까요

리포의 하드웨어 프로필 설명이 이 글의 백미예요. M5 Pro의 48GB는 균일 메모리(CPU와 GPU가 나눠 쓰는 하나의 메모리)지만, macOS가 약 25%(약 12GB)를 예약해 추론에 쓸 수 있는 작업대는 약 36GB뿐이라는 설명이에요.

여기서 가중치 16.8GB짜리 Q4_K_M을 올리면 단어집(KV 캐시) 약 3GB까지 합쳐 약 20GB예요. 돌아가긴 하지만 앱을 띄우면 빡빡해져요. 반면 Q3_K_M(가중치 13.5GB + 단어집 3GB)은 약 16.5GB로, 운영체제와 앱, 더 긴 문맥까지 담을 여유 23GB 이상이 남아요. 모든 층이 GPU(Metal 균일 메모리)에 머물러 CPU 낙하(offloading, 메모리 부족 시 CPU로 일을 떠넘기는 동작)가 없다는 설명도 붙어요.

기기 양자 모델 크기 문맥
Mac M5 Pro (48GB) Q3_K_M 13.5GB 8,192
Mac M5 Max (64~128GB) Q4_K_M+ 16.8GB 16,384
Mac (32GB 이상) Q3_K_M 13.5GB 8,192
Windows (GPU 24GB) Q4_K_M 16.8GB 8,192
Windows (GPU 12GB) Q3_K_M 13.5GB 4,096

Windows 24GB GPU에서는 Q4_K_M 16.8GB가 기본값이고, 12GB 카드에서는 Q3_K_M 13.5GB에 문맥도 4,096으로 줄어요. 문맥은 길수록 단어집 두께가 늘어 메모리를 더 차지하니, 카드가 작으면 문맥을 먼저 희생하는 구성이라는 게 이 표의 요지예요. 양자 파일은 리포 페이지에서 2비트 양자(IQ2_XXS 8.88GB)부터 크기별로 목록이 시작된다는 점도 위 화면에서 확인할 수 있어요.

orcarouter/Qwen3.8-27B-Uncensored-GGUF 리포 — 언어·라이선스(apache-2.0)·양자 태그와 2비트 양자 크기(IQ2_XXS 8.88GB) 목록이 보인다

설치 관리자가 하는 일

설치는 네 줄이면 끝나요. README의 시작 안내는 이래요(맥과 Windows 공통).

git clone https://github.com/Wassimyounes01/qwen38-uncensored.git
cd qwen38-uncensored
node bin/install.cjs        # 기기 감지 → 알맞은 양자 자동 선택
ollama run --think=false qwen3.8:27b-uncensored

설치 관리자는 플랫폼을 감지해 맥이면 Q3_K_M·Metal·12스레드, Windows면 Q4_K_M·CUDA·자동 스레드로 골라 Modelfile까지 만들어 줘요. README가 명시하는 소요 공간은 맥 Q3_K_M 13.5GB, Windows Q4_K_M 16.8GB이고, Ollama는 Qwen 3.8 아키텍처를 위해 0.17.1 이상이 필요하다고 하네요. --quant 옵션으로 양자를 강제할 수도 있어요. IQ4_XS 15.3GB, Q5_K_M 19.5GB, Q6_K 22.4GB, Q8_0 29.0GB(사실상 무손실)까지 목록이 있고, --legacy는 기본 검열이 남은 공식 가중치에 시스템 팩만 얹는 모드입니다.

느리다면 MLX로 갈아타기

애플 실리콘 사용자라면 MLX 백엔드가 선택지예요. MLX는 애플 실리콘 전용 연산 프레임워크로, README 기준 30~50% 더 빠르다고 해요. 양자 파일은 MLX 리포에 별도로 올라와 있고, 화면 태그에는 apple-silicon·4비트·8비트 정밀도가 표시돼 있어요.

node bin/install.cjs --mlx   # MLX 백엔드 설치
mlx_lm.server --model models/mlx --port 11434

포트가 Ollama와 같은 11434라서 앱 쪽 설정을 바꿀 필요가 없다는 게 README의 요점이에요. 뒷단만 갈아끼워도 기존 조합이 그대로 돌아가는 설계라고 하죠. ollama ps에서 CPU/GPU가 쪼개져 보이면, 이전 글에서 다룬 것처럼 100% GPU가 될 때까지 양자를 낮추거나 문맥을 줄이는 처방도 같아요.

orcarouter/Qwen3.8-27B-Uncensored-MLX 리포 — apple-silicon·4비트·8비트 정밀도 태그가 보인다

어떻게 활용하나요

이전 글(huihui_ai/qwen3.5-abliterated 해설)에서는 모델을 직접 pull하는 방식이었는데, 이 설치 관리자는 그 결정을 기기 감지로 자동화한 조각이에요. “무엇을 돌릴지”보다 “내 기기에 얼마나 담을지”라는 질문으로 중심이 옮겨 간 모습입니다.

로컬 API 예시도 README에 있어요. http://127.0.0.1:11434/api/chat에 모델 이름 qwen3.8:27b-uncensored와 num_ctx 8192, num_gpu 999를 실어 POST하면, 클라우드 API 없이 자기 앱에 붙일 수 있다고요. 안전 필터가 줄어든 실험적 모델이라 출력 검토는 사용자 몫이라는 이전 글의 단서도 그대로 유효해요.

이 글의 내용은 아래 자료를 기준으로 확인했어요. 화면 캡처는 정리 시점(2026-10-07)에 직접 접속해 찍은 것이에요.