
검열 없는 AI, 내 노트북에서 돌리기
한 줄 요약: Qwen 3.5에서 거절 능력만을 수술로 떼어 낸 모델 huihui_ai/qwen3.5-abliterated를 Ollama로 돌리는 방법이에요. 이 글은 시작점인 Windows 설치 가이드를 중심에 두고, VRAM 표와 점검 도구를 곁들여요.
1인 카드뉴스 제작자 carterperez.dev의 9장짜리 게시물이에요(2026년 10월 1일, 좋아요 193·댓글 71). 캡션은 “Free uncensored AI, running on your own laptop, fully offline(검열 없는 AI를 내 노트북에서, 완전 오프라인으로)“라는 문장으로 시작해요. 대상 모델은 65만 6,700회가량 pull된 huihui_ai/qwen3.5-abliterated예요.
릴스는 절차를 명령 세 개와 결정 하나로 요약하고, 명령 전문은 GUIDE 댓글을 달면 보내준다고 안내해요. 설치 카드는 리눅스 명령 한 줄과 “맥과 Windows는 ollama.com에서 앱을 내려받으세요”라는 안내만 줘요. 이 글은 그 짧은 안내를 Ollama 공식 문서 기준으로 풀어, Windows 가이드를 본문의 중심에 뒀어요.
거절 없는 모델, 세 줄 정리
카드의 제목은 “Someone deleted this model’s ability to say no.“예요. abliteration(검열삭제)는 2024년 논문이 발견한 거절 매개 성분, 즉 모델 내부의 한 방향을 가중치에서 빼서 거절 능력 자체를 없애는 수술이에요. 탈옥 프롬프트처럼 회유하는 게 아니라 두뇌 자체를 고친 것이므로 되살릴 방법도 없어요.
단서는 하나예요. 안전 필터가 줄어든 실험적 모델이라 출력 검토는 사용자 몫이고, 연구·실험 용도를 권고한다는 경고가 모델 페이지에 붙어 있어요. 이것만 기억했으면 바로 설치로 넘어갈게요.
Windows 설치 가이드
이 가이드는 릴스에서 한 줄로 넘어간 부분을 Ollama 공식 문서(Windows·FAQ·GPU 페이지) 기준으로 푼 것이에요.
요구 사항 확인
시작 전에 세 가지만 확인해요. 운영체제는 Windows 10 22H2 이상(Home·Pro 모두)이어야 해요. NVIDIA 카드면 드라이버 551.61 이상에, 카드 자체는 지원 목록(compute capability 5.0 이상)에 들어야 해요.
AMD 라데온이면 ROCm v7 또는 HIP7 드라이버 스택이 필요하고, RX 6000급처럼 ROCm v7이 노출되지 않는 일부 시스템에는 Vulkan이 기본으로 켜져 있어요. 그래픽 카드가 없어도 CPU만으로 돌아가지만 답장이 체감될 만큼 느려져요.
시작 전에 그래픽 드라이버를 한 번 업데이트해 두길 권해요.
설치와 첫 실행
- ollama.com에서 Windows용 설치 파일(
OllamaSetup.exe)을 내려받아 실행해요. - 관리자 권한 없이 내 계정의 홈 디렉터리에 설치돼요. 프로그램 자체에 최소 4GB가 필요해요.
- 설치가 끝나면 Ollama는 트레이에 상주하며 백그라운드에서 자동으로 돌아가요.
- 새로 연 PowerShell이나 cmd에서
ollama --version으로 확인해요. 설치 전부터 열려 있던 터미널은 명령 검색 경로(PATH)를 늦게 반영하니 새 창이 안전해요.
ollama serve는 필요 없다
릴스의 네 번째 카드는 “could not connect to ollama server, run ‘ollama serve’ to start it”이라는 에러를 보여주는데, 이건 서버(창구)가 꺼져 있을 때 나오는 얘기예요. Ollama는 집 안에 항상 열어 둔 창구 같은 프로그램이거든요.
Windows 앱은 트레이에서 창구를 대신 띄워 주므로, ollama serve를 직접 칠 일이 없어요. 에러가 보이면 트레이 아이콘이 살았는지부터 확인해요.
수동 실행은 리눅스를 스크립트 없이 돌릴 때나, 시스템 서비스로 Ollama를 임베딩하는 환경의 절차예요. Windows에서는 트레이 확인이 끝이에요.
모델 저장 위치와 공간
내려받은 모델은 C:\Users\사용자이름\.ollama 밑에 쌓여요. 모델 하나가 수십~수백 GB까지 자라므로 C 드라이브 여유를 먼저 확인하는 편이 안전해요.
부족하면 OLLAMA_MODELS 환경 변수로 저장 위치를 옮길 수 있는데, 절차는 뒤에 나올 환경 변수 편집과 동일해요. 문제가 생기면 %LOCALAPPDATA%\Ollama 폴더의 server.log·app.log부터 열어 봐요.
VRAM 표로 크기 고르기
다섯 번째 카드는 “Pick a model smaller than your VRAM(전용 메모리보다 작은 모델을 고르세요)“라고 안내해요. 모델이 넘치면 Ollama가 에러 없이 CPU 몫으로 던져서 같은 모델이 답장 수십 초짜리가 되는데, 이 선택이 전체 체험을 결정한다는 게 릴스의 요지예요.
Windows에서 VRAM은 작업 관리자(Ctrl+Shift+Esc)의 성능 탭에서 GPU를 클릭하면 ‘전용 GPU 메모리’ 항목으로 확인할 수 있어요. 여섯 번째 카드는 “SAVE THIS ONE”이라는 캡션과 함께 표를 건네줘요. 내 VRAM과 대조할게요.
| 내 VRAM | 고를 크기 | 다운로드 용량 |
|---|---|---|
| GPU 없음 | 2B | 1.9GB |
| 4GB | 2B | 1.9GB |
| 6GB | 4B | 3.3GB |
| 8~16GB | 9b | 6.6GB |
| 20~24GB | 27b | 17GB |
| 28GB 이상 | 35b | 24GB |
| 서버 | 122B | 81GB |
작은 태그 용량은 모델 페이지와 정확히 일치해요(2B 1.9GB, 4B 3.3GB, 9b 6.6GB). 큰 태그의 정확한 용량은 내려받기 전에 모델 페이지에서 다시 확인하길 권해요.
실행과 점검
모델을 골랐다면 남은 것은 두 명령이에요. Windows PowerShell이든 맥 터미널이든 명령은 동일하고, 콜론 뒤의 태그만 표에서 고른 크기로 바꿔 주면 돼요.
ollama pull huihui_ai/qwen3.5-abliterated:4B
ollama run huihui_ai/qwen3.5-abliterated:4B
답장이 느려지면 감이 아니라 ollama ps로 판단해요. PROCESSOR(처리 담당) 열이 100% GPU면 전용 작업대에 다 올라간 상태이고, 48%/52% CPU/GPU처럼 쪼개졌다면 절반이 CPU 몫이라는 뜻이에요. 그때 처방은 크기 교체예요(예컨대 9b에서 4B로).
콘솔이 아니라 명령을 잘못 고칠 일은 드물지만, 한 가지 조정 가능한 값이 컨텍스트(context, 문맥)예요. 모델 페이지는 256K를 내세우지만 Ollama의 기본 문맥 길이는 4,096 토큰이에요(공식 FAQ 명시). 늘리려면 대화 중엔 /set parameter num_ctx 8192, 전역 기본값으로는 환경 변수 OLLAMA_CONTEXT_LENGTH를 지정해요.
Windows 환경 변수 절차
공식 문서에는 나뉘어 있어서 순서로 정리할게요.
- 트레이에서 Ollama 아이콘을 우클릭해 Quit으로 종료해요. (환경 변수는 앱 재시작 때 읽혀요.)
- 설정(Windows 11) 또는 제어판(Windows 10)에서 “환경 변수”를 검색하고, “계정의 환경 변수 편집”을 열어요.
- 새로 만들기로
OLLAMA_CONTEXT_LENGTH변수를 만들고, 원하는 값(예: 8192)을 넣어요.OLLAMA_MODELS같은 다른 변수도 같은 창에서 추가해요. - 확인을 눌러 저장하고, 시작 메뉴에서 Ollama를 다시 실행하고, 터미널도 새로 열어요.
터미널 사용이 잦다면 PowerShell의 setx OLLAMA_CONTEXT_LENGTH 8192로 같은 사용자 변수를 기록해도 돼요. 기록 후에는 역시 앱을 종료했다가 다시 시작해야 적용돼요.
단서를 하나 달아요. 문맥은 늘리기만 하면 되는 값이 아니라 메모리를 직접 차지해서, 길어질수록 모델이 자주 쓰는 단어집(KV 캐시)의 두께가 전용 작업대 몫을 늘려요. 늘렸는데 오히려 느려졌다면 ollama ps를 다시 찍어 보고, 넘치면 한 단계 작은 태그로 교체해요.
와이파이를 꺼도 답한다
여덟 번째 카드는 “Turn your wifi off. It keeps answering.”(와이파이를 꺼라. 대답은 계속된다) NOTHING LEAVES YOUR MACHINE(기기를 떠나는 것은 아무 것도 없다)라는 부제까지 붙여 보여줘요.
로컬 모델이라 인터넷 없이도 돌아가고, 공식 FAQ 설명대로 제작사(ollama.com 쪽)도 프롬프트와 응답을 볼 수 없어요. 그래서 내 일기·문서 초안 같은 민감한 자료도 편하게 넣을 수 있고, 일주일에 두 번밖에 안 쓰는 구독을 대신할 자리가 돼요.
어떻게 연결되나
이 카드뉴스는 블로그의 로컬 LLM 시리즈에 한 조각을 더해요. Ollama 5단계 글은 설치 일반형과 앱 연결을, Ollama vs LM Studio 글은 도구 선택을 다뤘고, GGUF 양자화 글은 크기 근거, USB 검열 없는 LLM 글은 오프라인 조합을 담당해요.
정리하면 이래요. 크기는 VRAM 표로 고르고, Windows든 맥이든 pull·run 두 명령으로 실행하고, 느려지면 ollama ps로 확인하고 필요하면 문맥만 늘려요. “크기가 유일한 진짜 결정”이라는 릴스의 직감은 공식 문서로 다시 확인해도 유효했어요.
출처:
- 릴스 원문: carterperez.dev 게시물 (Instagram)
- 모델 페이지: huihui_ai/qwen3.5-abliterated (Ollama Library)
- Ollama 공식 문서: Windows
- Ollama 공식 문서: FAQ (기본 문맥 길이 4,096, ollama ps, 환경 변수 절차)
- Ollama 공식 문서: GPU 지원 (NVIDIA·AMD 요구 사항)
- 논문: Refusal in Language Models Is Mediated by a Single Direction (arXiv:2406.11717)
- 카드뉴스 제작자 사이트: carterperez.dev