1. Qwen 3.6 27B Abliterated 출시, 거부율 대폭 감소
Apostate 프로젝트가 첫 번째 대형 모델 릴리스로 Qwen 3.6 27B의 Abliterated 버전을 공개했습니다. 모델의 안전성 정렬(safety alignment)을 수정하여 거부율을 기존 92%에서 7.6%로 성공적으로 낮췄습니다. 이 수정은 모델의 핵심 성능을 유지하며, KL 발산(KL divergence) 수치가 0.120에 불과해 영향이 최소화되었습니다. 해당 모델은 Hugging Face에서 표준 및 GGUF 형식으로 이용 가능합니다.
- • Apostate 프로젝트가 Qwen 3.6 27B Abliterated 버전을 Hugging Face에 표준 및 GGUF 형식으로 공개했습니다.
- • 모델의 안전성 정렬을 수정하여 거부율을 92%에서 7.6%로 낮췄습니다.
- • 수정 작업이 모델 성능에 미치는 영향은 KL 발산 기준 0.120으로 매우 미미합니다.
- • 이번 릴리스는 Apostate 프로젝트의 첫 번째 대형 모델 공개입니다.
개발자들이 엄격한 안전성 거부 반응을 우회하면서도 모델 본연의 뛰어난 성능을 유지하는 로컬 모델을 배포할 수 있게 합니다.
2. Recall 플러그인, Claude Code에 로컬 세션 메모리 기능 추가
Claude Code를 위한 새로운 플러그인인 Recall은 외부 API로 데이터를 전송하지 않고도 지속적인 세션 메모리를 제공합니다. 사용자의 로컬 머신에서 완전히 작동하는 Recall은 TF-IDF 및 TextRank를 구현한 파이썬 스크립트를 사용하여 프로젝트 세션을 요약합니다. 로그와 요약본을 로컬 .recall/ 디렉토리에 저장함으로써 새로운 코딩 세션의 콜드 스타트 문제를 해결하고 토큰 사용량을 줄여줍니다. 또한 API 키나 비밀 정보가 로그에 기록되지 않도록 하는 내장 마스킹(redaction) 기능도 포함되어 있습니다.
- • Recall은 Claude Code를 위한 로컬 우선 플러그인으로, 세션 로그를 생성하고 프로젝트 세션을 요약합니다.
- • 이 도구는 완전히 로컬에서 실행되며, 요약을 위해 TF-IDF 및 TextRank 알고리즘을 사용하는 파이썬 스크립트를 활용합니다.
- • 세션 재개 시 토큰 소비를 줄이고 요약을 위한 외부 모델 호출을 방지하여 API 비용을 절감합니다.
- • Recall은 파일 기록 전 API 키나 토큰 같은 비밀 정보를 제거하는 마스킹 기능을 포함하고 있습니다.
- • 이 플러그인은 개인 및 공유 팀 메모리를 모두 지원하며 데이터를 .recall/ 디렉토리에 저장합니다.
개발자가 지속적인 로컬 세션 요약을 유지함으로써 Claude Code 사용 시 API 비용을 절감하고 프로젝트 컨텍스트를 반복해서 설명할 필요를 줄여줍니다.
3. 로컬 비전 모델 벤치마크, Qwen3.6 27B 추천
로컬 비전 언어 모델(VLM)에 대한 최신 벤치마크가 Apple Silicon 환경에서 llama.cpp를 사용하여 23개 모델을 평가했습니다. 결과에 따르면 Qwen3.6 27B(Q4, Thinking 모드 미사용)가 가장 뛰어난 성능을 보였습니다. 특히 하이브리드 모델에서 Thinking 모드를 활성화하면 오히려 비전 성능이 저하되고 타임아웃이 발생하며, MoE 모델은 비전 작업에서 일반적인 밀집(dense) 모델보다 성능이 떨어지는 것으로 나타났습니다.
- • 벤치마크는 96GB RAM을 탑재한 Apple M2 Max 환경에서 llama.cpp를 사용하여 30개의 이미지로 23개 모델을 평가했습니다.
- • Qwen3.6 27B(Q4, nothink)가 79.6점으로 최고 성능을 기록했습니다.
- • 하이브리드 모델에서 Thinking 모드를 활성화하면 비전 성능이 저하되고 불안정성 및 타임아웃이 발생하는 것으로 확인되었습니다.
- • VRAM 용량별 권장 모델은 4-8GB의 경우 Qwen3.5 4B, 12-16GB는 Qwen3-VL 8B(Q8), 24GB 이상은 Qwen3.6 27B입니다.
- • 비전 작업에서 Mixture of Experts(MoE) 모델은 동급의 밀집 모델보다 성능이 낮았습니다.
개발자들에게 로컬 비전 모델 배포를 위한 하드웨어별 명확한 권장 사항을 제공하고, Thinking 모드와 같은 성능 저하 요인에 대한 경고를 전달합니다.