1. Qwen 3.8 27B, 30분 만에 arm64 코드 리버스 엔지니어링 성공
Artificial Analysis의 인텔리전스 지수에서 4B~40B 크기 클래스 1위를 차지한 Qwen 3.8 27B가 상용 애플리케이션의 라이선스 검사 로직을 성공적으로 리버스 엔지니어링했습니다. Nvidia GB10 Grace Blackwell 칩이 탑재된 Lenovo ThinkStation PGX에서 구동된 이 모델은 arm64 코드의 정적 분석을 수행하고, 스스로 오류를 식별 및 수정하며, 난독화된 RSA 키를 복구하여 30분 만에 인증 우회에 성공했습니다. 또한, 모델은 코드 감사 전 초기 탈옥 시도를 인식하고 거부하는 능력도 보여주었습니다.
- • Qwen 3.8 27B는 Artificial Analysis 인텔리전스 지수에서 52점을 기록하며 4B~40B 클래스 1위를 차지했습니다.
- • 해당 모델은 arm64 코드 정적 분석을 통해 상용 애플리케이션의 라이선스 검사 로직을 리버스 엔지니어링했습니다.
- • 30분간의 과정 동안 모델은 스스로 오류를 수정하며 난독화된 RSA 키를 복구하고 인증을 우회했습니다.
- • SGLang, NVFP4, DFlash2 추측 디코딩을 사용하여 Nvidia GB10 Grace Blackwell 칩에서 초당 최대 50토큰의 성능을 기록했습니다.
이 사례는 모델이 로컬 환경에서 복잡한 다단계 추론과 자기 교정을 수행할 수 있음을 보여주며, 고도화된 보안 감사 워크플로우를 가능하게 합니다.
2. Vercel, Zig 기반 코딩 에이전트 'fx' 출시
Vercel은 Zig로 작성된 가볍고 빠른 코딩 에이전트인 `fx`를 출시했습니다. 이번 출시는 LLM이 Rust나 Zig와 같은 복잡한 시스템 프로그래밍 언어의 진입 장벽을 낮추고 있는 업계의 광범위한 변화와 맞물려 있습니다. 개발자들은 성능 최적화나 eBPF, DWARF 파일, 커스텀 네트워크 드라이버와 같은 저수준 기술을 다루기 위해 AI를 점점 더 많이 활용하고 있습니다. 예를 들어, Cloudflare의 Artifacts 서비스는 현재 100KB WebAssembly 모듈로 컴파일된 순수 Zig 기반 Git 프로토콜 엔진을 실행하고 있습니다.
- • Vercel은 작은 크기와 빠른 속도를 강점으로 내세운 Zig 기반 코딩 에이전트 fx를 출시했습니다.
- • Cloudflare의 Artifacts 서비스는 100KB WebAssembly 모듈로 컴파일된 순수 Zig 기반 Git 프로토콜 엔진을 사용합니다.
- • LLM은 Rust나 Zig와 같은 복잡한 언어의 진입 장벽을 낮추어 개발자가 성능 최적화에 AI를 활용할 수 있게 합니다.
- • AI 지원을 통해 개발자들은 eBPF, DWARF 파일, 커스텀 암호화와 같은 복잡한 기술을 더 쉽게 다룰 수 있게 되었습니다.
fx의 출시는 Zig의 속도와 작은 설치 공간을 활용하여 최적화된 저오버헤드 코딩 에이전트를 개발자들에게 제공합니다.
3. Claude Code(Opus 5), 대규모 코드 포팅 작업에서 Qwen 3.8 27B 능가
로컬 Qwen 3.8 27B 모델과 Opus 5를 비교하여 2.1MB 크기의 C 파일(39,000줄)을 단일 프롬프트로 단일 파일 HTML/three.js 프로젝트로 포팅하는 실험을 진행했습니다. Opus 5를 구동하는 Claude Code는 21분 만에 '보통(okay)' 수준의 품질로 작업을 완료했습니다. 반면, vLLM을 통해 로컬에서 FP8로 구동된 Qwen 3.8 27B는 Hermes 하네스에서 4시간 18분, Codehamr 하네스에서 1시간 40분이 소요되었으며, 두 경우 모두 '나쁨(bad)' 수준의 결과물을 생성했습니다.
- • Opus 5를 사용한 Claude Code는 21분 만에 2.1MB C 파일 포팅을 완료하고 1759줄의 '보통' 품질 결과물을 생성했습니다.
- • Hermes 하네스에서 구동된 Qwen 3.8 27B는 4시간 18분이 소요되어 949줄의 '나쁨' 품질 결과물을 생성했습니다.
- • Codehamr 하네스에서 구동된 Qwen 3.8 27B는 1시간 40분이 소요되어 1056줄의 '나쁨' 품질 결과물을 생성했습니다.
- • 로컬 Qwen 3.8 27B 환경은 RTX 6000 Pro 96GB GPU에서 vLLM과 FP8을 사용하여 구성되었습니다.
이번 벤치마크는 복잡한 단일 프롬프트 코드베이스 마이그레이션을 수행할 때 로컬 모델과 최첨단 API 모델 간의 성능 차이를 극명하게 보여줍니다.
4. 에이전트 하네스(Agent Harnesses)와 오픈소스 Pi 프레임워크 이해
에이전트 하네스는 AI 모델이 에이전트로 작동할 수 있도록 구조화된 환경을 제공하는 핵심 아키텍처 패턴으로 부상하고 있습니다. 일반적으로 시스템 프롬프트, 도구, 에이전트 루프, 변환 계층으로 구성된 하네스를 통해 개발자는 다양한 제공업체의 모델을 교체하거나 오픈 웨이트 모델을 로컬에서 실행할 수 있습니다. Earendil이 개발한 Pi는 노트북에서 로컬로 실행되는 무료 오픈소스 하네스로, 사용자 주권을 극대화하기 위해 5,000개 이상의 커뮤니티 공유 확장 기능을 제공합니다.
- • 에이전트 하네스는 시스템 프롬프트, 도구 세트, 에이전트 루프, 모델 호환성을 위한 변환 계층으로 구성됩니다.
- • 변환 계층을 통해 개발자는 다양한 제공업체(예: Anthropic, OpenAI)의 모델을 교체하거나 오픈 웨이트 모델을 사용할 수 있습니다.
- • Pi는 노트북에서 로컬로 실행되는 무료 오픈소스 에이전트 하네스로, 5,000개 이상의 커뮤니티 확장 기능을 지원합니다.
- • 하네스는 사용자의 하드웨어에서 로컬로 실행되며 완전히 소유하고 맞춤 설정할 수 있습니다.
하네스는 개발자에게 에이전트 실행에 대한 완전한 소유권과 로컬 제어권을 부여하며, 에이전트 루프를 독점적인 API 제공업체로부터 분리합니다.
5. DeepSeek Harness, 암호화된 TOR 기반 에이전트 메시징 지원
DeepSeek Harness(DSH)는 점진적이고 번거로움 없는 설정 과정과 특정 방식에 얽매이지 않는(unopinionated) 설계로 주목받고 있습니다. 이 도구는 간편한 확인을 위한 웹 UI를 제공하며, AI 에이전트와 종단간 암호화된 TOR 기반 메시징을 가능하게 합니다. 최근 한 개발자는 AI에게 직접 통합을 지시함으로써 DSH를 SimpleX와 성공적으로 통합했으며, 이는 수동 풀 리퀘스트나 커뮤니티 플러그인 없이도 도구의 유연성을 입증한 사례입니다.
- • DeepSeek Harness(DSH)는 간편한 확인을 위한 웹 UI와 점진적이고 번거로움 없는 설정 과정을 제공합니다.
- • DSH는 AI 에이전트와 종단간 암호화된 TOR 기반 메시징을 지원합니다.
- • 사용자가 AI에게 직접 통합을 지시하여 풀 리퀘스트나 플러그인 없이 SimpleX와 DSH를 성공적으로 통합했습니다.
- • DSH는 특정 방식에 얽매이지 않아 개발자가 동작을 완전히 맞춤 설정할 수 있습니다.
이 도구는 개발자에게 프라이버시와 보안 통신을 기본적으로 우선시하는, 매우 유연하고 맞춤 설정이 가능한 에이전트 환경을 제공합니다.
6. Qwen 3.8 27B NVFP4, RTX 5090에서 451K KV-캐시로 120 tok/s 달성
한 개발자가 vLLM을 사용하여 전력 제한(400W) NVIDIA RTX 5090에서 Qwen 3.8 27B NVFP4 모델을 성공적으로 구성했습니다. 메모리 활용도를 0.98까지 극대화하기 위해 UI를 비활성화한 Linux(Bazzite) 환경에서, 이 시스템은 세션당 196K 컨텍스트와 3개의 병렬 세션에 걸친 451K 글로벌 KV-캐시를 지원합니다. 이 설정은 llama-benchy 0.4.0으로 검증된 결과, 평균 초당 120토큰의 속도를 달성했습니다.
- • 이 설정은 세션당 196K 컨텍스트 윈도우와 3개의 병렬 세션에 걸친 451K 글로벌 KV-캐시를 지원합니다.
- • 전력 제한(400W) NVIDIA RTX 5090에서 평균 초당 120토큰의 생성 속도를 달성했습니다.
- • 메모리 활용도를 0.98까지 높이기 위해 UI를 비활성화한 Linux(Bazzite) 환경에서 구동됩니다.
- • 4K에서 185K까지의 컨텍스트 길이에 대해 llama-benchy 0.4.0을 사용하여 성능 벤치마크를 수행했습니다.
이 구성은 개발자가 소비자용 하드웨어에서 대규모 컨텍스트 윈도우와 병렬 세션을 로컬로 실행할 수 있는 방법을 보여줍니다.
7. Qwen 3.8 27B용 Atomic Dynamic GGUF 양자화 모델 출시
Atomic Chat 팀은 Qwen 3.8 27B 모델을 위한 Atomic Dynamic(AD) GGUF 양자화 모델을 출시하고, 복셀 섬(voxel island) 생성 작업을 통해 RTX PRO 6000에서 성능을 평가했습니다. 팀은 가장 안전한 선택으로 AD-Q6_K 변형(25.0GB)을 권장하며, 이는 BF16 대비 98.7%의 Top-1 정확도와 초당 49토큰의 속도를 제공합니다. 메모리 제약이 더 큰 경우, AD-Q4_K_M 변형은 크기를 17.1GB로 줄이면서도 95.6%의 정확도를 유지하고 속도를 초당 67토큰으로 높입니다.
- • AD-Q6_K 양자화는 BF16 대비 98.7%의 Top-1 정확도와 초당 49토큰의 디코딩 속도를 제공하는 가장 안전한 선택지로 권장됩니다.
- • AD-Q4_K_M 양자화는 모델 크기를 17.1GB로 줄이면서 95.6%의 정확도를 유지하고 초당 67토큰의 속도를 달성합니다.
- • AD-Q5_K_M 양자화는 20.2GB 크기에서 97.3%의 정확도와 초당 57토큰의 디코딩 속도를 제공합니다.
- • 모든 양자화 모델은 atomic.chat 앱이나 AtomicChat Hugging Face 컬렉션을 통해 다운로드할 수 있습니다.
개발자들은 이제 전문 워크스테이션 GPU에서 메모리 점유율과 정확도 사이의 균형을 맞춘, 고도로 최적화된 Qwen 3.8 27B 로컬 양자화 모델을 배포할 수 있습니다.
8. GLM-4.5-Air, Llama.cpp에서 다중 토큰 예측(MTP) 지원 추가
Llama.cpp에 다중 토큰 예측(MTP)이 처음 통합된 이후, 이제 GLM-4.5-Air 모델에 대한 지원이 추가되었습니다. 106B 파라미터의 MoE(Mixture-of-Experts) 모델인 GLM-4.5-Air는 이제 MTP를 활용하여 Strix Halo나 NVIDIA 3090 GPU와 같이 메모리 용량은 크지만 연산 능력이 제한적인 하드웨어에서 생성 속도를 개선할 수 있습니다. GGUF 파일을 위한 필수 MTP 블록은 jacek2024가 유지 관리하는 저장소에서 이용할 수 있습니다.
- • GLM-4.5-Air는 12B 활성 파라미터를 가진 106B 파라미터 MoE 모델입니다.
- • Llama.cpp의 MTP 지원은 이제 GLM-4.5-Air 및 전체 GLM-4.5 모델을 포함합니다.
- • 이 구현은 고메모리, 저연산 하드웨어에 최적화되어 있습니다.
- • 사용자는 jacek2024가 유지 관리하는 저장소를 통해 GGUF 파일용 MTP 블록을 이용할 수 있습니다.
이번 업데이트는 MTP의 성능 이점을 GLM-4.5-Air 모델로 확장하여, 메모리는 많지만 연산 자원이 제한된 하드웨어에서도 대규모 MoE 아키텍처를 효율적으로 로컬 배포할 수 있게 합니다.
9. 새로운 벤치마크: Kimi K3, A100의 1비트 GGUF보다 B300의 MXFP4가 3.3배 비용 효율적
Kimi K3 모델의 자체 호스팅에 대한 이전 비용 편익 분석을 바탕으로, 8x B300 GPU에서 네이티브 MXFP4를 사용하는 것이 구형 하드웨어에서의 1비트 양자화보다 훨씬 효율적이라는 새로운 벤치마크 데이터가 나왔습니다. 8x A100에서 1비트 GGUF를 사용하는 것이 시간당 비용은 더 낮지만, B300 설정의 뛰어난 처리량 덕분에 백만 토큰당 비용 효율성은 3.3배 더 높습니다.
- • 8x B300 GPU에서 vLLM과 네이티브 MXFP4를 사용하여 Kimi K3를 호스팅하는 비용은 초당 92토큰 기준 백만 토큰당 190달러입니다.
- • 8x A100-80GB GPU에서 1비트 UD-IQ1_S GGUF를 실행하는 비용은 초당 9토큰 기준 백만 토큰당 620달러입니다.
- • B300 구성은 시간당 대여 비용이 더 높음에도 불구하고 비용 효율성은 3.3배 더 높습니다.
이 벤치마크는 대규모 MoE 모델을 위해 하드웨어와 양자화 전략 사이에서 고민하는 인프라 엔지니어들에게 중요한 데이터를 제공합니다.
10. Nvidia, AI 제품 가격 15% 이상 인상 고객 통보
Nvidia는 AI 관련 제품의 가격 인상 계획을 고객들에게 통보했습니다. 발표된 인상 폭은 15%를 초과하며, 이는 하드웨어 조달 비용과 자체 모델을 호스팅하는 개발자들의 클라우드 GPU 대여 요금에 직접적인 영향을 미칠 것으로 예상됩니다.
- • Nvidia는 AI 관련 제품의 가격 인상에 대해 고객들에게 공식적으로 통보했습니다.
- • 발표된 AI 관련 제품의 가격 인상 폭은 15% 이상입니다.
이번 가격 인상은 하드웨어 획득 비용을 직접적으로 상승시키고 클라우드 GPU 인스턴스 가격을 인상시켜 개발자 인프라 예산에 영향을 줄 것입니다.