1. OpenRouter의 Owl Alpha, Meituan의 LongCat-2.0-Preview로 밝혀져
OpenRouter에서 가장 빠르게 성장하는 에이전트 모델 중 하나인 'Owl Alpha'가 사실 Meituan의 LongCat-2.0-Preview 모델이라는 보고가 있습니다. 이 모델은 토큰당 33B에서 56B 파라미터의 동적 활성 범위를 가진 1.6조 파라미터 규모의 MoE(Mixture-of-Experts) 모델로, 100만 토큰의 컨텍스트 윈도우를 지원합니다. OpenRouter에서 약 두 달간 테스트를 거친 이 모델은 빠르게 순위가 상승하여 Hermes Agent 1위, Claude Code 2위, OpenClaw 3위를 차지했습니다. 월간 10.1조 토큰을 처리하며 242%의 월간 성장률을 기록하고 있어, 에이전트 및 코딩 워크플로우를 구축하는 개발자들에게 매우 경쟁력 있는 선택지가 되고 있습니다.
- • 보고서에 따르면 OpenRouter의 'Owl Alpha' 모델은 Meituan의 LongCat-2.0-Preview입니다.
- • LongCat-2.0-Preview는 33B~56B 파라미터의 동적 활성 범위를 가진 1.6조 파라미터 MoE 모델입니다.
- • 이 모델은 100만 토큰의 컨텍스트 윈도우를 지원하며 약 두 달간 OpenRouter에서 테스트되었습니다.
- • 현재 Hermes Agent 1위, Claude Code 2위, OpenClaw 3위를 기록 중입니다.
- • 사용 데이터에 따르면 월간 10.1조 토큰을 처리하며 월 242%의 성장률을 보이고 있습니다.
OpenRouter를 사용하는 개발자들은 인기 있는 에이전트 모델의 아키텍처와 코딩 및 에이전트 워크플로우에 대한 성능을 더 잘 이해할 수 있게 되었습니다.
2. V-Zero 시각적 추론 모델, Hugging Face에 공개
V-Zero 시각적 추론 모델이 Hugging Face에 공개되어 개발자들이 4B 파라미터 버전을 사용할 수 있게 되었습니다. V-Zero는 답변 라벨이 없는 시각적 추론을 위해 설계되었으며, 대조적 증거 게이팅(contrastive evidence gating)을 활용한 온폴리시 증류(on-policy distillation) 방식을 사용합니다. 개발자에 따르면 이 아키텍처는 표준 지도 미세 조정(SFT)보다 5배, 강화 학습(RL)보다 10배 빠르게 학습할 수 있어, 경량 시각적 추론 기능을 미세 조정하거나 배포하려는 개발자들에게 매우 효율적인 옵션을 제공합니다.
- • V-Zero는 답변 라벨이 없는 시각적 추론을 위해 설계되었습니다.
- • 이 모델은 대조적 증거 게이팅을 포함한 온폴리시 증류 방식을 사용합니다.
- • V-Zero는 지도 미세 조정(SFT)보다 5배, 강화 학습(RL)보다 10배 빠르게 학습합니다.
- • V-Zero 모델의 4B 파라미터 버전이 Hugging Face에서 제공됩니다.
개발자들은 표준 지도 미세 조정이나 강화 학습 방식보다 훨씬 빠르게 학습되는 경량 시각적 추론 모델을 활용할 수 있습니다.
3. 이미지를 플레이 가능한 캐릭터로 변환하는 로컬 800M 모델
정적 이미지를 실시간으로 상호작용 가능한 제어 캐릭터로 변환하는 800M 파라미터 규모의 이미지-투-플레이어블 캐릭터 모델이 공개되었습니다. 이 모델은 소비자용 GPU에서 로컬로 실행되도록 최적화되었습니다. 비대해진 MLP와 확산 강제(diffusion forcing)를 통해 처음부터 학습된 디노이저를 사용하여 구축되었으며, 각 프레임에 대한 디노이징 루프를 KV 캐시에 직접 추가하는 인과적 확산(causal diffusion) 아키텍처를 채택했습니다. 슬라이딩 윈도우는 중간 프레임을 제거하여 모델의 20~30개 잠재 프레임 학습 제한 내에서 컨텍스트를 유지합니다. 최대 성능을 원하는 개발자를 위해 500M 버전도 제공되며, RTX 5090에서 초당 60프레임 이상을 달성할 수 있습니다.
- • 개발자는 소비자용 GPU에서 실행되도록 설계된 800M 버전의 이미지-투-플레이어블 캐릭터 모델을 공개했습니다.
- • 이 모델은 이전 버전 대비 12개의 잠재 프레임으로 컨텍스트가 증가하고 안정성이 향상되었습니다.
- • 더 작은 500M 버전은 RTX 5090에서 초당 60프레임(fps) 이상을 달성합니다.
- • 아키텍처는 비대해진 MLP와 확산 강제로 처음부터 학습된 디노이저를 사용합니다.
- • 인과적 확산을 사용하여 각 프레임의 디노이징 루프를 KV 캐시에 추가하고 슬라이딩 윈도우로 중간 프레임을 제거합니다.
이 모델은 실시간 대화형 이미지-투-비디오 생성을 위한 경량 로컬 모델을 제공하여 새로운 게임 및 창의적 애플리케이션을 가능하게 합니다.
4. Wayfinder 라우터, 오프라인 결정론적 프롬프트 라우팅 지원
Wayfinder는 개발자가 API 비용과 성능의 균형을 맞출 수 있도록 로컬 LLM과 호스팅된 LLM 간에 쿼리를 동적으로 라우팅하는 경량 오프라인 프롬프트 라우터입니다. OpenAI 호환 게이트웨이로 작동하는 Wayfinder는 외부 API 키나 네트워크 호출 없이 프롬프트의 구조와 문구에 따라 0.0에서 1.0 사이의 복잡성 점수를 할당하여 라우팅 결정을 내립니다. 개발자는 이진 임계값, 계층적 밴드, 적합 다항 로지스틱 분류기 등 세 가지 모드로 라우터를 구성할 수 있으며, 기본 URL을 업데이트하는 것만으로 기존 스택에 통합할 수 있습니다. 또한 오프라인 보정 및 피드백 기반 재보정을 위한 CLI와 웹 UI를 포함합니다.
- • Wayfinder는 프롬프트의 구조와 문구에 따라 0.0~1.0의 복잡성 점수를 할당하는 결정론적 오프라인 프롬프트 라우터입니다.
- • 이 도구는 라우팅 결정을 위해 API 키나 네트워크 호출을 요구하지 않습니다.
- • OpenAI 호환 게이트웨이로 작동하여 base_url 변경만으로 기존 애플리케이션에 통합 가능합니다.
- • 이진 임계값, 계층적 밴드, 다항 로지스틱 분류기의 세 가지 라우팅 모드를 지원합니다.
- • 오프라인 보정, 자동 출력 판단, 피드백 기반 재보정 기능을 포함합니다.
개발자는 라우팅 결정 자체를 위해 네트워크 호출을 할 필요 없이, 간단한 쿼리는 로컬 모델로, 복잡한 쿼리는 클라우드 API로 자동 라우팅하여 API 비용과 지연 시간을 줄일 수 있습니다.
5. DeepSeek, Qwen3 및 Gemma-4를 위한 DeepSpec으로 추측 디코딩 생태계 확장
DeepSeek-V4용 DSpark 출시에 이어, DeepSeek는 Qwen3 및 Gemma-4의 추론을 가속화하기 위해 설계된 풀스택 코드베이스 및 드래프트 모델 제품군(DSpark, DFlash, Eagle3)인 DeepSpec을 출시할 준비를 하고 있습니다. 이 저장소는 데이터 준비 유틸리티, 학습 코드, 평가 스크립트와 함께 Qwen3(4B, 8B, 14B) 및 Gemma-4-12B-it에 최적화된 체크포인트를 제공할 예정입니다. 이러한 경량 드래프트 모델을 더 큰 타겟 모델과 결합함으로써 개발자는 추측 디코딩을 통해 로컬 추론 속도를 크게 향상시킬 수 있습니다.
- • DeepSpec은 DeepSeek의 추측 디코딩 도구를 DeepSeek-V4 시리즈 이상으로 확장합니다.
- • 출시 예정인 제품군에는 드래프트 모델 학습 및 평가를 위한 풀스택 코드베이스가 포함됩니다.
- • 새로운 드래프트 모델(DSpark, DFlash, Eagle3)은 Qwen3 및 Gemma-4-12B-it에 최적화되어 있습니다.
- • 드래프트 체크포인트는 비사고(non-thinking) 모드에서 타겟 모델이 생성한 open-perfectblend 데이터셋으로 학습되었습니다.
이번 확장을 통해 DeepSeek의 추측 디코딩 도구가 더 광범위한 오픈 웨이트 모델로 확대되어, 개발자들이 Qwen3 및 Gemma-4 배포 시 추론 지연 시간을 줄일 수 있게 되었습니다.
6. llama.cpp, DeepSeek DFlash 추측 디코딩 지원 추가
DeepSeek의 DSpark 추측 디코딩 체크포인트 출시에 따라, llama.cpp 프로젝트는 DFlash 드래프트 모델에 대한 공식 지원을 병합했습니다. 이번 통합을 통해 개발자는 새로 출시된 DSpark 체크포인트를 사용하여 llama.cpp 생태계 내에서 직접 DeepSeek-V4 모델의 토큰 생성을 가속화할 수 있습니다.
- • llama.cpp는 이제 DFlash 드래프트 모델을 지원합니다.
- • 이를 통해 DeepSeek의 최근 출시된 DSpark 추측 디코딩 체크포인트를 사용할 수 있습니다.
- • 개발자는 DeepSeek-V4에 대해 보고된 60~85%의 로컬 속도 향상을 달성할 수 있습니다.
개발자들은 이제 llama.cpp에서 모델을 로컬로 실행하여 DSpark 출시와 함께 발표된 성능 향상을 구현할 수 있습니다.
7. 분산 vLLM 추론을 위한 AMD Strix Halo RDMA 클러스터 가이드
새로운 기술 가이드는 텐서 병렬 처리를 사용하여 분산 vLLM 추론을 위한 2노드 AMD Strix Halo 클러스터를 설정하는 단계별 지침을 제공합니다. 하드웨어 구성은 AMD Ryzen AI MAX+ 프로세서와 128GB 통합 메모리를 탑재한 두 개의 Framework 데스크톱 메인보드를 활용합니다. RoCE v2(RDMA over Converged Ethernet)를 지원하는 Intel E810 NIC를 사용하여 노드 간 통신 지연 시간을 표준 TCP/IP의 70~100μs에서 약 5μs로 줄였습니다. 이 가이드에는 Strix Halo의 RDMA 지원을 활성화하기 위한 맞춤형 librccl.so 패치가 포함되어 있으며, vLLM에서 'Force Eager Mode'를 활성화하여 CUDA 그래프 캡처 교착 상태를 방지할 것을 권장합니다.
- • 이 가이드는 Ryzen AI MAX+ 프로세서가 탑재된 Framework 데스크톱 메인보드를 사용하여 2노드 AMD Strix Halo 클러스터를 구성하는 방법을 설명합니다.
- • RoCE v2(RDMA over Converged Ethernet)를 지원하는 Intel E810 NIC를 사용하여 노드 간 통신 지연 시간을 약 5μs로 줄입니다.
- • Fedora 43에서 실행되며 클러스터 관리에 Ray를 사용하고, vLLM이 추론 엔진 및 텐서 병렬 처리를 담당합니다.
- • RDMA에 대한 gfx1151(Strix Halo) 지원을 활성화하기 위해 툴박스 컨테이너 내에 맞춤형 librccl.so 패치가 제공됩니다.
- • 분산 APU 클러스터에서 CUDA 그래프 캡처로 인한 잠재적 교착 상태를 방지하기 위해 vLLM에서 'Force Eager Mode'를 활성화할 것을 권장합니다.
이 가이드는 개발자가 소비자용 APU 하드웨어를 클러스터링하여 최소한의 통신 지연으로 더 큰 모델을 로컬에서 실행할 수 있는 구체적인 청사진을 제공합니다.
8. 로컬 모델과 RAG 기반의 게임 불가지론적 NPC 엔진
한 개발자가 SillyTavern 아키텍처에서 영감을 받아 완전히 로컬 모델에서 실행되도록 설계된 게임 불가지론적 NPC 엔진 및 백엔드를 선보였습니다. 현재 기술 스택은 음성-텍스트 변환을 위한 NVIDIA Parakeet 0.6, 핵심 언어 모델을 위한 Gemma 4 26B A4B, 음성 합성을 위한 Qwen3-TTS를 통합합니다. 컨텍스트 윈도우 제한을 관리하고 낮은 지연 시간을 유지하기 위해, 이 엔진은 검색 증강 생성(RAG)을 사용하여 매 턴마다 전체 행동 공간으로 모델에 과부하를 주는 대신, 상황에 맞는 관련 NPC 행동만 프롬프트에 동적으로 주입합니다.
- • 개발자는 SillyTavern 아키텍처에서 영감을 받은 게임 불가지론적 NPC 엔진 및 백엔드를 구축하고 있습니다.
- • 로컬 스택에는 음성-텍스트 변환을 위한 NVIDIA Parakeet 0.6, LLM을 위한 Gemma 4 26B A4B, 음성 합성을 위한 Qwen3-TTS가 포함됩니다.
- • 엔진은 검색 증강 생성(RAG)을 사용하여 상황별 관련 NPC 행동만 프롬프트에 주입합니다.
- • 이 RAG 기반 접근 방식은 매 턴마다 LLM이 전체 행동 목록으로 과부하되는 것을 방지합니다.
이 아키텍처는 컨텍스트 윈도우에 과부하를 주거나 높은 API 비용을 발생시키지 않으면서 대화형 애플리케이션에서 로컬 모델을 사용하는 실용적인 패턴을 보여줍니다.
9. Ornith-1.0-35B GGUF, 네이티브 MTP 추측 디코딩 그래프 업데이트
한 개발자가 Ornith-1.0-35B 모델을 위한 IQ4_XS-MTP 그래프를 출시하여 llama.cpp 내에서 자기 추측 디코딩을 가능하게 했습니다. 네이티브 다중 토큰 예측(MTP) 드래프트 헤드와 IQ4_XS 양자화 본체를 결합하여, 19.6GB 모델은 단일 RTX PRO 6000 Blackwell GPU에서 초당 233.8 토큰의 단일 스트림 디코딩 속도를 달성했으며, 이는 1.3배에서 1.35배의 성능 향상입니다. 결정적으로, 이 그래프의 다음 토큰 분포는 타겟 전용 모델과 바이트 단위로 동일하며, 93.4%의 토큰 일치율과 0.073의 낮은 BF16 KLD를 유지하여 개발자가 출력 품질을 희생하지 않고도 상당한 속도 향상을 얻을 수 있습니다.
- • 개발자는 네이티브 MTP 드래프트 헤드와 IQ4_XS 본체를 결합하여 Ornith-1.0-35B 모델용 IQ4_XS-MTP 그래프를 만들었습니다.
- • 이 그래프는 단일 RTX PRO 6000 Blackwell GPU에서 초당 233.8 토큰의 단일 스트림 디코딩 속도를 달성하여 1.3~1.35배의 성능 향상을 보입니다.
- • 모델의 다음 토큰 분포는 타겟 전용 모델과 바이트 단위로 동일하며, BF16 KLD는 0.073, 토큰 일치율은 93.4%입니다.
- • 모델 크기는 약 19.6GB입니다.
- • 테스트는 텐서 병렬 처리 1(tp=1)로 설정된 llama.cpp를 사용하여 수행되었습니다.
로컬 모델을 실행하는 개발자들은 이 자기 추측 디코딩 그래프를 사용하여 바이트 단위로 동일한 출력을 유지하면서 훨씬 빠른 추론 속도를 달성할 수 있습니다.
10. Bash4LLM+, LLM API를 위한 경량 의존성 없는 Bash 래퍼
Bash4LLM+는 개발자가 터미널에서 직접 LLM API와 상호작용할 수 있게 해주는 경량 단일 파일 Bash 래퍼입니다. 표준 Bash, curl, jq만 사용하여 구축되었으며 Python이나 Node.js와 같은 무거운 외부 런타임이 필요하지 않습니다. 프롬프트 전송, 대화형 채팅 세션, 줄 단위 파일 처리, 출력 스트리밍, 세션 메타데이터를 JSON으로 저장하는 기능을 지원합니다. 보안을 고려하여 설계된 Bash4LLM+는 시스템 /tmp 디렉토리나 eval 명령 사용과 같은 위험한 관행을 피합니다. 기본적으로 Groq을 지원하며, 개발자가 사용자 지정 스크립트를 통해 다른 API 제공업체를 추가할 수 있는 확장 가능한 아키텍처를 갖추고 있습니다.
- • Bash4LLM+는 터미널에서 직접 LLM과 상호작용하기 위해 설계된 단일 파일 Bash 래퍼입니다.
- • Bash, curl, jq만 사용하여 구축되었으며 Python이나 Node.js와 같은 외부 런타임이 필요 없습니다.
- • 프롬프트 전송, 채팅, 줄 단위 파일 처리, 출력 스트리밍, JSON 형식의 세션 메타데이터 저장을 지원합니다.
- • 시스템 /tmp 및 eval 명령 사용을 피하여 보안을 유지하도록 설계되었습니다.
- • 기본적으로 Groq을 지원하며, extras/providers/ 폴더의 스크립트를 통해 추가 제공업체를 통합할 수 있습니다.
이 도구는 Python이나 Node.js 런타임 없이도 셸 스크립트와 터미널 워크플로우에 LLM 쿼리를 통합할 수 있는 간단하고 안전하며 의존성이 없는 방법을 제공합니다.