Inference Brew

9B 파라미터 Mixture-of-Experts 아키텍처를 탑재한 Moondream 3.1 출시

00:00 / --:--

← 메인으로

9B 파라미터 Mixture-of-Experts 아키텍처를 탑재한 Moondream 3.1 출시

1. 9B 파라미터 Mixture-of-Experts 아키텍처를 탑재한 Moondream 3.1 출시

Moondream 3.1이 Mixture-of-Experts 아키텍처를 갖춘 비전 언어 모델로 출시되었습니다. 이 모델은 총 90억 개의 파라미터 중 20억 개의 활성 파라미터를 사용합니다. 시각적 추론 및 탐지 작업을 위해 설계되었으며, 쿼리(query), 탐지(detect), 포인트(point), 캡션(caption)과 같은 기본 기능을 지원합니다. Moondream 3.1의 모든 기능은 구조화된 출력값을 반환합니다.

  • Moondream 3.1은 총 90억 개의 파라미터와 20억 개의 활성 파라미터를 가진 Mixture-of-Experts(MoE) 아키텍처를 특징으로 합니다.
  • 이 모델은 시각적 추론 및 탐지 작업을 위해 설계되었습니다.
  • 쿼리, 탐지, 포인트, 캡션 등 다양한 기본 기능을 지원합니다.
  • Moondream 3.1의 모든 기본 기능은 구조화된 출력값을 반환합니다.

로컬 환경에서 시각적 추론, 탐지 및 구조화된 출력 작업을 수행할 수 있는 경량화된 고효율 오픈 웨이트 비전 모델을 제공합니다.

SOURCES

2. 인기 MCP 서버 전반에서 심각한 보안 취약점 발견

Canopii의 '2026년 MCP 보안 현황' 보고서는 11,524개의 공개된 MCP 서버를 분석했습니다. 보고서에 따르면 14개 중 1개꼴인 830개의 서버가 보안 등급 D 또는 F를 받았습니다. 연구진은 eval, 셸 인젝션, 안전하지 않은 역직렬화 등 위험한 코드 싱크를 포함한 서버 232개를 식별했습니다. 또한, 초기 게시 후 도구 정의를 변경한 서버 버전이 184개 발견되었습니다. 인증이 필요한 것으로 명시된 엔드포인트 중 741건은 익명의 호출자에게 도구를 제공했습니다. 특히 GitHub 스타 수가 1,000개 이상인 서버는 10개 미만인 서버보다 고위험군일 확률이 5배 이상 높았으며, 가장 많은 스타를 받은 상위 15개 서버 중 6개가 D 또는 F 등급을 받았습니다.

  • Canopii 보고서는 11,524개의 공개된 MCP 서버를 분석하여 830개(14개 중 1개)에 D 또는 F 등급을 부여했습니다.
  • 연구진은 eval, 셸 인젝션, 안전하지 않은 역직렬화 등 위험한 코드 싱크를 포함한 서버 232개를 식별했습니다.
  • 초기 게시 후 도구 정의를 변경한 서버 버전이 184개 발견되었습니다.
  • 인증이 필요한 엔드포인트가 익명의 호출자에게 도구를 제공한 사례가 741건 확인되었습니다.
  • GitHub 스타 수가 1,000개 이상인 서버는 10개 미만인 서버보다 고위험군일 확률이 5배 이상 높습니다.
  • 레지스트리에서 가장 많은 스타를 받은 상위 15개 서버 중 6개가 보안 등급 D 또는 F를 받았습니다.

타사 MCP 서버를 통합하는 개발자는 애플리케이션을 보호하기 위해 셸 인젝션 및 무단 도구 노출과 같은 취약점을 주의 깊게 감사해야 합니다.

SOURCES

3. llama.cpp 릴리스, 에이전트 워크플로우의 컨텍스트 체크포인트 버그 수정

llama.cpp b9978 릴리스는 에이전트 워크로드에 영향을 미치던 체크포인트 버그를 해결했습니다. 수정 전에는 모든 에이전트 턴마다 새로운 체크포인트가 생성되어 최소 단계 간격이 무시되고 커버리지 윈도우가 붕괴되었습니다. 이전 버그는 도구 호출 루프 중 컨텍스트 되감기가 발생할 때 모든 체크포인트를 삭제하여 전체 재처리를 유발했습니다. 이번 업데이트는 이전 작업의 간격이 좁은 체크포인트를 제거하여 더 넓은 커버리지 윈도우를 유지함으로써 긴 에이전트 세션의 속도를 향상시킵니다.

  • llama.cpp b9978 릴리스는 에이전트 워크로드에 영향을 미치던 체크포인트 버그를 해결했습니다.
  • 수정 전에는 모든 에이전트 턴마다 새로운 체크포인트가 생성되어 최소 단계 간격이 무시되고 커버리지 윈도우가 붕괴되었습니다.
  • 버그로 인해 도구 호출 루프 중 컨텍스트 되감기가 발생하면 모든 체크포인트가 삭제되어 전체 재처리가 발생했습니다.
  • 업데이트는 이전 작업의 간격이 좁은 체크포인트를 제거하여 더 넓은 커버리지 윈도우를 유지합니다.

이 수정 사항은 복잡한 도구 호출 루프 동안 긴 로컬 에이전트 세션의 속도와 효율성을 크게 향상시킵니다.

SOURCES

4. Zer0Fit MCP 서버, Google의 TabFM 및 TimesFM 모델을 로컬 워크플로우로 도입

한 대학원생이 Google의 TabFM 및 TimesFM 트랜스포머 모델을 단일 Docker 컨테이너에서 실행할 수 있는 MCP 래퍼인 Zer0Fit을 출시했습니다. 이 도구를 사용하면 이러한 표 형식 및 시계열 모델을 Open WebUI, Claude Code, Codex와 같은 로컬 LLM과 통합할 수 있습니다. Zer0Fit은 PyTorch 기반이므로 최소 16GB의 VRAM이 필요하며 CUDA 호환 하드웨어로 제한됩니다. 구현에는 VRAM 사용량을 관리하기 위해 5분의 TTL(Time-to-Live)을 갖춘 동적 모델 로드 및 언로드 기능이 포함되어 있습니다. 고전적인 데이터 세트를 대상으로 한 초기 테스트에서 Iris 분류기는 94.7%의 정확도를, California Housing 회귀 모델은 0.87의 R2 점수를 기록했습니다.

  • Zer0Fit은 Google의 TabFM 및 TimesFM 트랜스포머 모델을 MCP 서버로서 단일 Docker 컨테이너에서 로컬로 실행합니다.
  • 이 도구는 표 형식 및 시계열 모델을 Open WebUI, Claude Code, Codex와 같은 로컬 LLM과 통합할 수 있게 합니다.
  • PyTorch 기반이므로 최소 16GB의 VRAM이 필요하며 CUDA 호환 하드웨어로 제한됩니다.
  • VRAM 사용량을 관리하기 위해 5분의 TTL(Time-to-Live)을 갖춘 동적 모델 로드 및 언로드 기능을 제공합니다.
  • 초기 테스트에서 Iris 분류기는 94.7%의 정확도를, California Housing 회귀 모델은 0.87의 R2 점수를 기록했습니다.
  • 현재 CSV 파일을 지원하며 향후 XLS, XLSX, JSON, JSONL 형식에 대한 지원을 추가할 계획입니다.

개발자가 강력한 표 형식 및 시계열 예측, 분류, 회귀 모델을 로컬 LLM 워크플로우 및 에이전트 환경에 직접 통합할 수 있게 합니다.

SOURCES

5. Mindwalk, Claude Code 및 Codex 에이전트 세션을 3D로 시각화

Mindwalk는 코드베이스의 3D 맵 위에서 코딩 에이전트 세션을 재생하는 새로운 시각화 도구입니다. 이 도구는 외부로 데이터를 전송하지 않고 로컬에서 Claude Code 및 Codex의 세션 로그를 처리합니다. 리포지토리를 3D 맵으로 표현하며, 검색, 읽기, 편집 작업에 따라 파일 활동이 빛나는 효과로 시각화됩니다. Mindwalk는 Go 백엔드와 React/Three.js 프론트엔드로 구축되었으며, 정규화된 트레이스 및 citymap JSON 파일을 활용합니다. MIT 라이선스로 배포되며 Ricko Yu가 개발했습니다.

  • Mindwalk는 Claude Code 및 Codex의 세션 로그를 로컬에서 처리하여 코드베이스 활동의 3D 맵을 생성합니다.
  • 파일 활동은 검색, 읽기, 편집 작업에 따라 빛나는 효과로 시각화됩니다.
  • 트리 및 지형 뷰, 터치 상태 추적, 히스토그램이 포함된 재생 데크, 사용자 턴 및 하위 에이전트 실행을 위한 타임라인 마크 등의 기능을 제공합니다.
  • Go 백엔드와 React/Three.js 프론트엔드로 구축되었으며 정규화된 트레이스 및 citymap JSON 파일을 활용합니다.
  • MIT 라이선스로 배포되며 셸 스크립트 설치 또는 소스 빌드를 통해 사용할 수 있습니다.

코드베이스 활동의 대화형 3D 시각화를 통해 개발자가 복잡한 다단계 에이전트 동작을 디버깅하고 이해하도록 돕습니다.

SOURCES

6. Modelr 앱, Apple Silicon에서 로컬 이미지-3D 생성 지원

개발자 Zimeng Xiong은 Hunyuan3D-Paint 및 Hunyuan3D-Shape의 Swift/MLX 포트를 기반으로 한 Apple Silicon용 독립형 이미지-3D 데스크톱 애플리케이션 Modelr를 출시했습니다. 이 애플리케이션은 MLX 프레임워크를 활용하여 PyTorch나 CPU 처리 오버헤드 없이 Apple Silicon에서 모델을 실행합니다. M4 Max 칩의 FP16 벤치마크 결과, hy3d shape(small)은 20.9초(피크 메모리 5.6GB), hy3d paint(pbr)는 344초(피크 메모리 39GB)가 소요되었습니다. Modelr는 SwiftVision을 사용한 배경 제거 및 3D 모델 생성을 위한 실시간 확산 스트리밍 기능을 제공합니다.

  • 개발자 Zimeng Xiong이 Apple Silicon용 독립형 이미지-3D 데스크톱 애플리케이션 Modelr를 출시했습니다.
  • MLX 프레임워크를 사용하여 PyTorch나 CPU 처리 오버헤드 없이 Hunyuan3D-Paint 및 Hunyuan3D-Shape를 실행합니다.
  • M4 Max 칩의 FP16 벤치마크에서 hy3d shape(small)은 20.9초(피크 메모리 5.6GB)가 소요되었습니다.
  • hy3d paint(pbr) 모델은 동일 하드웨어에서 344초(피크 메모리 39GB)가 소요되었습니다.
  • SwiftVision을 사용한 배경 제거 및 3D 모델 생성을 위한 실시간 확산 스트리밍 기능을 포함합니다.
  • 소스 코드와 가중치는 GitHub의 Hunyuan3D-Swift 및 Modelr 리포지토리에서 확인할 수 있습니다.

개발자가 클라우드 API에 의존하지 않고 Mac 하드웨어에서 이미지로부터 3D 모델을 생성하는 빠르고 가벼운 로컬 방식을 제공합니다.

SOURCES

7. llama.cpp용 네이티브 GGUF Jacobian-Lens 시각화 및 조향 도구 출시

한 개발자가 llama.cpp에서 실행되는 GGUF 모델을 위해 설계된 대화형 Jacobian-lens 시각화 및 실시간 조향 도구를 출시했습니다. Anthropic의 연구에서 영감을 받은 이 프로젝트는 모델 관찰, J-space 스와핑, 어블리터레이션 및 조향을 지원하는 네이티브 GGUF 서버를 특징으로 합니다. 이 도구는 덴스(dense) 및 Mixture-of-Experts(MoE) GGUF 모델 모두와 호환되며 실행 중인 llama-server 인스턴스를 관찰할 수 있습니다. 렌즈의 메모리 요구 사항은 모델 크기의 약 1/8 수준이며, 160GB 모델의 경우 약 20GB의 추가 RAM이 필요합니다.

  • jlens-gguf 도구는 모델 관찰, J-space 스와핑, 어블리터레이션 및 조향을 지원하는 네이티브 GGUF 서버를 제공합니다.
  • 덴스 및 Mixture-of-Experts(MoE) GGUF 모델과 호환되며 실행 중인 llama-server 인스턴스를 관찰할 수 있습니다.
  • 렌즈의 메모리 요구 사항은 모델 크기의 약 1/8 수준이며, 160GB 모델의 경우 약 20GB의 추가 RAM이 필요합니다.
  • 프로젝트 코드는 GitHub(github.com/igorbarshteyn/jlens-gguf)에서 공개적으로 이용 가능합니다.

이 도구는 개발자가 추론 중에 로컬 GGUF 모델의 내부 활성화를 검사하고 조향할 수 있는 구체적인 방법을 제공합니다.

SOURCES

8. mlx-lm, Apple Silicon에서 Nemotron Puzzle 75B 네이티브 지원 추가

pull request #1535를 통해 mlx-lm 라이브러리에 nemotron_h_puzzle에 대한 네이티브 지원이 추가되었습니다. 64GB M2 Max에서 4비트 및 5비트 전문가 양자화 성능을 비교한 결과, 두 구성 모두 6비트 덴스 레이어와 BF16 출력 헤드를 사용했습니다. 4비트 구성은 초당 14.27 토큰을 기록하여 5비트 구성의 초당 10.53 토큰보다 뛰어난 성능을 보였습니다. 모델 구현을 위해 블록 단위 구성 지원, 텐서 리매핑, NVIDIA의 FP32 노름 및 라우터 동작 일치가 필요했습니다. 첫 번째 레이어 SSM 출력의 불일치는 softplus 계산의 승격 순서를 NVIDIA 참조와 일치하도록 조정하여 코사인 유사도를 0.999998까지 개선함으로써 해결되었습니다.

  • pull request #1535를 통해 mlx-lm 라이브러리에 nemotron_h_puzzle에 대한 네이티브 지원이 추가되었습니다.
  • 64GB M2 Max에서 4비트 전문가 양자화 구성이 초당 14.27 토큰을 기록하여 5비트 구성(10.53 t/s)보다 뛰어난 성능을 보였습니다.
  • 5비트 구성은 메모리 압박으로 인해 로컬 작업 확인 및 긴 컨텍스트 검색에서 성능이 저하되었습니다.
  • 모델 구현을 위해 블록 단위 구성 지원, 텐서 리매핑, NVIDIA의 FP32 노름 및 라우터 동작 일치가 필요했습니다.
  • 첫 번째 레이어 SSM 출력의 불일치는 softplus 계산의 승격 순서를 조정하여 코사인 유사도를 0.999998까지 개선했습니다.
  • 131k 어휘 lm_head가 반복적인 출력을 생성하는 것을 방지하기 위해 BF16 출력 헤드 사용이 필수적입니다.

개발자가 최적화된 메모리 사용량과 성능으로 Apple Silicon에서 강력한 75B 파라미터 모델을 로컬로 실행할 수 있게 합니다.

SOURCES

9. DeepSeek, V4-Pro 가격 75% 인하로 비용 격차 확대

DeepSeek와 미국 프론티어 연구소 간의 기존 비용 격차를 바탕으로, DeepSeek는 이제 V4-Pro 모델 가격을 75% 인하했습니다. 이는 개발자의 진입 장벽을 낮추지만, 다단계 에이전트 워크플로우에서 토큰 소비가 급격히 증가함에 따라 이러한 추론 비용 하락 효과가 상쇄되고 있습니다. 앞서 언급했듯이 에이전트 시스템은 입력 대 청구 토큰 비율이 1:700에 달할 수 있으므로, 단위 비용이 낮아지더라도 개발자는 지속 가능한 마진을 유지하기 위해 프롬프트 캐싱 및 비용 인식 라우팅과 같은 기술을 채택해야 합니다.

  • DeepSeek는 V4-Pro 가격을 75% 인하하여 미국 프론티어 모델 대비 비용 우위를 더욱 확대했습니다.
  • 단위 비용이 낮아졌음에도 불구하고 다단계 에이전트 워크플로우는 1:700 비율에 달하는 토큰을 계속 소비합니다.
  • 토큰 증폭은 기존의 좌석 기반 가격 책정을 사용하는 공급업체의 마이너스 매출 총이익을 유발하는 주요 요인으로 남아 있습니다.
  • 개발자들은 높은 에이전트 토큰 사용량을 상쇄하기 위해 프롬프트 캐싱 및 추측 디코딩과 같은 비용 관리 전략을 점점 더 많이 구현하고 있습니다.

DeepSeek의 가격 인하는 고가의 미국 프론티어 모델에 대한 매력적인 대안이 되지만, 에이전트 워크플로우의 고유한 토큰 증폭 특성으로 인해 단위 비용 절감만으로는 기업 공급업체의 근본적인 마진 문제를 해결하지 못할 수 있습니다.

SOURCES

10. Anthropic, Fable 5 프로모션 액세스 및 요금 제한 7월 19일까지 연장

Anthropic은 기존 7월 12일 만료 예정이었던 Claude Fable 5 액세스 프로모션 기간과 Claude Code 구독자를 위한 50% 더 높은 주간 요금 제한을 연장했습니다. 이러한 혜택은 이제 7월 19일까지 유지됩니다. Fable 5 사용량은 추가 비용 없이 구독자의 주간 제한량의 최대 절반까지 계속 계산됩니다.

  • Claude Code에 대한 프로모션 액세스 및 50% 더 높은 주간 요금 제한이 7월 19일까지 연장되었습니다.
  • 이번 연장은 7월 12일에 종료될 예정이었던 초기 프로모션 기간에 따른 것입니다.
  • Fable 5 사용량은 추가 비용 없이 구독자의 주간 제한량의 최대 절반까지 계속 계산됩니다.

개발자는 코딩 및 추론 워크플로우를 위해 더 높은 요금 제한과 Fable 5에 대한 프로모션 액세스를 일주일 더 활용할 수 있습니다.

SOURCES

11. Claude Code와 OpenCode의 토큰 효율성 비교 연구

에이전트 코딩 도구인 Claude Code와 OpenCode의 효율성을 비교하기 위한 실증적 연구가 수행되었습니다. 이 연구는 Claude Code가 OpenCode보다 사용량 측정기를 더 빠르게 상승시킨다는 일화적 증거가 제기된 후 시작되었습니다. 연구진은 코딩 도구와 Anthropic 엔드포인트 사이에 로깅을 추가하여 모든 요청과 사용량 블록을 캡처함으로써 실증 데이터를 수집했습니다. 연구 결과, Claude Code는 프롬프트를 읽기 전에 33,000개의 토큰을 전송하는 반면 OpenCode는 7,000개의 토큰을 전송하여 캐시 전략 및 하네스 토큰 사용 측면에서 OpenCode보다 효율성이 떨어지는 것으로 결론지었습니다.

  • 연구는 Anthropic 엔드포인트에 대한 요청을 로깅하여 에이전트 코딩 도구인 Claude Code와 OpenCode의 효율성을 비교했습니다.
  • Claude Code는 프롬프트를 읽기 전에 33,000개의 토큰을 전송하는 반면, OpenCode는 7,000개의 토큰을 전송하는 것으로 나타났습니다.
  • 연구진은 Claude Code가 캐시 전략 및 하네스 토큰 사용 측면에서 OpenCode보다 효율성이 떨어진다고 결론지었습니다.
  • 이 연구는 Claude Code가 OpenCode보다 사용량 측정기를 더 빠르게 상승시킨다는 일화적 증거가 제기된 후 시작되었습니다.

Claude Code를 사용하는 개발자는 OpenCode와 같은 대체 도구에 비해 API 사용 비용을 가속화할 수 있는 더 높은 토큰 오버헤드에 유의해야 합니다.

SOURCES

12. RTX 5090 및 Qwen3.6 35B를 이용한 병렬 에이전트 처리량 벤치마킹

RTX 5090 GPU와 LM Studio를 통해 로드된 Qwen 3.6 35B 모델을 사용한 벤치마크 테스트에서 다중 에이전트 처리량을 평가했습니다. 테스트 매개변수에는 에이전트당 5개의 요청, 최대 1024 토큰, 0.3의 온도가 포함되었습니다. 결합된 처리량은 하위 선형적으로 확장되며, 8개의 에이전트가 단일 에이전트 처리량의 2.2배를 제공합니다. 개별 에이전트 속도는 에이전트 1개일 때 256.54 t/s에서 8개일 때 67.22 t/s로 떨어집니다. 2개의 에이전트를 실행할 때 70.4%의 피크 효율성이 달성됩니다. 주요 성능 병목 현상은 KV 캐시 요구 사항과 컴퓨팅 분할로 확인되었습니다.

  • LM Studio를 통해 로드된 Qwen3.6 35B를 RTX 5090에서 벤치마킹하여 병렬 작업 8개 설정 시 다중 에이전트 처리량을 평가했습니다.
  • 결합된 처리량은 하위 선형적으로 확장되며, 8개의 에이전트가 단일 에이전트 처리량의 2.2배를 제공합니다.
  • 개별 에이전트 속도는 에이전트 1개일 때 256.54 t/s에서 8개일 때 67.22 t/s로 떨어집니다.
  • 2개의 에이전트를 실행할 때 70.4%의 피크 효율성이 달성되며, OpenCode의 권장 구성은 4~5개의 에이전트입니다.
  • 각 에이전트는 전체 컨텍스트 윈도우를 활용하므로 8개의 에이전트를 실행할 때 8배의 KV 캐시 사용량이 발생합니다.
  • 주요 성능 병목 현상은 KV 캐시 요구 사항과 컴퓨팅 분할로 확인되었습니다.

로컬 다중 에이전트 시스템을 실행할 때 개발자가 처리량 이득과 VRAM 및 오버헤드 비용 간의 균형을 맞추기 위한 구체적인 구성 지침을 제공합니다.

SOURCES

13. Qwen3.6-27B 도구 호출 및 루핑 문제에 대한 커뮤니티 해결책

로컬 Qwen3.6-27B 모델 사용자들은 프론티어 모델의 신뢰할 수 있는 로컬 대안으로 사용하기 어렵게 만드는 빈번한 도구 호출 실패와 루핑 동작을 보고했습니다. 이를 해결하기 위해 한 사용자는 Pi 코딩 에이전트를 위한 확장 프로그램을 개발하여 루핑을 위해 JSON 스트림을 모니터링하고 모델이 조기에 중단될 때 궤도를 유지하도록 프롬프트를 자동으로 주입합니다. 또한 커뮤니티 구성원들은 Hugging Face의 'froggeric'이 호스팅하는 특정 채팅 템플릿을 사용하면 로컬 모델에서 발생하는 일반적인 루핑 및 도구 호출 실패 문제를 해결할 수 있음을 확인했습니다.

  • Qwen3.6-27B 사용자들은 로컬 에이전트 작업 중 빈번한 도구 호출 실패와 루핑 동작을 보고했습니다.
  • 한 개발자는 루핑을 위해 JSON 스트림을 모니터링하고 모델이 궤도를 유지하도록 프롬프트를 주입하는 Pi 코딩 에이전트용 확장 프로그램을 만들었습니다.
  • 커뮤니티 구성원들은 Hugging Face의 'froggeric'이 호스팅하는 특정 채팅 템플릿을 사용하면 일반적인 루핑 및 도구 호출 실패를 해결할 수 있음을 확인했습니다.

이러한 해결책은 개발자가 에이전트 작업을 위해 Qwen3.6-27B를 프론티어 모델의 더 신뢰할 수 있는 로컬 대안으로 실행하도록 돕습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.