Inference Brew

Google, 인코더 없는 멀티모달 아키텍처를 적용한 Gemma 4 12B 출시

00:00 / --:--

← 메인으로

Google, 인코더 없는 멀티모달 아키텍처를 적용한 Gemma 4 12B 출시

1. Google, 인코더 없는 멀티모달 아키텍처를 적용한 Gemma 4 12B 출시

Google DeepMind의 Gemma 4 12B는 별도의 비전 및 오디오 인코더를 제거하여 아키텍처의 큰 변화를 가져왔습니다. 대신 3,500만 개의 파라미터를 가진 임베더가 시각적 패치를 처리하고, 원시 오디오 프레임이 핵심 LLM의 임베딩 공간으로 직접 투영됩니다. 이러한 통합 설계 덕분에 이 모델은 16GB VRAM 또는 통합 메모리를 갖춘 소비자용 하드웨어에서 로컬로 실행될 수 있으며, Google은 26B Mixture of Experts 모델에 근접하는 성능을 제공한다고 주장합니다.

  • Gemma 4 12B는 Apache 2.0 라이선스로 출시된 119억 5천만 개의 파라미터를 가진 모델입니다.
  • 원시 오디오(16kHz)와 시각적 패치(48x48 픽셀)가 LLM 백본으로 직접 전달되는 인코더 없는 아키텍처를 특징으로 합니다.
  • 256K 토큰 컨텍스트 윈도우, 네이티브 에이전트 도구 사용, 단계별 추론 모드를 지원합니다.
  • llama.cpp, MLX, vLLM, Ollama, SGLang, Unsloth, LM Studio와 호환됩니다.
  • 로컬 추론 지연 시간을 줄이기 위한 전용 Multi-Token Prediction(MTP) 드래프터 모델이 포함되어 있습니다.

개발자가 별도의 비전 및 오디오 인코더 없이도 복잡성과 지연 시간을 줄여 표준 16GB 노트북에서 고성능 멀티모달 모델을 로컬로 실행할 수 있게 합니다.

2. Nous Research, 로컬 에이전트 워크플로우를 위한 Hermes Desktop GUI 출시

Hermes Desktop은 자율 Hermes Agent에 세련된 그래픽 인터페이스를 제공합니다. 이 애플리케이션은 실시간 도구 활동, 스트리밍 응답, 파일 탐색 기능을 시각화하며, 자체 개선 가능한 재사용 기술 및 세션 간 기억과 같은 에이전트의 핵심 기능을 유지합니다. 개발자는 Docker나 Modal과 같은 샌드박스 백엔드를 사용하여 에이전트 작업을 안전하게 실행할 수 있습니다.

  • Hermes Desktop은 macOS, Windows, Linux에서 사용할 수 있는 네이티브 애플리케이션입니다.
  • Hermes Agent v0.15.2와 통합되어 CLI와 동일한 핵심, 구성, API 키 및 메모리를 공유합니다.
  • 로컬, Docker, SSH, Singularity, Modal 등 5가지 백엔드에서 샌드박스 실행을 지원합니다.
  • Model Context Protocol(MCP)을 통한 도구 통합과 에이전트가 관리하는 지속적인 메모리 기능을 제공합니다.
  • MIT 라이선스로 출시되었으며 모델에 구애받지 않습니다.

스트리밍 도구 출력, 샌드박스 실행, Model Context Protocol(MCP) 지원을 갖춘 시각적 인터페이스를 제공하여 로컬 에이전트 개발을 간소화합니다.

SOURCES

3. sandboxed, 미리보기 URL을 지원하는 오픈 소스 개발 샌드박스 제공

AI 코딩 플레이그라운드나 에이전트 플랫폼과 같은 멀티 테넌트 사용 사례를 위해 설계된 sandboxed는 Kubernetes를 피함으로써 인프라를 간소화합니다. 단일 Linux 호스트에서 경량 Docker 및 Traefik 설정을 사용하며, 유휴 상태 시 중지 메커니즘을 활용하여 여러 샌드박스가 서버 리소스를 효율적으로 공유할 수 있도록 합니다.

  • Docker, Traefik, SQLite를 사용하여 단일 서버에서 실행됩니다.
  • 메모리 및 호스팅 비용을 최적화하기 위한 유휴 시 중지 및 요청 시 깨우기 메커니즘을 갖추고 있습니다.
  • AI 기반 코딩 작업을 위해 OpenCode 및 Claude Code CLI가 사전 설치되어 있습니다.
  • 라이브 미리보기 URL을 위한 자동 라우팅 및 TLS를 지원합니다.

AI 앱 빌더 및 에이전트 플랫폼 개발자가 Kubernetes의 복잡성 없이 안전한 멀티 테넌트 실행 환경을 쉽게 구축할 수 있게 합니다.

SOURCES

4. Mnemo, LLM을 위한 로컬 우선 AI 메모리 레이어 출시

Mnemo는 로컬 사이드카 서비스로 실행되어 장기 에이전트 메모리 문제를 해결합니다. LLM 입력을 파싱하여 SQLite에 구조화된 지식 그래프를 구축함으로써, 외부 클라우드 데이터베이스나 복잡한 벡터 검색 설정에 의존하지 않고도 과거 컨텍스트를 빠르고 낮은 지연 시간으로 검색할 수 있게 합니다.

  • Rust로 작성된 단일 정적 바이너리로 배포되며 SQLite와 petgraph를 활용합니다.
  • 텍스트에서 명명된 엔티티와 관계를 추출하고 50밀리초 이내에 원자적 업데이트를 수행합니다.
  • Ollama, OpenAI, Anthropic 및 기타 OpenAI 호환 API와 통합됩니다.
  • CLI 도구, Python SDK 및 REST API를 제공합니다.

개발자에게 클라우드 의존성이 없는 빠른 메모리 레이어를 제공하여 LLM 세션 전반에 걸쳐 장기적인 컨텍스트를 유지할 수 있게 합니다.

SOURCES

5. Alibaba의 Fun-Realtime-TTS, Speech Arena 리더보드 1위 차지

Alibaba의 Fun-Realtime-TTS가 Artificial Analysis Speech Arena 리더보드에서 Google의 Gemini 3.1 Flash TTS와 Inworld의 Realtime TTS-2를 추월했습니다. 이 모델은 음성 복제 및 지역 억양을 포함한 다국어 출력을 포함한 강력한 기능 세트를 제공하여 음성 지원 에이전트를 구축하는 개발자에게 매력적인 옵션이 됩니다.

  • 962번의 아레나 등장을 바탕으로 Elo 점수 1,219점을 획득하여 1위를 차지했습니다.
  • 100만 문자당 27.59달러의 가격으로, Sonic 3.5와 같은 여러 최첨단 TTS 모델보다 저렴합니다.
  • 실시간 음성 생성, 음성 복제, 음성 디자인 및 지역 억양을 지원합니다.
  • Alibaba Cloud API 액세스를 통해 개발자가 사용할 수 있습니다.

개발자에게 낮은 지연 시간과 합리적인 가격을 갖춘 경쟁력 있는 최고 수준의 텍스트 음성 변환(TTS) 옵션을 제공합니다.

SOURCES

6. llama.cpp, Qwen 모델을 위한 Multi-Token Prediction 최적화

llama.cpp의 최신 업데이트는 Multi-Token Prediction을 통한 로컬 추론 가속화에 중점을 둡니다. 포스트 노름(post-norm) 은닉 상태가 처리되는 방식을 최적화함으로써, 이 프레임워크는 더 높은 드래프트 수락률을 달성하여 호환되는 Qwen 모델을 로컬에서 실행할 때 초당 토큰 출력 속도를 높입니다.

  • Llama.cpp 버전 b9495는 특히 Qwen3.5 및 Qwen3.6을 위한 MTP 관련 개선 사항을 도입했습니다.
  • 풀 리퀘스트(PR #24025)는 Qwen3.5에 포스트 노름 은닉 상태를 사용하여 더 빠른 MTP를 구현합니다.
  • 초기 벤치마크에 따르면 Qwen3.6-35B-A3B-MTP의 드래프트 수락률은 0.526입니다.

다중 토큰 생성 중 드래프트 수락률을 개선하여 Qwen 모델을 실행하는 개발자의 로컬 추론 속도를 높입니다.

SOURCES

7. QLoRA와 DPO를 사용한 LFM2-1.2B 파인튜닝 단계별 가이드

이 단계별 코딩 튜토리얼은 Liquid AI의 LFM2-1.2B 모델을 조정하기 위한 전체 파이프라인을 제공합니다. 파라미터 효율적인 학습을 위한 QLoRA와 후속 DPO 정렬 단계를 결합함으로써, 개발자는 무료 또는 저비용 Google Colab 환경 내에서 현대적인 정렬 워크플로우를 완전히 재현할 수 있습니다.

  • Transformers, TRL, PEFT, datasets, bitsandbytes를 포함한 오픈 소스 라이브러리를 사용합니다.
  • 60단계에 걸쳐 'smoltalk' 데이터셋의 500개 샘플을 사용하여 지도 파인튜닝(SFT)을 시연합니다.
  • 모델 응답을 정렬하기 위해 40단계에 걸쳐 직접 선호도 최적화(DPO)를 통합합니다.
  • 학습 중 GPU 메모리 사용량을 최소화하기 위해 4비트 양자화를 사용합니다.

자신의 데이터로 작고 효율적인 모델을 사용자 정의하려는 개발자에게 구체적이고 리소스가 적게 드는 레시피를 제공합니다.

SOURCES

8. Vercel, AI 추론 도용 방지를 위해 BotID 분석 권장

AI 애플리케이션이 성장함에 따라 공격자들은 노출된 API 엔드포인트를 표적으로 삼아 모델 추론을 훔쳐 재판매하는 사례가 늘고 있습니다. Vercel의 분석은 표준 속도 제한 전략이 이러한 공격을 차단하는 데 실패하고 있음을 강조하며, 개발자가 LLM 제공업체에 요청을 라우팅하기 전에 BotID 분석을 채택하여 클라이언트의 진위 여부를 검증할 것을 촉구합니다.

  • 공격자는 노출된 프론트엔드 엔드포인트를 악용하여 AI 추론을 탈취하고 재판매합니다.
  • 전통적인 속도 제한은 정교한 무단 재판매를 막기에 종종 불충분합니다.
  • Vercel은 모든 들어오는 AI 요청의 정당성을 확인하기 위해 BotID 분석을 구현할 것을 권장합니다.

개발자가 API 키를 보호하고 권한 없는 제3자가 모델 액세스 권한을 재판매함으로써 발생하는 예상치 못한 클라우드 비용을 방지하도록 돕습니다.

SOURCES

9. Ideogram, 오픈 웨이트의 Ideogram 4 이미지 모델 출시

Ideogram은 최신 v4 이미지 생성 모델을 오픈 웨이트로 공개했습니다. 이 모델은 DesignArena 리더보드 정상에 빠르게 올라섰으며, 개발자들에게 독점적인 이미지 생성 API에 대한 매우 경쟁력 있는 오픈 대안을 제공합니다.

  • Ideogram v4가 오픈 웨이트로 출시되었습니다.
  • 현재 DesignArena 플랫폼에서 1위 모델로 선정되었습니다.
  • 즉시 다운로드 및 통합이 가능합니다.

개발자에게 로컬에서 호스팅하거나 앱에 통합할 수 있는 최첨단 오픈 웨이트 이미지 생성 모델에 대한 액세스를 제공합니다.

SOURCES

10. Angular v22, 네이티브 MCP 및 에이전트 도구 도입

Angular v22는 핵심 프레임워크와 AI 개발자 도구 모두에 중요한 업데이트를 가져왔습니다. 네이티브 MCP 지원과 실험적인 WebMCP 기능을 도입함으로써, 이 릴리스는 AI 에이전트와 코딩 어시스턴트가 브라우저 내에서 직접 Angular 애플리케이션을 이해하고 리팩토링하며 상호 작용하기 쉽게 만듭니다.

  • AI 어시스턴트에게 현대적인 Angular 컨텍스트를 제공하기 위해 업데이트된 MCP 제공 및 Angular 에이전트 기술을 도입합니다.
  • 에이전트가 브라우저 도구와 직접 상호 작용할 수 있도록 WebMCP에 대한 실험적 지원을 추가합니다.
  • Signal Forms, Angular Aria 및 비동기 반응형 API를 프로덕션 준비 상태로 전환합니다.
  • TypeScript 6 호환성을 제공하며 TSGo를 위해 Webpack을 더 이상 사용하지 않습니다.

프론트엔드 개발자가 Angular 관련 컨텍스트와 브라우저 도구를 AI 코딩 어시스턴트에 쉽게 노출할 수 있게 합니다.

SOURCES

11. iii 엔진으로 문서 인텔리전스 백엔드 구축

iii 엔진과 Python SDK는 문서 인텔리전스 파이프라인 생성을 간소화합니다. 개별 처리 함수를 등록함으로써 개발자는 일정에 따라 실행되거나 HTTP를 통해 트리거되는 복잡한 워크플로우를 오케스트레이션할 수 있으며, 내장된 Prometheus 지원을 통해 처리량과 시스템 상태를 쉽게 모니터링할 수 있습니다.

  • 텍스트 정규화, 토큰화, 감정 분석 및 키워드 추출을 위한 모듈식 함수를 지원합니다.
  • 직접 호출, HTTP 엔드포인트 및 예약된 cron 트리거를 포함한 여러 실행 방법을 제공합니다.
  • 런타임 메트릭과 하트비트를 추적하기 위해 공유 메모리 상태를 유지합니다.
  • 로컬 콘솔 또는 포트 9464의 Prometheus 메트릭 스크래핑을 통해 모니터링할 수 있습니다.

로컬 또는 HTTP를 통해 다단계 문서 처리 파이프라인을 오케스트레이션할 수 있는 구조화되고 모니터링 가능한 방법을 제공합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.