Inference Brew

Microsoft, MAI-Image-2.6-Flash 출시; Meta, Muse Image 에이전트 기능 확장

00:00 / --:--

← 메인으로

Microsoft, MAI-Image-2.6-Flash 출시; Meta, Muse Image 에이전트 기능 확장

1. Microsoft, MAI-Image-2.6-Flash 출시; Meta, Muse Image 에이전트 기능 확장

Microsoft는 2.5 시리즈 대비 성능이 향상된 MAI-Image-2.6-Flash를 출시하며 이미지 생성 라인업을 업데이트했습니다. 또한 Meta는 지난 8월 말 처음 소개된 Muse Image 모델의 검색 통합 및 자체 개선(self-refinement)과 같은 에이전트 기능에 대한 세부 정보를 추가로 공개했습니다.

  • • Microsoft는 MAI-Image-2.6-Flash를 출시하여 2.5 버전 대비 텍스트-이미지 변환에서 69 Elo 포인트, 이미지 편집에서 34 Elo 포인트 향상을 달성했습니다.
  • • MAI-Image-2.6-Flash는 Microsoft Foundry에서 이용 가능하며 부동산 및 게임 에셋 생성에 최적화되어 있습니다.
  • • 이전에 검색 기반(search grounding) 기능으로 출시되었던 Meta의 Muse Image는 이제 코드 실행 및 출력 자체 개선이 가능한 에이전트 모델로 자리매김했습니다.
  • • Muse Image는 Meta Model API와 fal, Runway, OpenRouter 등의 파트너를 통해 이용할 수 있습니다.

개발자들은 이제 더 효율적인 Microsoft의 업그레이드된 모델을 사용할 수 있게 되었으며, Meta의 Muse Image가 가진 에이전트 도구 활용 능력에 대해 더 명확히 이해할 수 있게 되었습니다.

2. TheDrummer, 오픈 웨이트 모델 Artemis-31B-v1.1 출시

TheDrummer는 Artemis-31B-v1.1 출시를 통해 오픈 웨이트 모델 포트폴리오를 확장했습니다. 이 모델은 초기 v1 릴리스보다 향상된 안정성과 함께 고품질의 산문 및 창의적 작문 기능을 제공하도록 설계되었으며, 서사나 콘텐츠 생성 애플리케이션을 구축하는 개발자들에게 견고한 자체 호스팅 옵션을 제공합니다.

  • • TheDrummer가 Hugging Face에 Artemis-31B-v1 및 Artemis-31B-v1.1을 출시했습니다.
  • • Artemis-31B-v1.1은 v1의 정교화 버전으로, 산문 및 작문 품질을 유지하면서 안정성을 개선했습니다.
  • • 개발자는 HordeAI와 유사한 크라우드소싱 추론 플랫폼인 BeaverNet도 개발 중입니다.
  • • 개발자의 향후 계획에는 Gemma, Qwen, Muse, Mistral 아키텍처 기반의 모델들이 포함되어 있습니다.

고품질 텍스트 생성을 원하는 개발자들은 창의적 작문과 산문에 최적화된 안정적이고 정교한 31B 파라미터 모델을 직접 호스팅할 수 있습니다.

SOURCES

3. NVIDIA, Qwen3.8-Flash-Next의 NVFP4 양자화 버전 출시

Alibaba의 125B 파라미터 Qwen3.8-Flash-Next 모델이 8월 26일 출시된 데 이어, NVIDIA는 Hugging Face에 NVFP4 양자화 버전을 공개했습니다. 이 최적화는 거대한 Mixture-of-Experts 모델의 메모리 및 저장 공간 요구 사항을 63% 줄이면서도 정확도 손실을 최소화하여, 로컬 또는 프라이빗 클라우드에서 더욱 효율적인 추론을 가능하게 합니다.

  • • NVIDIA가 Hugging Face에 Qwen3.8-Flash-Next 모델의 NVFP4 양자화 버전을 출시했습니다.
  • • 이번 양자화는 125B 파라미터 모델의 저장 공간 및 메모리 점유율을 63% 감소시킵니다.
  • • 이 릴리스는 Alibaba가 출시한 비양자화 기본 모델과 비교하여 하이브리드 어텐션 기능과 정확도 수준을 유지합니다.
  • • 이번 개발을 통해 대규모 Mixture-of-Experts 아키텍처를 로컬 또는 프라이빗 클라우드 인프라에서 더 효율적으로 배포할 수 있게 되었습니다.

이번 양자화로 인해 최근 출시된 125B 파라미터 Qwen3.8-Flash-Next 모델의 VRAM 요구 사항이 대폭 낮아져 자체 호스팅이 훨씬 쉬워졌습니다.

SOURCES

4. Sonos, 커스텀 에이전트 및 MCP 지원을 포함한 Sonos 27 플랫폼 출시

Sonos의 새로운 Sonos 27 소프트웨어 플랫폼은 모델 컨텍스트 프로토콜(MCP)을 통합하여 현대적인 AI 표준을 수용합니다. 이를 통해 개발자는 외부 LLM 및 AI 어시스턴트가 Sonos 오디오 하드웨어를 직접 제어할 수 있는 통합 기능을 구축할 수 있으며, 플랫폼의 커스텀 에이전트 기능을 통해 사용자는 고유한 개성을 가진 주요 제공업체의 추론 엔진을 실행할 수 있습니다.

  • • Sonos는 이기종 오디오 서비스와 장치를 통합하는 Sonos Fabric을 도입한 Sonos 27 소프트웨어 플랫폼을 출시했습니다.
  • • 이 플랫폼에는 사용자가 OpenAI, Anthropic, Gemini, Grok과 같은 AI 추론 엔진을 호출할 수 있는 커스텀 에이전트가 포함되어 있습니다.
  • • Sonos 27은 모델 컨텍스트 프로토콜(MCP)을 지원하여 외부 AI 어시스턴트가 Sonos 시스템을 제어할 수 있게 합니다.
  • • 또한 회사는 Beam Ultra 사운드바와 원활한 오디오 핸드오프를 지원하는 Ace Ultra 헤드폰을 발표했습니다.

개발자들은 이제 모델 컨텍스트 프로토콜을 통해 ChatGPT와 같은 외부 AI 어시스턴트를 사용하여 Sonos 하드웨어를 제어할 수 있습니다.

SOURCES

5. Funes, 코딩 에이전트를 위한 내구성 있는 로컬 메모리 계층 추가

Funes는 로컬의 독립적인 메모리 계층을 제공함으로써 에이전트 워크플로우의 일반적인 한계를 해결합니다. 세션 기록을 로컬에서 인덱싱하고 임베딩함으로써, 복잡한 외부 데이터베이스 설정 없이도 인기 있는 코딩 에이전트들이 다양한 개발 환경과 기기 전반에서 컨텍스트를 유지할 수 있도록 합니다.

  • • Funes는 코딩 에이전트가 여러 기기에서 세션 기록을 유지하고 불러올 수 있는 내구성 있는 메모리 계층을 제공합니다.
  • • 이 시스템은 Claude Code, Codex, pi, Hermes를 포함한 여러 에이전트를 지원합니다.
  • • Funes는 인덱싱과 임베딩을 사용하여 로컬에서 컨텍스트 메모리 저장 및 검색을 관리합니다.
  • • 메모리 계층은 외부 의존성 없이 완전히 작동하므로 개발자가 에이전트의 메모리 데이터를 직접 소유할 수 있습니다.

개발자들은 외부 데이터베이스 의존성 없이 Claude Code나 Codex와 같은 코딩 에이전트에 지속적인 자체 호스팅 메모리를 제공할 수 있습니다.

SOURCES

6. GitHub, Copilot을 위한 Project HydraFusion 다중 모델 오케스트레이션 프리뷰 공개

GitHub의 Project HydraFusion은 단일 프론티어 모델보다 복합 AI 시스템의 강력함을 보여줍니다. HydraFusion은 실행 패턴을 동적으로 선택하고 로컬 및 클라우드 모델 전반에 작업을 라우팅함으로써, DeepSWE 및 TerminalBench와 같은 벤치마크에서 프론티어급에 가까운 코딩 성능을 달성하는 동시에 추론 비용을 대폭 절감하여 비용 효율적인 에이전트 아키텍처를 구축하려는 개발자들에게 청사진을 제공합니다.

  • • GitHub은 런타임 오케스트레이션을 사용하여 여러 모델을 조정하는 GitHub Copilot용 연구 프리뷰인 Project HydraFusion을 도입했습니다.
  • • 이 시스템은 Single, Cascade, Critique 패턴을 사용하여 로컬, 클라우드, 복합 모델 간에 작업을 동적으로 라우팅합니다.
  • • TerminalBench 2.1 평가에서 HydraFusion은 Claude Opus 5 대비 작업 품질을 4.9% 포인트 향상시키고 비용을 67% 절감했습니다.
  • • DeepSWE 벤치마크에서는 비용을 36% 절감하면서 Opus 5의 1.5% 포인트 이내의 품질을 달성했습니다.
  • • 현재 프리뷰는 첫 번째 턴의 단일 프롬프트 코딩 작업에 중점을 두고 있으며, 향후 다중 턴 세션으로 확장할 계획입니다.

개발자들은 API 비용을 최대 67% 절감하면서도 코딩 작업에서 프론티어 모델 수준의 품질을 구현할 수 있습니다.

SOURCES

7. 연구 결과, 코딩 에이전트가 LSP 탐색보다 Grep을 더 자주 선호하는 것으로 나타나

코딩 에이전트 도구 사용에 관한 비교 연구는 에이전트의 능력이 도구 인터페이스와 출력 형식에 크게 의존한다는 점을 강조합니다. LSP 기반 탐색이 더 뛰어난 정밀도(참조 완성도 작업에서 grep의 0.76 대비 1.00)를 제공하지만, 에이전트는 이를 효과적으로 활용하는 데 어려움을 겪는 경우가 많습니다. 이 연구는 개발자들이 전체 에이전트 루프 내에서 검색 인터페이스를 평가하고, 후속 파일 읽기를 최소화하기 위해 LSP 출력에 소스 텍스트를 보강할 것을 제안합니다.

  • • 연구는 코딩 에이전트를 위해 어휘적 grep 검색과 LSP 기반의 의미론적 탐색을 비교했습니다.
  • • 에이전트는 LSP가 더 정확한 결과를 제공할 때조차도 의미론적 탐색보다 grep을 더 자주 선호했습니다.
  • • 의미론적 우선 탐색 경로를 강제했을 때 단순 코드 위치 찾기 작업의 성공률이 100%에서 89%로 감소했습니다.
  • • LSP 출력을 파일 위치뿐만 아니라 소스 텍스트를 포함하도록 업데이트했을 때 이름 변경 작업의 Pass@1이 0.67에서 0.83으로 향상되었습니다.
  • • LSP 기반 탐색은 노이즈가 많은 저장소에서 F1 점수를 0.246 향상시켰지만, 깨끗한 TypeScript 저장소에서는 아무런 이득을 제공하지 못했습니다.

코딩 에이전트를 구축하는 개발자들은 전체 에이전트 루프 내에서 도구 인터페이스를 평가해야 합니다. 의미론적 탐색을 우선시하도록 강제하는 것이 오히려 작업 성공률을 낮출 수 있기 때문입니다.

SOURCES

8. Compile by Training, 자연어를 로컬 신경망 프로그램으로 변환

Compile by Training은 자연어를 직접 작고 전문화된 신경망 프로그램으로 컴파일하여 로컬 실행에 대한 새로운 접근 방식을 제공합니다. 이러한 프로그램은 소형 인터프리터에서 실행되므로, 개발자는 최소한의 리소스 오버헤드로 복잡한 사양을 로컬에서 실행할 수 있으며, 기존 로컬 LLM 추론보다 훨씬 짧은 시간에 높은 의미론적 정확도를 달성할 수 있습니다.

  • • Compile by Training은 자연어 사양을 작은 신경망 프로그램으로 번역합니다.
  • • 생성된 프로그램은 소형 인터프리터에서 로컬로 실행되므로 실행 중에 대규모 로컬 LLM이 필요하지 않습니다.
  • • 컴파일 과정은 완료까지 약 1분이 소요됩니다.
  • • 이 도구는 FuzzyBench-Hard 벤치마크에서 83.6%의 의미론적 정확도를 달성합니다.

개발자들은 텍스트 사양으로부터 높은 의미론적 정확도와 빠른 컴파일 시간을 갖춘 경량의 로컬 우선 신경망 프로그램을 생성할 수 있습니다.

SOURCES

9. Microsoft, 로컬 30B+ 모델 개발을 위한 Project Zenith 도입

Microsoft의 Project Zenith는 대규모 모델을 로컬에서 실행하려는 개발자들을 위해 특별히 맞춤화되었습니다. 최소 64GB의 통합 메모리와 AMD Ryzen AI Halo 실리콘을 탑재한 하드웨어를 기반으로 하는 이 플랫폼은 표준 Windows의 방해 요소와 알림을 제거하고, 무제한 로컬 추론을 지원하기 위해 필수적인 개발자 설정 및 도구를 사전 구성합니다.

  • • Microsoft는 64GB 이상의 통합 메모리를 갖춘 기기를 위한 개발자 최적화 Windows 환경인 Project Zenith를 도입했습니다.
  • • 첫 번째 Project Zenith 기기는 AMD Ryzen AI Halo 칩을 탑재했으며 IFA에서 발표되었습니다.
  • • 이 플랫폼은 30B+ 파라미터 모델을 로컬에서 무제한으로 실행하도록 최적화된 방해 없는 환경을 제공합니다.
  • • 사전 설치된 도구로는 VS Code, GitHub Copilot, PowerToys, WinAppCLI, Windows Dev Skills가 있습니다.
  • • OS 수정 사항에는 긴 경로 지원 활성화, 파일 확장자 표시, 표준 알림 및 팁 제거가 포함됩니다.

개발자들은 AMD Ryzen AI Halo 칩을 탑재한 특수 Windows 하드웨어에서 30B+ 파라미터 모델을 로컬에서 무제한으로 실행할 수 있습니다.

SOURCES

10. B3S GGUF 형식, 3진 모델 VRAM 사용량 22% 절감

B3S GGUF 형식의 도입은 3진 모델을 위해 특별히 설계된 매우 효율적인 무손실 패킹 방법을 제공합니다. 가중치를 가중치당 1.75비트 레이아웃으로 패킹함으로써, B3S는 Q2_0 대비 VRAM 사용량을 약 22% 줄입니다. 현재 AMD ROCm 및 CPU 백엔드에서 검증되었지만, 이 형식은 3진 모델 전용이며 표준 FP16 모델에 적용할 경우 품질 저하가 발생합니다.

  • • B3S GGUF 형식은 가중치가 -1, 0, +1로 제한된 3진 모델(예: BitNet-b1.58, Ternary-Bonsai)을 위해 개발되었습니다.
  • • B3S는 블록당 128개의 가중치를 사용하는 3진법 패킹을 사용하여 가중치당 1.75비트를 구현합니다.
  • • 이 형식은 9B 모델의 경우 모델 크기를 2.5GB에서 2.0GB로, 27B 모델의 경우 7.6GB에서 5.9GB로 줄여줍니다.
  • • 구현은 AMD ROCm/HIP 및 CPU 백엔드 지원이 검증된 llama.cpp 포크를 기반으로 합니다.
  • • 이전 Q2_B3 GGUF를 새로운 B3S 레이아웃으로 변환하기 위한 별도의 리패커 도구를 사용할 수 있습니다.

BitNet과 같은 로컬 3진 모델을 실행하는 개발자들은 품질 저하 없이 VRAM 점유율을 크게 낮출 수 있습니다.

SOURCES

11. Artificial Analysis, 에이전트 벤치마크를 통합한 Intelligence Index v4.2로 업그레이드

기존 Intelligence Index를 기반으로, Artificial Analysis는 벤치마크 포화 문제를 해결하기 위해 버전 4.2를 출시했습니다. 이번 업데이트는 이전에 독립형 평가였던 AA-Briefcase 벤치마크를 핵심 인덱스에 통합하고, 모델 게임(model gaming)을 방지하기 위해 비공개 보유 테스트 세트의 가중치를 40%로 높였습니다. 이 업데이트는 개발자들에게 모델 추론 및 비용 효율성에 대한 더욱 강력한 측정 지표를 제공합니다.

  • • Intelligence Index가 v4.2로 업데이트되었습니다.
  • • AA-Briefcase 벤치마크가 이제 인덱스에 통합되었습니다.
  • • 비공개 테스트 세트가 이제 인덱스 가중치의 40%를 차지합니다.
  • • 문서 추론을 위한 새로운 GDP.pdf 벤치마크가 추가되었습니다.
  • • Claude Fable 5.1과 GPT-6 Astra가 업데이트된 순위에서 선두를 달리고 있습니다.

AA-Briefcase와 비공개 테스트 세트의 통합은 개발자들에게 모델 추론 및 비용 효율성에 대해 더욱 강력하고 게임 방지 기능이 있는 측정 지표를 제공합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.