1. Alibaba, 호스팅형 Qwen3.8-Omni-Flash API 출시
지난 8월 오픈 웨이트 모델인 Qwen3.8-Flash-Next를 공개한 데 이어, Alibaba는 Qwen3.8-Omni-Flash를 호스팅형 API 서비스로 출시했습니다. 이 새로운 옴니모달 버전은 텍스트, 이미지, 오디오, 비디오 입력을 지원하며 100만 토큰의 컨텍스트 윈도우를 제공합니다. 해당 서비스는 QwenCloud 및 Alibaba Cloud Model Studio를 통해 이용할 수 있습니다. 또한, 이 모델을 기반으로 개발하는 개발자들을 지원하기 위해 에이전트 활용을 촉진하는 Qwen-MM-Plugins를 Apache-2.0 라이선스로 공개했습니다.
- • Qwen3.8-Omni-Flash는 Qwen3.8-Flash-Next 아키텍처의 호스팅형 API 버전입니다.
- • 이 서비스는 텍스트, 이미지, 오디오, 비디오 입력을 지원하며 100만 토큰의 컨텍스트 윈도우를 제공합니다.
- • 가격은 입력 토큰 100만 개당 0.15달러, 출력 토큰 100만 개당 0.47달러로 책정되었습니다.
- • 에이전트 활용을 지원하기 위해 Qwen-MM-Plugins(Apache-2.0)가 포함되었습니다.
- • 이 모델은 OmniVideoBench 정확도를 67.8로 향상시키면서 토큰 사용량을 45.7% 절감했습니다.
개발자들은 이제 모델을 직접 호스팅할 필요 없이 장문 비디오 및 오디오 처리를 포함한 멀티모달 애플리케이션을 위해 Qwen3.8-Flash-Next 아키텍처를 관리형 서비스로 활용할 수 있습니다.
2. xAI, 다중 참조 지원이 포함된 Grok Imagine Image 2.0 출시
xAI는 Artificial Analysis 텍스트-이미지 리더보드에서 4위를 기록하며 OpenAI를 제외하고 가장 높은 순위를 차지한 텍스트-이미지 생성 및 편집 모델인 Grok Imagine Image 2.0을 출시했습니다. 이 모델은 텍스트-이미지 생성, 이미지 편집, 그리고 최대 5개의 입력 이미지를 사용하는 다중 참조 생성을 지원합니다. xAI API, Grok Imagine 웹사이트, Grok 앱, fal, Replicate를 통해 이용할 수 있습니다. 이전 세대와 비교하여 지식, 텍스트 렌더링, 조명 기능에서 상당한 성능 향상을 보였습니다.
- • xAI는 Artificial Analysis 텍스트-이미지 리더보드에서 4위를 차지한 Grok Imagine Image 2.0을 출시했습니다.
- • 이 모델은 텍스트-이미지 생성, 이미지 편집, 최대 5개의 입력 이미지를 사용하는 다중 참조 생성을 지원합니다.
- • xAI API, Grok Imagine 웹사이트, Grok 앱, fal, Replicate를 통해 이용 가능합니다.
- • 이 모델은 Artificial Analysis 리더보드에서 품질 대비 가격의 파레토 최적 경계에 위치합니다.
- • 지식, 텍스트 렌더링, 조명 기능에서 상당한 성능 향상이 관찰되었습니다.
개발자들은 최대 5개의 입력 이미지를 사용하는 다중 참조 생성을 지원하는 매우 경쟁력 있고 비용 효율적인 이미지 생성 및 편집 모델을 통합할 수 있습니다.
3. SpaceXAI, 저지연 스트리밍을 지원하는 Grok Voice Transcribe 2.0 출시
SpaceXAI는 Grok Voice Transcribe 1.0의 후속 모델인 새로운 음성-텍스트 변환 모델 Grok Voice Transcribe 2.0을 출시했습니다. 이 모델은 스트리밍 최종 전사(Final Transcripts)의 경우 음성 종료 후 0.49초 만에 2.7%의 단어 오류율(WER)을 달성하며, 첫 부분 전사(First Partial Transcripts)의 경우 3.4%의 WER을 기록합니다. 비스트리밍 작업에서는 AA-WER 기준 2.3%의 점수를 기록하여 59개 모델 중 5위를 차지했으며, 속도 계수는 약 160배입니다. 정확도는 더 높지만 Muse Voice Transcribe, ElevenLabs Scribe v2 Realtime, Cartesia Ink-2와 같은 경쟁 모델보다는 느립니다.
- • SpaceXAI는 이전 1.0 버전을 잇는 Grok Voice Transcribe 2.0을 출시했습니다.
- • 이 모델은 스트리밍 최종 전사에서 음성 종료 후 0.49초 만에 2.7%의 단어 오류율(WER)을 달성합니다.
- • 스트리밍 전사 가격은 시간당 0.20달러(1,000분당 3.33달러)이며, 비스트리밍은 시간당 0.10달러(1,000분당 1.67달러)입니다.
- • 비스트리밍 작업에서 이 모델은 AA-WER 기준 2.3%를 기록하여 59개 모델 중 5위를 차지했으며 속도 계수는 약 160배입니다.
- • 스트리밍 가격은 Cartesia Ink-2(4.00달러)보다 저렴하며 ElevenLabs Scribe v2 Realtime(6.50달러) 비용의 절반 수준입니다.
개발자들은 시간당 0.20달러라는 경쟁력 있는 가격으로 애플리케이션에 매우 정확하고 지연 시간이 짧은 스트리밍 음성 전사 기능을 구현할 수 있습니다.
4. Jina AI, 저예산 GPU용 jina-ocr-v1 출시
Jina AI는 NVIDIA L4와 같은 저예산 GPU를 위해 설계된 엔드투엔드 시각적 문서 파서인 jina-ocr-v1을 출시했습니다. 이 모델은 총 34억 개의 파라미터와 토큰당 약 5억 7천만 개의 활성 파라미터를 포함하며, DeepSeek-OCR 백본을 기반으로 DeepSeek-3B-MoE 디코더를 활용합니다. 손실 없는 결정론적 출력 생성을 가능하게 하는 FastMTP 추론 디코딩 헤드가 포함되어 있습니다. 이 파서는 마크다운 형식으로 콘텐츠를 출력하며, 표는 HTML, 수식은 LaTeX로 포맷팅됩니다. 단일 NVIDIA A100 40GB GPU에서 초당 2.57페이지의 처리량을 달성합니다.
- • Jina AI는 저예산 GPU용으로 설계된 엔드투엔드 시각적 문서 파서인 jina-ocr-v1을 출시했습니다.
- • 이 모델은 총 34억 개의 파라미터와 토큰당 약 5억 7천만 개의 활성 파라미터를 포함합니다.
- • DeepSeek-OCR 백본을 기반으로 하며 FastMTP 추론 디코딩 헤드가 있는 DeepSeek-3B-MoE 디코더를 활용합니다.
- • OmniDocBench v1.6에서 91.14점, olmOCR-Bench에서 83.4점을 기록했습니다.
- • 이 모델은 CC BY-NC 4.0 라이선스로 출시되었으며 Jina AI로부터 상업용 라이선스를 받아야 합니다.
- • 파서는 마크다운 형식으로 콘텐츠를 출력하며 표는 HTML, 수식은 LaTeX로 포맷팅됩니다.
개발자들은 구조화된 마크다운, HTML 표, LaTeX 수식을 고속으로 출력하는 매우 정확한 문서 파서를 직접 호스팅할 수 있습니다.
5. Realtime-Venus, 전이중 오디오-비주얼 모델 오픈소스화
Realtime-Venus 저장소는 Realtime-Venus-Omni와 Realtime-Venus-Audio라는 두 가지 체크포인트를 공개했습니다. Realtime-Venus-Omni는 MiniCPM-o 4.5를 기반으로 조정된 9B 오디오-비주얼 상호작용 모델로, 능동적 상호작용, 의미론적 중단 처리, 학습이 필요 없는 장기 비디오 메모리를 지원합니다. Realtime-Venus-Audio는 오디오 이해와 오디오 기반 대화를 위해 설계된 오디오 중심 체크포인트입니다. 이 시스템은 네이티브 전이중 대화 기능을 갖추고 있어 말하는 동안 입력을 인식할 수 있으며, 진행 중인 대화를 차단하지 않고 외부 도구 통합을 처리하기 위해 인스트림 델리게이트 요청을 사용합니다.
- • Realtime-Venus 저장소는 Realtime-Venus-Omni(9B 오디오-비주얼 모델)와 Realtime-Venus-Audio(오디오 중심 모델)를 호스팅합니다.
- • 이 시스템은 네이티브 전이중 대화 기능을 갖추고 있어 말하는 동안 입력을 인식할 수 있습니다.
- • Omni-Proactive 상호작용 기능은 모델이 사용자 프롬프트를 기다리지 않고 이벤트에 대한 응답을 시작할 수 있게 합니다.
- • 진행 중인 대화를 차단하지 않고 외부 도구 통합을 처리하기 위해 인스트림 델리게이트 요청을 사용합니다.
- • 이 시스템은 번들로 제공되는 Token2wav 리소스와 참조 음성을 사용하여 텍스트와 네이티브 음성 출력을 모두 생성합니다.
개발자들은 의미론적 중단 처리와 인스트림 도구 통합이 가능한 고도로 상호작용적인 음성 및 비디오 에이전트를 구축할 수 있습니다.
6. 421M 파라미터의 비자기회귀 결정 모델 Laya 출시
개발자 Laya는 의도 라우팅, 사실 확인, 조정 합의, 프롬프트 가드레일, 루브릭 채점, 다중 턴 대화 궤적 등의 작업을 위해 설계된 421M 파라미터의 비자기회귀 결정 모델을 출시했습니다. 이 모델 아키텍처는 양방향 ModernBERT-large 인코더와 스크래치 Transformer 헤드를 결합하여 유형화된 스키마를 해결하며, 약 35밀리초의 매우 빠른 순방향 패스 시간을 달성합니다. 25,000개 이상의 인간이 주석을 단 실제 사례를 사용하여 96GB VRAM을 갖춘 단일 RTX 6000 Pro GPU에서 학습되었으며, 정책 경사 강화 학습 접근 방식을 통해 최적화되었습니다.
- • Laya는 의도 라우팅, 사실 확인, 조정, 가드레일을 위한 421M 파라미터의 비자기회귀 결정 모델입니다.
- • 이 아키텍처는 양방향 ModernBERT-large 인코더와 스크래치 Transformer 헤드를 결합하여 유형화된 스키마를 해결합니다.
- • 이 모델은 약 35밀리초의 매우 빠른 순방향 패스 시간을 달성합니다.
- • 25,000개 이상의 인간이 주석을 단 실제 사례를 사용하여 단일 RTX 6000 Pro GPU에서 학습되었습니다.
- • Laya는 전용 Hugging Face 공간과 GitHub 저장소를 통해 테스트할 수 있습니다.
개발자들은 단 35밀리초의 순방향 패스 시간으로 매우 전문화되고 초고속인 라우팅 및 조정 모델을 로컬에서 실행할 수 있습니다.
7. Confucius4-R2T2 오픈소스 스트리밍 ASR 모델 출시
Confucius4-R2T2라는 새로운 실시간 스트리밍 자동 음성 인식(ASR) 모델이 오픈소스로 공개되었습니다. 이 모델은 음성 에이전트를 위해 특별히 설계된 17억 파라미터 시스템입니다. GitHub와 Hugging Face를 통해 액세스할 수 있으며, 개발자들에게 실시간 음성-텍스트 변환 작업을 위한 자체 호스팅 옵션을 제공합니다.
- • Confucius4-R2T2는 오픈소스 실시간 스트리밍 자동 음성 인식(ASR) 모델입니다.
- • 이 모델은 17억 개의 파라미터를 특징으로 하며 음성 에이전트를 위해 특별히 설계되었습니다.
- • GitHub와 Hugging Face를 통해 액세스할 수 있습니다.
개발자들은 GitHub나 Hugging Face에서 직접 지연 시간이 짧고 음성 에이전트에 최적화된 음성-텍스트 변환 모델을 자체 호스팅할 수 있습니다.
8. Claude Code, 네이티브 Windows 지원 및 AGENTS.md 통합 추가
Anthropic은 최근 출시된 플러그인 평가 워크플로우를 기반으로 Claude Code의 기능을 확장했습니다. 이번 최신 업데이트는 네이티브 Windows 설치 지원, PDF 읽기, 프로젝트 구성을 위한 AGENTS.md 파일 읽기 기능을 추가했습니다. 또한 멀티 에이전트 오케스트레이션을 위한 동적 워크플로우와 새로운 프록시 구성 옵션을 도입했으며, Claude Opus 4.8, 4.5 및 Sonnet 4.6을 포함한 확장된 모델 지원을 제공합니다.
- • Claude Code는 이제 네이티브 Windows 설치와 PDF 파일 읽기를 지원합니다.
- • 이 도구는 프로젝트별 지침을 위해 AGENTS.md를 읽습니다.
- • 새로운 동적 워크플로우는 복잡한 멀티 에이전트 작업 오케스트레이션을 가능하게 합니다.
- • Claude Opus 4.8, 4.5, Sonnet 4.6 및 Mantle을 통한 Amazon Bedrock 지원이 추가되었습니다.
- • 새로운 환경 변수 CLAUDE_GATEWAY_PROXY_IS_EGRESS_BOUNDARY=1은 포워드 프록시를 지원합니다.
개발자들은 향상된 크로스 플랫폼 접근성과 프로젝트 수준의 구성 제어를 얻게 되어 Claude Code 에이전트 워크플로우가 더욱 성숙해졌습니다.
9. ZCode 코딩 에이전트, Git 기록을 Aliyun OSS로 몰래 업로드하는 것으로 밝혀져
Zhipu의 AI 코딩 데스크톱 애플리케이션인 ZCode에 대한 보안 조사 결과, 해당 소프트웨어가 사용자 작업 공간을 몰래 패키징하여 Aliyun OSS로 업로드하는 것으로 밝혀졌습니다. 캡처된 데이터에는 전체 .git 기록, LFS 자산 캐시, reflogs 및 전역 구성이 포함되며, .git 디렉토리가 페이로드의 약 86.6%를 차지합니다. 백그라운드 캡처 및 업로드 프로세스는 사용자가 로그인되어 있는 한 시작 시 무조건 트리거되며, '최적화된 경험(Optimize Experience)' 및 '저장소 스냅샷 인덱싱(Repo Snapshot Indexing)'과 같은 UI 설정을 완전히 무시합니다. 업로드된 아카이브는 공개 키를 사용하는 엔벨로프 암호화로 암호화되어 있어 사용자가 자신의 업로드된 파일에 액세스하거나 복호화할 수 없습니다.
- • ZCode는 .git 기록, LFS 자산 캐시, reflogs를 포함한 사용자 작업 공간을 몰래 패키징, 암호화하여 Aliyun OSS로 업로드합니다.
- • 백그라운드 캡처는 로그인 시 시작 시 무조건 실행되며 '최적화된 경험' 및 '저장소 스냅샷 인덱싱'과 같은 UI 설정을 무시합니다.
- • 업로드된 아카이브는 공개 키를 사용하는 엔벨로프 암호화를 사용하며 개인 키는 Z.ai의 통제하에 있습니다.
- • .git 디렉토리는 페이로드의 약 86.6%를 차지하며 과거 API 키와 삭제된 민감한 구성이 노출될 위험이 있습니다.
- • 사용자는 '~/.zcode/v2/checkpoints' 디렉토리에 파일 시스템 수준의 불변성 플래그(macOS의 경우 chflags, Linux의 경우 chattr)를 사용하여 업로드 프로세스를 차단할 수 있습니다.
ZCode를 사용하는 개발자는 과거 API 키, 삭제된 구성 및 독점 코드의 노출을 방지하기 위해 백그라운드 업로드를 차단하는 즉각적인 조치를 취해야 합니다.
10. MiniMax, MiniMax Code 터미널 버전 오픈소스화
MiniMax는 MiniMax Code의 터미널 버전을 MIT 라이선스로 GitHub에 오픈소스로 공개했습니다. 이 릴리스는 0.4.12 소스 프리뷰이며 데스크톱 애플리케이션의 소스는 포함하지 않습니다. 이 저장소는 대화형 TUI, 헤드리스 실행, 코드 편집, 셸 명령, diff, 테스트 검증, 권한 제어 및 샌드박싱을 특징으로 합니다. 하위 에이전트, 플러그인, 기술, MCP(Model Context Protocol) 및 OpenAI 및 Anthropic 호환 공급자와 함께 BYOK(Bring Your Own Key)를 지원합니다.
- • MiniMax는 MiniMax Code의 터미널 버전(v0.4.12 소스 프리뷰)을 MIT 라이선스로 GitHub에 오픈소스로 공개했습니다.
- • 이 도구는 대화형 TUI, 헤드리스 실행, 코드 편집, 셸 명령, diff 및 샌드박싱을 특징으로 합니다.
- • 하위 에이전트, 플러그인, 기술, MCP(Model Context Protocol) 및 OpenAI 및 Anthropic 호환 공급자를 위한 BYOK(Bring Your Own Key)를 지원합니다.
- • 이 릴리스에는 데스크톱 애플리케이션의 소스 코드가 포함되어 있지 않습니다.
- • 저장소는 일치하는 버전 번호가 게시된 패키지와 소스 체크아웃 간의 동일한 빌드 출처를 보장하지 않는다고 명시합니다.
개발자들은 하위 에이전트, 플러그인 및 사용자 지정 LLM 백엔드를 지원하는 고도로 사용자 정의 가능한 MIT 라이선스 터미널 코딩 에이전트를 채택할 수 있습니다.
11. Notion, 에이전트 지침 관리를 위해 개발자 플랫폼에 Skills API 추가
2026년 5월 AI 에이전트를 위한 개발자 플랫폼 출시 이후, Notion은 Skills API를 도입했습니다. 이 새로운 도구를 통해 팀은 에이전트 지침을 공동으로 편집하고 배포할 수 있으며, GitHub 동기화 또는 Vercel의 기술 설치 프로그램과 통합하여 에이전트 환경 전반에 걸친 배포를 간소화할 수 있습니다.
- • 새로운 Skills API로 Notion 개발자 플랫폼을 확장합니다.
- • 에이전트 지침의 공동 편집 및 배포를 가능하게 합니다.
- • GitHub 동기화 및 Vercel의 기술 설치 프로그램을 통한 배포를 지원합니다.
이 업데이트는 에이전트 지침을 대규모로 관리하고 공유하는 데 필요한 특정 인프라를 제공하여 플랫폼을 워크플로우 통합 허브에서 협업 에이전트 개발 환경으로 발전시킵니다.
12. NVIDIA, Hugging Face에 SoL-Pi 에이전트 하네스 오픈소스화
NVIDIA는 전체 에이전트 하네스를 Hugging Face의 오픈소스 도구로 출시하여 SoL-Pi 프로젝트를 확장했습니다. 이는 Pi 코딩 에이전트를 최적화하기 위해 특별히 설계된 SoL-Pi 확장 프로그램의 이전 릴리스를 따릅니다. 새로운 하네스는 재귀적 자동 연구 루프를 활용하여 토큰 트래픽을 최대 49%까지 줄이며, 개발자가 다양한 에이전트 워크플로우 전반에서 API 비용을 절감할 수 있는 더 넓은 프레임워크를 제공합니다.
- • NVIDIA는 Hugging Face에 SoL-Pi 에이전트 하네스를 오픈소스로 공개했습니다.
- • 이 릴리스는 이전에 발표된 Pi 코딩 에이전트용 SoL-Pi 확장 프로그램을 확장합니다.
- • 이 하네스는 재귀적 자동 연구 루프를 사용하여 토큰 트래픽을 44.7%에서 49.0%까지 줄입니다.
- • 개발자들은 에이전트 성능을 유지하면서 API 비용을 약 3분의 1로 절감할 수 있습니다.
개발자들은 이제 전체 SoL-Pi 하네스에 액세스하여 초기 Pi 코딩 에이전트 확장 프로그램을 넘어 더 광범위한 에이전트 애플리케이션에서 토큰 사용을 최적화하고 API 비용을 절감할 수 있습니다.
13. 가이드, 로컬 LLM을 위한 상위 오픈소스 에이전트 하네스 순위 발표
2026년 9월 18일에 게시된 가이드는 라이선스, 문서화, 유지 관리 및 안전성을 기준으로 로컬 LLM을 위한 11개의 오픈소스 에이전트 하네스의 순위를 매겼습니다. 이 가이드는 OpenCode, Goose, Cline, OpenHands, Aider 등을 강조합니다. 컨텍스트 윈도우를 최소 64,000 토큰으로 설정하고 모델이 도구 호출을 지원하도록 보장하는 것과 같은 일반적인 모범 사례를 개략적으로 설명합니다. 또한 OpenHands가 Qwen3.6-35B-A3B 사용을 권장하며 최소 24GB VRAM 또는 Apple Silicon에서 64GB 통합 메모리가 필요하다는 점을 언급하며 구체적인 하드웨어 요구 사항을 자세히 설명합니다.
- • 이 가이드는 OpenCode, Goose, Cline, OpenHands, Aider를 포함한 11개의 오픈소스 에이전트 하네스의 순위를 매깁니다.
- • 일반적인 모범 사례는 컨텍스트 윈도우를 최소 64,000 토큰으로 설정하고 모델이 도구 호출을 지원하도록 보장할 것을 권장합니다.
- • OpenHands는 Qwen3.6-35B-A3B 사용을 권장하며 최소 24GB VRAM 또는 Apple Silicon에서 64GB 통합 메모리가 필요합니다.
- • Goose는 Linux Foundation의 Agentic AI Foundation 하에서 Ollama, LM Studio 및 Docker Model Runner를 포함한 런타임을 지원합니다.
- • Aider는 저장소 맵과 특정 텍스트 기반 편집 형식을 사용하여 약한 도구 호출을 관리합니다.
개발자들은 구체적인 하드웨어 제약 조건과 라이선스 조건을 기반으로 올바른 로컬 에이전트 프레임워크를 신속하게 평가하고 선택할 수 있습니다.
14. 실증적 연구, 코딩 에이전트를 위한 최적의 하네스 설계 식별
새로운 실증적 연구는 SWE-Bench Verified 및 Terminal-Bench 2.1을 사용하여 176개의 서로 다른 설정에서 코딩 에이전트를 평가하여 계획, 작업 공간 및 컨텍스트 관리를 분석했습니다. 연구 결과, 컨텍스트 관리가 엄격한 계산 예산 하에서 성능에 가장 중요한 요소이며, LLM 기반 요약 전에 규칙 기반 생략을 단계화하는 것이 가장 효율적인 전략임이 입증되었습니다. 또한 계획은 더 약한 모델에게는 정확도 비계 역할을 하고 더 강력한 모델에게는 비용 절감 메커니즘 역할을 하며, 사전 정의된 도구는 bash 숙련도가 낮은 모델의 성능을 향상시킵니다.
- • 연구원들은 SWE-Bench Verified 및 Terminal-Bench 2.1을 사용하여 4개 모델에 걸쳐 176개의 설정을 평가했습니다.
- • 컨텍스트 관리는 엄격한 계산 예산 하에서 성능에 가장 중요한 요소로 확인되었습니다.
- • LLM 기반 요약 전에 규칙 기반 생략을 단계화하는 것이 가장 효율적인 컨텍스트 관리 전략임이 입증되었습니다.
- • 계획은 더 약한 모델에게는 정확도 비계 역할을 하고 더 강력한 모델에게는 비용 절감 메커니즘 역할을 합니다.
- • 사전 정의된 도구는 bash 숙련도가 낮은 모델의 성능을 향상시키는 반면, bash 가능 모델은 bash 인터페이스만 사용하여 효과적으로 작동할 수 있습니다.
맞춤형 코딩 에이전트를 구축하는 개발자는 구조화된 컨텍스트 관리와 적응형 계획을 통해 성능을 최적화하고 API 비용을 절감할 수 있습니다.
15. 전문가 스트리밍을 통해 64GB Mac에서 95.5 GiB Qwen3.8-Flash-Next 실행
개발자들은 이제 라우팅된 전문가를 SSD에 유지함으로써 64GB RAM을 갖춘 Mac에서 95.5 GiB Qwen3.8-Flash-Next 모델을 실행할 수 있습니다. 이 설정은 전문가 스트리밍과 nitinpanj/qwen38-flash-next-v3 체크포인트를 지원하기 위해 llama.cpp의 사용자 지정 포크가 필요합니다. 64GB RAM을 갖춘 M5 Pro에서 이 모델은 4k 컨텍스트에서 초당 약 367 토큰의 프롬프트 처리 속도를 달성하며, 드래프트 헤드가 활성화된 상태에서 생성 속도는 초당 27.6 토큰에 도달합니다. 성능은 gather 기반 희소 어텐션과 Metal MoE 융합으로 더욱 향상됩니다.
- • 95.5 GiB Qwen3.8-Flash-Next 모델은 라우팅된 전문가를 SSD에 유지하여 64GB Mac에서 실행할 수 있습니다.
- • 이 설정은 전문가 스트리밍과 nitinpanj/qwen38-flash-next-v3 체크포인트를 지원하기 위해 llama.cpp의 사용자 지정 포크가 필요합니다.
- • 64GB RAM을 갖춘 M5 Pro에서 드래프트 헤드가 활성화된 상태에서 생성 속도는 초당 27.6 토큰에 도달합니다.
- • gather 기반 희소 어텐션은 62k 컨텍스트에서 19%, 130k 컨텍스트에서 50% 성능을 향상시켰습니다.
- • 64GB Apple Silicon 머신에서 전문가 캐시의 실질적인 한계는 36 GiB입니다.
개발자들은 값비싼 멀티 GPU 설정 없이도 표준 Apple Silicon 하드웨어에서 대규모 고품질 Mixture-of-Experts 모델을 로컬에서 실행할 수 있습니다.