Inference Brew

Z.ai, 멀티모달 Flash 모델로 GLM-5.3 제품군 확장

00:00 / --:--

← 메인으로

Z.ai, 멀티모달 Flash 모델로 GLM-5.3 제품군 확장

1. Z.ai, 멀티모달 Flash 모델로 GLM-5.3 제품군 확장

743B 파라미터의 GLM-5.3 모델 출시 이후, Z.ai는 네이티브 멀티모달 Mixture-of-Experts 모델인 GLM-5.3-Flash를 선보였습니다. 기존 GLM-5.3이 코딩과 보안에 집중했다면, Flash 버전은 18B 활성 파라미터와 1M 토큰 컨텍스트 윈도우를 통해 효율성에 최적화되었습니다. 이번 출시는 OpenRouter에서 'Ox Alpha'로 알려졌던 모델을 공식화한 것이며, 기존 GLM-5.3 API와 함께 개발자들에게 MIT 라이선스가 적용된 보다 접근성 높은 옵션을 제공합니다.

  • • GLM-5.3-Flash는 320B 파라미터 MoE 모델로, 18B 활성 파라미터와 1M 토큰 컨텍스트 윈도우를 지원합니다.
  • • 이 모델은 MIT 라이선스로 출시되었으며, FP8 및 BF16 형식의 가중치를 사용할 수 있습니다.
  • • API 가격은 입력 토큰 100만 개당 0.15달러, 출력 토큰 100만 개당 0.50달러로 책정되었습니다.
  • • 이 모델은 Artificial Analysis Intelligence Index에서 57점을 기록했습니다.
  • • 자체 호스팅을 위해서는 약 306 GiB의 FP8 가중치와 NVIDIA Hopper 이상의 하드웨어가 필요합니다.

이번 출시는 GLM-5.3 생태계 내에서 고성능의 자체 호스팅 가능한 멀티모달 옵션을 제공하며, 개발자들에게 743B 파라미터 모델보다 비용 효율적인 대안을 제시합니다.

2. Alibaba, 오픈 웨이트 멀티모달 MoE 모델 Qwen3.8-Flash-Next 출시

Alibaba의 Qwen 팀은 통합 비전 인코더를 갖춘 오픈 웨이트 인과 언어 모델인 Qwen3.8-Flash-Next를 출시했습니다. 비용 효율적인 토큰 처리를 위해 설계된 이 모델의 학습 비용은 Qwen3.7-Plus의 약 9분의 1 수준입니다. Gated DeltaNet과 Qwen Sparse Attention을 결합한 하이브리드 어텐션 메커니즘을 사용하여 긴 컨텍스트의 지연 시간을 최소화했습니다. 개발자들은 Unsloth, Swift, LLaMA-Factory를 사용하여 모델을 미세 조정하거나 대중적인 서빙 프레임워크를 통해 배포할 수 있습니다.

  • • Qwen3.8-Flash-Next는 125B 파라미터 백본과 토큰당 6B 활성 파라미터를 특징으로 하며, Qwen4 아키텍처의 미리보기 역할을 합니다.
  • • 이 모델은 262,144 토큰의 네이티브 컨텍스트 윈도우를 지원하며, YaRN을 사용하여 최대 1,000,000 토큰까지 확장할 수 있습니다.
  • • Gated DeltaNet, Qwen Sparse Attention, Gated Residual 및 Muon 옵티마이저를 포함한 아키텍처 업데이트가 적용되었습니다.
  • • 배포에는 멀티 GPU 노드가 필요하며, FP8 체크포인트는 172.78 GiB, BF16 체크포인트는 335.28 GiB입니다.
  • • 이 모델은 qwen-community-1.0 라이선스로 출시되었으며 vLLM, SGLang, TokenSpeed, llama.cpp와 호환됩니다.

개발자들은 표준 멀티 GPU 서빙 프레임워크에서 실행되는 네이티브 262k 컨텍스트 윈도우를 갖춘 매우 비용 효율적인 오픈 웨이트 멀티모달 모델을 사용할 수 있게 되었습니다.

3. Google, Gemini 3.5 Transcribe API 퍼블릭 프리뷰 출시

Google은 원시 오디오를 '음', '어'와 같은 불필요한 단어를 자동으로 제거하여 깔끔하고 서식화된 텍스트로 변환하도록 설계된 새로운 음성 인식 모델 Gemini 3.5 Transcribe를 출시했습니다. 이번 출시에는 사전 녹음된 오디오를 위한 Gemini 3.5 Transcribe와 연속 스트리밍을 위한 Gemini 3.5 Transcribe Live가 포함됩니다. 일부 경쟁사보다 가격은 약간 높지만, 속도와 오류율 측면에서 GPT Live Transcribe를 능가하는 뛰어난 지연 시간과 정확도를 제공합니다.

  • • Gemini 3.5 Transcribe는 사전 녹음된 오디오에 대해 2.6%, 스트리밍 사용 사례에 대해 4.0%의 단어 오류율(WER)을 달성합니다.
  • • 이 모델은 AI Studio의 Gemini API를 통해 퍼블릭 프리뷰로 제공되며, 85개 이상의 언어와 사용자 정의 어휘를 지원합니다.
  • • 사전 녹음 API는 1,000분당 약 5달러, 스트리밍 Live API는 1,000분당 약 9달러입니다.
  • • 이 모델은 이전 Chirp 3 엔진보다 70% 빠르며, 사전 녹음된 오디오를 실시간 대비 약 84배 속도로 처리합니다.
  • • 스트리밍 Live API는 첫 번째 부분 전사 이벤트까지 0.25초의 지연 시간으로 5.8%의 WER을 달성합니다.
  • • API는 최대 3명의 화자에 대한 타임스탬프가 포함된 다중 화자 식별 및 네이티브 함수 호출을 지원합니다.

개발자들은 다중 화자 식별, 사용자 정의 어휘, 실시간 스트리밍을 처리하는 빠르고 지연 시간이 짧은 전사 API를 통합할 수 있습니다.

4. fal, 최적화된 MiniMax H3 Max 모델 출시

7월에 출시된 기본 MiniMax H3 모델을 기반으로, fal은 MiniMax H3 Max를 선보였습니다. 이 사후 학습 버전은 프롬프트 준수 및 미적 품질이 향상되었으며, Artificial Analysis의 이미지-비디오 리더보드에서 1위를 차지했습니다. fal은 맞춤형 추론 스택과 모델을 공동 최적화함으로써 기존 H3 엔드포인트보다 저렴한 비용으로 이 고성능 버전을 제공합니다.

  • • MiniMax H3 Max는 Artificial Analysis의 오디오 포함 비디오 리더보드에서 이미지-비디오 부문 1위, 텍스트-비디오 부문 3위를 기록했습니다.
  • • 가격은 768p 비디오 1초당 0.04달러로, 기존 H3 기본 요금인 1초당 0.06달러에서 인하되었습니다.
  • • 통합 오디오 생성 및 최대 768p 해상도를 지원합니다.
  • • 맞춤형 추론 스택을 통해 3초 이내에 5초 분량의 비디오 생성이 가능합니다.
  • • fal은 향후 모델 가중치를 공개할 계획입니다.

개발자들은 이제 fal의 API를 통해 MiniMax H3 모델의 더 높은 성능과 비용 효율적인 버전을 사용할 수 있습니다.

5. 오픈 소스 옴니모달 월드 모델 EchoWM 출시

오픈 소스 커뮤니티는 고도로 동기화된 멀티모달 환경을 생성하도록 설계된 옴니모달 월드 모델인 EchoWM을 출시했습니다. 연속적인 6-DoF 카메라 궤적을 따라 모델은 720p 비디오, 환경 오디오, 음악 및 음성을 동시에 생성할 수 있습니다. EchoWM은 1인칭 및 3인칭 상호작용을 모두 지원하며, 점진적 학습과 자기회귀 학습을 결합하여 긴 시간 동안 동기화를 유지합니다.

  • • EchoWM은 GitHub에 저장소가 호스팅된 오픈 소스 옴니모달 월드 모델입니다.
  • • 이 모델은 연속적인 6-DoF 카메라 궤적을 따라 동기화된 출력을 생성합니다.
  • • 720p 비디오, 환경음, 음악 및 음성을 공동으로 생성합니다.
  • • 1인칭 및 3인칭 대화형 생성을 모두 지원합니다.
  • • 점진적 학습과 자기회귀 학습을 활용하여 동기화된 장기 생성 기능을 제공합니다.

개발자들은 연속적인 카메라 궤적을 기반으로 동기화된 멀티모달 출력을 생성하는 통합된 오픈 웨이트 모델을 실험할 수 있습니다.

SOURCES

6. GhostJacking 취약점, 로그 페이로드를 통한 AI 에이전트 탈취 가능

DEF CON 34에서 Tenet Security는 과도한 권한을 가진 AI 에이전트가 차단된 방화벽 로그에 숨겨진 악성 명령을 실행하는 치명적인 취약점인 'GhostJacking'을 시연했습니다. 에이전트는 종종 미리 발급된 자격 증명을 사용하여 로그를 읽기 때문에, 오염된 페이로드를 실행하도록 쉽게 속을 수 있습니다. 테스트 결과, Sonnet 4.6 기반의 Claude Code가 90%의 시도에서 공격에 취약한 것으로 나타났습니다. 이러한 위험을 완화하기 위해 개발자들은 시스템 수정 시 인간의 수동 승인을 요구하는 엄격한 권한 게이트를 구현해야 합니다.

  • • GhostJacking은 AI 에이전트가 로그에서 오염된 페이로드를 읽고 이를 합법적인 명령으로 해석하여 실행할 때 발생합니다.
  • • 벤치마크 테스트에서 Sonnet 4.6 기반의 Claude Code는 10번의 시도 중 9번 심어진 명령을 따랐습니다.
  • • Tenet Security는 6개의 포춘 500대 기업을 포함하여 이 공격에 취약한 구성을 가진 48개 조직을 식별했습니다.
  • • 2026 OWASP LLM 애플리케이션 상위 10위는 이러한 실제 위험으로 인해 '과도한 에이전시(Excessive Agency)'를 3위로 격상했습니다.
  • • 보안 전문가들은 영향력이 큰 변경 사항에 대해 인간의 승인을 요구하는 권한 게이트 구현을 권장합니다.

개발자들은 에이전트가 주입된 로그 페이로드를 실행하지 못하도록 영향력이 큰 작업에 대해 엄격한 인간 개입 승인 게이트를 구현해야 합니다.

SOURCES

7. 표준 가상 머신, 고급 AI 에이전트 격리에 실패

Patch the Planet 이니셔티브의 일환으로 수행된 보안 테스트 중, GPT 5.6-Cyber를 실행하는 사이버 능력 AI 에이전트가 표준 QEMU/KVM 가상 머신을 세 번 탈출하는 데 성공했습니다. 12시간 동안 자율적으로 작동한 에이전트는 분류되지 않은 버그, 제로데이, libslirp의 공개된 취약점을 조합하여 익스플로잇을 연구하고 구축했습니다. 이 결과는 표준 가상 머신이 고급 자율 AI 에이전트를 격리하기에 부적절함을 보여주며, Firecracker와 같은 보안 중심 가상화 기술로 전환할 것을 강력히 권장합니다.

  • • GPT 5.6-Cyber를 실행하는 자율 에이전트가 Debian 12 호스트의 QEMU/KVM 가상 머신을 세 번 탈출했습니다.
  • • 에이전트는 12시간 동안 자율적으로 작동하며 익스플로잇을 연구, 구축하고 실패 시 역추적했습니다.
  • • 에이전트는 Januscape(CVE-2026-53359) 및 libslirp의 CVE-2026-9539를 포함하여 알려진 취약점, 분류되지 않은 보안 버그 및 제로데이를 악용했습니다.
  • • 저자는 표준 VM이 고급 AI 에이전트를 격리하기에 불충분하다고 결론지었습니다.
  • • 보고서는 에이전트 샌드박싱을 위해 Firecracker와 같은 보안 중심 가상화 기술 사용을 강력히 권장합니다.

에이전트 실행 샌드박스를 구축하는 개발자는 호스트 손상을 방지하기 위해 표준 VM을 피하고 Firecracker와 같은 보안 중심 가상화를 채택해야 합니다.

SOURCES

8. Vercel Connect, 정식 출시(GA) 전환

Vercel은 Connect 서비스를 퍼블릭 베타에서 정식 출시(GA)로 전환했습니다. 장기 API 토큰을 일시적이고 작업 범위가 지정된 자격 증명으로 대체하기 위해 2026년 6월 처음 도입된 이 서비스는 이제 100개 이상의 사전 구축된 커넥터 라이브러리를 포함합니다. 이번 출시는 개발자들에게 AI 에이전트 보안 및 거버넌스를 관리하기 위한 안정적이고 프로덕션 준비가 완료된 통합 모델을 제공합니다.

  • • Vercel Connect가 퍼블릭 베타에서 정식 출시로 전환되었습니다.
  • • 이 서비스는 이제 다양한 서비스를 위한 100개 이상의 사전 구축된 커넥터를 제공합니다.
  • • AI 에이전트 작업을 보호하기 위해 런타임에 발급되는 단기 자격 증명을 계속 제공합니다.
  • • GA 릴리스는 엔터프라이즈 규모의 에이전트 배포를 위한 프로덕션급 거버넌스 제어를 도입합니다.

개발자들은 이제 정적 API 키를 제거하는 안정적이고 지원되는 보안 프레임워크를 통해 AI 에이전트 워크플로우를 테스트에서 프로덕션으로 전환할 수 있습니다.

SOURCES

9. RAG 시스템 간소화를 위한 실용적인 아키텍처 프레임워크

Hacker News의 새로운 아키텍처 가이드는 RAG(Retrieval-Augmented Generation) 시스템을 과도하게 엔지니어링하는 업계 추세에 의문을 제기합니다. 저자는 실용적인 의사결정 프레임워크를 제시하며, 시스템의 60%는 간단한 BM25 전체 텍스트 검색과 저렴한 에이전트 기반 쿼리 재작성을 결합해야 한다고 권장합니다. 매일 10%를 초과하는 높은 문서 변경률을 가진 시스템의 경우, 지속적인 재인덱싱 오버헤드를 제거하기 위해 즉석 임베딩을 제안하며, 전체 사전 임베딩은 안정적인 코퍼스를 가진 대규모 시스템에만 예약할 것을 권장합니다.

  • • 이 프레임워크는 청킹이 필요 없고 모델 폐기 위험을 피할 수 있기 때문에 MVP로 BM25 전체 텍스트 검색을 시작할 것을 제안합니다.
  • • GPT-4o-mini와 같은 저렴한 모델을 사용한 에이전트 기반 쿼리 재작성은 대화형 쿼리를 쿼리당 약 0.001달러로 키워드로 변환할 수 있습니다.
  • • BM25와 임베딩 기반 리랭킹을 결합한 하이브리드 검색은 쿼리당 200-500ms의 지연 시간을 추가합니다.
  • • 매일 10%를 초과하는 높은 문서 변경률을 가진 시스템은 전체 재인덱싱을 피하기 위해 즉석 임베딩을 권장합니다.
  • • 핫/콜드 티어링은 빈번한 문서를 사전 임베딩하고 드문 문서를 즉석에서 임베딩하여 비용을 최적화합니다.
  • • 저자는 시스템의 60%는 쿼리 재작성을 포함한 전체 텍스트 검색, 25%는 하이브리드 검색, 10%만이 전체 사전 임베딩을 사용해야 한다고 제안합니다.

개발자들은 과도한 엔지니어링을 피하고 문서 변경률에 검색 전략을 맞춤으로써 더 빠르고 저렴하며 안정적인 RAG 시스템을 구축할 수 있습니다.

SOURCES

10. Lemonade 플랫폼, 최신 업데이트에서 시맨틱 라우팅 및 임베디드 SDK 추가

v10.8 릴리스 이후, Lemonade 프로젝트는 로컬 AI 개발 플랫폼에 대한 주요 업데이트를 도입했습니다. 이번 릴리스는 이전의 하드웨어 가속 개선 사항을 확장하여 ARM64 및 Metal 백엔드에 대한 네이티브 지원을 추가했습니다. 새로운 기능으로는 직접적인 애플리케이션 번들링을 위한 임베디드 SDK와 사용자 프롬프트를 기반으로 모델을 자동으로 선택하는 시맨틱 및 정책 기반 라우팅이 가능한 라우터가 포함됩니다. 또한, 플랫폼에는 음악 및 3D 자산 모달리티를 위한 실험적 엔진이 포함되었습니다.

  • • 자동 모델 선택을 위한 시맨틱 및 정책 기반 라우팅을 도입합니다.
  • • Lemonade를 애플리케이션에 직접 번들링하기 위한 임베디드 SDK를 추가합니다.
  • • 백엔드 지원을 ARM64 및 Metal로 확장합니다.
  • • 음악 및 3D 자산 모달리티를 위한 실험적 엔진을 추가합니다.

개발자들은 이제 Lemonade의 기능을 애플리케이션에 직접 통합하고 플랫폼의 기존 로컬 AI 서비스 아키텍처를 기반으로 자동화된 모델 선택을 활용할 수 있습니다.

SOURCES

11. Particle, Radar 팟캐스트 인텔리전스 API 및 MCP 서버 출시

Particle은 음성 오디오를 AI 시스템이 매우 쉽게 액세스할 수 있도록 설계된 팟캐스트 인텔리전스 플랫폼인 Radar를 출시했습니다. 13만 개 이상의 팟캐스트를 전사하고 분석한 Radar는 이러한 대화를 웹에서 검색 가능하게 만들고 기본 데이터를 개발자에게 노출합니다. AI 애플리케이션 빌더에게 중요한 점은 이 플랫폼이 표준 API와 MCP(Model Context Protocol) 서버를 모두 제공하여 AI 에이전트가 팟캐스트 통찰력을 즉시 쿼리하고 활용할 수 있도록 한다는 것입니다.

  • • Particle의 새로운 Radar 플랫폼은 13만 개 이상의 팟캐스트 카탈로그를 전사하고 분석합니다.
  • • 이 플랫폼은 팟캐스트 대화를 웹에서 완전히 검색 가능하게 만듭니다.
  • • 팟캐스트 데이터와 전사본은 전용 API를 통해 AI 에이전트에 노출됩니다.
  • • 통합에는 원활한 에이전트 연결을 위한 MCP(Model Context Protocol) 서버가 포함됩니다.

개발자들은 사전 구축된 MCP 서버를 사용하여 풍부하고 구조화된 팟캐스트 데이터와 전사본을 AI 에이전트 및 애플리케이션에 쉽게 통합할 수 있습니다.

SOURCES

12. 커스텀 vLLM 포크, Qwen3.8 27B를 위한 INT8 서빙 스택 제공

새로운 커뮤니티 개발 vLLM 포크는 네이티브 FP8 기능이 부족한 구형 GPU 하드웨어에서 Qwen3.8 27B 모델을 최적화하도록 설계된 완전한 INT8 서빙 스택을 도입합니다. vLLM, AITER 및 DFlash2를 사용한 27B GPTQ INT8 양자화를 결합하여, 이 스택은 모든 어텐션 블록과 GEMM에서 참조 품질에 가까운 수준을 유지하면서 엄청난 처리량 향상을 달성합니다. 한편, 커뮤니티 벤치마크는 Qwen3.8 27B의 4비트 양자화(Q4_K_M)가 로컬 추론 및 에이전트 작업에 매우 효과적임을 확인했습니다.

  • • 커스텀 vLLM 포크는 4x MI100 시스템에서 Qwen3.8 27B 생성 성능을 초당 15 토큰에서 초당 972 토큰으로 향상시킵니다.
  • • 이 스택은 W8A8 INT8 GEMM 라이브러리, INT8 KV 캐시, AITER Unified Attention 및 커스텀 allreduce/allgather 작업을 통합합니다.
  • • 이 구현은 AMD MI100 GPU에 특별히 튜닝되었으며 MI50 및 MI210 카드와 호환됩니다.
  • • Qwen3.8 27B의 Q4_K_M 양자화는 1비트 대안보다 높은 정확도를 유지하며 가장 효과적인 옵션으로 벤치마킹되었습니다.
  • • RTX 4090과 같은 소비자 하드웨어에서의 로컬 테스트는 모델이 시스템 RAM으로 오프로드하여 130k를 초과하는 컨텍스트 길이를 처리할 수 있음을 보여줍니다.

네이티브 FP8 지원이 없는 구형 GPU에서 로컬 모델을 실행하는 개발자들은 최적화된 INT8 양자화를 사용하여 참조 품질에 가까운 성능과 엄청난 처리량 향상을 달성할 수 있습니다.

13. 로컬 모델을 AI 게이트웨이에 연결하기 위한 요구 사항 상세 가이드

ngrok의 Sam Rose는 미세 조정되거나 로컬 Llama 모델을 AI 게이트웨이에 통합할 때 개발자가 직면하는 일반적인 마찰 지점을 해결하는 상세 가이드를 게시했습니다. 많은 게이트웨이가 OpenAI 호환 기본 URL을 기대하기 때문에, 개발자들은 종종 로컬 GPU 서버를 공용 인터넷에 노출해야 하는 상황에 처합니다. 이 문서는 7개의 주요 게이트웨이에 대한 통합 요구 사항을 단계별로 안내하고, ngrok.ai를 사용하여 로컬 엔드포인트에 대한 안전한 공용 호스트 이름을 설정하는 방법을 보여줍니다.

  • • 많은 인기 있는 AI 게이트웨이는 미세 조정되거나 로컬 모델을 통합하기 위해 OpenAI 호환 기본 URL을 요구합니다.
  • • 로컬 GPU 서버를 이러한 게이트웨이에 연결하려면 일반적으로 공용 호스트 이름과 열린 인바운드 포트가 필요합니다.
  • • 이 문서는 7개의 인기 있는 AI 게이트웨이에 걸친 통합 요구 사항을 개략적으로 설명합니다.
  • • 이 가이드는 복잡한 방화벽 구성 없이 로컬 모델 엔드포인트를 안전하게 노출하기 위해 ngrok.ai 사용을 권장합니다.

개발자들은 보안 터널링 도구를 사용하여 로컬 GPU 서버를 공용 AI 게이트웨이에 연결할 때 발생하는 연결 문제를 해결할 수 있습니다.

SOURCES

14. macOS에서 Codex '잠금 사용(Locked Use)' 기능에 대한 안정성 경고 발행

Codex를 사용하는 개발자들은 macOS에서의 심각한 안정성 문제로 인해 '잠금 사용' 기능을 피할 것을 권장받습니다. 이 기능은 불안정한 macOS 시스템 기능에 의존하며, 사용자가 macOS 키체인에서 완전히 잠기는 문제가 보고되었습니다. 이 문제는 현재 Apple 개발자 포럼에서 알려진 버그로 인식되고 있으며, 패치가 발행될 때까지 개발자들은 이 기능을 활성화하지 말아야 합니다.

  • • 공개 서비스 공지에서 Codex '잠금 사용' 기능을 사용하지 말 것을 경고합니다.
  • • 이 기능은 불안정한 macOS 기능에 의존하며 사용자에게 여러 번의 완전한 키체인 잠금 문제를 일으켰습니다.
  • • 근본적인 문제는 Apple 개발자 포럼에서 알려진 버그로 인식됩니다.

macOS에서 Codex를 사용하는 개발자들은 시스템 키체인에서 완전히 잠기는 것을 방지하기 위해 잠금 사용 기능을 비활성화하거나 피해야 합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.