Inference Brew

SpaceXAI, 프론티어 모델 Grok 4.6으로 업그레이드

00:00 / --:--

← 메인으로

SpaceXAI, 프론티어 모델 Grok 4.6으로 업그레이드

1. SpaceXAI, 프론티어 모델 Grok 4.6으로 업그레이드

SpaceXAI가 Grok 4.5의 후속 모델인 Grok 4.6을 출시했습니다. 장기 실행 에이전트, 코딩, 지식 업무를 위해 설계된 이 새로운 모델은 향상된 안전 장치와 재생성된 SFT 궤적을 통한 학습이 특징입니다. 현재 Grok Build 플랫폼, Cursor, OpenRouter, Vercel 및 Cloudflare를 통해 사용할 수 있습니다.

  • • Grok 4.6은 Grok 4.5의 후속 모델로, Artificial Analysis Intelligence Index에서 61점을 기록했습니다.
  • • 가격은 이전 버전과 동일하게 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러로 유지됩니다.
  • • 50만 토큰의 컨텍스트 윈도우, 함수 호출(function calling), 구조화된 출력 기능을 제공합니다.
  • • Grok Build, Cursor, OpenRouter, Vercel, Cloudflare를 통해 즉시 이용 가능합니다.

개발자들은 이전 Grok 4.5 릴리스에서 확립된 기능을 바탕으로 GPT-5.6 Sol 성능과 일치하는, 에이전트에 최적화된 업데이트된 프론티어 모델을 사용할 수 있게 되었습니다.

2. Alibaba, 오픈 웨이트 Qwen3.8-2.4T-A95B-FP8 MoE 모델 공개

Alibaba는 Qwen3.8-Max 모델의 오픈 웨이트를 공개하겠다는 약속을 이행했으며, 현재 Qwen3.8-2.4T-A95B-FP8로 제공됩니다. 이 거대한 MoE(Mixture-of-Experts) 모델은 950억 개의 활성 파라미터, 262K의 기본 컨텍스트 윈도우, 추론을 위한 필수 사고 모드(thinking mode)를 갖추고 있습니다. 주요 추론 프레임워크를 통해 자체 호스팅이 가능합니다.

  • • Qwen3.8-2.4T-A95B-FP8은 총 2.4조 개의 파라미터를 가지며, 512개의 전문가(experts)에 걸쳐 950억 개의 파라미터가 활성화됩니다.
  • • 기본 컨텍스트 길이는 262,144 토큰이며, 최대 1,010,000 토큰까지 확장 가능합니다.
  • • 출력 전 태그 내에 추론 과정이 생성되는 필수 사고 모드를 지원합니다.
  • • 사용자는 reasoning_effort 파라미터(xhigh, medium, low)를 사용하여 추론 깊이를 조정할 수 있습니다.
  • • Transformers, vLLM, SGLang 추론 프레임워크와 호환됩니다.

개발자들은 이제 이전에 QwenCloud API 액세스로 제한되었던 프론티어급 Qwen3.8-Max 모델을 직접 호스팅할 수 있게 되었습니다.

3. DeepSeek, NVIDIA, Mistral의 새로운 오픈 웨이트 모델 생태계 합류

오픈 웨이트 모델 환경이 빠르게 확장되고 있습니다. Meta의 Muse Glimmer 출시를 이어받아, 이번 주에는 DeepSeek-V4-Flash-0731, NVIDIA의 Nemotron-3.5-Lightning-30B-A3B 및 VoiceChat-11B, Liquid AI의 LFM2.5-2.6B, Mistral의 Shieldstral-1.0-3B가 추가되어 개발자들에게 로컬 배포를 위한 다양한 도구를 제공합니다.

  • • DeepSeek-V4-Flash-0731은 MIT 라이선스 하의 304B MoE 모델입니다.
  • • NVIDIA는 Nemotron-3.5-Lightning-30B-A3B와 전이중(full-duplex) VoiceChat-11B를 출시했습니다.
  • • Liquid AI는 131k 컨텍스트를 지원하는 LFM2.5-2.6B를 출시했습니다.
  • • Mistral은 멀티모달 가드레일 모델인 Shieldstral-1.0-3B를 출시했습니다.

개발자들은 최근 출시된 Muse Glimmer 외에도 로컬 배포, 저지연 추론, 에이전트 워크플로우를 위한 허용적 라이선스의 전문 모델을 더 폭넓게 선택할 수 있게 되었습니다.

SOURCES

4. Upstage, Solar Pro 4 추론 모델 출시

Upstage는 에이전트 및 긴 컨텍스트 작업에서 상당한 성능 향상을 보여주는 독자적인 플래그십 추론 모델 Solar Pro 4를 출시했습니다. 이 모델은 방대한 컨텍스트 윈도우와 높은 최대 출력 제한을 갖추고 있어 복잡한 다단계 추론 워크플로우에 적합합니다.

  • • Upstage는 Solar Pro 4를 출시했으며, Artificial Analysis Intelligence Index에서 Solar Pro 3의 14점 대비 42점을 기록했습니다.
  • • 가격은 Upstage 자체 API를 통해 입력 토큰 100만 개당 0.30달러, 출력 토큰 100만 개당 1.20달러로 책정되었습니다.
  • • 512K 토큰 컨텍스트 윈도우와 128K 토큰 최대 출력 제한을 제공합니다.
  • • Upstage 자체 API, OpenRouter, TimelyRouter를 통해 이용 가능합니다.
  • • Solar Pro 4는 환각률을 24%로 낮추고 Terminal-Bench v2.1 점수를 57%로 높였습니다.

개발자들은 대규모 작업에 대해 방대한 컨텍스트 윈도우와 향상된 에이전트 성능을 갖춘 저비용 추론 모델을 활용할 수 있습니다.

SOURCES

5. Liquid AI, 온디바이스 비전 모델 LFM2.5-VL-3B 출시

Liquid AI는 LFM2.5 하이브리드 모델 제품군의 멀티모달 변형인 LFM2.5-VL-3B를 출시했습니다. LFM2.5-2.6B 언어 백본과 SigLIP2 NaFlex 400M 비전 인코더를 결합한 이 모델은 로컬 온디바이스 배포에 최적화되어 있으며, 작은 메모리 점유율 내에서 고처리량 추론을 제공합니다.

  • • Liquid AI는 32K 컨텍스트 윈도우를 가진 31억 파라미터 비전-언어 모델 LFM2.5-VL-3B를 출시했습니다.
  • • 이 모델은 로컬에서 실행되며, 3GB 메모리 내에서 Apple M5 Max에서 228 토큰/초, Galaxy S26 Ultra에서 20 토큰/초의 속도를 달성합니다.
  • • SigLIP2 NaFlex 400M 비전 인코더를 탑재하고 16개 언어를 지원합니다.
  • • 실시간 객체 탐지, 레이아웃 주석이 포함된 OCR, 온디바이스 번역에 최적화되어 있습니다.
  • • Hugging Face에서 이용 가능하며 atomic.chat 모바일 애플리케이션을 통해 테스트할 수 있습니다.

개발자들은 실시간 객체 탐지, OCR, 번역을 위해 소비자용 하드웨어에서 빠르고 가벼운 비전 모델을 로컬로 배포할 수 있습니다.

SOURCES

6. GitHub, MAI-Code-1.1-Flash로 Copilot 업그레이드

2026년 6월 MAI-Code-1-Flash 모델의 초기 출시를 바탕으로, GitHub은 이제 MAI-Code-1.1-Flash를 출시했습니다. 이 업데이트된 모델은 이전 모델보다 25% 더 높은 토큰 효율성을 제공하며 가격은 4분의 1 수준으로 낮아졌고, 코딩 작업 성능은 향상되었습니다.

  • • MAI-Code-1.1-Flash는 2026년 6월 출시된 오리지널 MAI-Code-1-Flash 모델의 후속입니다.
  • • 새로운 모델은 이전 모델 대비 25% 더 높은 토큰 효율성을 제공하며 비용은 75% 저렴합니다.
  • • 성능 향상에는 Terminal-Bench 2.1에서 22% 향상, .NET 작업에서 15% 향상이 포함됩니다.
  • • 이 모델은 현재 GitHub Copilot 내에서 사용할 수 있습니다.

GitHub Copilot을 사용하는 개발자들은 이전 버전보다 훨씬 저렴한 비용으로 더 빠르고 고품질의 코드 생성 및 향상된 CLI 성능을 누릴 수 있습니다.

SOURCES

7. Cohere, North-Micro-Vision-Instruct 모델 출시

CohereLabs는 연구 및 개발 작업을 위해 설계된 오픈 웨이트 비전-언어 모델 North-Micro-Vision-Instruct를 출시했습니다. 이 모델은 20억 파라미터 언어 백본과 4억 파라미터 비전 인코더를 특징으로 하며, 기본 해상도 이미지 처리 및 다중 이미지 입력을 지원합니다.

  • • North Micro Vision Instruct는 20억 언어 백본과 4억 SigLIP 2 비전 인코더를 결합한 24억 파라미터 모델입니다.
  • • Apache 2.0 라이선스로 출시되었으며 Hugging Face에서 이용 가능합니다.
  • • 기본 해상도 이미지 처리, 다중 이미지 입력, 128K 토큰 언어 컨텍스트 윈도우를 지원합니다.
  • • 연구, 프로토타이핑, 파인튜닝, 문서 이해를 위해 설계되었습니다.
  • • 도구 호출이나 에이전트 워크플로우는 지원하지 않으며, 수학 및 코드 생성 기능은 제한적입니다.

개발자들은 프로토타이핑, 문서 이해, 시각적 QA를 위해 가볍고 허용적인 라이선스의 비전 모델을 직접 호스팅할 수 있습니다.

SOURCES

8. Mistral, 지역 엔드포인트 및 우선순위 티어 출시

Mistral은 기업에 AI 모델 및 인프라에 대한 더 큰 통제권을 제공함으로써 AI 주권을 발전시키고 있습니다. 고객이 추론 처리를 위해 유럽 또는 미국을 선택할 수 있도록 지역 엔드포인트를 정식 출시했으며, 약정된 서비스 수준과 사용자 지정 속도 제한을 제공하는 우선순위 티어를 도입했습니다.

  • • Mistral 지역 엔드포인트가 정식 출시되어 고객이 추론 처리를 위해 유럽 또는 미국을 선택할 수 있습니다.
  • • Mistral 우선순위 티어는 공개 프리뷰 상태로, 약정된 서비스 수준, 사용자 지정 속도 제한, 가동 시간 SLA를 제공합니다.
  • • Mistral은 Z.ai의 GLM-5.2를 시작으로 타사 오픈 모델을 지원하도록 플랫폼을 확장하고 있습니다.
  • • 다년 약정을 인프라 액세스로 전환하기 위해 유럽 컴퓨팅 유닛(ECU)을 도입했습니다.

개발자들은 이제 유럽이나 미국 내에서 지역별 추론 처리를 보장받고, 미션 크리티컬 워크로드를 위한 약정된 서비스 수준을 확보할 수 있습니다.

SOURCES

9. LiteLLM 공급망 공격으로 2,500개 이상의 조직 자격 증명 노출

오픈 소스 도구 LiteLLM에 대한 대규모 공급망 공격으로 Microsoft, Amazon, Cisco, Samsung, Salesforce를 포함한 2,500개 이상의 조직 자격 증명이 노출되었습니다. 이번 침해는 피해자들이 Trivy 취약점 스캐너에 대한 이전 공급망 공격에서 비롯된 LiteLLM의 손상된 버전을 Python Package Index(PyPI)에서 다운로드하면서 발생했습니다.

  • • LiteLLM에 대한 공급망 공격으로 2,500개 이상의 조직에 대한 클라우드 키, 저장소 토큰, AI 제공업체 키를 포함한 자격 증명이 노출되었습니다.
  • • 침해는 사용자들이 Python Package Index(PyPI)에서 LiteLLM의 손상된 버전을 다운로드하면서 발생했습니다.
  • • 이번 손상은 KICS 및 Telnyx Python SDK에도 영향을 미친 Trivy 취약점 스캐너에 대한 이전 공급망 공격에서 비롯되었습니다.
  • • 도난당한 자격 증명은 3월 중 40분 동안 유출되었으며, 보안 연구원들에 의해 데이터의 진위가 확인되었습니다.

LiteLLM을 사용하는 개발자는 즉시 환경을 감사하고, 노출된 API 키를 교체하며, 손상된 버전의 패키지를 실행하고 있지 않은지 확인해야 합니다.

SOURCES

10. Cursor, 자동화된 PR 파이프라인을 위해 'Origin'을 'Cursor Review'로 리브랜딩

6월 Git 호환 포지인 'Origin'의 초기 출시 이후, Cursor는 이제 'Cursor Review'라는 새로운 이름으로 플랫폼을 클로즈드 베타에서 전환하고 있습니다. 업데이트된 플랫폼은 저장소 관리를 위한 'Codebase' 탭과 인간과 AI 에이전트 간의 자동화된 풀 리퀘스트 워크플로우를 촉진하기 위한 'Review' 탭을 특징으로 합니다.

  • • Cursor는 'Origin' 플랫폼을 'Cursor Review'로 리브랜딩하고 있습니다.
  • • 플랫폼이 클로즈드 파트너 베타에서 전환되고 있습니다.
  • • 새로운 기능에는 저장소 관리를 위한 'Codebase' 탭과 자동화된 PR 파이프라인을 위한 'Review' 탭이 포함됩니다.
  • • 공개 출시는 이번 주 중으로 예상됩니다.

이번 전환은 Cursor의 에이전트 네이티브 Git 포지가 클로즈드 베타에서 협업 코드 리뷰를 위한 더 넓고 기능 중심적인 플랫폼으로 이동함을 의미합니다.

SOURCES

11. 추측적 디코딩(Speculative Decoding), Apple Silicon에서 Muse Glimmer 30B 속도 향상

한 개발자가 Apple Silicon의 mlx-dspark 프로젝트에서 Meta의 Muse Glimmer 30B 모델에 대한 추측적 디코딩을 구현했습니다. 이 구현은 수학, 코드, 채팅 작업 전반에서 상당한 속도 향상을 달성하는 동시에 출력이 일반 디코딩과 바이트 단위로 동일하게 유지되어 모델 품질을 보존합니다.

  • • mlx-dspark 프로젝트의 추측적 디코딩은 M4 Pro에서 Muse Glimmer 30B 속도를 8.2에서 최대 26 토큰/초로 향상시켰습니다.
  • • 8비트 모델의 속도 향상 계수는 수학 3.27배, 코드 2.5배, 채팅 2.22배였습니다.
  • • 출력은 일반 디코딩과 바이트 단위로 동일하게 유지되어 모델 품질 저하가 없습니다.
  • • 8비트 실행은 40GB 메모리 사용량을 기록하며, 4비트 빌드는 18GB 메모리를 요구하며 1.7배의 속도 향상을 제공합니다.
  • • 이 프로젝트는 오픈 소스이며 GitHub에서 이용 가능합니다.

Apple Silicon에서 로컬 모델을 실행하는 개발자들은 출력 품질 저하 없이 지연 시간을 획기적으로 줄일 수 있습니다.

SOURCES

12. 새로운 연구, 토큰 절감 도구가 LLM 비용을 증가시킬 수 있음을 발견

'분모 효과(denominator effect)'로 인해 rtk 및 headroom과 같은 토큰 압축 도구가 실제로는 미미한 절감 효과만 제공한다는 이전 보고서에 이어, PointFive의 새로운 연구는 그 영향이 이전에 이해했던 것보다 더 나쁠 수 있음을 시사합니다. 103개 작업에 걸친 2,908개의 Claude Code 세션을 평가한 결과, 비용 절감 수단으로 마케팅되는 이러한 도구가 모델 및 작업 구성에 따라 실제로는 총 LLM 비용을 최대 46.4%까지 증가시킬 수 있다는 사실이 밝혀졌습니다.

  • • PointFive는 토큰 절감 도구의 실제 비용 영향을 측정하기 위해 2,908개의 Claude Code 세션과 103개의 작업을 평가했습니다.
  • • 연구 결과, 이러한 도구는 최대 90% 절감이라는 마케팅 주장과 달리 LLM 비용을 최대 46.4%까지 증가시킬 수 있는 것으로 나타났습니다.
  • • 이 발견은 이러한 도구와 관련된 3.7%의 미미한 절감 효과와 운영 위험을 식별했던 2026년 6월의 이전 벤치마크를 확장한 것입니다.

개발자들은 광고된 절감 효과에 대한 회의론을 넘어 토큰 절감 전략을 적극적으로 벤치마킹해야 합니다. 이러한 도구는 이제 비용 최적화 솔루션이 아니라 오히려 API 지출 증가의 원인으로 식별될 수 있기 때문입니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.