Inference Brew

SpaceXAI, 프론티어 모델 Grok 4.7로 업데이트

00:00 / --:--

← 메인으로

SpaceXAI, 프론티어 모델 Grok 4.7로 업데이트

1. SpaceXAI, 프론티어 모델 Grok 4.7로 업데이트

SpaceXAI가 Grok 4.6의 후속 모델인 Grok 4.7을 출시했습니다. 새로운 버전은 500k 컨텍스트 윈도우를 유지하면서 에이전트 지식 작업 및 코딩 작업에서 상당한 벤치마크 향상을 보여줍니다. 입력 및 출력 가격은 토큰당 2달러/6달러로 동일하지만, 모델의 'xhigh' 모드는 이전 버전보다 최대 125% 더 많은 출력 토큰을 소비하여 복잡한 작업에 대한 총 API 비용이 증가합니다.

  • • Grok 4.7은 Grok 4.6의 후속 모델로, Artificial Analysis Intelligence Index에서 46점을 기록했습니다.
  • • AA-Briefcase 벤치마크에서 Grok 4.6 대비 에이전트 성능이 111점 향상되었습니다.
  • • 500k 토큰 컨텍스트 윈도우를 유지하며 기본 가격은 100만 토큰당 2달러/6달러입니다.
  • • xhigh 모드는 Grok 4.6보다 125% 더 많은 출력 토큰을 소비하여 복잡한 작업의 비용이 상승합니다.

개발자들은 더 뛰어난 추론 및 코딩 모델을 사용할 수 있게 되었지만, 이전 Grok 4.6 릴리스와 비교하여 'xhigh' 모드에서의 비용 증가를 고려해야 합니다.

2. Xiaomi, V2.5-Pro의 후속 모델 MiMo-V2.6-Pro 출시

2026년 6월에 출시된 MiMo-V2.5-Pro 시리즈를 기반으로 Xiaomi가 MiMo-V2.6-Pro를 출시했습니다. 이 새로운 1.02조 파라미터 Mixture-of-Experts 모델은 420억 개의 활성 파라미터를 특징으로 하며, Artificial Analysis Intelligence Index에서 46점을 기록하여 V2.5-Pro의 26점 대비 상당한 성능 향상을 보였습니다. 이 모델은 100만 입력 토큰당 0.435달러, 100만 출력 토큰당 0.87달러로 책정되어 개발자들에게 경쟁력 있는 경제성을 제공합니다.

  • • MiMo-V2.6-Pro는 420억 개의 활성 파라미터를 가진 1.02조 파라미터 MoE 모델입니다.
  • • 이 모델은 Artificial Analysis Intelligence Index에서 46점을 기록하여 V2.5-Pro의 26점을 상회합니다.
  • • 가격은 100만 입력 토큰당 0.435달러, 100만 출력 토큰당 0.87달러로 설정되었습니다.
  • • 이 모델은 99% 캐시 적중 할인을 포함하여 개발자의 비용 효율성을 높입니다.

개발자들은 이제 MiMo-V2.5-Pro의 더 뛰어난 후속 모델을 통해 경쟁력 있는 가격으로 향상된 지능을 활용할 수 있습니다.

SOURCES

3. Meta, Model API를 통해 Segment Anything Model (SAM) 3.1 출시

Meta가 Meta Model API에 Segment Anything Model (SAM) 3.1을 공식 출시했습니다. 이번 업데이트를 통해 개발자는 정적 이미지와 비디오 시퀀스 모두에서 텍스트 프롬프트를 사용한 객체 탐지, 세분화 및 추적을 수행할 수 있습니다. 낮은 지연 시간과 높은 신뢰성을 보장하기 위해 Meta는 맞춤형 추론 인프라에서 SAM 3.1을 서비스합니다. API 가격은 이미지 1,000개당 2.50달러, 비디오 프레임 1,000개당 0.20달러입니다.

  • • Meta는 Meta Model API에 SAM 3.1을 출시하여 텍스트 프롬프트 기반 객체 탐지, 세분화 및 추적을 지원합니다.
  • • 이 모델은 특정 아키텍처에 최적화된 전용 추론 인프라에서 서비스됩니다.
  • • 가격은 이미지 1,000개당 2.50달러 또는 비디오 프레임 1,000개당 0.20달러로 설정되었습니다.

개발자들은 복잡한 비전 모델을 직접 호스팅할 필요 없이 관리형 API를 통해 고급 컴퓨터 비전 기능을 앱에 쉽게 통합할 수 있습니다.

SOURCES

4. Cloudflare, Python Workers 정식 출시 발표

Cloudflare가 Python Workers의 정식 출시를 발표하며 서버리스 개발자 플랫폼에 일류 Python 지원을 제공합니다. 이번 릴리스를 통해 개발자는 JavaScript 래퍼 없이도 Workers AI, R2, Durable Objects와 같은 Cloudflare 서비스와 직접 상호 작용하는 네이티브 Python 코드를 작성하고 배포할 수 있습니다. Python Workers는 FastAPI 및 Flask와 같은 인기 있는 웹 프레임워크와 OpenAI, LangChain, MCP와 같은 핵심 AI 라이브러리를 지원합니다. 또한 새로운 소켓 브리지를 통해 Hyperdrive를 통한 관계형 데이터베이스로의 원활한 연결이 가능합니다.

  • • Python은 이제 Cloudflare 개발자 플랫폼에서 완전히 지원되는 일류 언어입니다.
  • • Python Workers는 Workers AI, R2, D1, Durable Objects를 포함한 Cloudflare 서비스와 네이티브로 통합됩니다.
  • • 개발자는 내장 커넥터를 사용하여 FastAPI, Django, Flask와 같은 ASGI/WSGI 프레임워크를 실행할 수 있습니다.
  • • openai, langchain, mcp를 포함한 인기 있는 AI 라이브러리가 기본적으로 지원됩니다.
  • • 새로운 소켓 브리지를 통해 Hyperdrive를 사용하여 PostgreSQL 및 MySQL 데이터베이스에 직접 연결할 수 있습니다.

개발자들은 이제 JavaScript 접착 코드 없이도 Python 기반 AI 애플리케이션, FastAPI 백엔드 및 MCP 서버를 Cloudflare에 직접 배포할 수 있습니다.

SOURCES

5. Foremerge: 병렬 코딩 에이전트를 위한 로컬 조정 계층

Foremerge는 동일한 코드베이스에서 작업하는 병렬 코딩 에이전트를 관리하기 위해 설계된 오픈 소스 로컬 조정 계층으로 출시되었습니다. Rust 바이너리로 구축된 Foremerge는 Claude Code, Codex, Cursor와 원활하게 통합되는 CLI와 18개의 도구를 갖춘 MCP 서버를 제공합니다. git 공통 디렉토리 내의 공유 SQLite 데이터베이스를 활용하여, 이 도구는 git 기록을 수정하거나 비용이 많이 드는 LLM 기반 판사에 의존하지 않고도 에이전트 작업과 범위를 추적하여 의도 충돌을 결정론적으로 감지합니다.

  • • Foremerge는 병렬 코딩 에이전트 전반에 걸쳐 의도된 작업과 범위를 추적하는 로컬 조정 계층입니다.
  • • 이 도구는 CLI와 18개의 도구가 포함된 MCP 서버를 갖춘 Rust 바이너리로 구현되었습니다.
  • • git 기록을 수정하지 않기 위해 git 공통 디렉토리의 공유 SQLite 파일을 사용하여 git 및 워크트리 위에서 작동합니다.
  • • 충돌 감지는 LLM 판사가 아닌 선언된 작업을 기반으로 완전히 결정론적으로 이루어집니다.
  • • 이 시스템은 Claude Code, Codex, Cursor와 호환되며 최대 98개의 병렬 에이전트로 테스트되었습니다.

여러 병렬 코딩 에이전트를 실행하는 개발자는 값비싼 LLM 판사에 의존하지 않고도 충돌하는 코드 변경을 방지할 수 있습니다.

SOURCES

6. AX: 자율 에이전트를 위한 고처리량 선언적 오케스트레이터

AX는 클러스터 내에서 수십억 개의 자율 에이전트 워크로드를 관리하고 확장하도록 설계된 오픈 소스 고처리량 오케스트레이터로 도입되었습니다. Agent Substrate 위에서 작동하는 AX는 에이전트 배포에 Kubernetes와 같은 선언적 경험을 제공합니다. 개발자는 워크스페이스 및 게이트웨이 사양을 사용하여 작업을 정의하며, AX는 해당 에이전트를 대규모로 안전하게 실행하는 데 필요한 샌드박싱, 배선 및 네트워크 격리를 자동으로 처리합니다.

  • • AX는 대규모 자율 에이전트 워크로드를 실행하기 위해 구축된 고처리량 선언적 오케스트레이터입니다.
  • • 이 시스템은 Agent Substrate 위에서 작동하며 Kubernetes와 유사한 사용자 경험을 제공합니다.
  • • AX는 사용자가 정의한 워크스페이스 및 게이트웨이 사양에 따라 에이전트 작업을 샌드박싱, 배선 및 네트워크 격리합니다.

개발자는 익숙한 선언적 워크스페이스 및 게이트웨이 사양을 사용하여 대규모 에이전트 워크로드를 배포, 샌드박싱 및 확장할 수 있습니다.

SOURCES

7. Alibaba Qwen 팀, RecreationWorld 에이전트 샌드박스 출시

Alibaba의 Qwen 팀이 Hugging Face에서 호스팅되는 전문 샌드박스 환경인 RecreationWorld를 출시했습니다. 하이브리드 컴퓨터 사용 에이전트를 위해 설계된 RecreationWorld는 자율 에이전트가 실제 애플리케이션과 상호 작용하고, 복잡한 워크플로우를 실행하며, 자신의 빌드를 시각적으로 검증할 수 있는 5개 플랫폼 환경을 제공합니다. 이번 릴리스는 개발자에게 GUI 기반 에이전트 동작을 벤치마킹하고 개선할 수 있는 표준화되고 안전한 환경을 제공합니다.

  • • RecreationWorld는 하이브리드 컴퓨터 사용 에이전트를 위해 특별히 설계된 5개 플랫폼 샌드박스입니다.
  • • 이 플랫폼을 통해 에이전트는 실제 애플리케이션을 탐색하고, 작업을 실행하며, 빌드를 시각적으로 검증할 수 있습니다.
  • • 이 샌드박스는 Alibaba의 Qwen 팀이 출시했으며 Hugging Face에서 호스팅됩니다.

개발자는 표준화된 샌드박스 내에서 여러 플랫폼에 걸쳐 컴퓨터 사용 에이전트를 안전하게 테스트하고 시각적으로 검증할 수 있습니다.

SOURCES

8. Halo 프레임워크, 오픈 소스 모델의 사후 학습 가속화

오픈 소스 모델의 미세 조정 및 정렬을 최적화하기 위한 Halo라는 새로운 사후 학습 프레임워크가 도입되었습니다. Halo는 Hugging Face의 기존 TRL 라이브러리 대비 최대 2.8배의 처리량을 제공하는 동시에 피크 메모리 소비를 줄입니다. 개발자에게 중요한 점은 Halo 프레임워크를 사용하여 학습된 모델이 기본 Hugging Face 형식과 완전히 호환되어 기존 파이프라인에 원활하게 배포할 수 있다는 것입니다.

  • • Halo는 오픈 소스 모델의 사후 학습을 위해 설계된 새로운 프레임워크입니다.
  • • 이 프레임워크는 기존 TRL(Transformer Reinforcement Learning) 대비 최대 2.8배의 처리량을 제공합니다.
  • • Halo는 학습 실행 중 기존 TRL보다 적은 피크 메모리를 필요로 합니다.
  • • Halo로 처리된 모델은 기본 Hugging Face 형식을 유지합니다.

로컬 모델을 미세 조정하는 개발자는 사후 학습 파이프라인의 속도를 크게 높이고 하드웨어 비용을 절감할 수 있습니다.

SOURCES

9. ZCode, 데이터 업로드 사고 이후 스택 오픈 소스화 및 보안 취약점 패치

최근 무단 워크스페이스 업로드에 관한 보안 결과에 대응하여, ZCode는 오픈 소스 모델로 전환하고 데스크톱 애플리케이션, 웹 워크스페이스, 백엔드, 에이전트 CLI 및 런타임을 GitHub에 공개했습니다. 함께 제공되는 v3.14.0 업데이트는 Repo Wiki 기능을 제거하고 자동 로컬 저장소 스냅샷 업로드를 비활성화하여 보고된 취약점을 해결합니다. 또한 CAICT와 NSFOCUS의 제3자 감사를 통해 ZCode의 클라우드 스토리지 버킷이 삭제되었으며 제로 데이터 상태임이 확인되어, 모델 학습을 위해 사용자 코드가 보관되지 않았음을 입증했습니다.

  • • ZCode는 데스크톱 앱, 웹 워크스페이스, 백엔드, 에이전트 CLI 및 런타임을 GitHub에 오픈 소스로 공개했습니다.
  • • v3.14.0 릴리스는 Repo Wiki를 제거하고 로컬 저장소 스냅샷 업로드를 비활성화하여 보안 문제를 해결합니다.
  • • CAICT와 NSFOCUS의 독립적인 감사를 통해 zcode-prod Alibaba Cloud OSS 버킷이 검증된 제로 데이터 상태이며 삭제되었음을 확인했습니다.
  • • 회사는 사용자 코드 데이터가 보관되거나 모델 학습에 사용되지 않았음을 확인했습니다.
  • • ZCode는 개발자를 위한 보상이 포함된 지속적인 취약점 보고 프로그램을 구축하고 있습니다.

이번 업데이트는 이전에 식별된 데이터 개인 정보 보호 위험에 대한 검증된 수정 사항과 함께 오픈 소스, 자체 호스팅 환경으로 이동함으로써 개발자가 ZCode를 계속 안전하게 사용할 수 있는 경로를 제공합니다.

SOURCES

10. Meta, Muse AI 플랫폼을 타사 커넥터에 개방

Meta는 이번 달 초에 출시된 Muse 소비자 AI 에이전트 플랫폼을 확장하여 맞춤형 API 커넥터 구축을 위한 개발자 액세스를 개방했습니다. 이제 개발자는 자신의 서비스를 Muse 생태계에 직접 통합할 수 있으며, Meta는 기본 에이전트 오케스트레이션 및 컨텍스트 관리를 처리합니다. 모든 제출물은 보안, 기능 및 법적 규정 준수를 다루는 검토 프로세스를 거쳐야 합니다.

  • • Meta는 Muse 플랫폼을 위한 맞춤형 API 커넥터 제출을 받고 있습니다.
  • • 개발자는 API를 제공하고 Muse는 에이전트 오케스트레이션 및 컨텍스트를 관리합니다.
  • • 커넥터는 사용자에게 제공되기 전에 기능, 보안 및 법적 검토를 통과해야 합니다.
  • • 승인된 통합은 Muse 생태계 내에서 추천 배치될 수 있습니다.

이번 개발을 통해 타사 서비스가 Muse 어시스턴트에 직접 통합될 수 있게 되어 플랫폼의 기능을 Meta의 초기 기능 세트 이상으로 확장할 수 있습니다.

SOURCES

11. Kev: 로컬 추론을 위한 소형 Qwen3.5 기반 결정 모델

Kev는 rank-16 LoRA 어댑터와 포인터 헤드를 사용하여 Qwen3.5 아키텍처 위에 구축된 소형 Apache-2.0 라이선스 결정 모델 제품군을 도입했습니다. 0.8B, 4B 및 9B 크기로 제공되는 이 모델은 예/아니오, 객관식, 평가 질문과 같은 구조화된 작업에 최적화되어 있습니다. 이 모델은 CUDA, ROCm 및 Apple Silicon에서 로컬로 실행되며, 더 큰 변형 모델도 32GB Mac에 쉽게 맞습니다. Kev는 TypeSafe의 System One과 즉시 호환되어 개발자가 TypeSafe Python SDK를 로컬 Kev 서버로 직접 가리킬 수 있습니다.

  • • Kev는 Qwen3.5를 기반으로 하는 소형 결정 모델 제품군으로 0.8B, 4B, 9B 파라미터 크기로 제공됩니다.
  • • 이 모델은 Apache-2.0 라이선스 하에서 구조화된 예/아니오, 객관식 및 평가 질문 유형을 지원합니다.
  • • 4B 및 9B 버전은 CUDA, ROCm 및 Apple Silicon에서 실행되며 bf16 정밀도를 사용하여 32GB Mac에 맞습니다.
  • • 로컬 Kev 서버는 TypeSafe의 System One과 완전히 호환되어 TypeSafe Python SDK와 직접 통합할 수 있습니다.
  • • 모델은 간단한 JSONL 형식과 --init_from 플래그를 사용하여 도메인별 데이터로 미세 조정할 수 있습니다.

개발자는 Apple Silicon 또는 CUDA에서 로컬로 빠르고 구조화된 의사 결정 모델을 실행할 수 있으며 TypeSafe SDK와 완벽하게 호환됩니다.

SOURCES

12. 저사양 RAM 에이전트 코딩을 위한 Sharp-Spark-X2.5-4B-GGUF 출시

저사양 하드웨어에서 로컬 에이전트 코딩을 구현하기 위해 새로운 양자화 모델인 Sharp-Spark-X2.5-4B-GGUF가 Hugging Face에 출시되었습니다. 비영리 자원봉사 노력으로 개발된 이 모델은 소형 GPU 또는 16GB 이하의 RAM을 탑재한 장치에 맞게 특별히 보정되었습니다. 양자화 프로세스는 코딩 및 사이버 보안 작업에 가중치를 둔 맞춤형 중요도 행렬을 활용하여 표준 수학적 충실도 지표보다 실제 SWE-bench-Live 성능을 우선시합니다.

  • • Sharp-Spark-X2.5-4B-GGUF는 저사양 하드웨어에서의 에이전트 코딩을 위해 설계된 양자화 모델입니다.
  • • 양자화 프로세스는 에이전트 코딩 및 사이버 보안을 위해 보정된 맞춤형 중요도 행렬을 사용합니다.
  • • 이 모델은 전통적인 KL-발산 지표보다 SWE-bench-Live 성능을 우선시합니다.
  • • 스마트폰 및 16GB 이하의 RAM을 탑재한 구형 노트북에서 실행되도록 설계되었습니다.
  • • 이 모델은 비영리 자원봉사 노력으로 Hugging Face에서 제공됩니다.

하드웨어가 제한된 개발자는 16GB 이하의 RAM을 탑재한 장치에서 유능한 로컬 코딩 에이전트를 실행할 수 있습니다.

SOURCES

13. phantom-kv: 핫스왑 가능한 KV-캐시 주입을 통한 LLM 검열 해제

phantom-kv라는 새로운 오픈 소스 프로젝트는 기본 가중치를 변경하지 않고 대규모 언어 모델 동작을 수정하는 새로운 방법을 도입합니다. 18MB의 오프라인 학습된 키/값 텐서 뱅크를 모델의 KV 캐시에 직접 주입함으로써, phantom-kv는 유해한 프롬프트에 대한 거부 동작을 억제하면서 무해한 프롬프트에 대한 표준 동작을 유지할 수 있습니다. 이 접근 방식을 통해 개발자는 서로 다른 캐시 슬롯을 사용하여 즉석에서 기능 모드를 핫스왑할 수 있습니다. 매우 유연하지만 8B 모델에 대한 감사 결과, 캐시 그래프는 긴 세션에서 2-4k 토큰의 반감기를 가지며 효과를 유지하려면 주기적인 재주입 주기가 필요함이 밝혀졌습니다.

  • • phantom-kv는 학습된 키/값 텐서 뱅크(~18MB)를 LLM의 KV 캐시에 로드하는 거부 제거 시스템입니다.
  • • 이 시스템은 기본 모델 가중치를 수정하거나 엔진 후크를 요구하지 않으며, 언로드 시 모델을 바이트 단위로 동일하게 유지합니다.
  • • 서로 다른 캐시 슬롯을 활용하여 핫스왑 가능한 기능 모드(예: 방어 또는 공격)를 지원합니다.
  • • 8B 모델에 대한 감사 결과 긴 세션에서 2-4k 토큰의 반감기가 나타났으며, 이는 주기적인 재주입으로 완화할 수 있습니다.
  • • 감사 결과 어휘적 거부 억제 지표는 의미론적 거부가 재구문으로 지속될 수 있으므로 규정 준수를 과대평가할 수 있음이 지적되었습니다.

개발자는 여러 미세 조정된 가중치를 호스팅하는 오버헤드 없이 로컬 모델에서 안전 및 기능 모드를 동적으로 전환할 수 있습니다.

SOURCES

14. Apple M5 Ultra Mac Studio, 대규모 로컬 AI 성능 향상 제공

M5 Ultra Mac Studio에 대한 새로운 리뷰는 로컬 AI 에이전트 및 복잡한 워크플로우를 실행하기 위한 최고의 워크스테이션으로서의 위치를 강조합니다. 두 개의 M5 Max 칩을 연결하는 쿼드 다이 아키텍처를 기반으로 하는 이 기기는 신경 가속기가 포함된 80코어 GPU와 1.2 TB/s의 방대한 메모리 대역폭을 특징으로 합니다. oMLX 백엔드를 사용한 실제 테스트에서 M5 Ultra는 M3 Ultra보다 토큰 생성에서 70%의 속도 향상과 프롬프트 처리에서 150%의 개선을 보여주었으며, 기존 그래픽 카드의 VRAM 제약 없이 Qwen3.8-Flash-Next와 같은 로컬 모델을 실행하는 데 매우 효과적입니다.

  • • M5 Ultra Mac Studio는 신경 가속기가 포함된 80코어 GPU를 특징으로 하며 M3 Ultra 대비 최대 4.5배의 피크 AI 컴퓨팅을 제공합니다.
  • • 메모리 대역폭은 M3 Ultra의 819 GB/s 대비 50% 증가한 1.2 TB/s입니다.
  • • 실제 테스트 결과 M5 Ultra는 M3 Ultra보다 토큰 생성 속도가 70% 빠르고 프롬프트 처리 속도가 150% 빠릅니다.
  • • 이 하드웨어는 Qwen3.8-Flash-Next로 구동되는 Open Minis 및 Hermes Agent와 같은 로컬 에이전트를 성공적으로 실행합니다.
  • • NVIDIA RTX 5090이 더 높은 원시 컴퓨팅을 제공하지만, Mac Studio의 통합 메모리는 소비자 GPU의 32GB VRAM 제한을 피합니다.

로컬 AI 에이전트와 대규모 문서 분석을 실행하는 개발자는 VRAM 제한 GPU에 대한 매우 유능한 하드웨어 대안을 얻게 됩니다.

SOURCES

15. Hugging Face, Rust 기반 Tokenizers v1 출시

Hugging Face가 인기 있는 토크나이저 라이브러리의 버전 1을 공식 출시했습니다. Rust로 재작성된 v1 릴리스는 성능과 효율성에 중점을 두어 멀티 스레드 확장성과 크게 줄어든 패키지 크기를 제공합니다. 이 라이브러리는 여러 언어에 걸쳐 강력하고 고속의 토큰화를 제공하여 로컬 추론 엔진 및 맞춤형 모델 파이프라인을 위한 고도로 최적화된 종속성입니다.

  • • Hugging Face는 Rust 기반 토크나이저 라이브러리의 버전 1을 공식 출시했습니다.
  • • 이번 업데이트는 멀티 스레드 확장성과 최소한의 패키지 설치 공간을 도입합니다.
  • • 이 라이브러리에는 여러 언어에 대한 강력한 지원이 포함되어 있습니다.

로컬 추론 파이프라인이나 맞춤형 학습 워크플로우를 구축하는 개발자는 여러 언어에 걸쳐 더 빠르고 고도로 최적화된 토큰화의 이점을 누릴 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.