Inference Brew

OpenAI, GPT-5.6 모델 제품군 제한적 프리뷰 출시

00:00 / --:--

← 메인으로

OpenAI, GPT-5.6 모델 제품군 제한적 프리뷰 출시

1. OpenAI, GPT-5.6 모델 제품군 제한적 프리뷰 출시

GPT-5.6 제품군에 대한 초기 발표를 바탕으로, OpenAI는 정부 승인을 받은 파트너들을 대상으로 모델의 제한적 프리뷰를 시작했습니다. 이 시리즈에는 플래그십 모델인 Sol, 균형 잡힌 Terra, 경제적인 Luna 모델이 포함됩니다. 이번 프리뷰에서는 서브 에이전트 기반 추론 모드, 명시적 프롬프트 캐싱 중단점, 특정 가격 책정 계층과 같은 새로운 기능이 도입되었으며, 향후 몇 주 내에 일반 공개될 예정입니다.

  • OpenAI가 Sol, Terra, Luna 모델을 포함한 GPT-5.6 제품군의 제한적 프리뷰를 시작했습니다.
  • 프리뷰는 현재 정부 승인을 받은 파트너로 제한되며, 향후 몇 주 내에 일반 공개될 예정입니다.
  • GPT-5.6 Sol은 'max' 추론과 'ultra' 서브 에이전트 오케스트레이션을 도입합니다.
  • 가격은 100만 토큰당 Sol 5.00달러/30.00달러, Terra 2.50달러/15.00달러, Luna 1.00달러/6.00달러로 책정되었습니다.
  • 새로운 개발자 기능에는 30분 최소 캐시 수명을 가진 명시적 프롬프트 캐싱 중단점이 포함됩니다.

개발자들은 곧 있을 일반 공개를 앞두고 특정 가격, 추론 기능, 새로운 프롬프트 캐싱 기능을 포함한 GPT-5.6 모델 계층에 대한 구체적인 세부 정보를 확인할 수 있게 되었습니다.

2. 미국 정부, Claude Mythos 5 수출 제한 해제

미국 정부가 2주 전 긴급 지침에 따라 전 세계적으로 오프라인 상태가 되었던 Anthropic의 Claude Mythos 5 AI 모델에 대한 수출 제한을 해제했습니다. 새로운 합의에 따라 100개 이상의 승인된 미국 기업 및 정부 기관은 외국인 직원에게 수출 라이선스를 요구하지 않고도 시스템에 액세스할 수 있게 되었습니다. Claude Mythos 5는 특정 기관에 대해 사용이 허가되었지만, Anthropic의 Fable 5 모델은 안전 가드레일에 대한 협상이 계속됨에 따라 여전히 제한된 상태입니다.

  • 미국 정부가 Anthropic의 Claude Mythos 5에 대한 차단을 해제하고 100개 이상의 미국 기관에 출시를 승인했습니다.
  • 이번 조치는 잠재적인 탈옥 우려로 인해 6월 13일에 보고된 전 세계적인 중단 조치를 뒤집는 것입니다.
  • 새로운 합의는 특정 기관 및 외국인 직원에게 이전할 때 Claude Mythos 5에 대한 수출 라이선스 요구 사항을 제거합니다.
  • Anthropic의 Fable 5 모델은 출시 관련 논의가 계속되는 동안 차단된 상태로 유지됩니다.

정부가 이전에 전 세계적인 모델 중단을 초래했던 수출 라이선스 요구 사항을 제거함에 따라, 승인된 미국 기관의 개발자들은 Claude Mythos 5 사용을 재개할 수 있게 되었습니다.

3. Nemotron-3-Super-120B, 504K 토큰에서 완벽한 리콜 달성

400K 컨텍스트에서 성능 저하가 나타났던 이전 벤치마크를 바탕으로, Nemotron-3-Super-120B-A12B 모델은 이제 504,482 토큰까지 완벽한 니들 인 어 헤이스택 리콜을 보여줍니다. 하이브리드 Mamba2, 주기적 어텐션, 그리고 고정 크기 순환 상태를 갖춘 MoE 아키텍처를 활용함으로써, 이 모델은 긴 컨텍스트 길이에서 순수 어텐션 모델에서 관찰되었던 VRAM 비대화 및 성능 저하를 방지합니다.

  • Nemotron-3-Super-120B-A12B는 504,482 토큰까지 정확한 니들 인 어 헤이스택 리콜을 달성합니다.
  • 이 모델은 하이브리드 Mamba2/MoE 아키텍처를 사용하여 고정 크기 순환 상태를 유지함으로써 이전 400K 컨텍스트 테스트에서 보였던 성능 저하를 방지합니다.
  • 4개의 RTX 3090 GPU에서 테스트한 결과 504K 컨텍스트에서 초당 23 토큰의 안정적인 디코드 속도를 보여줍니다.
  • 이번 업데이트는 이전에 보고된 400K 컨텍스트 제한을 넘어 모델의 실용성을 크게 확장합니다.

이번 개발은 초기 테스트에서 확인된 주요 병목 현상을 해결하여, 개발자들이 소비자용 하드웨어에서 훨씬 더 긴 컨텍스트 윈도우를 통해 높은 정확도와 사용 가능한 디코드 속도를 유지할 수 있게 합니다.

SOURCES

4. NVIDIA, Blackwell GPU용 NVFP4 양자화 GLM-5.2 출시

NVIDIA는 Blackwell GPU 아키텍처를 타겟으로 하는 GLM-5.2 모델의 최적화 버전을 Hugging Face에 게시했습니다. 이는 Zhipu AI의 7530억 파라미터 Mixture-of-Experts 모델 발표에 따른 것입니다. 모델을 NVFP4 형식으로 양자화함으로써, NVIDIA는 원래의 FP8 정밀도와 거의 일치하는 정확도 수준을 유지하면서 Blackwell 하드웨어에서 고성능 로컬 실행을 가능하게 했습니다.

  • NVIDIA가 Hugging Face에 GLM-5.2 모델의 NVFP4 양자화 버전을 출시했습니다.
  • 이 모델은 100만 토큰 컨텍스트 윈도우를 가진 7530억 파라미터 Mixture-of-Experts 아키텍처입니다.
  • NVFP4 형식은 Blackwell GPU에 최적화되어 고성능 로컬 실행을 제공합니다.
  • 양자화된 모델은 원래의 FP8 정밀도와 거의 일치하는 정확도 수준을 유지합니다.

개발자들은 이제 최적화된 메모리 사용량과 FP8에 가까운 정확도로 Blackwell 하드웨어에서 753B 파라미터 GLM-5.2 모델을 배포할 수 있습니다.

SOURCES

5. DeepReinforce, Ornith-2.0으로 Ornith 코딩 모델 제품군 확장

어제 Ornith-1.0 코딩 모델 출시에 이어, DeepReinforce는 Ornith-2.0 제품군으로 라인업을 확장했습니다. Ornith-1.0이 에이전트 코딩 작업에 중점을 두었다면, 새로운 Ornith-2.0 모델은 강화 학습(RL) 스캐폴드를 작성하도록 특별히 훈련되었습니다. 두 모델 제품군 모두 Gemma 4 및 Qwen 3.5 기반으로 구축되었으며 Hugging Face에서 사용할 수 있습니다.

  • DeepReinforce가 Ornith-2.0 출시와 함께 오픈 소스 코딩 모델 제품군을 확장했습니다.
  • Ornith-2.0은 강화 학습(RL) 스캐폴드 작성에 최적화되어 있습니다.
  • 어제 출시된 Ornith-1.0 모델과 마찬가지로, 새로운 모델은 Gemma 4 및 Qwen 3.5 기반 아키텍처로 구축되었습니다.
  • 새로운 릴리스에 대한 모델 가중치와 기술 문서는 Hugging Face에서 확인할 수 있습니다.

개발자들은 이제 더 넓은 범위의 전문 코딩 모델에 액세스할 수 있게 되었으며, 특히 새로운 Ornith-2.0은 강화 학습 스캐폴드 생성에 특화되어 있습니다.

SOURCES

6. Vercel, 제로 오버헤드 실행 루프를 갖춘 AI SDK 7 출시

Vercel은 다단계 도구 오케스트레이션 및 에이전트 UI 스트리밍을 간소화하는 데 중점을 둔 AI SDK 7을 출시했습니다. 이번 업데이트는 복잡한 도구 호출을 단순화하고 에이전트 UI 상태를 프론트엔드 프레임워크로 직접 스트리밍하기 쉽게 만드는 제로 오버헤드 실행 루프를 도입했습니다. 또한, 새로운 통합 텔레메트리 계층이 서버리스 컴퓨팅 런타임과 직접 통합되어 개발자에게 토큰 사용량, 모델 선택 및 도구 실행 지연 시간에 대한 심층적인 추적 가시성을 제공합니다.

  • Vercel이 스트림 및 도구 오케스트레이션을 향상하기 위해 AI SDK 7을 출시했습니다.
  • 이번 업데이트는 다단계 도구 호출을 단순화하기 위해 제로 오버헤드 실행 루프를 도입했습니다.
  • 에이전트 UI 상태를 프론트엔드 프레임워크로 직접 스트리밍하는 기능을 추가했습니다.
  • 통합 텔레메트리 계층이 서버리스 컴퓨팅 런타임과 통합되어 토큰 사용량, 모델 선택 및 도구 실행 지연 시간을 추적합니다.

개발자들은 더 반응성이 뛰어난 에이전트 UI를 구축하고 서버리스 환경에서 토큰 사용량, 모델 선택 및 도구 지연 시간을 쉽게 추적할 수 있습니다.

SOURCES

7. Hugging Face, 단일 명령 vLLM 배포 출시

Hugging Face는 개발자가 단일 명령으로 비공개 OpenAI 호환 vLLM 엔드포인트를 실행할 수 있는 간소화된 배포 워크플로우를 도입했습니다. Hugging Face의 초당 과금 서버리스 Jobs 인프라에서 작동하는 이 서비스는 영구적인 GPU 인스턴스를 관리하지 않고도 오픈 웨이트 모델을 호스팅할 수 있는 매우 비용 효율적이고 마찰이 적은 방법을 제공합니다.

  • Hugging Face가 개발자를 위한 단일 명령 배포 워크플로우를 출시했습니다.
  • 이 워크플로우를 통해 비공개 OpenAI 호환 vLLM 엔드포인트를 생성할 수 있습니다.
  • 이 서비스는 Hugging Face의 초당 과금 서버리스 Jobs 인프라에서 실행됩니다.

개발자들은 초당 과금 방식으로 비공개 자동 확장 vLLM 추론 엔드포인트를 즉시 실행할 수 있습니다.

SOURCES

8. Weave, 코딩 에이전트를 위한 소스 공개 모델 라우터 출시

Weave는 Claude Code, Codex, Cursor와 같은 코딩 에이전트 바로 앞에 배치되도록 설계된 지능형 모델 라우터를 출시했습니다. 표준 Anthropic 또는 OpenAI 엔드포인트로 작동하는 이 라우터는 에이전트 추적을 기반으로 훈련된 RL 모델을 사용하여 작업 복잡성을 분석합니다. 일상적인 작업은 DeepSeek v4, GLM 5.2, Kimi K2.6과 같은 더 빠르고 저렴한 모델로 자동 라우팅하고, 복잡한 요청은 Opus 4.8 또는 GPT 5.5와 같은 고성능 프론티어 모델로 예약합니다. Weave는 출력 품질 저하 없이 토큰 비용을 40% 절감했다고 보고했습니다. 이 도구는 Elastic License 2.0에 따라 소스가 공개되어 있습니다.

  • Weave가 Claude Code, Codex, Cursor와 통합되도록 설계된 모델 라우터를 개발했습니다.
  • 라우터는 작업 복잡성에 따라 요청을 지시하는 Anthropic/OpenAI 엔드포인트 역할을 합니다.
  • 일상적인 작업은 더 저렴한 모델(DeepSeek v4, GLM 5.2, Kimi K2.6)로, 복잡한 작업은 프론티어 모델(Opus 4.8, GPT 5.5)로 라우팅합니다.
  • 라우팅 로직은 수만 개의 에이전트 추적을 기반으로 훈련된 RL 모델에 의해 구동됩니다.
  • Weave는 품질이나 속도 저하 없이 내부적으로 토큰 비용을 40% 절감했다고 보고했습니다.
  • 라우터는 자체 호스팅 또는 호스팅 서비스를 위해 Elastic License 2.0에 따라 소스가 공개되어 있습니다.

개발자들은 일상적인 코딩 작업을 더 저렴한 모델로 라우팅하고 복잡한 쿼리를 위해 프론티어 모델을 예약함으로써 LLM API 비용을 최대 40%까지 절감할 수 있습니다.

SOURCES

9. MRAgent 메모리 프레임워크, 토큰 소비 대폭 절감

싱가포르 국립대학교 연구원들은 AI 에이전트의 장기 추론을 최적화하기 위해 설계된 오픈 소스 프레임워크인 MRAgent를 도입했습니다. 정적 검색에 의존하는 대신, MRAgent는 Cue-Tag-Content 메커니즘을 사용하여 메모리를 다층 연관 그래프로 구성하여 LLM이 동적으로 메모리를 재구성하고 관련 없는 가지를 정리할 수 있도록 합니다. LongMemEval 벤치마크 테스트에서 MRAgent는 샘플당 프롬프트 토큰 소비량을 LangMem이 소비한 326만 토큰 대비 11만 8천 토큰으로 줄였으며, 실행 런타임도 절반으로 단축했습니다. 코드는 현재 GitHub에서 사용할 수 있습니다.

  • 싱가포르 국립대학교 연구원들이 AI 에이전트의 장기 추론을 위한 프레임워크인 MRAgent를 개발했습니다.
  • MRAgent는 Cue-Tag-Content 연관 그래프를 사용하여 정적 검색을 동적 메모리 재구성으로 대체합니다.
  • 이 프레임워크는 LongMemEval에서 샘플당 프롬프트 토큰 소비량을 LangMem의 326만 대비 11만 8천으로 줄였습니다.
  • 실행 런타임을 A-MEM 기준인 1,122초의 절반 정도인 586초로 단축했습니다.
  • 연구원들은 GitHub에 MRAgent 코드를 공개했습니다.

개발자들은 API 토큰 비용과 실행 지연 시간을 대폭 줄이면서 깊은 컨텍스트를 유지하는 장기 에이전트를 구축할 수 있습니다.

SOURCES

10. Liquid AI, Opus 4.8 프레임워크로 WebGPU 지원 공식화

Liquid AI는 에이전트 WebGPU 커널 최적화 프레임워크인 Opus 4.8을 공식 출시했습니다. 이번 릴리스는 이전에 커뮤니티 시연에서 선보였던 LFM2.5-230M 모델에 대한 브라우저 내 추론 기능을 공식화합니다. 이 프레임워크를 통해 모델은 웹 브라우저에서 초당 최대 1,400 토큰의 속도로 로컬에서 실행될 수 있으며, 개발자가 빠르고 지연 시간이 없는 로컬 모델을 클라이언트 측 웹 애플리케이션에 직접 배포할 수 있는 지원 경로를 제공합니다.

  • Liquid AI가 공식 WebGPU 커널 최적화 프레임워크인 Opus 4.8을 출시했습니다.
  • 이 프레임워크는 LFM2.5-230M 모델에 대한 브라우저 내 추론 기능을 공식화합니다.
  • 이전에 보고된 초당 1,400 토큰의 추론 속도를 유지합니다.

개발자들은 이제 LFM2.5-230M 모델에 대해 고속 로컬 브라우저 기반 추론을 배포할 수 있는 Liquid AI의 공식 지원 프레임워크를 갖게 되었습니다.

SOURCES

11. Apple, Apple Silicon용 'container' CLI 도구 오픈 소스화

Apple은 Swift로 작성된 Apache 2.0 라이선스 명령줄 도구인 'container'를 오픈 소스로 공개했습니다. 이 도구는 Linux 컨테이너를 Apple Silicon에서 경량 가상 머신으로 실행합니다. 보안, 개인 정보 보호 및 성능을 극대화하기 위해 이 도구는 단일 공유 VM에 의존하는 대신 각 컨테이너에 대해 별도의 격리된 VM을 실행합니다. 런타임은 Virtualization 및 Keychain 서비스와 같은 macOS 프레임워크와 직접 통합되며, 버전 1.0.0에서는 지속적인 컨테이너 머신, TOML 구성, 자동화를 위한 구조화된 JSON/YAML/TOML 출력이 추가되었습니다.

  • Apple이 Linux 컨테이너를 Apple Silicon에서 경량 VM으로 실행하는 오픈 소스 Swift 명령줄 도구인 'container'를 출시했습니다.
  • 이 도구는 Apache 2.0 라이선스를 따르며 OCI 호환 컨테이너 이미지를 지원합니다.
  • 공유 VM 도구와 달리 보안, 개인 정보 보호 및 성능을 향상하기 위해 각 컨테이너에 대해 별도의 경량 가상 머신을 실행합니다.
  • 이 도구는 Apple Silicon이 필요하며 전체 가상화 및 네트워킹 지원을 위해 macOS 26을 권장합니다.
  • 버전 1.0.0은 지속적인 컨테이너 머신, TOML 구성, 자동화를 위한 구조화된 JSON, YAML, TOML 출력을 도입합니다.

개발자들은 에이전트 실행 또는 로컬 서비스를 위해 macOS에서 직접 안전하고 격리된 로컬 샌드박스를 실행할 수 있습니다.

SOURCES

12. Alibaba, Qwen-Image-Agent 프레임워크 도입

Alibaba는 실제 이미지 생성 워크플로우를 향상하기 위해 설계된 에이전트 프레임워크인 Qwen-Image-Agent를 도입했습니다. 계획, 추론, 검색 및 메모리 기능을 통합함으로써 이 프레임워크는 텍스트-이미지 모델을 안내하기 위해 컨텍스트를 자동으로 수집하고 구조화하여 더 정확하고 컨텍스트를 인식하는 이미지 출력을 생성합니다.

  • Alibaba가 실제 이미지 생성을 위한 에이전트 프레임워크인 Qwen-Image-Agent를 도입했습니다.
  • 이 프레임워크는 텍스트-이미지 모델에 컨텍스트를 제공하기 위해 정보를 계획, 추론, 검색 및 기억합니다.

개발자들은 에이전트 계획 및 메모리를 활용하여 출력 품질을 향상하는 더 정교한 이미지 생성 파이프라인을 구축할 수 있습니다.

SOURCES

13. AWS, Nvidia 컴퓨팅 워크로드 가격 20% 인상

Amazon Web Services는 AI 워크로드 대여 서비스에 대해 20% 가격 인상을 발표했으며, 이는 Nvidia 컴퓨팅 인스턴스 대여 비용을 직접적으로 인상하는 것입니다. 금요일에 발표된 이번 가격 인상은 모델 훈련, 미세 조정 또는 대용량 추론 워크로드를 위해 AWS GPU 인스턴스에 의존하는 개발자들에게 즉각적인 영향을 미칠 것입니다.

  • Amazon Web Services가 AI 워크로드 대여 서비스에 대해 20% 가격 인상을 발표했습니다.
  • 이번 가격 인상은 특히 Nvidia 컴퓨팅 인스턴스에 영향을 미칩니다.
  • 발표는 금요일에 이루어졌습니다.

AWS Nvidia 인스턴스에서 모델을 호스팅하거나 미세 조정하는 개발자들은 컴퓨팅 비용이 20% 직접 인상되는 것을 경험하게 될 것입니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.