Inference Brew

OpenAI, Cerebras 기반 GPT-5.6 Sol에 'Ultrafast' 티어 추가

00:00 / --:--

← 메인으로

OpenAI, Cerebras 기반 GPT-5.6 Sol에 'Ultrafast' 티어 추가

1. OpenAI, Cerebras 기반 GPT-5.6 Sol에 'Ultrafast' 티어 추가

OpenAI는 지난 7월 도입된 'Fast mode'에 이어 GPT-5.6 Sol을 위한 'Ultrafast' 티어를 미리보기로 공개했습니다. Cerebras의 Wafer-Scale Engine으로 구동되는 이 티어는 표준 처리 방식보다 14배 빠른 초당 750개의 출력 토큰을 생성하며, 현재 기업용 평가를 위해 대기자 명단을 통해 제공되고 있습니다.

  • • 새로운 'Ultrafast' 티어는 Cerebras의 Wafer-Scale Engine 아키텍처로 구동됩니다.
  • • 성능은 초당 750 출력 토큰에 도달하며, 이는 표준 처리 대비 14배 증가한 수치입니다.
  • • GDP-Val 벤치마크에서 5.6배의 엔드투엔드 속도 향상을 입증했습니다.
  • • 현재 대기자 명단을 통해 일부 고객에게만 제한적으로 액세스가 제공됩니다.

이 새로운 티어는 기존 'Fast mode' 대비 비약적인 성능 향상을 제공하여, 실시간 음성 및 고속 에이전트 워크플로우에서 지연 시간을 거의 제로에 가깝게 줄여줍니다.

2. Google, Gemini 3.6 Flash의 후속 모델 Gemini 3.7 Flash 출시

2026년 7월 Gemini 3.6 Flash 출시 이후, Google은 Gemini 3.7 Flash를 선보였습니다. 이번 업데이트는 새로운 사전 학습이 아닌 코딩 및 에이전트 작업을 위한 알고리즘 추론 개선에 중점을 둡니다. 이 모델은 API 및 엔터프라이즈 플랫폼을 통해 제공되며, 사용자 지정 가능한 사고 예산(thinking budgets) 기능과 2026년 말까지 50% 가격 할인 혜택을 포함합니다.

  • • Gemini 3.7 Flash는 Google AI Studio, Android Studio 및 엔터프라이즈 플랫폼의 Gemini API를 통해 사용할 수 있습니다.
  • • 2026년 12월 31일까지 입력 토큰 100만 개당 0.75달러, 출력 토큰 100만 개당 3.75달러의 도입 가격이 적용됩니다.
  • • 이 모델은 100만 토큰의 컨텍스트 윈도우와 사용자 지정 가능한 사고 구성을 지원합니다.
  • • 벤치마크 성능은 코딩 작업에서 향상을 보였으며, FrontierCode 1.1 Main은 43.6%, DeepSWE v1.1은 65.3%를 기록했습니다.

이번 릴리스는 개발자들에게 복잡한 워크플로우를 위한 더 강력한 추론 모델을 제공하며, 조정 가능한 사고 구성을 통해 지연 시간과 품질 사이의 균형을 맞출 수 있게 합니다.

3. DeepSeek-V4-Pro API 및 에이전트 프레임워크 출시와 새로운 가격 체계 도입

V4 시리즈의 프로덕션 릴리스와 V4-Flash의 베타 출시 이후, DeepSeek는 플래그십 모델인 DeepSeek-V4-Pro를 출시했습니다. 이번 출시에는 오픈소스 에이전트 프레임워크인 DeepSeek Harness v0.1이 포함됩니다. 또한, 2024년 8월 16일부터 적용되는 피크 및 오프피크 모델로의 API 가격 조정을 시행했습니다.

  • • DeepSeek-V4-Pro는 구성 가능한 추론 노력 수준(reasoning effort levels)과 함께 API를 통해 사용할 수 있습니다.
  • • 오픈소스 에이전트 프레임워크인 DeepSeek Harness v0.1이 출시되었습니다.
  • • 2024년 8월 16일부터 새로운 피크 및 오프피크 API 가격이 적용되며, 비용이 크게 인상되었습니다.
  • • V4-Pro는 OpenAI Responses API 및 Codex 통합을 기본적으로 지원합니다.

개발자들은 이제 전체 V4-Pro 모델과 새로운 에이전트 프레임워크를 사용할 수 있으며, 확정된 가격 체계를 통해 API 사용 비용 증가에 대한 명확성을 확보하게 되었습니다.

SOURCES

4. Qwen 3.8 출시: 프롬프트 제어 추론 및 타사 Jinja 수정 사항 포함

Qwen 3.8은 코딩, 장기 작업 및 에이전트 실행 능력이 향상되었습니다. 공식 채팅 템플릿은 대화 기록 오염 및 에이전트 중단과 같은 문제를 겪고 있지만, 커뮤니티에서 개발한 Jinja 템플릿이 이러한 버그를 해결하고 기능적인 사고 토글 및 KV 캐시 최적화를 가능하게 합니다.

  • • Qwen 3.8은 Qwen 3.5 아키텍처를 기반으로 구축된 2.4조 파라미터의 Mixture-of-Experts 모델입니다.
  • • 이 모델은 SGLang 및 vLLM을 포함한 배포 프레임워크를 지원합니다.
  • • 새로운 reasoning_effort 매개변수를 통해 개발자가 추론 깊이(xhigh, medium, low)를 제어할 수 있습니다.
  • • Hugging Face의 타사 Jinja 템플릿은 사고 기능 비활성화 시 발생하는 충돌 및 도구 호출 실패를 포함한 공식 템플릿 버그를 수정합니다.
  • • 수정된 템플릿은 KV 캐시 최적화, 범용 도구 파싱 및 llama.cpp --reasoning-preserve 플래그에 대한 기본 지원을 제공합니다.

개발자들은 세밀한 추론 제어가 가능한 2.4조 파라미터 MoE 모델을 배포할 수 있으며, 수정된 템플릿을 사용하여 충돌 및 도구 호출 실패를 방지할 수 있습니다.

SOURCES

5. 280B 오픈 웨이트 MoE 모델 'dots3-note preview' 출시

dots3-note preview 모델은 멀티모달 이해력과 방대한 컨텍스트 윈도우를 오픈 웨이트 생태계에 도입합니다. 16B의 활성 파라미터만을 사용하여 로컬 또는 자체 호스팅 추론 비용을 관리하면서도 고품질의 추론 및 에이전트 실행을 제공하는 것을 목표로 합니다.

  • • dots3-note preview는 dots3 제품군에서 처음으로 출시된 오픈 웨이트 모델입니다.
  • • 이 모델은 총 280B 파라미터와 16B 활성 파라미터를 사용하는 Mixture-of-Experts 아키텍처를 사용합니다.
  • • 최대 512K 토큰의 컨텍스트 길이를 지원하며 텍스트, 이미지, 비디오 및 오디오를 이해합니다.
  • • 지시 이행, 논리적 추론, 도구 사용 및 에이전트 워크플로우에 최적화되어 있습니다.
  • • 성능, 지연 시간 및 비용의 균형을 맞추기 위해 dots3 제품군 중 가장 가벼운 모델로 설계되었습니다.

개발자들은 에이전트 워크플로우, 코드 생성 및 저지연 추론에 최적화된 대규모 멀티모달 오픈 웨이트 모델을 사용할 수 있게 되었습니다.

SOURCES

6. 단일 헤드 멀티태스크 비전 모델 'SenseNova-Vision 7B' 출시

5천만 개의 지시-응답 쌍 데이터셋으로 학습된 SenseNova-Vision은 전통적인 컴퓨터 비전 작업을 단일 생성 프레임워크로 통합합니다. 매우 뛰어난 성능을 자랑하지만, 웹 데모를 실행하려면 최소 80GB VRAM의 GPU가 필요하며 벤치마킹에는 8x80GB GPU 구성이 필요합니다.

  • • SenseNova-Vision은 Apache 2.0 라이선스로 출시된 7B Mixture-of-Tokens(MoT) 모델입니다.
  • • 이 모델은 다양한 컴퓨터 비전 작업을 단일 생성 문제로 처리하여 특수 예측 헤드를 제거했습니다.
  • • 자연어 지시와 시각적 힌트를 받아 바운딩 박스, OCR 텍스트, 세그멘테이션 마스크 또는 깊이 맵을 출력합니다.
  • • 다중 뷰 3D 재구성 및 카메라 포즈 추정을 포함한 고급 기능을 지원합니다.
  • • 모델 가중치, 학습 파이프라인 및 데이터 준비 도구는 GitHub와 Hugging Face에서 사용할 수 있습니다.

개발자들은 자연어 지시와 시각적 힌트를 통해 다양한 비전 작업을 처리할 수 있는 단일 Apache 2.0 라이선스 모델을 배포할 수 있습니다.

SOURCES

7. Mistral, OCR 4.1 공개 미리보기로 기능 확장

Mistral OCR 4 문서 이해 모델의 초기 출시를 기반으로, Mistral은 버전 4.1을 공개 미리보기로 출시했습니다. 이번 업데이트는 기본 단락 수준 바운딩 박스 추출 및 구조적 블록 레이블을 도입하여 문서 파싱 API를 개선했으며, RAG 파이프라인을 위한 문서 레이아웃 처리에 대해 개발자에게 더 세밀한 제어 권한을 제공합니다.

  • • OCR 4.1은 2026년 7월 16일부터 공개 미리보기로 제공됩니다.
  • • 기본 단락 수준 바운딩 박스 추출 및 구조적 블록 레이블을 도입했습니다.
  • • 저품질 추출 필터링을 돕기 위해 블록 수준 신뢰도 점수를 추가했습니다.
  • • 가격은 1,000페이지당 3.5유로, 또는 주석이 달린 1,000페이지당 4.38유로로 책정되었습니다.

이번 업데이트는 개발자들에게 더 정확한 구조적 데이터와 블록 수준의 신뢰도 점수를 제공하여, 초기 OCR 4 릴리스보다 더 나은 필터링과 향상된 문서 파싱 정확도를 가능하게 합니다.

SOURCES

8. Writer, 기업용 에이전트를 위한 Palmyra X6 744B MoE 모델 출시

Palmyra X6 모델과 함께 Writer는 재구축된 에이전트 오케스트레이션 하니스와 관리자가 에이전트 사용량을 모니터링하고 워크플로우를 분석하며 지출 한도를 설정할 수 있는 새로운 거버넌스 도구를 도입했습니다. 내부 평가에서 Palmyra X6는 0.87점을 기록하여 Claude Sonnet 4.6 및 GPT-5.5를 포함한 여러 프론티어 모델을 능가했습니다.

  • • Palmyra X6는 Z.ai의 오픈 웨이트 GLM-5.2를 기반으로 사후 학습된 7,440억 파라미터 Mixture-of-Experts 모델입니다.
  • • 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 8달러입니다.
  • • Writer는 이 모델이 이전 모델보다 52% 낮은 비용, 48% 빠른 속도, 10% 높은 품질로 작동한다고 주장합니다.
  • • 이 모델은 626개의 합성 에이전트 궤적에 대해 앵커링 지도 미세 조정(ASFT)을 사용하여 학습되었습니다.
  • • 업데이트된 에이전트 오케스트레이션 하니스는 비용을 41% 절감하고 작업 완료 속도를 44% 향상시킨다고 보고되었습니다.

기업용 에이전트를 구축하는 개발자들은 토큰 비용과 실행 지연 시간을 줄이기 위해 설계된 고도로 최적화된 대규모 MoE 모델을 활용할 수 있습니다.

SOURCES

9. 자연어를 셸 명령어로 번역하는 미세 조정된 Qwen2.5-Coder-1.5B

이 프로젝트는 소형 모델에 대한 작업별 미세 조정의 힘을 보여줍니다. 1.5B 파라미터 모델을 셸 명령어에 특화함으로써, 개발자는 표준 노트북 CPU에서 즉시 실행될 만큼 작은 크기를 유지하면서 훨씬 더 큰 모델과 경쟁할 수 있는 성능을 달성했습니다. 개발자는 모델에 정적 안전 검사가 부족하여 파괴적인 명령어를 생성할 수 있다고 경고합니다.

  • • 이 모델은 125,000개의 자연어/명령어 쌍으로 학습된 미세 조정된 Qwen2.5-Coder-1.5B입니다.
  • • Q4_K_M으로 양자화된 결과물인 941MB 파일은 llama.cpp를 통해 실행되며 1.6GB의 RAM을 사용합니다.
  • • i5-11320H 노트북 CPU(4 스레드)에서 초당 31.9토큰, 중앙값 쿼리 시간 0.59초를 달성합니다.
  • • InterCode-ALFA 벤치마크에서 0.620점을 기록하여 미세 조정되지 않은 Qwen2.5-Coder-7B(0.613)를 능가했습니다.
  • • 가중치는 Hugging Face에, 소스 코드는 Apache-2.0 라이선스로 GitHub에 공개되었습니다.

개발자들은 최소한의 지연 시간과 메모리 점유율로 표준 노트북 하드웨어에서 로컬로 경량화된 고도로 전문화된 코딩 모델을 실행할 수 있습니다.

SOURCES

10. 더 빠르고 저렴한 코딩 에이전트 'Bullet' 출시

6번의 피벗 끝에 창업자 Adi와 Alex가 개발한 Bullet은 Claude Code와 같은 기존 도구의 속도와 효율성 문제에 대응하기 위해 설계되었습니다. 개발자들은 라운드 트립을 줄이는 것이 원시 모델 속도보다 에이전트 성능에 훨씬 더 중요하다는 것을 파악하여 고도로 최적화된 턴 관리 아키텍처를 구축했습니다.

  • • Bullet은 SWE-bench Verified에서 500개 작업 중 479개(95.8%)를 단 한 번의 시도로 해결했으며, 작업당 평균 119초가 소요되었습니다.
  • • 내부 측정 결과 이전 에이전트 방식 대비 라운드 트립이 16% 감소하고 비용이 27% 절감되었습니다.
  • • Bullet은 Fable 또는 Sol과 결합된 mini-SWE-agent보다 35~67% 더 빠른 것으로 보고되었습니다.
  • • 이 에이전트는 모델 라우팅, 타겟팅된 코드 검색 및 공격적인 컨텍스트 위생을 통해 성능을 최적화합니다.
  • • Bullet은 codewithbullet.com에서 사용할 수 있습니다.

개발자들은 토큰 비용을 낮추면서 단 한 번의 시도로 SWE-bench Verified 작업의 95.8%를 해결하는 더 빠른 코딩 에이전트를 채택할 수 있습니다.

SOURCES

11. Cloudflare에서 오픈소스 MCP 샌드박스 출시

커뮤니티 챌린지의 일환으로 개발된 이 새로운 오픈소스 프로젝트는 MCP에 최적화된 완전한 기능의 샌드박스 환경을 제공합니다. 이는 개발자들에게 MCP 호환 도구 및 서버를 테스트하고 배포할 수 있는 자체 호스팅 대안을 제공합니다.

  • • 이 프로젝트는 Cloudflare에서 호스팅되는 완전한 샌드박스 환경을 특징으로 합니다.
  • • 자체 호스팅을 지원하며 완전한 Model Context Protocol(MCP) 지원을 포함합니다.
  • • 이 도구는 DCR(Developer Control Representation) 및 API 문서를 제공합니다.
  • • 이 프로젝트는 swyx가 제기한 챌린지에 대한 응답으로 개발되었습니다.

개발자들은 내장된 API 문서와 함께 MCP 서버를 테스트하고 실행할 수 있는 가볍고 자체 호스팅 가능한 샌드박스 환경을 얻게 됩니다.

SOURCES

12. Netlify AI Gateway, OpenRouter 통합 및 에이전트 러너 확장

Netlify와 OpenRouter의 파트너십은 개발자를 위한 다중 모델 라우팅을 단순화합니다. Netlify는 이러한 모델을 에이전트 러너에 통합하고 AXIS 평가 프레임워크를 활용함으로써, 개발자가 성능과 비용의 균형을 맞출 수 있도록 돕습니다. 예를 들어, GPT 5.6 Sol을 저노력 모드로 기본 설정하여 Claude Opus에 대한 경제적인 대안을 제공합니다.

  • • Netlify의 AI Gateway는 이제 OpenRouter에서 사용할 수 있는 모든 모델을 지원합니다.
  • • 에이전트 러너는 Kimi K3, GLM 5.2, DeepSeek V4와 같은 프론티어 코딩 모델을 포함하도록 확장되었습니다.
  • • Netlify는 에이전트 러너를 위한 새로운 에이전트 선택지로 오픈소스 OpenCode 모델을 도입했습니다.
  • • 이 플랫폼은 오픈소스 AXIS 프레임워크를 사용하여 기능 및 크레딧 효율성을 기준으로 코딩 에이전트를 평가합니다.
  • • Netlify의 테스트에서 DeepSeek V4 Flash 0731은 가장 적은 크레딧(실행당 2.4)을 소비한 반면, Claude Opus 5는 최대 1,055 크레딧을 소비했습니다.

Netlify에 배포하는 개발자들은 이제 모든 OpenRouter 모델에 액세스하고 DeepSeek V4 및 GLM 5.2와 같은 고급 코딩 에이전트를 실행할 수 있습니다.

SOURCES

13. Artificial Analysis, 사용자 지정 모델 벤치마킹을 위한 Optima 출시

Artificial Analysis에 따르면, AI 도입 조직의 90%가 사용자 지정 벤치마크의 필요성을 인식하고 있지만, 복잡성 때문에 이를 구축한 곳은 5% 미만입니다. Optima는 회사의 연구 플랫폼을 활용하여 모든 개발 팀이 사용자 지정 평가에 접근할 수 있도록 함으로써 이러한 장벽을 낮추는 것을 목표로 합니다.

  • • Optima를 사용하면 파일, Hugging Face 데이터셋 또는 Arize AI, Braintrust, Langfuse의 에이전트 추적을 사용하여 벤치마크를 구축할 수 있습니다.
  • • 사용자는 사용 사례를 설명하고 입력 및 출력 예시를 제공하여 벤치마크를 정의할 수 있습니다.
  • • 이 플랫폼은 여러 모델에서 동시에 벤치마크를 실행하고 업데이트된 리더보드를 유지하는 것을 지원합니다.
  • • 평가는 객관적인 루브릭 또는 GDPval-AA 및 AA-Briefcase와 같은 쌍대 비교 방식을 통해 지원됩니다.
  • • 이 플랫폼은 모델 효율성을 비교하기 위해 성능, 작업당 비용 및 작업당 시간을 추적합니다.

개발자들은 일반적인 벤치마크에서 벗어나 특정 프로덕션 워크로드에 대해 모델을 평가하고 비용, 지연 시간 및 정확도를 추적할 수 있습니다.

SOURCES

14. 연구 결과, AI 생성 MCP 커넥터의 신뢰성 격차 확인

Claude Code와 같은 AI 코딩 도우미는 코드를 빠르게 스캐폴딩할 수 있지만, CData의 평가는 엔터프라이즈급 통합을 위해 AI에만 의존하는 것의 한계를 강조합니다. 연구 결과는 MCP 서버가 프로덕션 준비 상태임을 보장하기 위해 개발자가 여전히 엄격한 감독과 수동 엔지니어링을 제공해야 함을 시사합니다.

  • • CData는 엔터프라이즈 MCP 신뢰성에 중요한 8가지 차원에서 AI 생성 데이터 커넥터를 평가했습니다.
  • • 이 연구는 OAuth 토큰 수명 주기 관리에서 상당한 신뢰성 격차를 확인했습니다.
  • • AI 생성 커넥터는 대규모 데이터셋을 처리할 때 성능과 신뢰성 문제로 어려움을 겪었습니다.
  • • 전문가의 지도는 커넥터 성능을 향상시켰지만 프로덕션 준비 신뢰성을 일관되게 보장하지는 못했습니다.

AI 코딩 도구로 MCP 서버를 구축하는 개발자들은 특히 OAuth 토큰 수명 주기 및 대규모 데이터셋 처리와 같은 중요한 프로덕션 요구 사항을 수동으로 검증해야 합니다.

SOURCES

15. Pi, 코딩 에이전트 컨텍스트 제한 관리를 위해 압축(Compaction) 구현

Pi의 압축 메커니즘은 장기 실행 에이전트 세션에서 상태를 관리하는 휴대 가능하고 읽기 쉬운 방법을 제공합니다. 중요한 컨텍스트를 성공적으로 보존하지만, 개발자는 기록 접두사를 변경하면 후속 요청이 다시 계산되어 프롬프트 캐싱이 깨진다는 점에 유의해야 합니다. 사용자는 사용자 지정 압축 프롬프트로 확장을 만들어 이 동작을 사용자 지정할 수 있습니다.

  • • 압축은 컨텍스트 제한에 가까워지면 자동으로 트리거되거나 /compact 명령을 통해 수동으로 트리거됩니다.
  • • 이 프로세스는 구조화된 '컨텍스트 요약 도우미' 시스템 프롬프트와 함께 전용 LLM 요청을 사용합니다.
  • • 결과 요약은 목표, 진행 상황 및 주요 결정에 대한 일반 텍스트 섹션으로 구조화됩니다.
  • • Pi는 압축 중에 기본적으로 최근 메시지의 20,000토큰(약 5~20턴)을 유지합니다.
  • • 압축은 대화 기록 접두사를 변경하기 때문에 기존 프롬프트 캐싱을 깨뜨립니다.

개발자들은 컨텍스트 윈도우를 초과하지 않고 장기 실행 세션을 유지하기 위해 자체 에이전트 런타임에 유사한 압축 패턴을 구현할 수 있습니다.

SOURCES

16. Anthropic, 모델 학습을 위한 Claude 출력 사용 약관 명확화

Anthropic의 라이선스 약관은 경쟁 모델 학습과 비경쟁 모델 학습 사이에 명확한 선을 긋습니다. 개발자가 Claude를 사용하여 경쟁 범용 LLM을 부트스트랩할 수는 없지만, 생성된 출력을 사용하여 콘텐츠 분류, 정보 추출 및 이상 탐지와 같은 기능을 위한 소규모 작업별 모델을 미세 조정하는 것은 자유롭습니다.

  • • Anthropic은 Claude의 출력을 사용하여 범용 챗봇이나 경쟁적인 오픈 엔드 텍스트 생성 모델을 학습시키는 것을 금지합니다.
  • • 사용자는 감정 분석, 요약 및 의미론적 검색과 같은 비경쟁 모델을 학습시키기 위해 출력을 사용하는 것이 허용됩니다.
  • • 제품 기능, 데이터 분석 및 내부 워크플로우를 위한 애플리케이션에 출력을 통합하는 것은 완전히 허용됩니다.
  • • Anthropic은 이러한 학습 제한을 조건으로 사용자가 입력으로부터 생성된 출력에 대한 소유권을 갖도록 허용합니다.
  • • 회사는 이러한 제한의 주요 이유로 안전 문제와 인프라 투자 보호를 꼽습니다.

개발자들은 Anthropic의 라이선스 약관을 위반하지 않고 Claude 출력을 사용하여 감정 분석이나 요약과 같은 작업별 모델을 안전하게 미세 조정할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.