Inference Brew

OpenAI, 관리형 Codex Harness를 포함한 Agents API 퍼블릭 베타 출시

00:00 / --:--

← 메인으로

OpenAI, 관리형 Codex Harness를 포함한 Agents API 퍼블릭 베타 출시

1. OpenAI, 관리형 Codex Harness를 포함한 Agents API 퍼블릭 베타 출시

OpenAI의 새로운 Agents API는 긴 세션에 대한 자동 컨텍스트 압축, 효율적인 도구 사용, 하위 에이전트 위임 등 에이전트 오케스트레이션의 복잡한 작업을 처리합니다. 코드를 실행하고 파일을 편집하며 MCP 서버에 연결하는 통합 인터페이스를 제공함으로써, 이 API는 신뢰할 수 있는 에이전트를 구축하는 데 필요한 상용구 코드를 줄여줍니다. 가격은 기본 모델의 API 요금과 호스팅된 샌드박스 및 도구에 대한 추가 비용으로 책정됩니다.

  • • Agents API는 OpenAI 내부에서 사용하는 것과 동일한 Codex Harness 및 인프라를 개발자에게 제공합니다.
  • • 개발자는 OpenAI 관리형 샌드박스, 자체 인프라 또는 9개의 파트너 샌드박스에서 에이전트 연산을 실행할 수 있습니다.
  • • 파트너 샌드박스에는 Vercel, E2B, Modal, Cloudflare, Daytona, DigitalOcean, Blaxel, Runloop, Oracle이 포함됩니다.
  • • API는 에이전트(Agent), 환경(Environment), 세션(Session), 이벤트 및 항목(Events and items)이라는 4가지 핵심 개념으로 구성됩니다.
  • • 데이터 상주 지역은 현재 미국으로 제한되며, 데이터 무보존(ZDR)은 지원되지 않습니다.

개발자가 OpenAI의 관리형 인프라와 파트너 샌드박스를 사용하여 지속 가능한 클라우드 에이전트를 구축하고 배포할 수 있게 합니다.

SOURCES

2. DeepSeek, 업데이트된 DeepSeek-V4.1-Flash 모델 출시

2026년 5월에 출시된 기존 DeepSeek-V4 Flash 모델을 기반으로 하는 새로운 V4.1-Flash는 Causal Encoder-Decoder 설계와 고급 Compressed Sparse Attention 2(CSA2)를 도입하여 메모리 효율성을 더욱 최적화했습니다. 이 업데이트는 FP4 양자화를 활용하여 KV 캐시 점유율을 토큰당 890바이트로 줄임으로써 이전 V4 Pro 시리즈보다 에이전트 및 코딩 작업에서 뛰어난 성능을 발휘합니다.

  • • DeepSeek-V4.1-Flash는 552B 파라미터의 멀티모달 Mixture-of-Experts 모델입니다.
  • • 프리필(prefill) 시 8B, 디코드(decode) 시 16B의 활성 파라미터를 사용하는 1M 토큰 컨텍스트 윈도우를 특징으로 합니다.
  • • 향상된 KV 캐시 효율성을 위해 Compressed Sparse Attention 2(CSA2)와 FP4 양자화를 구현했습니다.
  • • 에이전트, 코딩 및 사이버 보안 벤치마크에서 이전 DeepSeek V4 Pro 0813을 능가합니다.
  • • vLLM, SGLang, Transformers 및 퍼블릭 API를 통해 MIT 라이선스로 제공됩니다.

초기 V4 Flash 릴리스에 비해 긴 컨텍스트 애플리케이션의 메모리 오버헤드를 크게 낮춘, 더 효율적인 업그레이드된 멀티모달 모델을 제공합니다.

3. Cognition, FrontierCode에서 50% 점수를 기록한 SWE-2 코딩 모델 출시

Cognition의 SWE-2는 Kimi K3 베이스를 기반으로 하며 에이전트 코딩을 위한 광범위한 강화 학습을 거쳤습니다. 모든 추론 노력 수준을 단일 실행으로 학습함으로써 이 모델은 비용-성능 경계를 최적화하여, SWE-2 미디엄 모델이 SWE-1.7보다 58% 적은 턴을 사용하고 평균 81% 낮은 비용으로 더 나은 성능을 내도록 합니다. 공개 가중치나 독립형 API 엔드포인트는 없지만, 개발자는 Devin 제품군을 통해 즉시 모델에 액세스할 수 있습니다.

  • • SWE-2는 Kimi K3에서 사후 학습된, 토큰당 104B 활성 파라미터를 가진 2.8T 파라미터 Mixture-of-Experts 모델입니다.
  • • 이 모델은 FrontierCode 1.1 벤치마크에서 50.0점을 기록하여 Claude Fable 5.1과 동일한 성능을 64% 낮은 비용으로 제공합니다.
  • • 오늘부터 Devin Desktop, CLI, Devin Web 및 Fusion에서 사용할 수 있으며, 공개 가중치나 토큰당 API 가격은 없습니다.
  • • SWE-2는 추론을 위해 NVFP4 및 FP8 커널을 사용하며, 처리량을 10~20% 향상시키는 프리필 딜레이어(prefill delayer)를 포함합니다.
  • • 이 모델은 모든 추론 노력 수준을 단일 실행으로 최적화하는 강화 학습 알고리즘을 사용하여 학습되었습니다.

Devin을 사용하는 개발자는 비용-성능 경계를 최적화하는 훨씬 저렴하고 효율적인 에이전트 코딩 모델을 사용할 수 있습니다.

4. AI Sage, Gated DeltaNet을 탑재한 GigaChat-3.5-Reasoning 출시

GigaChat-3.5-Reasoning은 Gated DeltaNet을 활용하여 긴 컨텍스트 시나리오에서 높은 효율성을 달성합니다. CISPO를 사용하여 도메인별 전문가를 학습시킨 후 단일 모델로 증류하여 개발되었으며, 수학, 코딩 및 추론 작업을 위한 강력한 오픈 가중치 대안을 제공합니다. MIT 라이선스가 적용된 가중치는 현재 Hugging Face에서 이용 가능합니다.

  • • GigaChat-3.5-Reasoning은 Gated DeltaNet을 특징으로 하는 432B-A28B Mixture-of-Experts 모델입니다.
  • • 이 모델은 온-폴리시(on-policy) 증류를 통해 코드, 수학 및 일반 지식 분야의 도메인 전문가를 증류하여 학습되었습니다.
  • • 추론 추적에서 37% 적은 토큰을 사용하면서 DeepSeek V4 Flash Preview와 유사한 성능을 보입니다.
  • • 모델 가중치는 MIT 라이선스 하에 Hugging Face에서 이용 가능합니다.
  • • 이 모델은 giga.chat의 웹 인터페이스를 통해서도 액세스할 수 있습니다.

개발자는 추론 추적에 훨씬 적은 토큰을 사용하면서도 최첨단 성능과 일치하는 고효율 추론 모델을 자체 호스팅할 수 있습니다.

SOURCES

5. 공격적 보안 및 에이전트 코딩을 위한 CyberTiel 35B-A3B 출시

CyberTiel은 실제 소프트웨어 엔지니어링 문제를 목표로 하며, 제작자는 이 모델이 Qwen3.8-27b보다 훨씬 짧은 시간에 코드베이스 문제를 해결하는 데 있어 Opus 4.6 미디엄을 능가한다고 주장합니다. 일반적인 세계 지식을 희생함으로써 이 모델은 전문화된 코딩 및 보안 작업에 대한 유용성을 극대화합니다. 개발자는 새로 출시된 GGUF 및 MLX 형식을 사용하여 로컬에서 모델을 실행할 수 있습니다.

  • • CyberTiel은 TielCoder 베이스를 기반으로 하는 검열되지 않은 35B-A3B 코더 모델입니다.
  • • 이 모델은 공격적 보안 연구 및 에이전트 소프트웨어 엔지니어를 위해 특별히 설계되었습니다.
  • • 엄선된 사이버 보안 및 소프트웨어 엔지니어링 코퍼스로 학습된 개선된 imatrix를 사용하여 양자화되었습니다.
  • • 로컬 배포를 위해 GGUF 및 MLX 버전의 모델이 Hugging Face에서 제공됩니다.
  • • 이 모델은 일반적인 세계 지식보다 코딩 능력을 우선시하며 익명의 연구자에 의해 개발되었습니다.

보안 중심 개발자들에게 실제 코드베이스 문제에서 더 큰 모델보다 뛰어난 성능을 발휘하는 고도로 전문화된, 검열되지 않은 로컬 모델을 제공합니다.

SOURCES

6. 맞춤형 UI 요소 생성을 위한 OUI-1 모델 출시

OUI-1은 장황한 표준 웹 형식이 아닌 OpenUI-Lang으로 학습하여 사용자 인터페이스 요소를 생성하는 효율적인 방법을 도입했습니다. 이 DSL 중심 접근 방식은 UI 서식 지정에 일반적으로 필요한 시스템 프롬프트 오버헤드를 크게 줄여줍니다. 그러나 기본 DiffusionGemma 아키텍처가 llama.cpp 지원을 결여하고 있어 로컬에서 모델을 실행하려는 개발자는 어려움을 겪을 것입니다.

  • • OUI-1은 DiffusionGemma를 미세 조정하여 Hugging Face에 업로드된 모델입니다.
  • • 이 모델은 HTML, Markdown 또는 React 대신 사용자 지정 도메인 특정 언어인 OpenUI-Lang을 사용합니다.
  • • DSL에 대한 미세 조정은 시스템 프롬프트와 비교하여 컨텍스트 윈도우 오버헤드를 줄이도록 설계되었습니다.
  • • DiffusionGemma는 현재 llama.cpp에서 지원되지 않아 Ollama와 같은 도구를 통한 로컬 실행이 제한됩니다.

토큰 사용량을 줄이는 전문화된 UI 생성 접근 방식을 제공하지만, 현재 llama.cpp 호환성으로 인해 로컬 배포가 제한적입니다.

SOURCES

7. LandingAI, DPT-3 모델을 탑재한 Agentic Document Extraction Gen2 출시

LandingAI의 ADE Gen2는 평면적인 청킹(chunking)에서 계층적 트리 구조로 전환함으로써 문서 처리의 주요 변화를 나타냅니다. 이를 통해 검증 가능한 접지를 통해 정밀한 데이터 추출이 가능합니다. 이 릴리스는 정식 출시되었으며 AWS, Azure, Google Cloud, Snowflake 및 온프레미스를 포함한 유연한 배포 옵션을 지원하며, 혼합 워크로드에서 25%에서 80%의 비용 절감이 예상됩니다.

  • • ADE Gen2는 DPT-3 Pro 및 DPT-3 Verity를 포함하는 새로운 DPT-3 모델 제품군을 기반으로 구축되었습니다.
  • • 이 시스템은 문서를 트리 구조로 처리하고 원자적 접지를 제공하여 데이터를 특정 단어나 라인으로 추적합니다.
  • • DPT-3 Verity는 단어 수준의 신뢰도를 갖춘 결정론적 전사를 제공하며, DPT-3 Pro는 복잡한 레이아웃과 필기를 처리합니다.
  • • 가격은 페이지당 3크레딧의 고정 모델에서 페이지당 요금과 출력 문자 요금을 합산하는 방식으로 변경되었습니다.
  • • Gen1 클라이언트 코드는 Gen2 엔드포인트와 호환되지 않으므로 기존 사용자는 마이그레이션이 필요합니다.

개발자는 라인 수준의 접지를 통해 매우 정밀한 문서 파싱을 얻을 수 있지만, 기존 클라이언트 코드를 새로운 비호환 엔드포인트로 마이그레이션해야 합니다.

SOURCES

8. Redis, LangCache 관리형 의미론적 캐싱 서비스 출시

Redis LangCache는 LLM을 호출하기 전에 의미론적 캐시를 검색하고 이후 응답을 저장하는 2단계 호출 루프로 작동합니다. 프롬프트의 정확한 텍스트가 아닌 의도를 일치시킴으로써 이 서비스는 동적 사용자 입력에 대한 캐시 적중률을 극대화합니다. Redis는 고객 데이터가 자체 서버에 유지되며 모델 학습에 절대 사용되지 않음을 보장합니다.

  • • Redis LangCache는 Redis Cloud에서 퍼블릭 프리뷰로 제공되는 관리형 의미론적 캐싱 서비스입니다.
  • • 이 서비스는 전용 Python 및 JavaScript SDK가 포함된 REST API를 통해 액세스할 수 있습니다.
  • • 의미론적 의미를 기반으로 프롬프트를 일치시켜 표준 LLM 쿼리보다 최대 15배 빠르게 캐시 적중을 반환합니다.
  • • 구성 가능한 유사성 임계값, TTL, 제거 정책 및 적응형 정밀도 제어 기능을 포함합니다.
  • • 초기 고객인 Mangoes.ai는 70%의 캐시 적중률과 70%의 LLM 지출 감소를 보고했습니다.

Redis Cloud에서의 관리형 의미론적 캐싱을 통해 LLM API 비용과 응답 지연 시간을 줄여줍니다.

SOURCES

9. Sentry, LLM 워크플로우 디버깅을 위한 에이전트 추적 도구 도입

Sentry의 새로운 에이전트 추적 기능은 비결정론적 AI 워크플로우의 관찰 가능성 문제를 해결합니다. 에이전트 실행 단계를 매핑함으로써 개발자는 잘못된 출력을 특정 도구 호출이나 프롬프트 실패로 쉽게 추적할 수 있습니다. 이 도구는 Slack 및 GitHub Actions와 같은 다양한 환경에서 디버깅을 시연하는 라이브 워크숍에서 소개되었습니다.

  • • Sentry의 에이전트 추적 도구는 잘못된 도구 호출, 잘못된 출력 및 설명되지 않은 토큰 지출과 같은 문제를 진단합니다.
  • • 이 도구를 통해 개발자는 에이전트가 정확히 어디에서 중단되는지, 그리고 관련된 운영 비용이 얼마인지 식별할 수 있습니다.
  • • Sentry는 Slack 에이전트, 전자상거래 챗봇, GitHub Action을 포함한 라이브 에이전트에서 이 도구를 시연했습니다.
  • • 개발자는 모니터링 및 분석을 위해 자신의 맞춤형 에이전트를 Sentry 플랫폼에 통합할 수 있습니다.

개발자에게 에이전트 실행 경로에 대한 깊은 가시성을 제공하여 실패 지점을 정확히 찾아내고 토큰 지출을 최적화할 수 있게 합니다.

SOURCES

10. NVIDIA, Pi 코딩 에이전트 최적화를 위한 SoL-Pi 확장 기능 출시

NVIDIA의 SoL-Pi 확장 기능은 Pi 코딩 에이전트의 성능을 최적화하는 비침습적인 방법을 제공합니다. 진단 로그를 압축하는 Evidence-Preserving Reducer 및 윈도우 압박을 관리하는 Online Context Compact와 같은 기능을 구현함으로써, 이 확장 기능은 불필요한 토큰 교환을 최소화합니다. 모든 메커니즘은 선택 사항이며 기본적으로 비활성화되어 있으므로 개발자는 특정 워크플로우에 맞게 최적화를 선택적으로 적용할 수 있습니다.

  • • SoL-Pi는 Pi 코딩 에이전트의 효율성을 향상시키기 위해 설계된 독립형 확장 기능입니다.
  • • 이 확장 기능은 소스 코드를 패치하지 않고 퍼블릭 API를 사용하여 수정되지 않은 Pi 릴리스 위에 설치됩니다.
  • • Action Fusion, ObservationPack, Evidence-Preserving Reducer, Online Context Compact라는 4가지 선택적 메커니즘을 포함합니다.
  • • Action Fusion은 편집 또는 쓰기 작업과 동일한 도구 호출에서 유효성 검사 명령을 실행합니다.
  • • ObservationPack은 큰 텍스트 결과를 페이징된 리콜이 가능한 안정적인 핸들로 변환하여 토큰 트래픽을 줄입니다.

Pi 에이전트를 사용하는 개발자가 선택적 최적화 메커니즘을 통해 추론 비용과 지연 시간을 크게 낮출 수 있게 합니다.

SOURCES

11. 관리형 에이전트 자격 증명 관리를 위한 LangSmith Connections 출시

에이전트 워크플로우에서 자격 증명을 관리하는 것은 역사적으로 보안 병목 현상이었습니다. LangSmith Connections는 OAuth 및 공유 API 키를 처리하는 구조화된 방법을 제공하여 이 문제를 해결합니다. 이를 통해 에이전트는 엄격한 보안 경계와 감사 추적을 유지하면서 티켓 제출이나 외부 데이터베이스 쿼리와 같은 인증된 작업을 수행할 수 있습니다.

  • • LangSmith Connections는 AI 에이전트를 위해 설계된 관리형 자격 증명 관리 시스템입니다.
  • • 이 시스템은 웹 검색과 같은 공유 작업을 위해 에이전트 소유의 자격 증명을 지원합니다.
  • • 사용자 소유의 OAuth 설정을 지원하여 에이전트가 개별 사용자를 대신하여 안전하게 행동할 수 있도록 합니다.
  • • 이 시스템은 배포된 에이전트의 보안과 기능적 역량을 모두 향상시키는 것을 목표로 합니다.

웹 검색을 수행하거나 티켓을 제출하는 자율 에이전트를 위한 API 키 및 OAuth 토큰 관리의 보안 문제를 해결합니다.

SOURCES

12. ZeroModels, 멀티 백엔드 추론을 위한 Keras 3 사전 학습 모델 출시

ZeroModels는 애플리케이션에 멀티모달 기능을 통합하는 개발자를 위한 간소화된 대안을 제공합니다. Keras 3를 활용함으로써 이 컬렉션은 배포 환경에 따라 JAX, PyTorch 또는 TensorFlow에서 모델이 원활하게 실행되도록 합니다. 트랜스포머와 같은 무거운 런타임 종속성이 없기 때문에 리소스가 제한적이거나 고도로 최적화된 프로덕션 파이프라인에 매우 적합합니다.

  • • ZeroModels는 전적으로 Keras 3로 구축된 사전 학습 모델 컬렉션입니다.
  • • 지원되는 작업에는 이미지 분류, 객체 탐지, 세그멘테이션, 깊이 추정 및 음성 인식이 포함됩니다.
  • • 코드베이스는 JAX, PyTorch 및 TensorFlow 백엔드와 완전히 호환됩니다.
  • • 이 컬렉션은 런타임 시 트랜스포머나 torch 라이브러리가 필요하지 않습니다.

개발자가 무거운 런타임 라이브러리 오버헤드 없이 다양한 백엔드에 걸쳐 경량 비전 및 음성 모델을 배포할 수 있게 합니다.

SOURCES

13. Cherenkov 추론 엔진, Apple Silicon에서 로컬 MoE 모델 최적화

Cherenkov는 로컬 하드웨어에서 대규모 Mixture-of-Experts 모델을 실행할 때 발생하는 메모리 제한 문제를 해결합니다. 어떤 전문가가 필요할지 예측하고 SSD에서 즉시 스트리밍함으로써, 이 엔진은 전체 모델을 RAM에 로드하는 것을 방지합니다. 이러한 예측 스트리밍 접근 방식은 32GB MacBook Air와 같이 메모리가 제한된 장치에서도 물리적 메모리 제한을 초과할 모델을 실행할 수 있게 합니다.

  • • Cherenkov는 Apple Silicon을 위해 특별히 설계된 추론 엔진입니다.
  • • 이 엔진은 예측 전문가 스트리밍을 사용하여 통합 메모리에서 전문가의 제한된 작업 세트를 유지합니다.
  • • 1계층 룩어헤드(lookahead)를 활용하여 필요한 전문가를 예측하고 SSD 읽기를 미리 시작합니다.
  • • SSD 읽기 시간이 충분하지 않은 경우 더 작은 Q3 또는 Q2 양자화로 대체할 수 있습니다.
  • • 32GB M4 MacBook Air에서 Qwen3.8-Flash-Next를 실행하여 초당 8-22 토큰을 달성했습니다.

필요에 따라 SSD에서 전문가를 스트리밍하여 소비자용 Mac에서 대규모 Mixture-of-Experts 모델을 로컬로 실행할 수 있게 합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.