Inference Brew

OpenAI, GPT-Realtime-2.1 및 2.1-mini로 Realtime API 업데이트

00:00 / --:--

← 메인으로

OpenAI, GPT-Realtime-2.1 및 2.1-mini로 Realtime API 업데이트

1. OpenAI, GPT-Realtime-2.1 및 2.1-mini로 Realtime API 업데이트

OpenAI는 지난 5월 출시된 GPT-Realtime-2 모델을 기반으로 Realtime API의 2.1 버전을 출시했습니다. 이번 업데이트에는 새로운 미니 모델이 포함되었으며, 최적화된 오디오 캐싱을 통해 p95 지연 시간을 25% 단축하는 등 성능이 크게 향상되었습니다. 또한 추론 노력(reasoning effort) 설정 기능과 캐시된 오디오 입력에 대한 경쟁력 있는 가격 정책을 도입하여 저지연 음성 애플리케이션의 기능을 한층 더 개선했습니다.

  • OpenAI는 GPT-Realtime-2 시리즈의 업데이트로 gpt-realtime-2.1과 gpt-realtime-2.1-mini를 출시했습니다.
  • 새로운 모델들은 향상된 오디오 캐싱을 통해 p95 지연 시간을 25% 단축했습니다.
  • 미니 모델은 추론 노력 설정이 가능한 네이티브 도구 사용 및 함수 호출을 지원합니다.
  • 캐시된 오디오 입력에 대한 새로운 가격은 100만 토큰당 0.30달러로, 일반 오디오보다 훨씬 저렴합니다.

개발자들은 향상된 지연 시간과 새로운 미니 모델을 활용하여 기존 GPT-Realtime-2보다 더 비용 효율적이고 반응성이 뛰어난 음성 에이전트를 구축할 수 있게 되었습니다.

SOURCES

2. NVIDIA, Nemotron-Labs-3-Puzzle-75B-A9B 출시

NVIDIA는 고처리량 로컬 추론을 위해 구축된 압축 및 배포 최적화 모델인 Nemotron-Labs-3-Puzzle-75B-A9B를 선보였습니다. Iterative Puzzle 프레임워크를 상위 120B 모델에 적용하여 활성 매개변수 수를 9.3B로 줄이면서도 강력한 추론 능력을 유지했습니다. 이 모델의 하이브리드 아키텍처는 Mamba, MoE, Attention 레이어를 결합하여 B200 노드에서 처리량을 2배 향상시켰으며, 단일 H100 GPU로 최대 8개의 100만 토큰 요청을 동시에 처리할 수 있습니다.

  • Nemotron-Labs-3-Puzzle-75B-A9B는 Iterative Puzzle 압축 프레임워크를 사용하여 Nemotron-3-Super-120B-A12B에서 파생되었습니다.
  • 하이브리드 아키텍처는 Mamba, MoE, Attention 레이어와 다중 토큰 예측(Multi-Token Prediction)을 결합했습니다.
  • 활성 매개변수를 9.3B(기존 12.8B)로, 총 매개변수를 75.3B(기존 120.7B)로 줄였습니다.
  • 8xB200 노드에서 상위 모델 대비 약 2배 높은 서버 처리량을 제공합니다.
  • 100만 토큰 작업에 대한 단일 H100 동시성이 1개에서 8개로 증가했습니다.
  • 상업적 이용이 가능하며 영어, 스페인어, 중국어를 포함한 다국어를 지원합니다.

개발자들은 로컬 추론 작업을 실행할 때 표준 GPU 노드에서 훨씬 더 높은 동시성과 처리량을 달성할 수 있습니다.

SOURCES

3. Gepard 1.0: 오픈 소스, vLLM 네이티브 스트리밍 TTS

Gepard 1.0은 실시간 대화형 AI에 최적화된 오픈 소스 스트리밍 우선 텍스트 음성 변환 모델로 출시되었습니다. Qwen3.5 백본과 Nemo NanoCodec을 기반으로 하는 이 5억 5,500만 매개변수 모델은 약 50ms의 매우 짧은 첫 오디오 생성 시간(TTFA)을 달성하며 제로샷 음성 복제를 지원합니다. vLLM 네이티브 모델이기 때문에 개발자는 기존 LLM 서빙 인프라와 함께 쉽게 배포할 수 있으며, 엔터프라이즈 하드웨어에서 최대 256개의 병렬 스트림을 처리하는 높은 동시성을 구현할 수 있습니다.

  • Gepard 1.0은 Apache 2.0 라이선스로 출시된 5억 5,500만 매개변수 스트리밍 TTS 모델입니다.
  • Qwen3.5 0.8B 백본과 Nemo NanoCodec을 활용하며 제로샷 음성 복제를 지원합니다.
  • vLLM을 통해 NVIDIA RTX 5090에서 50ms의 첫 오디오 생성 시간(TTFA)과 20배의 실시간 계수(RTF)를 달성합니다.
  • 단일 RTX Pro 6000 Blackwell GPU로 최대 256개의 병렬 시퀀스를 처리할 수 있습니다.
  • 영어, 스페인어, 포르투갈어, 네덜란드어를 지원하며 Seed-TTS-eval NISQA-MOS 벤치마크에서 4.25점을 기록했습니다.

음성 에이전트를 구축하는 개발자들은 vLLM과 네이티브로 통합되는 모델을 사용하여 거의 즉각적이고 고품질인 음성 합성을 구현할 수 있습니다.

SOURCES

4. Anthropic, Claude Cowork을 클라우드 실행 기반의 웹 및 모바일로 확장

기존 Claude Cowork 에이전트를 기반으로 Anthropic은 연속적인 클라우드 기반 작업 실행을 지원하는 웹 및 모바일 버전을 출시했습니다. 이번 업데이트를 통해 사용자는 활성 데스크톱 세션을 유지하지 않고도 백그라운드에서 다단계 에이전트 워크플로우를 실행할 수 있으며, 기기 전반에서 인간의 승인이 필요한 작업에 대해 실시간 알림을 받을 수 있습니다.

  • Claude Cowork은 현재 Max 플랜 구독자를 대상으로 웹, iOS, Android에서 베타 버전으로 제공됩니다.
  • 작업이 기본적으로 클라우드에서 실행되므로 사용자의 기기가 오프라인 상태일 때도 자율적인 실행이 가능합니다.
  • 로컬 파일 액세스가 필요한 작업을 위해 데스크톱 클라이언트는 계속 제공됩니다.
  • Anthropic은 2026년 8월까지 Claude Sonnet 5 모델에 대한 도입 가격과 Cowork 구독자를 위한 확장된 사용 할당량을 제공합니다.

이번 확장을 통해 장시간 실행되는 에이전트 작업을 위해 로컬 기기를 계속 켜둘 필요가 없어졌으며, 비동기식 비즈니스 및 운영 워크플로우에서 Claude Cowork의 활용도가 크게 향상되었습니다.

5. 2026년 중반 CLI 코딩 에이전트 현황

2026년 중반 터미널 기반 코딩 에이전트에 대한 평가를 통해 성숙해가는 AI 어시스턴트 환경을 조명합니다. 이 분석은 Claude Code, Codex CLI, Omp, OpenCode를 표준 개발자 워크플로우 전반에서 비교합니다. Claude Code, Codex CLI, Omp는 코드베이스 읽기 및 편집 실행 측면에서 유사한 기능을 제공하지만, 권한 프롬프트나 작업 공간 정리와 같은 운영 세부 사항에서는 차이를 보입니다. OpenCode는 출력 품질 면에서 다소 뒤처지지만, 폭넓은 모델 호환성을 원하는 개발자에게는 여전히 유효한 대안입니다.

  • Claude Code, Codex CLI, Omp는 저장소 읽기, 파일 편집, 검사 실행과 같은 핵심 작업에서 비슷한 성능을 보여줍니다.
  • 이 도구들은 작업 명확성, 저장소 관리, 실행 권한을 관리하는 방식에서 큰 차이를 보입니다.
  • OpenCode는 다른 세 가지 주요 CLI 에이전트에 비해 품질이 낮은 결과를 생성하는 것으로 나타났습니다.
  • OpenCode는 더 다양한 기반 모델과 통합할 수 있는 유연성이 특징입니다.

개발자들은 일상적인 개발 워크플로우에 어떤 터미널 기반 코딩 어시스턴트를 통합할지 정보에 입각한 결정을 내릴 수 있습니다.

SOURCES

6. docx-cli, AI 에이전트의 효율적인 Word 문서 편집 지원

Microsoft Word 문서는 원시 OOXML의 복잡성 때문에 AI 에이전트에게 큰 어려움이었습니다. 오픈 소스 docx-cli 도구는 .docx 파일을 에이전트가 쉽게 파싱하고 편집할 수 있는 주석이 달린 마크다운 및 일반 명령으로 변환하여 이 문제를 해결합니다. 벤치마크에 따르면 docx-cli를 사용하면 문서 손상을 방지할 뿐만 아니라 토큰 소비량을 2.5배 줄이고 작업 성공률을 크게 높일 수 있습니다. 이 도구는 Claude Code 및 Codex와 같은 인기 있는 에이전트 프레임워크와 원활하게 통합됩니다.

  • docx-cli를 사용하면 AI 에이전트가 원시 OOXML 대신 일반 명령과 주석이 달린 마크다운을 사용하여 .docx 파일을 읽고 편집할 수 있습니다.
  • 벤치마크에서 Sonnet 모델 계층은 docx-cli를 사용하여 100%의 성공률(6/6 작업)을 달성했으며 토큰 소비량은 2.5배 적었습니다.
  • docx-cli를 통해 생성된 36개의 문서 출력물 모두가 Microsoft Word에서 성공적으로 열렸으며, 기본 기술을 사용했을 때는 5건의 오류가 발생했습니다.
  • 이 도구는 변경 내용 추적, 표 조작, 이미지 삽입, 문서 렌더링과 같은 고급 기능을 지원합니다.
  • Claude Code, Codex, Pi와 같은 에이전트 하네스와 호환되며 npm 또는 독립형 바이너리를 통해 설치할 수 있습니다.

문서 처리 에이전트를 구축하는 개발자들은 원시 OOXML 조작을 깔끔한 마크다운 명령으로 대체함으로써 API 비용을 대폭 절감하고 서식 손상을 방지할 수 있습니다.

SOURCES

7. VisionBridge Proxy, 텍스트 전용 LLM에 이미지 지원 추가

VisionBridge는 텍스트 전용 LLM과 멀티모달 작업 사이의 간극을 메워주는 영리한 오픈 소스 프록시입니다. OpenAI 호환 서버로 작동하는 VisionBridge는 이미지 입력을 가로채고 텍스트 모델에 도구 호출 함수(OCR, 자르기, 스캔 등)를 노출합니다. 그러면 텍스트 모델이 별도의 전용 비전 모델에 쿼리를 보내 필요한 시각적 데이터를 수집합니다. 이를 통해 개발자는 미세 조정이나 맞춤형 모델 학습 없이도 고성능 텍스트 전용 추론 모델에 이미지 처리 기능을 추가할 수 있습니다.

  • VisionBridge는 MIT 라이선스로 제공되는 OpenAI 호환 프록시입니다.
  • 보기(look), OCR, 자르기(crop)와 같은 함수를 사용하여 별도의 비전 모델에 쿼리함으로써 텍스트 전용 모델이 이미지를 해석할 수 있게 합니다.
  • 모델 학습, 가중치 조정 또는 복잡한 파이프라인 설정이 필요하지 않습니다.

개발자들은 미세 조정이나 모델 가중치 수정 없이도 텍스트 전용 추론 모델을 업그레이드하여 시각적 입력을 처리할 수 있습니다.

SOURCES

8. Rowboat: Claude Desktop의 오픈 소스, 로컬 우선 대안

Rowboat는 Claude Desktop의 오픈 소스, 로컬 우선 대안으로 출시되었습니다. Apache-2.0 라이선스를 따르는 Rowboat는 단일 채팅 창이 아닌 이메일, 회의록, 코딩 등 전용 작업 표면을 중심으로 AI 상호작용을 구성합니다. 모든 데이터를 로컬에 일반 마크다운으로 저장하며, Agent Client Protocol을 사용하여 Claude Code나 Codex와 같은 코딩 에이전트를 조정합니다. 개발자는 모든 로컬 또는 클라우드 기반 LLM을 연결하고 Rowboat의 로컬 메모리 및 도구 통합과 연동되는 맞춤형 웹 기반 인터페이스를 구축할 수 있습니다.

  • Rowboat는 Apache-2.0 라이선스의 오픈 소스이며 모든 데이터를 로컬에 일반 마크다운 파일로 저장합니다.
  • 이메일 작성, 회의록, 브라우저 탐색, 병렬 코딩을 위한 전용 작업 표면을 제공합니다.
  • 병렬 코딩 모드는 Agent Client Protocol을 사용하여 Claude Code 또는 Codex 인스턴스를 조정합니다.
  • Ollama나 LM Studio를 통한 로컬 모델을 포함하여 모든 LLM을 지원하며, 개발자가 맞춤형 웹 기반 작업 표면을 구축할 수 있습니다.

개발자들은 Claude Code 및 Codex에 대한 내장 지원을 통해 모든 LLM을 사용하여 맞춤형 로컬 우선 AI 워크플로우를 구축하고 실행할 수 있습니다.

SOURCES

9. Liquid AI, 추론 루프를 방지하는 Antidoom 오픈 소스화

Liquid AI는 추론 모델이 동일한 텍스트 블록을 반복적으로 출력하는 '둠 루프' 실패 모드를 해결하기 위해 설계된 사후 학습 기술인 Antidoom을 오픈 소스로 공개했습니다. 전체 모델을 재학습하는 대신, Antidoom의 최종 토큰 선호도 최적화(FTPO)는 루프를 유발하는 첫 번째 토큰의 가중치를 분리하고 조정하여 모델을 일관된 대안 경로로 유도합니다. 이 경량 파이프라인은 단 몇 시간 만에 실행할 수 있어 개발자가 배포 전 로컬 추론 모델을 안정화할 수 있는 실용적인 방법을 제공합니다.

  • Antidoom은 최종 토큰 선호도 최적화(FTPO)를 사용하여 반복적인 루프를 시작하는 특정 토큰만 타겟팅하여 재학습합니다.
  • 파이프라인은 매우 효율적이며 8x MI325 GPU에서 약 1시간의 데이터 생성과 단일 GPU에서 1~2시간의 학습이 필요합니다.
  • Qwen 3.5 4B 모델에 Antidoom을 적용하여 탐욕적 샘플링(greedy-sampling) 둠 루프 비율을 22.9%에서 1%로 줄였습니다.
  • 초기 LFM 2.5 2.6B 체크포인트 테스트에서 루프 비율을 10.2%에서 1.4%로 줄였습니다.
  • 이 방법은 사후 학습 복구 도구로서, 이전 기능을 잃지 않으면서 모델이 올바른 답변을 출력하는 능력을 복원합니다.

로컬 추론 모델을 미세 조정하거나 배포하는 개발자들은 이 방법을 적용하여 모델이 무한 텍스트 생성 루프에 빠지는 것을 방지할 수 있습니다.

SOURCES

10. 로컬-클라우드 모델 라우팅에 적용된 Jacobian Lens

오픈 소스 모델에 Anthropic의 Jacobian Lens 해석 가능성 연구를 적용하여 실용적인 로컬-클라우드 라우팅 메커니즘을 도출했습니다. 추론 중 Gemma 4와 같은 모델의 내부 '작업 공간 궤적'을 분석하여, 경쟁하는 토큰 후보가 모델 레이어 깊숙이 지속되는 '안개 낀(foggy)' 내부 상태를 감지하는 경량 로지스틱 회귀 라우터를 구축했습니다. 라우터가 이러한 상태를 감지하면 자동으로 더 큰 클라우드 모델로 전환하여 API 비용을 최소화하면서 자신감 있는 로컬 환각을 방지합니다.

  • 이 방법론은 Gemma 4 변형 및 Qwen 3.6 27B를 포함한 오픈 소스 모델에서 테스트되었습니다.
  • 내부 작업 공간 궤적 기능을 분석한 결과, 안개 낀 상태(여러 후보 토큰이 레이어 깊숙이 경쟁하는 상태)가 자신감 있지만 잘못된 답변과 상관관계가 있음이 밝혀졌습니다.
  • 이러한 내부 기능에 대해 학습된 로지스틱 회귀 라우터는 Gemma 모델의 오류 예측에서 단순 출력 신뢰도 점수보다 뛰어난 성능을 보였습니다.
  • 라우터는 이미 잘 보정된 출력 신뢰도를 갖춘 Qwen 27B에 대한 예측은 개선하지 못했습니다.
  • 코드, 데모 및 사전 학습된 라우터는 GitHub와 Hugging Face에 오픈 소스로 공개되었습니다.

개발자들은 기본적으로 로컬에서 쿼리를 실행하고 내부 상태가 높은 불확실성을 나타낼 때만 자동으로 클라우드 API로 확장하는 매우 비용 효율적인 하이브리드 아키텍처를 구축할 수 있습니다.

SOURCES

11. mistral.rs v0.9.0, CPU 디코딩에서 llama.cpp 능가

로컬 추론 엔진 mistral.rs가 CPU 성능에 초점을 맞춘 0.9.0 버전으로 업데이트되었습니다. AVX2, AVX512 및 ARM NEON 명령어 세트에 대한 하드웨어별 최적화를 구현하여 llama.cpp 대비 최대 1.8배 빠른 디코딩 속도를 달성했습니다. 또한, 이번 업데이트에는 In-Situ Quantization(ISQ) 시스템이 도입되어 개발자가 Hugging Face에서 비양자화 모델을 직접 로드하고 실행하는 동시에 즉석에서 양자화하여 메모리를 절약할 수 있습니다.

  • mistral.rs v0.9.0은 Qwen3 4B Q4_K 실행 시 llama.cpp보다 최대 1.8배 빠른 CPU 디코딩 속도를 제공합니다.
  • 이 엔진은 x86 CPU(AVX2 및 AVX512)와 ARM CPU(NEON)에 대한 세밀한 최적화를 특징으로 합니다.
  • 측정된 모든 컨텍스트 깊이에서 성능 우위가 유지되었습니다.
  • 이번 릴리스에는 Hugging Face에서 모델을 직접 실행할 수 있는 In-Situ Quantization(ISQ) 시스템이 포함되어 있습니다.

CPU 전용 환경에서 로컬 모델을 배포하는 개발자들은 최대 1.8배 더 빠른 디코딩 속도를 달성할 수 있습니다.

SOURCES

12. Kokoro TTS, CPU 친화적인 컨테이너화 API 획득

NVIDIA GPU에 최적화된 82M 매개변수 Kokoro TTS 모델의 초기 릴리스를 기반으로, 로컬 배포를 간소화하기 위해 새로운 Kokoro-FastAPI 컨테이너가 출시되었습니다. 이 5GB 이미지는 OpenAI 호환 음성 API를 제공하여 개발자가 전용 GPU 하드웨어 없이도 표준 CPU의 로컬 스택에 모델을 통합할 수 있게 합니다.

  • Kokoro TTS 배포 옵션을 GPU 전용에서 CPU 친화적인 컨테이너화 환경으로 확장합니다.
  • 기존 애플리케이션에 더 쉽게 통합할 수 있도록 OpenAI 호환 음성 API를 제공합니다.
  • 테스트 및 배포를 위한 내장 웹 UI가 포함되어 있습니다.
  • 벤치마크는 AMD Ryzen 7 및 Apple M2 Pro와 같은 소비자용 CPU에서 효율적인 성능을 보여줍니다.

이번 개발은 Kokoro 모델의 접근성을 확장하여 개발자가 소비자용 하드웨어에서 저지연, 자체 호스팅 음성 합성을 배포할 수 있게 합니다.

SOURCES

13. Hy3-1M, GGUF 및 llama.cpp를 통해 로컬 실행 가능

7월 6일 Tencent의 Hy3 MoE 모델 출시를 기반으로, 오픈 소스 커뮤니티에서 이제 로컬 추론을 지원하게 되었습니다. GGUF 양자화 버전은 Hugging Face에서 이용할 수 있으며, pull request #25395를 통해 llama.cpp에 지원이 추가되었습니다. NVIDIA RTX 5090에서의 벤치마크 결과, 이 모델은 초당 10~11 토큰의 속도를 달성합니다.

  • Hy3-1M에 대한 GGUF 양자화 버전을 이제 Hugging Face에서 이용할 수 있습니다.
  • llama.cpp는 이제 pull request #25395를 통해 이 모델을 지원합니다.
  • 96GB RAM을 탑재한 NVIDIA RTX 5090에서의 로컬 추론은 초당 10-11 토큰에 도달합니다.

개발자들은 이제 표준 로컬 추론 도구를 사용하여 소비자용 하드웨어에서 Hy3 모델을 자체 호스팅할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.