Inference Brew

OpenAIがRealtime APIをアップデート、gpt-realtime-2.1および2.1-miniをリリース

00:00 / --:--

← ホームへ戻る

OpenAIがRealtime APIをアップデート、gpt-realtime-2.1および2.1-miniをリリース

1. OpenAIがRealtime APIをアップデート、gpt-realtime-2.1および2.1-miniをリリース

OpenAIは、5月にリリースされたGPT-Realtime-2を基盤として、Realtime APIの2.1バージョンを公開しました。今回のアップデートには新しいminiバリアントが含まれており、オーディオキャッシュの最適化によりp95レイテンシが25%削減されるなど、大幅なパフォーマンス向上が図られています。また、推論の努力レベル(reasoning effort)の設定や、キャッシュされたオーディオ入力に対する競争力のある価格設定も導入され、低レイテンシの音声アプリケーション向けの機能がさらに洗練されました。

  • OpenAIはGPT-Realtime-2シリーズのアップデートとして、gpt-realtime-2.1およびgpt-realtime-2.1-miniをリリースしました。
  • 新しいモデルは、オーディオキャッシュの改善によりp95レイテンシを25%削減しました。
  • miniモデルは、推論の努力レベルを設定可能なネイティブツール使用および関数呼び出しをサポートしています。
  • キャッシュされたオーディオ入力の新しい価格は100万トークンあたり0.30ドルに設定されており、通常のオーディオ入力よりも大幅に低価格です。

開発者は、改善されたレイテンシと新しいminiモデルを活用することで、従来のGPT-Realtime-2よりもコスト効率が高く、応答性に優れた音声エージェントを構築できるようになります。

SOURCES

2. NVIDIAがNemotron-Labs-3-Puzzle-75B-A9Bをリリース

NVIDIAは、高スループットのローカル推論向けに構築された、圧縮・最適化済みのモデル「Nemotron-Labs-3-Puzzle-75B-A9B」を発表しました。親モデルである120Bモデルに「Iterative Puzzle」フレームワークを適用することで、強力な推論能力を維持しつつ、アクティブパラメータ数を9.3Bまで削減しました。このモデルのハイブリッドアーキテクチャはMamba、MoE、Attention層を組み合わせており、B200ノードで2倍のスループット向上を実現し、単一のH100 GPUで最大8つの100万トークンリクエストを同時に処理可能です。

  • Nemotron-Labs-3-Puzzle-75B-A9Bは、Iterative Puzzle圧縮フレームワークを使用してNemotron-3-Super-120B-A12Bから派生しました。
  • ハイブリッドアーキテクチャは、Mamba、MoE、Attention層をインターリーブし、Multi-Token Predictionを採用しています。
  • アクティブパラメータを9.3B(12.8Bから)、総パラメータを75.3B(120.7Bから)に削減しました。
  • 8xB200ノードにおいて、親モデルと比較して約2倍のサーバースループットを実現します。
  • 100万トークンのワークロードにおける単一H100の同時実行数は、1から8リクエストに増加しました。
  • 商用利用が可能で、英語、スペイン語、中国語など複数の言語をサポートしています。

開発者は、ローカルでの推論ワークロードを実行する際、標準的なGPUノード上で大幅に高い同時実行数とスループットを達成できます。

SOURCES

3. Gepard 1.0: vLLMネイティブのオープンソース・ストリーミングTTS

Gepard 1.0は、リアルタイム会話AI向けに最適化された、ストリーミングファーストのオープンソース音声合成(TTS)モデルとしてリリースされました。Qwen3.5バックボーンとNemo NanoCodecを基盤とするこの555Mパラメータのモデルは、約50msという極めて短い初回音声生成時間を実現し、ゼロショット音声クローン作成もサポートしています。vLLMネイティブであるため、開発者は既存のLLMサービングインフラストラクチャと容易に統合でき、エンタープライズハードウェア上で最大256の並列ストリームという高い同時実行性を実現可能です。

  • Gepard 1.0は、Apache 2.0ライセンスでリリースされた555MパラメータのストリーミングTTSモデルです。
  • Qwen3.5 0.8BバックボーンとNemo NanoCodecを利用し、ゼロショット音声クローンをサポートしています。
  • vLLMを使用し、NVIDIA RTX 5090上で50msの初回音声生成時間(TTFA)と20倍のリアルタイム係数(RTF)を達成しています。
  • 単一のRTX Pro 6000 Blackwell GPUで最大256の並列シーケンスを処理可能です。
  • 英語、スペイン語、ポルトガル語、オランダ語をサポートし、Seed-TTS-eval NISQA-MOSベンチマークで4.25を記録しました。

音声エージェントを構築する開発者は、vLLMとネイティブに統合されたモデルを使用することで、ほぼ瞬時の高品質な音声合成を実現できます。

SOURCES

4. AnthropicがClaude CoworkをWebおよびモバイルへ拡大、クラウド実行に対応

Anthropicは既存のClaude Coworkエージェントを拡張し、継続的なクラウドベースのタスク実行をサポートするWeb版およびモバイル版をリリースしました。このアップデートにより、ユーザーはデスクトップセッションをアクティブに保つことなく、バックグラウンドでマルチステップのエージェントワークフローを実行できるようになり、デバイスをまたいで人間による承認が必要なタスクのリアルタイム通知を受け取ることが可能になります。

  • Claude Coworkは、Maxプランのサブスクライバー向けにWeb、iOS、Androidでベータ版として利用可能になりました。
  • タスクはデフォルトでクラウド上で実行されるようになり、ユーザーのデバイスがオフラインの間も自律的な実行が可能です。
  • ローカルファイルへのアクセスが必要なタスクについては、引き続きデスクトップクライアントが利用可能です。
  • Anthropicは、2026年8月までClaude Sonnet 5モデルの導入価格と、Coworkサブスクライバー向けの拡張利用枠を提供しています。

この拡張により、長時間実行されるエージェントタスクのためにローカルマシンの稼働を維持する必要がなくなり、非同期のビジネスおよび運用ワークフローにおけるClaude Coworkの有用性が大幅に向上します。

5. 2026年中盤におけるCLIコーディングエージェントの現状

2026年中盤のコマンドラインコーディングエージェントの評価では、ターミナルベースのAIアシスタントの成熟した状況が浮き彫りになりました。この分析では、Claude Code、Codex CLI、Omp、OpenCodeを標準的な開発者ワークフローで比較しています。Claude Code、Codex CLI、Ompは、コードベースの読み取りや編集の実行において同等の能力を発揮しますが、権限プロンプトやワークスペースのクリーンさといった運用面で違いが見られます。OpenCodeは出力品質で劣るものの、幅広いモデル互換性を求める開発者にとっては依然として有効な選択肢です。

  • Claude Code、Codex CLI、Ompは、リポジトリの読み取り、ファイルの編集、チェックの実行といった主要タスクにおいて同等のパフォーマンスを示します。
  • これらのツールは、タスクの明確さ、リポジトリの衛生状態、実行権限の管理方法において大きく異なります。
  • OpenCodeは、他の3つの主要なCLIエージェントと比較して、出力品質が低いことが判明しました。
  • OpenCodeは、より多様な基盤モデルと統合できる柔軟性が評価されています。

開発者は、日々の開発ワークフローにどのターミナルベースのコーディングアシスタントを統合すべきか、情報に基づいた判断を下すことができます。

SOURCES

6. docx-cliがAIエージェントによるWord文書の効率的な編集を支援

Microsoft Word文書の扱いは、生のOOXMLの複雑さゆえに、これまでAIエージェントにとって大きな課題でした。オープンソースのdocx-cliツールは、.docxファイルをエージェントが容易に解析・編集できる注釈付きMarkdownおよびプレーンコマンドに変換することで、この問題を解決します。ベンチマークによると、docx-cliを使用することで文書の破損を防ぐだけでなく、トークン消費量を2.5倍削減し、タスクの成功率を大幅に向上させることが示されています。このツールは、Claude CodeやCodexなどの一般的なエージェントフレームワークとシームレスに統合されます。

  • docx-cliを使用すると、AIエージェントは生のOOXMLではなく、プレーンコマンドと注釈付きMarkdownを使用して.docxファイルを読み書きできます。
  • ベンチマークでは、Sonnetモデル層がdocx-cliを使用して100%の成功率(6/6タスク)を達成し、トークン消費量を2.5倍削減しました。
  • docx-cliで生成された36件の文書出力はすべてMicrosoft Wordで正常に開けましたが、デフォルトのスキルを使用した場合は5件が失敗しました。
  • 変更履歴の追跡、表の操作、画像の挿入、文書レンダリングなどの高度な機能をサポートしています。
  • Claude Code、Codex、Piなどのエージェントハーネスと互換性があり、npmまたはスタンドアロンバイナリ経由でインストール可能です。

文書処理エージェントを構築する開発者は、生のOOXML操作をクリーンなMarkdownコマンドに置き換えることで、APIコストを大幅に削減し、フォーマットの破損を排除できます。

SOURCES

7. VisionBridge Proxyがテキスト専用LLMに画像サポートを追加

VisionBridgeは、テキスト専用LLMとマルチモーダルタスクの間のギャップを埋める巧妙なオープンソースプロキシです。OpenAI互換サーバーとして動作するVisionBridgeは、画像入力をインターセプトし、テキストモデルに対してツール呼び出し機能(OCR、クロッピング、スキャンなど)を公開します。テキストモデルは、必要な視覚データを収集するために、別の専用視覚モデルにクエリを送信します。これにより、開発者は微調整やカスタムモデルのトレーニングを行うことなく、高性能なテキスト専用推論モデルに画像処理機能を追加できます。

  • VisionBridgeは、MITライセンスの下で提供されるOpenAI互換プロキシです。
  • look、OCR、cropなどの関数を使用して別の視覚モデルにクエリを送信することで、テキスト専用モデルが画像を解釈できるようにします。
  • モデルのトレーニング、重みの調整、複雑なパイプラインのセットアップは一切不要です。

開発者は、モデルの微調整や重みの変更を行うことなく、テキスト専用の推論モデルをアップグレードして視覚入力を処理させることができます。

SOURCES

8. Rowboat: Claude Desktopに代わるオープンソースのローカルファーストな代替手段

Rowboatは、Claude Desktopに代わるオープンソースのローカルファーストな代替手段として立ち上げられました。Apache-2.0ライセンスの下で提供されるRowboatは、単一のチャットウィンドウではなく、メール、会議メモ、コーディングといった専用の作業面を中心にAIとの対話を整理します。すべてのデータはローカルにプレーンなMarkdownとして保存され、Agent Client Protocolを使用してClaude CodeやCodexなどのコーディングエージェントを調整します。開発者は、任意のローカルまたはクラウドベースのLLMを接続し、Rowboatのローカルメモリやツール統合にフックするカスタムWebインターフェースを構築できます。

  • RowboatはApache-2.0ライセンスのオープンソースであり、すべてのデータをローカルにプレーンなMarkdownファイルとして保存します。
  • メール作成、会議メモ、ブラウザナビゲーション、並列コーディングのための専用作業面を備えています。
  • 並列コーディングモードでは、Agent Client Protocolを使用してClaude CodeまたはCodexのインスタンスを調整します。
  • OllamaやLM Studio経由のローカルモデルを含むあらゆるLLMをサポートし、開発者はカスタムのWebベース作業面を構築できます。

開発者は、Claude CodeやCodexの組み込みサポートを備えた任意のLLMを使用して、カスタムのローカルファーストなAIワークフローを構築・実行できます。

SOURCES

9. Liquid AIが推論ループを停止させる「Antidoom」をオープンソース化

Liquid AIは、推論モデルが同じテキストブロックを繰り返し出力する「ドゥームループ」という失敗モードを解決するために設計された事後学習手法「Antidoom」をオープンソース化しました。モデル全体を再学習するのではなく、AntidoomのFinal Token Preference Optimization(FTPO)は、ループを引き起こす最初のトークンの重みを分離・調整し、モデルを首尾一貫した代替パスへと誘導します。この軽量なパイプラインはわずか数時間で実行可能であり、開発者がデプロイ前にローカル推論モデルを安定させるための実用的な手段を提供します。

  • AntidoomはFinal Token Preference Optimization(FTPO)を使用して、反復ループを開始する特定のトークンのみをターゲットにして再学習します。
  • パイプラインは非常に効率的で、8x MI325 GPUで約1時間のデータ生成と、単一GPUで1〜2時間の学習が必要です。
  • Qwen 3.5 4BモデルにAntidoomを適用したところ、貪欲サンプリングにおけるドゥームループ率が22.9%からわずか1%に減少しました。
  • 初期のLFM 2.5 2.6Bチェックポイントでのテストでは、ループ率が10.2%から1.4%に減少しました。
  • この手法は事後学習の修復ツールとして機能し、以前の能力を損なうことなく、正しい回答を出力するモデルの能力を回復させます。

ローカル推論モデルを微調整またはデプロイする開発者は、この手法を適用することで、モデルが無限のテキスト生成ループに陥るのを防ぐことができます。

SOURCES

10. Jacobian Lensをローカル・クラウド間のモデルルーティングに適用

AnthropicのJacobian Lens解釈可能性研究をオープンソースモデルに適用することで、実用的なローカル・クラウド間ルーティングメカニズムが実現しました。推論中にGemma 4のようなモデルの内部「ワークスペース軌跡」を分析することで、ある研究者は、競合するトークン候補がモデルの層の深くまで持続する「霧のかかった(foggy)」内部状態を検出する軽量なロジスティック回帰ルーターを構築しました。ルーターがこれらの状態を検出すると、自動的にクラウド上のより大きなモデルへフォールバックし、自信満々のローカルハルシネーションを防ぎつつAPIコストを最小限に抑えます。

  • この手法は、Gemma 4バリアントやQwen 3.6 27Bを含むオープンソースモデルでテストされました。
  • 内部ワークスペース軌跡の特徴を分析した結果、霧のかかった状態(複数の候補トークンが層の深部で競合する状態)は、自信満々だが誤った回答と相関していることが明らかになりました。
  • これらの内部特徴で学習されたロジスティック回帰ルーターは、Gemmaモデルの誤り予測において、単純な出力信頼度スコアよりも優れた性能を発揮しました。
  • このルーターは、すでに適切に調整された出力信頼度を備えているQwen 27Bの予測精度は向上させませんでした。
  • コード、デモ、および事前学習済みルーターは、GitHubおよびHugging Faceでオープンソース化されています。

開発者は、デフォルトでローカルでクエリを実行し、内部状態が不確実性を示した場合にのみ自動的にクラウドAPIへエスカレーションする、非常にコスト効率の高いハイブリッドアーキテクチャを構築できます。

SOURCES

11. mistral.rs v0.9.0がCPUデコードでllama.cppを上回る

ローカル推論エンジン「mistral.rs」がバージョン0.9.0にアップデートされ、CPUパフォーマンスに焦点が当てられました。AVX2、AVX512、ARM NEON命令セットに対するハードウェア固有の最適化を実装することで、llama.cppと比較して最大1.8倍のデコード速度向上を実現しています。さらに、今回のアップデートではIn-Situ Quantization(ISQ)システムが導入され、開発者はHugging Faceから非量子化モデルを直接ロードして実行しつつ、実行時にオンザフライで量子化することでメモリを節約できるようになりました。

  • mistral.rs v0.9.0は、Qwen3 4B Q4_Kを実行する際、llama.cppよりも最大1.8倍高速なCPUデコードを実現します。
  • このエンジンは、x86 CPU(AVX2およびAVX512)とARM CPU(NEON)向けに詳細な最適化が施されています。
  • パフォーマンス上の利点は、測定されたすべてのコンテキスト深度で維持されました。
  • このリリースには、Hugging Faceから直接モデルを実行できるIn-Situ Quantization(ISQ)システムが含まれています。

CPUのみの環境でローカルモデルをデプロイする開発者は、最大1.8倍のデコード速度向上を達成できます。

SOURCES

12. Kokoro TTSがCPUフレンドリーなコンテナ化APIに対応

NVIDIA GPU向けに最適化された82MパラメータのKokoro TTSモデルの初期リリースを基盤として、ローカルデプロイを簡素化する新しい「Kokoro-FastAPI」コンテナがリリースされました。この5GBのイメージはOpenAI互換の音声APIを提供し、開発者は専用のGPUハードウェアを必要とせずに、標準的なCPU上のローカルスタックにモデルを統合できます。

  • Kokoro TTSのデプロイオプションを、GPU専用からCPUフレンドリーなコンテナ化環境へと拡大しました。
  • 既存のアプリケーションへの統合を容易にするOpenAI互換の音声APIを提供します。
  • テストおよびデプロイ用のWeb UIが組み込まれています。
  • AMD Ryzen 7やApple M2 Proなどのコンシューマー向けCPUで効率的なパフォーマンスを発揮することがベンチマークで示されています。

この開発によりKokoroモデルのアクセシビリティが拡大し、開発者はコンシューマーグレードのハードウェア上で低レイテンシの自己ホスト型音声合成をデプロイできるようになります。

SOURCES

13. Hy3-1MがGGUFおよびllama.cpp経由でローカル実行可能に

7月6日のTencentのHy3 MoEモデルのリリースを基盤として、オープンソースコミュニティがローカル推論を可能にしました。GGUF量子化がHugging Faceで利用可能になり、プルリクエスト#25395を通じてllama.cppへのサポートが追加されました。NVIDIA RTX 5090でのベンチマークでは、毎秒10〜11トークンの生成速度を達成しています。

  • Hy3-1MのGGUF量子化がHugging Faceで利用可能になりました。
  • llama.cppがプルリクエスト#25395を通じてモデルをサポートしました。
  • 96GB RAMを搭載したNVIDIA RTX 5090でのローカル推論は、毎秒10〜11トークンに達します。

開発者は、標準的なローカル推論ツールを使用して、コンシューマーハードウェア上でHy3モデルを自己ホストできるようになりました。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。