Inference Brew

OpenAI、Cerebras搭載のGPT-5.6 Solに「Ultrafast」ティアを追加

00:00 / --:--

← ホームへ戻る

OpenAI、Cerebras搭載のGPT-5.6 Solに「Ultrafast」ティアを追加

1. OpenAI、Cerebras搭載のGPT-5.6 Solに「Ultrafast」ティアを追加

OpenAIは7月に導入した「Fast mode」をさらに発展させ、GPT-5.6 Sol向けの「Ultrafast」ティアのプレビューを開始しました。CerebrasのWafer-Scale Engineを搭載したこのティアは、標準的な処理の14倍となる毎秒750出力トークンを実現しており、現在はエンタープライズ評価向けにウェイティングリスト形式で提供されています。

  • • 新しい「Ultrafast」ティアは、CerebrasのWafer-Scale Engineアーキテクチャを採用。
  • • 性能は毎秒750出力トークンに達し、標準処理と比較して14倍の高速化を実現。
  • • GDP-Valベンチマークにおいて、エンドツーエンドで5.6倍の高速化を実証。
  • • 現在はウェイティングリストを通じて、一部の顧客のみが利用可能。

この新ティアは既存の「Fast mode」から飛躍的な性能向上を実現しており、リアルタイム音声や高速なエージェントワークフローにおいて、ほぼゼロレイテンシでの運用を可能にします。

2. Google、Gemini 3.6 Flashの後継としてGemini 3.7 Flashを発表

2026年7月のGemini 3.6 Flashリリースに続き、GoogleはGemini 3.7 Flashを導入しました。今回のアップデートは新規の事前学習ではなく、コーディングやエージェントタスクにおけるアルゴリズム推論の改善に焦点を当てています。本モデルはAPIおよびエンタープライズプラットフォーム経由で利用可能で、カスタマイズ可能な思考予算(thinking budgets)を備え、2026年末まで50%の価格割引が適用されます。

  • • Gemini 3.7 Flashは、Google AI Studio、Android Studio、およびエンタープライズプラットフォームのGemini API経由で利用可能。
  • • 2026年12月31日までの導入価格は、入力100万トークンあたり0.75ドル、出力100万トークンあたり3.75ドル。
  • • 100万トークンのコンテキストウィンドウと、カスタマイズ可能な思考設定をサポート。
  • • ベンチマーク性能ではコーディングタスクで向上を見せ、FrontierCode 1.1 Mainで43.6%、DeepSWE v1.1で65.3%を記録。

開発者は、調整可能な思考設定を通じてレイテンシと品質のバランスを制御でき、複雑なワークフローに対してより強力な推論モデルを活用できるようになります。

3. DeepSeek-V4-Pro APIおよびエージェントフレームワークをリリース、新価格体系を導入

V4シリーズのプロダクションリリースとV4-Flashのベータ公開に続き、DeepSeekはフラッグシップモデル「DeepSeek-V4-Pro」をリリースしました。これにはオープンソースのエージェントフレームワークである「DeepSeek Harness v0.1」が含まれます。さらに、2024年8月16日より、以前発表されていたAPI価格調整が実施され、ピーク時とオフピーク時の価格モデルへ移行しました。

  • • DeepSeek-V4-Proは、推論努力レベルを設定可能なAPI経由で利用可能。
  • • オープンソースのエージェントフレームワーク「DeepSeek Harness v0.1」をリリース。
  • • 2024年8月16日より、ピーク時およびオフピーク時の新しいAPI価格体系が適用され、コストが大幅に増加。
  • • V4-ProはOpenAI Responses APIおよびCodex統合をネイティブサポート。

開発者はフルスペックのV4-Proモデルと新しいエージェントフレームワークにアクセス可能となり、確定した価格体系によりAPI利用コストの透明性が向上しました。

SOURCES

4. Qwen 3.8リリース:プロンプト制御による推論とサードパーティ製Jinja修正

Qwen 3.8は、コーディング、長期タスク、エージェント実行における能力を向上させました。公式のチャットテンプレートにはチャット履歴の汚染やエージェントの停止といった問題がありますが、コミュニティが開発したJinjaテンプレートがこれらのバグを解決し、機能的な思考トグルとKVキャッシュの最適化を実現しています。

  • • Qwen 3.8は、Qwen 3.5アーキテクチャをベースにした2.4兆パラメータのMixture-of-Expertsモデル。
  • • SGLangやvLLMなどのデプロイメントフレームワークをサポート。
  • • 新しいreasoning_effortパラメータにより、推論深度(xhigh, medium, low)を制御可能。
  • • Hugging Face上のサードパーティ製Jinjaテンプレートが、思考機能無効時のクラッシュやツール呼び出し失敗などの公式テンプレートのバグを修正。
  • • 修正済みテンプレートはKVキャッシュ最適化、汎用ツール解析、llama.cppの--reasoning-preserveフラグのネイティブサポートを提供。

開発者は、2.4兆パラメータのMoEモデルをきめ細かな推論制御でデプロイでき、修正済みテンプレートを使用することでクラッシュやツール呼び出しの失敗を回避できます。

SOURCES

5. 280BオープンウェイトMoEモデル「dots3-note preview」がリリース

dots3-note previewモデルは、マルチモーダルな理解力と巨大なコンテキストウィンドウをオープンウェイトエコシステムにもたらします。アクティブパラメータ数は16Bに抑えられており、ローカルまたはセルフホスト環境での推論コストを管理しつつ、高品質な推論とエージェント実行を実現することを目指しています。

  • • dots3-note previewは、dots3ファミリーとして初めてリリースされたオープンウェイトモデル。
  • • 総パラメータ数280B、アクティブパラメータ数16BのMixture-of-Expertsアーキテクチャを採用。
  • • 最大512Kトークンのコンテキスト長をサポートし、テキスト、画像、動画、音声を理解可能。
  • • 指示追従、論理推論、ツール使用、エージェントワークフローに最適化。
  • • 能力、レイテンシ、コストのバランスを取るため、dots3ファミリーの中で最も軽量なモデルとして設計。

開発者は、エージェントワークフロー、コード生成、低レイテンシ推論に最適化された、巨大なマルチモーダルオープンウェイトモデルを利用可能になります。

SOURCES

6. シングルヘッド・マルチタスク視覚モデル「SenseNova-Vision 7B」がリリース

5,000万件の指示応答ペアで学習されたSenseNova-Visionは、従来のコンピュータビジョンタスクを単一の生成フレームワークに統合します。非常に高性能ですが、Webデモの実行には最低80GBのVRAMを搭載したGPUが必要であり、ベンチマークには8x80GBのGPU構成が必要です。

  • • SenseNova-Visionは、Apache 2.0ライセンスでリリースされた7BのMixture-of-Tokens (MoT)モデル。
  • • 様々なコンピュータビジョンタスクを単一の生成問題として扱い、専門的な予測ヘッドを排除。
  • • 自然言語の指示と視覚的なヒントを受け取り、バウンディングボックス、OCRテキスト、セグメンテーションマスク、深度マップを出力。
  • • マルチビュー3D再構成やカメラポーズ推定などの高度な機能をサポート。
  • • モデルの重み、学習パイプライン、データ準備ツールがGitHubおよびHugging Faceで公開。

開発者は、Apache 2.0ライセンスの単一モデルをデプロイし、自然言語の指示と視覚的なヒントを通じて多様な視覚タスクを処理できます。

SOURCES

7. Mistral、OCR 4の機能を拡張した「4.1 Public Preview」を公開

文書理解モデル「Mistral OCR 4」の初期リリースを基盤として、Mistralはバージョン4.1をパブリックプレビューとして公開しました。このアップデートでは、段落レベルのバウンディングボックス抽出と構造ブロックラベルをネイティブに導入することで、RAGパイプラインにおける文書レイアウト処理の制御精度を向上させています。

  • • OCR 4.1は2026年7月16日よりパブリックプレビューとして利用可能。
  • • 段落レベルのバウンディングボックス抽出と構造ブロックラベルをネイティブ導入。
  • • 低品質な抽出結果をフィルタリングするためのブロックレベルの信頼度スコアを追加。
  • • 価格は1,000ページあたり3.5ユーロ、または注釈付き1,000ページあたり4.38ユーロ。

このアップデートにより、より正確な構造データとブロックレベルの信頼度スコアが得られるようになり、初期のOCR 4リリースと比較してフィルタリングの改善と文書解析精度の向上が可能になります。

SOURCES

8. Writer、エンタープライズエージェント向け744B MoEモデル「Palmyra X6」をリリース

Palmyra X6モデルと併せて、Writerはエージェントオーケストレーションハーネスを再構築し、管理者がエージェントの使用状況を監視、ワークフローを分析、支出制限を設定できる新しいガバナンスツールを導入しました。内部評価において、Palmyra X6は0.87を記録し、Claude Sonnet 4.6やGPT-5.5を含む複数のフロンティアモデルを上回りました。

  • • Palmyra X6は、Z.aiのオープンウェイトGLM-5.2をベースにポストトレーニングされた7440億パラメータのMixture-of-Expertsモデル。
  • • 価格は入力100万トークンあたり2ドル、出力100万トークンあたり8ドル。
  • • Writerは、従来モデルと比較してコストが52%低く、速度が48%速く、品質が10%高いと主張。
  • • 626件の合成エージェント軌跡を用いたアンカー付き教師あり微調整(ASFT)で学習。
  • • 更新されたエージェントオーケストレーションハーネスにより、コストを41%削減し、タスク完了速度を44%向上させたと報告。

エンタープライズグレードのエージェントを構築する開発者は、トークンコストと実行レイテンシを削減するために設計された、高度に最適化された大規模MoEモデルを活用できます。

SOURCES

9. 自然言語をシェルコマンドに変換する微調整済み「Qwen2.5-Coder-1.5B」が登場

このプロジェクトは、小規模モデルに対するタスク特化型微調整の威力を示しています。1.5Bパラメータのモデルをシェルコマンドに特化させることで、開発者は標準的なノートPCのCPU上で即座に動作する軽量さを維持しつつ、はるかに大規模なモデルに匹敵する性能を達成しました。ただし、静的な安全チェックが欠如しており、破壊的なコマンドを生成する可能性があると警告されています。

  • • 125,000件の自然言語/コマンドペアで学習された、微調整済みQwen2.5-Coder-1.5Bモデル。
  • • Q4_K_Mに量子化された941MBのファイルは、llama.cpp経由で動作し、1.6GBのRAMを使用。
  • • i5-11320HノートPC CPU(4スレッド)で、毎秒31.9トークン、中央値0.59秒のクエリ時間を達成。
  • • InterCode-ALFAベンチマークで0.620を記録し、未調整のQwen2.5-Coder-7B(0.613)を上回る。
  • • 重みはHugging Faceで、ソースコードはGitHubでApache-2.0ライセンスの下に公開。

開発者は、最小限のレイテンシとメモリフットプリントで、標準的なノートPCハードウェア上で高度に専門化されたコーディングモデルをローカル実行できます。

SOURCES

10. 高速かつ低コストなコーディングエージェント「Bullet」がリリース

創業者AdiとAlexが6度のピボットを経て開発したBulletは、Claude Codeなどの既存ツールにおける速度と効率への不満を解消するために設計されました。開発者は、エージェントのパフォーマンスにおいて、モデルの生速度よりもラウンドトリップを減らすことの方がはるかに重要であると特定し、高度に最適化されたターン管理アーキテクチャを構築しました。

  • • BulletはSWE-bench Verifiedにおいて500タスク中479タスク(95.8%)を1回の試行で解決し、タスクあたりの平均時間は119秒。
  • • 内部測定では、従来のエージェント手法と比較してラウンドトリップが16%減少し、コストが27%削減された。
  • • Bulletは、mini-SWE-agentとFableまたはSolを組み合わせたものよりも35〜67%高速であると報告されている。
  • • モデルルーティング、ターゲットを絞ったコード検索、積極的なコンテキスト管理を通じてパフォーマンスを最適化。
  • • Bulletはcodewithbullet.comで利用可能。

開発者は、SWE-bench Verifiedタスクの95.8%を1回の試行で解決し、トークンコストを削減できる、より高速なコーディングエージェントを採用できます。

SOURCES

11. オープンソースのMCPサンドボックスがCloudflare上で公開

コミュニティチャレンジの一環として開発されたこの新しいオープンソースプロジェクトは、MCPに最適化された完全に機能するサンドボックス環境を提供します。開発者は、MCP準拠のツールやサーバーをテストおよびデプロイするためのセルフホスト可能な代替手段を得ることができます。

  • • Cloudflare上でホストされる完全なサンドボックス環境を特徴とする。
  • • セルフホスティングをサポートし、Model Context Protocol (MCP)を完全にサポート。
  • • DCR(Developer Control Representation)とAPIドキュメントを提供。
  • • このプロジェクトはswyxによって出されたチャレンジに応えて開発された。

開発者は、組み込みのAPIドキュメントを備えた、MCPサーバーをテストおよび実行するための軽量でセルフホスト可能なサンドボックス環境を利用できます。

SOURCES

12. Netlify AI GatewayがOpenRouterと統合、エージェントランナーを拡張

NetlifyとOpenRouterの提携により、開発者のマルチモデルルーティングが簡素化されます。これらのモデルをAgent Runnersに統合し、AXIS評価フレームワークを活用することで、Netlifyは開発者がパフォーマンスとコストのバランスを取ることを支援します(例:GPT 5.6 Solを低負荷モードに設定し、Claude Opusの経済的な代替手段として提供するなど)。

  • • NetlifyのAI Gatewayは、OpenRouterで利用可能なすべてのモデルをサポート。
  • • Agent Runnersが拡張され、Kimi K3、GLM 5.2、DeepSeek V4などのフロンティアコーディングモデルが含まれるようになった。
  • • Netlifyは、Agent Runnersの新しいエージェント選択肢としてオープンソースのOpenCodeモデルを導入。
  • • プラットフォームは、オープンソースのAXISフレームワークを使用して、機能性とクレジット効率に基づいてコーディングエージェントを評価。
  • • Netlifyのテストでは、DeepSeek V4 Flash 0731が最も少ないクレジット(1実行あたり2.4)を消費し、Claude Opus 5は最大1,055クレジットを消費した。

Netlifyにデプロイする開発者は、OpenRouter上のあらゆるモデルにアクセスし、DeepSeek V4やGLM 5.2のような高度なコーディングエージェントを実行できるようになります。

SOURCES

13. Artificial Analysis、カスタムモデルベンチマーク用プラットフォーム「Optima」をローンチ

Artificial Analysisによると、AIを推進する組織の90%がカスタムベンチマークの必要性を認識しているものの、その複雑さから実際に構築しているのは5%未満です。Optimaは、同社のリサーチプラットフォームを活用することで、あらゆる開発チームがカスタム評価を利用できるようにし、この障壁を下げることを目指しています。

  • • Optimaでは、ファイル、Hugging Faceデータセット、またはArize AI、Braintrust、Langfuseからのエージェントトレースを使用してベンチマークを構築可能。
  • • ユーザーはユースケースを記述し、入力と出力の例を提供することでベンチマークを定義できる。
  • • 複数のモデル間で同時にベンチマークを実行し、更新されたリーダーボードを維持する機能をサポート。
  • • 客観的なルーブリック、またはGDPval-AAやAA-Briefcaseのようなペアワイズ判定手法による評価をサポート。
  • • モデルの効率を比較するために、パフォーマンス、タスクあたりのコスト、タスクあたりの時間を追跡。

開発者は汎用的なベンチマークから脱却し、特定のプロダクションワークロードに対してモデルを評価し、コスト、レイテンシ、精度を追跡できるようになります。

SOURCES

14. AI生成MCPコネクタの信頼性にギャップがあることが判明

Claude CodeのようなAIコーディングアシスタントはコードを迅速に構築できますが、CDataの評価は、エンタープライズグレードの統合をAIのみに頼ることの限界を浮き彫りにしました。この調査結果は、MCPサーバーが本番環境で利用可能であることを保証するために、開発者が依然として厳格な監視と手動エンジニアリングを行う必要があることを示唆しています。

  • • CDataは、エンタープライズMCPの信頼性に不可欠な8つの次元にわたって、AI生成データコネクタを評価。
  • • 調査により、OAuthトークンのライフサイクル管理において重大な信頼性のギャップが特定された。
  • • AI生成コネクタは、大規模データセットを処理する際のパフォーマンスと信頼性に苦戦した。
  • • 専門家によるガイダンスはコネクタのパフォーマンスを向上させたが、本番環境での信頼性を一貫して保証するものではなかった。

AIコーディングツールを使用してMCPサーバーを構築する開発者は、特にOAuthトークンのライフサイクルや大規模データセットの処理など、重要な本番要件を手動で検証する必要があります。

SOURCES

15. Pi、コーディングエージェントのコンテキスト制限を管理するために「Compaction」を実装

Piのコンパクションメカニズムは、長期実行されるエージェントセッションにおいて状態を管理するための、ポータブルで読み取り可能な方法を提供します。重要なコンテキストを保持することには成功していますが、履歴のプレフィックスを変更すると後続のリクエストが再計算を強制され、プロンプトキャッシュが壊れることに開発者は注意が必要です。ユーザーは、カスタムコンパクションプロンプトを使用して拡張機能を作成することで、この動作をカスタマイズできます。

  • • コンパクションは、コンテキスト制限に近づいた際に自動的に、または/compactコマンドで手動でトリガーされる。
  • • このプロセスでは、構造化された「コンテキスト要約アシスタント」システムプロンプトを使用した専用のLLMリクエストが使用される。
  • • 結果として得られる要約は、目標、進捗、主要な決定事項というプレーンテキストのセクションに構造化される。
  • • Piはコンパクション中、デフォルトで最新のメッセージ20,000トークン(約5〜20ターン)を保持する。
  • • コンパクションは会話履歴のプレフィックスを変更するため、既存のプロンプトキャッシュを破壊する。

開発者は、同様のコンパクションパターンを独自のエージェントランタイムに実装することで、コンテキストウィンドウを溢れさせることなく長期セッションを維持できます。

SOURCES

16. Anthropic、Claudeの出力をモデル学習に使用することに関する規約を明確化

Anthropicのライセンス条項は、競合するモデル学習と競合しないモデル学習の間に明確な線を引いています。開発者はClaudeを使用して競合する汎用LLMをブートストラップすることはできませんが、生成された出力を使用して、コンテンツ分類、情報抽出、異常検知などの機能のための小規模なタスク固有モデルを微調整することは自由です。

  • • Anthropicは、Claudeの出力を汎用チャットボットや競合するオープンエンドのテキスト生成モデルの学習に使用することを禁止。
  • • ユーザーは、感情分析、要約、セマンティック検索など、競合しないモデルの学習に出力を使用することが許可されている。
  • • 製品機能、データ分析、内部ワークフローのためのアプリケーションへの出力統合は完全に許可されている。
  • • Anthropicは、これらの学習制限を条件として、ユーザーが入力から生成した出力の所有権をユーザーに付与する。
  • • 同社は、制限の主な理由として、安全上の懸念とインフラ投資の保護を挙げている。

開発者は、Anthropicのライセンス条項に違反することなく、Claudeの出力を安全に使用して、感情分析や要約などのタスク固有モデルを微調整できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。