Inference Brew

OpenAIが1.05Mトークンのコンテキストとコンピュータ操作機能を備えたGPT-6 Astraを発表

00:00 / --:--

← ホームへ戻る

OpenAIが1.05Mトークンのコンテキストとコンピュータ操作機能を備えたGPT-6 Astraを発表

1. OpenAIが1.05Mトークンのコンテキストとコンピュータ操作機能を備えたGPT-6 Astraを発表

OpenAIは、コンピュータ操作とソフトウェアエンジニアリングタスクに最適化された次世代モデル「GPT-6 Astra」をリリースしました。Astraは、コンパクション(圧縮)ではなく、ウィンドウ間で新しいメモ保持手法を使用して状態を管理する1.05Mトークンのコンテキストウィンドウを導入しています。ホスティングRAMを節約するためにレイヤーを再利用するループ型トランスフォーマーアーキテクチャに基づいて構築されており、価格は入力100万トークンあたり10ドル、出力100万トークンあたり50ドルです。Daybreak Accessメンバー、ChatGPT有料プラン、OpenAI API、およびAWS向けに順次展開されています。

  • • GPT-6 Astraは、1,050,000トークンのコンテキストウィンドウと、128,000トークンの最大出力制限を備えています。
  • • API価格は入力100万トークンあたり10ドル、出力100万トークンあたり50ドルに設定されており、キャッシュされた読み取りには90%の割引が適用されます。
  • • このモデルは、DeepSWE v1.1ベンチマークで74.1%、Provider Adapterハーネスを使用したARC-AGI-3で99.9%を達成しています。
  • • Astraは、ストレージやRAMの要件を増やさずに容量を増やすためにレイヤーを再利用するループ型トランスフォーマーアーキテクチャを採用しています。
  • • このモデルはOpenAIの「重大なサイバーセキュリティしきい値」に達していると指定されており、標準ユーザーによる高度なエクスプロイト発見機能は制限されています。

開発者は、APIの基本価格は高めですが、タスクあたりのトークン消費量を劇的に削減できる、高度なコンピュータ操作およびコーディングモデルを利用できるようになります。

2. MetaがMuse Spark 1.3のパフォーマンスとコントリビューター向け価格設定を詳細に発表

Metaは昨日リリースされたMuse Spark 1.3モデルに関する詳細情報を公開し、1Mトークンのコンテキストウィンドウと効率性の向上を強調しました。このモデルは、バージョン1.2と比較してツール呼び出しを20%、トークン使用量を25%削減しています。また、Metaは将来のモデルトレーニングを支援するためにプロンプトと出力を共有することを選択したユーザーに対し、95%の割引を提供しています。

  • • Muse Spark 1.3は1Mトークンのコンテキストウィンドウを備えています。
  • • 効率性の向上には、ツール呼び出しの20%削減とトークン使用量の25%削減が含まれます。
  • • このモデルはDeepSWE v1.1ベンチマークで75.4のスコアを達成しました。
  • • モデルトレーニングのためのデータ共有を選択したユーザーには95%の割引が適用されます。
  • • 最高レベルの推論モードは、安全性のテストのため引き続き制限されています。

開発者は、新たに公開されたコントリビュータープログラムを通じて、モデルの効率向上とコスト削減の機会を評価できるようになりました。

3. IFMが512Kコンテキストを備えたオープンウェイトモデルファミリー「K2 Horizon」をリリース

MBZUAIのInstitute of Foundation Models(IFM)は、6つのオープンウェイトモデルからなる「K2 Horizon」をリリースしました。このリリースは非常に透明性が高く、完全なトレーニングライフサイクル、中間チェックポイント、トレーニングデータのレシピ、およびxLLMトレーニングインフラストラクチャを提供しています。モデルの範囲は、軽量な0.9Bバリアントから、巨大な375B-A23BスパースMixture-of-Experts(MoE)モデルまで多岐にわたります。36B-A4Bモデルでは、アクティブなパラメータを最適化するためにMixture-of-Value-Attention(MoVA)メカニズムが導入されており、大型モデルはネイティブで512Kトークンのコンテキストウィンドウをサポートしています。

  • • K2 Horizonファミリーには、375B-A23B、36B-A4B、32B、7B、3.7B、0.9Bの6つのモデルが含まれます。
  • • モデルはApache 2.0ライセンスでリリースされ、中間チェックポイント、トレーニングデータのレシピ、コードが完全にオープンソース化されています。
  • • 36B-A4Bおよび375B-A23BモデルはMixture-of-Experts(MoE)アーキテクチャを採用しており、36Bモデルは新しいMixture-of-Value-Attention(MoVA)メカニズムを特徴としています。
  • • モデルは最大524,288トークンのネイティブコンテキストウィンドウをサポートしています。
  • • NVIDIA、AMD、Cerebrasハードウェア向けに、vLLM、SGLang、Ollamaを通じた初日デプロイメントサポートが利用可能です。

開発者は、512Kという巨大なコンテキストウィンドウを備えた非常に高性能な完全オープンウェイトモデルファミリーにアクセスでき、vLLM、SGLang、Ollamaでの初日サポートも受けられます。

4. MicrosoftがMAI-Transcribe-2をリリース、価格を72%引き下げ

2026年6月に導入されたMAI-Transcribe-1.5モデルを基盤として、MicrosoftはMAI-Transcribe-2をリリースしました。この新しいモデルは、価格を1時間あたり0.10ドルへと72%削減し、処理速度をリアルタイムの411倍に向上させると同時に、精度を単語誤り率2.0%まで改善しました。現在、Microsoft FoundryおよびMAI Playgroundを通じて利用可能です。

  • • MAI-Transcribe-2の価格は1時間あたり0.10ドルで、MAI-Transcribe-1.5の1,000分あたり6ドルというコストから72%の削減となります。
  • • モデルの単語誤り率は2.0%を達成し、前モデルの2.4%から改善されました。
  • • 処理速度は前バージョンの276倍から、リアルタイムの411倍に向上しました。
  • • 新機能には、60言語のサポート、話者分離(ダイアライゼーション)、単語レベルのタイムスタンプが含まれます。
  • • Microsoft FoundryおよびMAI Playgroundを通じて現在利用可能です。

このアップデートにより、Microsoftの独自文字起こしモデルを使用する開発者は、前世代と比較してコストとレイテンシを大幅に削減できます。

5. InworldがRealtime TTS-2を一般公開(GA)へ移行

Inworldは、Realtime TTS-2モデルをリサーチプレビューから完全な商用リリースへと移行しました。100以上の言語とプレーンテキスト形式のスタイル指示をサポートするこのモデルは、Artificial Analysis Controlled Voice ArenaでEloスコア1,123を獲得し、第1位にランクインしました。開発者は100万文字あたり20.83ドルで利用可能です。

  • • Realtime TTS-2は、初期のリサーチプレビューを経て一般公開されました。
  • • モデルの価格は100万文字あたり20.83ドルです。
  • • Artificial Analysis Controlled Voice ArenaでEloスコア1,123を獲得し、第1位にランクされています。
  • • 自動言語検出機能を備え、100以上の言語をサポートしています。
  • • 毎秒106文字の生成スループットを達成しています。

開発者は、毎秒106文字のスループットで高品質な多言語音声生成を提供する、本番環境対応バージョンのモデルにアクセスできるようになりました。

SOURCES

6. Alibabaが動画生成・編集モデル「Wan 3.0」をリリース

Alibabaは、動画生成モデルファミリーのメジャーアップデートである「Wan 3.0」をリリースしました。このモデルは、ネイティブ音声付きで最大30秒の1080p動画を生成可能です。テキスト、画像、音声、Webページなど幅広いクリエイティブ入力をサポートし、ビジュアル、プロット、対話、サウンドの指示ベースの編集を可能にします。Wan 3.0は現在、Alibaba Cloud Model Studioでパブリックプレビュー中です。

  • • Wan 3.0は、ネイティブ音声付きで最大30秒の1080p動画を生成します。
  • • テキストから動画、画像から動画、参照ベースの生成、指示ベースの編集をサポートしています。
  • • Artificial Analysis Video Arenaにおいて、「音声付き動画編集」で第1位、「音声付きテキストから動画」で第2位にランクされています。
  • • 価格は480pで1秒あたり0.05ドル、720pで0.10ドル、1080pで0.20ドルから始まります。
  • • Alibaba Cloud Model Studioを通じてパブリックプレビューで利用可能です。

開発者は、スタイル転送やモーション保持を含む高度な動画編集および生成機能を、Alibaba Cloud Model Studioを通じて直接統合できます。

SOURCES

7. sanoTTSがマイクロコントローラー向けの超軽量ニューラルTTSスタックをリリース

ある開発者が、リソースの限られたハードウェア向けに設計された超軽量ニューラルテキスト読み上げスタック「sanoTTS」をリリースしました。モデルファミリーは294kから220万パラメータの範囲で、最小のモデルはint8に量子化するとわずか337kbのサイズになります。その小さなフットプリントにもかかわらず、1.5Mモデルは3ドルのESP32マイクロコントローラー上で0.225のリアルタイム係数で動作し、1秒未満で4秒の音声を生成できます。

  • • sanoTTSは11種類の音声と6言語をサポートし、モデルサイズは294kから2.2Mパラメータまであります。
  • • 294kモデルはint8量子化時にわずか337kbのサイズで、512kbのSRAMを搭載した3ドルのチップ上で動作します。
  • • 1.5MモデルはESP32マイクロコントローラー上で0.225のリアルタイム係数を達成し、1秒で4秒の音声を生成します。
  • • モデルファミリーは、npmパッケージ「sanotts-web」を通じてWebアプリケーションで利用可能です。
  • • 開発者は、sanoTTSがこれまでに作成された中で最小のニューラルTTSモデルであると主張しています。

開発者は、NPUなしで、低コストのエッジハードウェアやマイクロコントローラー上で直接、高品質なローカルテキスト読み上げ機能をデプロイできます。

SOURCES

8. Anthropicが「Claude Commerce Agents」リファレンスブループリントをリリース

Anthropicは、ショッピングおよびマーチャントエージェントを構築するためのオープンソースのリファレンスブループリント「anthropics/commerce-agents」をリリースしました。このリポジトリは、小売、旅行、通信、エンターテインメントという4つの業種向けの実行可能な実装を提供します。パフォーマンスを最適化するため、Anthropicは従来のインテントルーターよりも「エージェントスキル」アーキテクチャを推奨しており、これによりレイテンシとAPIコストを最小限に抑えることができます。システムには、モデルがアクションを提案し、ハーネスがそれを適用する承認ゲートも利用されています。

  • • 「anthropics/commerce-agents」リポジトリはApache 2.0ライセンスでリリースされています。
  • • ブループリントには、Python 3.11+およびNode 22で動作する小売、旅行、通信、エンターテインメント向けの実行可能な業種別実装が含まれています。
  • • Claude API、Amazon Bedrock、Microsoft Foundry、Google Cloud Vertex AIを通じたデプロイメントをサポートしています。
  • • アーキテクチャは、レイテンシとトークンコストを最小化するために、インテントルーターではなく「エージェントスキル」設計を使用しています。
  • • リリースには、エージェント実装の構築とレビューのためのClaude Codeプラグインが含まれています。

開発者は、レイテンシとトークンコストを最小限に抑える最適化されたスキルアーキテクチャを使用して、本番環境対応のコマースエージェントを迅速に構築およびデプロイできます。

SOURCES

9. Cursorクラウドエージェントがプライベートネットワーク内での実行をサポート

8月20日に導入されたイベント駆動型クラウドエージェントに続き、Cursorはインフラストラクチャサポートを拡大し、これらのエージェントがプライベートネットワーク内で実行できるようにしました。以前はCursorの標準クラウド環境に制限されていましたが、開発チームが直接管理するマシンプールに動的にスケジュールできるようになり、内部サービスやプライベートなソース管理への安全なアクセスが可能になりました。

  • • Cursorクラウドエージェントは、プライベートなユーザー管理マシンプールでの実行をサポートするようになりました。
  • • これは8月に導入されたイベント駆動型エージェント機能を拡張するものです。
  • • エージェントは内部サービスやプライベートソース管理システムに直接アクセスできるようになりました。
  • • エージェントは引き続き標準のCursorプラットフォームを通じて開始および管理されます。

このアップデートにより、チームはCursorのエージェントワークフローを、以前はクラウドホスト型エージェントからアクセスできなかった内部データベース、カスタムビルドパイプライン、プライベートソース管理システムと統合できるようになります。

SOURCES

10. AIエージェントのAPI対話作成とデバッグを支援する「Restless」がローンチ

Restlessは、AIエージェントがAPIと対話する方法を効率化するために設計された開発者ツールとしてローンチされました。このプラットフォームは既存のエンドポイントからAPIドキュメントを自動生成し、エージェントが呼び出し方を理解しやすくします。重要な点として、Restlessには失敗したAPI呼び出しをインターセプトするエラー処理メカニズムが含まれており、エージェントがリアルタイムで自己修正してリクエストを再試行できるようにする修正指示を生成します。

  • • Restlessは既存のエンドポイントからAPIドキュメントを自動生成し、エージェントの統合を支援します。
  • • このツールは、失敗したAPI呼び出しをキャッチし、エージェントに再試行の指示を提供するエラー処理ループを備えています。
  • • リアルタイムのAPIログにより、開発者は顧客のアクティビティを呼び出しごとに監視できます。
  • • 開発者は「npx restless init」を実行することで、ローカルでツールを初期化できます。

開発者は、Restlessが失敗したAPI呼び出しをキャッチし、修正指示をエージェントにフィードバックすることで、より回復力のあるエージェント統合を構築できます。

SOURCES

11. Nvidiaがアイドル状態のコンピュータをリンクしてローカルAI推論を行う「PAIR」をリリース

Nvidiaは、アイドル状態のコンピュータを統合されたローカルAI推論プールにネットワーク化するために設計された、無料のオープンソースツール「Personal AI Router (PAIR)」を立ち上げました。Windows、Linux、macOSと互換性があり、PAIRはNvidia RTX GPU、DGX Sparkシステム、Apple M4チップをサポートしています。このソフトウェアは相互TLS(mTLS)を使用して通信を保護し、デバイスがネットワークに参加または離脱する際に動的にスケーリングするため、開発者は複数のマシン間でローカルモデルを実行できます。

  • • PAIRは、アイドル状態の家庭用コンピュータをリンクしてローカルAI推論を並列実行する無料のオープンソースツールです。
  • • このソフトウェアは、Nvidia GeForce RTX 20シリーズ以降、RTX Pro、DGX Spark、およびApple M4チップ以降と互換性があります。
  • • PAIRは、アクティブなタスクを妨げないように、ネットワークに参加または離脱するデバイスに自動的に調整します。
  • • 接続は6桁のペアリングコードと相互TLS(mTLS)暗号化を使用して保護されます。
  • • Nvidiaは、Perplexity Portable Computer、Hermes Agent、OpenClawなどのエージェントアプリケーション向けの簡素化されたローカルセットアップも発表しました。

開発者は、複数のローカルマシンの計算能力を活用して、クラウドGPUの料金を支払うことなく、より大きなモデルを実行したり、ローカル推論を高速化したりできます。

SOURCES

12. ik_llama.cppがQwen4exp向けにマルチトークン予測(MTP)サポートを追加

Qwen3.6でのMTPによるパフォーマンス向上で注目されたik_llama.cppプロジェクトは、Qwen4expモデルに対するMTPサポートをマージすることで機能を拡張しました。このアップデートにより、2.6BのMTPヘッドを使用してトークンのドラフトと検証を行うことが可能になり、出力の同等性を維持しながら、互換性のあるハードウェアでの推論速度が2倍になります。

  • • ik_llama.cppのPR #2369により、Qwen4expのMTPサポートが追加されました。
  • • ドラフトと検証のために2.6BのMTPヘッドを使用します。
  • • ドラフトの受け入れ率は、コードで93〜99%、散文で60〜65%に達します。
  • • RTX 5090でのパフォーマンスは毎秒90トークンに達します。
  • • マルチGPUサポートのないシングルスロット操作に限定されています。

開発者は、プロジェクトで以前に観察されたパフォーマンス上の利点を拡張し、新しいQwen4expアーキテクチャに対してMTPによる高速化を活用できるようになりました。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。