Inference Brew

Z AIが100万トークンのコンテキストを持つオープンウェイトモデル「GLM-5.2」をリリース

00:00 / --:--

← ホームへ戻る

Z AIが100万トークンのコンテキストを持つオープンウェイトモデル「GLM-5.2」をリリース

1. Z AIが100万トークンのコンテキストを持つオープンウェイトモデル「GLM-5.2」をリリース

Z AIの最新リリースは、最先端クラスの推論能力をオープンウェイトのエコシステムにもたらします。毎秒112トークンの速度で動作するこのモデルは、科学的推論において顕著な向上を見せており、物理学ベンチマーク「CritPt」では16ポイントの改善を達成し、Claude Opus 4.8と同等の性能を示しました。量子化版モデルはすでにHugging Faceで公開されており、4ビットおよび2ビットのオプションにより、Mac StudioクラスターやエンタープライズGPU環境でのローカル実行が可能です。

  • GLM-5.2は、総パラメータ数744B、アクティブパラメータ数40BのオープンウェイトMixture of Expertsモデルです。
  • コンテキストウィンドウはGLM-5.1の20万トークンから100万トークンへと拡張されました。
  • MITライセンスでリリースされており、商用利用およびセルフホストが可能です。
  • Artificial Analysis Intelligence Index v4.1で51点を記録し、オープンウェイトモデルとして首位に立ちました。
  • ファーストパーティAPIの価格は、入力100万トークンあたり1.40ドル、出力100万トークンあたり4.40ドルに設定されています。

開発者は、複雑な科学的タスクにおいてプロプライエタリなモデルに匹敵する性能を持つ、MITライセンスの高性能な推論モデルを自前でホストできるようになります。

2. OpenAI、ChatGPT向け双方向音声モデル「GPT-Bidi-1」を準備中

OpenAIによるGPT-Bidi-1の開発は、音声エージェントが会話の流れを処理する方法における大きな転換点を示しています。音声を双方向に処理することで、従来の音声パイプラインで発生していた不自然なターン交代の遅延を解消し、極めて自然な会話インターフェースへの道を開きます。

  • GPT-Bidi-1は、ChatGPTの音声モード用に設計された双方向音声モデルです。
  • 聞き取りと発話を同時に行うことができ、リアルタイムでの割り込みにも対応します。
  • ユーザーの入力に基づいて、文の途中でも発話内容を調整できます。

開発者は、自然で割り込み可能かつリアルタイムな音声対話をサポートするAPI機能の登場を期待できます。

SOURCES

3. Soniox、低遅延ストリーミング音声認識APIをリリース

Sonioxの新しいリアルタイムモデルは、精度と遅延のパレート最適境界に位置しています。ほぼ瞬時の文字起こしを低い単語誤り率(WER)で提供するこのAPIは、インタラクティブな音声アプリケーションやリアルタイム翻訳サービスに最適化されています。

  • Soniox v5 Real-Timeは、Sonioxコンソール経由で音声1,000分あたり2ドルで提供されます。
  • 最終的な文字起こしにおいて、発話終了から0.05秒で4.5%の単語誤り率(WER)を達成します。
  • 60以上の言語をサポートし、リアルタイム翻訳および言語識別機能を提供します。
  • 本リリースは、既存の非ストリーミングモデル「Soniox v5 Async」を補完するものです。

開発者は、他のプロプライエタリなAPIよりも大幅に低いコストで、高精度なリアルタイム文字起こしと翻訳を音声エージェントに統合できます。

SOURCES

4. 7Bコードモデル「LoopCoder-v2」、SWE-bench Verifiedで64.4を達成

LoopCoder-v2は、テスト時の計算スケーリングを活用することで、パラメータサイズを大きく上回る性能を発揮します。研究者らは、2ループ構成が潜在的な洗練において最適なバランスを提供し、3ループ目以降は収穫逓減や性能低下を招くことを突き止めました。

  • LoopCoder-v2は、Parallel Loop Transformerアーキテクチャに基づいて構築された7Bの指示チューニング済みコードモデルです。
  • 2ループ構成を使用し、SWE-bench Verifiedベンチマークで64.4のスコアを達成しました。
  • 100以上のプログラミング言語をカバーする18兆トークンでゼロから学習されました。
  • アーキテクチャは、クロスループ位置オフセットと共有KVゲート付きスライディングウィンドウアテンションを利用し、一定のキャッシュフットプリントを維持します。
  • モデルおよび関連コードはHugging Faceで公開されています。

開発者は、複雑なソフトウェアエンジニアリングタスクにおいて、自身のサイズを遥かに上回るモデルを凌駕する、非常に効率的なオープンウェイトのコーディングモデルを利用できるようになります。

5. OpenAI Codex、ブラウザエージェント向けにChrome DevTools Protocolサポートを追加

OpenAIによるCDPサポートのCodexへの統合は、より有能なウェブ利用エージェントに向けた重要な一歩です。この機能はまだ初期段階であり地理的な制限もありますが、エージェントがライブウェブ環境と動的に対話するために必要な基盤を提供します。

  • OpenAIのCodexは、設定のオプトインを通じてChrome DevTools Protocol(CDP)をサポートするようになりました。
  • この機能により、エージェントはJavaScriptのパフォーマンスをプロファイリングし、ウェブサイトをリアルタイムで修正できます。
  • 現在、EEA(欧州経済領域)、英国、スイスのユーザーはアクセスできません。
  • この初期段階の機能は慎重なプロンプトが必要であり、現在パフォーマンス上の課題に直面しています。

ウェブ自動化エージェントを構築する開発者は、ネイティブなブラウザデバッグ機能とリアルタイムのウェブサイト修正機能を活用できるようになります。

SOURCES

6. Vercel、オープンソースAIエージェントフレームワーク「Eve」をリリース

Vercelの新しいフレームワークは、ディレクトリ内のファイルをエージェントの機能に直接マッピングすることで、エージェント開発を簡素化します。安全な接続、マルチチャネル通信、評価トレースの組み込みサポートにより、eveはクラウドにエージェントをデプロイする開発者にとって堅牢で本番環境グレードの基盤を提供します。

  • eveは、AIエージェントの構築とスケーリングのためのApache-2.0ライセンスのオープンソースフレームワークです。
  • このフレームワークは、エージェントをディスク上のディレクトリとして定義するファイルシステムファーストのアーキテクチャを採用しています。
  • 組み込み機能には、耐久実行、サンドボックス化されたコンピューティング、人間による承認プロセスが含まれます。
  • 開発者は「npx create-eve@latest」を使用して新しいエージェントを構築し、Vercelに直接デプロイできます。
  • Vercelは現在、eveフレームワークを使用して100以上のエージェントを本番環境で運用しています。

開発者は、組み込みの耐久実行機能とサンドボックス化されたコンピューティングを備えた、シンプルなディレクトリベースのアーキテクチャを使用して、本番環境対応のエージェントを構築できます。

SOURCES

7. Claude Designが刷新、Claude Codeとの双方向同期に対応

プレビュー開始から2ヶ月を経て、AnthropicはClaude Designの高いトークン消費量に関する開発者の主要な不満に対処しました。ビジュアルエディタと共有使用制限を導入することで、このアップデートは不要なモデルのやり取りを最小限に抑えつつ、コンポーネントロックのようなエンタープライズグレードのコンプライアンス機能を提供します。

  • Claude DesignはClaude Codeとの双方向統合を特徴とし、ターミナルベースのデザインシステム同期が可能になりました。
  • このアップデートにより、組織はGitHub、デザインファイル、または生のアップロードからコンポーネントをインポートできます。
  • Anthropicは、Claude Design、チャット、Cowork、Claude Code間で利用制限を共有することで、トークン消費の問題に対処しました。
  • ドラッグ&リサイズ機能を備えた新しいエディタにより、レイアウト調整に必要なモデルのやり取り回数が削減されます。
  • プラットフォームはVercel、Replit、Lovable、Canva、Adobeへのエクスポートサポートを追加しました。

開発者はデザインシステムをシームレスに同期し、ターミナルから直接UIタスクを実行できるようになり、トークン消費量と手作業による引き継ぎを削減できます。

SOURCES

8. AWS、ネイティブMCPサポートを備えた「Context Intelligence Stack」を立ち上げ

AWSは、手動でのナレッジキュレーションを排除するように設計されたスタックで、エージェントのコンテキスト競争に参入します。S3 AnnotationsやGlueスキルアセットからビジネス定義をクエリ可能なグラフに統合することで、AWS ContextはエージェントがMCPを介してネイティブにアクセスできる、安全で監査可能なランタイムコンテキストレイヤーを提供します。

  • AWS Contextは、データセットやビジネスルール間の関係を自動的に推論する新しいナレッジグラフサービスです。
  • エージェントは、Bedrock AgentCoreやEKSを介して、エージェント検索APIやMCPツールを通じてシステムにクエリを実行します。
  • スタックには、S3 AnnotationsとAWS Glue Data Catalogのスキルアセットのプレビューが含まれています。
  • クエリは、安全なデータアクセスのために、呼び出し元のユーザーのIAMおよびLake Formation権限を継承します。
  • メタデータはApache Iceberg形式でAmazon S3 Tablesに公開されます。

AWS上でエージェントをデプロイする開発者は、Bedrockと統合され、MCPを介してツールを公開するマネージドコンテキストレイヤーを活用できます。

SOURCES

9. Cursor Origin Launches as Agent-Native Git Forge

Building on the initial announcement of the Origin platform, Cursor has now officially launched Cursor Origin. This forge is designed to handle the specific demands of AI agents, including automated branching, committing, and code reviews, providing a dedicated environment for agent-scale development.

  • Cursor Origin is now live as a Git-compatible forge for AI agents.
  • The platform supports parallel agent tasks like cloning, branching, and rebasing.
  • It serves as an AI software factory designed to optimize agent-scale development pipelines.

Developers can now utilize the platform to deploy coding agents into a repository hosting environment specifically optimized for automated, parallel workflows.

SOURCES

10. Android 17、AIエージェント向けにネイティブMCPとAppFunctionsを導入

Android 17におけるネイティブなModel Context Protocol(MCP)サポートの追加は、モバイルエージェントアーキテクチャにとって大きな前進です。オンデバイスモデルがアプリケーション機能をどのように発見し実行するかを標準化することで、Googleは開発者がエージェントフレンドリーなモバイルアプリケーションを構築することを大幅に容易にしています。

  • Android 17は、AppFunctionsとAndroid MCP(Model Context Protocol)サポートを導入しました。
  • これらの機能により、アプリケーションはオンデバイスエージェント向けにオーケストレーション可能なツールを公開できます。
  • Googleは、このリリースを深く統合されたプラットフォーム全体のインテリジェンスシステムへの移行と位置づけています。

モバイル開発者は、アプリの機能をシステムレベルのAIエージェントがネイティブに呼び出せるオーケストレーション可能なツールとして公開できます。

SOURCES

11. Lemonade v10.8、動的VRAM管理とMCPゲートウェイを追加

Lemonadeの迅速な開発サイクルは、ローカルモデル実行のための非常に実用的な機能を提供し続けています。自動メモリ管理とネイティブなModel Context Protocolゲートウェイを組み合わせることで、このアップデートにより、ローカルモデルを現代のエージェントワークフローに統合することが非常に容易になります。

  • Lemonade v10.8は、アイドル状態のモデルを自動的にアンロードし、KVキャッシュを縮小する動的VRAM管理を導入しました。
  • POST /mcpにある新しいMCPゲートウェイは、モデルリスト、チャット、文字起こし、画像生成のためのツールを公開します。
  • このアップデートでは、OpenAI互換プロバイダーから補完機能を提供するためのプロバイダー非依存のオフロードバックエンドが追加されました。
  • プラットフォームサポートが拡大し、Windows上のNVIDIA Blackwell arm64 CUDAおよびAMD ROCmが含まれるようになりました。

開発者は、GPUメモリを自動的に管理しながら、ローカルモデルをMCPツールとしてMCP対応ホストに公開できます。

SOURCES

12. ホワイトハウス、Claude Fable 5の再リリース前に脱獄対策を要求

この進行中の論争は、最先端AIラボが敵対的なプロンプトに対してモデルを保護しなければならないという高まる圧力を浮き彫りにしています。独立したサイバーセキュリティ専門家は、熟練したユーザーが常に回避策を見つけるため、現在のガードレールは一時的な応急処置に過ぎないことが多いと指摘しています。Anthropicが政権の積極的なテスト要求を満たすべく取り組んでいる間、モデルの復帰は停滞したままです。

  • 米国政府は、Claude Fable 5の再リリース前に、Anthropicに対して脱獄の脆弱性を解決するよう求めています。
  • 国家安全保障局(NSA)は、脱獄によってユーザーがガードレールを回避し、サイバー、化学、生物学的な機能にアクセスできる可能性があることを確認しました。
  • 政権は、政府の検出に頼るのではなく、Anthropicがすべての最先端モデルに対して脱獄のテストを積極的に行うことを期待しています。
  • Anthropicは、脱獄に関する政権の懸念は誇張されており、現実世界への影響は最小限であると主張しています。

Anthropicの最先端モデルを使用する開発者は、同社がサイバーセキュリティや生物学的なクエリに対するより堅牢で積極的なガードレールを実装するまで待つ必要があります。

SOURCES

13. Llama.cpp Expands Model API to Include Full Lifecycle Management

Following the introduction of the model hotswap API earlier this month, Llama.cpp has merged a new pull request that extends its API capabilities to include full model lifecycle management. Developers can now programmatically load, unload, and download models on demand, moving beyond simple swapping to comprehensive model management without server restarts.

  • Expands the existing hotswap API to include loading, unloading, and downloading functionality.
  • Pull request #23976 enables complete programmatic model lifecycle management.
  • Allows for dynamic model management without requiring server restarts.
  • No user interface is currently available for these new features.

This update enables developers to build more dynamic, multi-model local applications by providing full control over the model lifecycle via API calls.

SOURCES

14. Claw-SWE-Bench、コーディングエージェントの評価基準を標準化

Claw-SWE-Benchは、モデルを駆動するラッパー層である「ハーネス」の性能をモデル自体から切り離すことで、エージェント評価における重要なギャップに対処します。ベンチマークの結果、成功率とコストはハーネスの設計によって大きく異なることが示されており、開発者にエージェントアーキテクチャを最適化するための標準化された方法を提供します。

  • Claw-SWE-Benchは、8つの言語と43のリポジトリにわたる350の実際のGitHubイシューを使用しています。
  • すべてのハーネスは、1時間の制限時間や単一の試行を含む固定条件下で評価されます。
  • 採点はリポジトリのファイル変更のみに基づいて行われ、エージェントの出力フォーマットは無視されます。
  • 80のタスクを含むLiteバージョンが利用可能で、フル実行コストの23%でランキングを再現できます。
  • ベンチマークには、将来の回答へのアクセスを防ぐための不正防止策が含まれています。

コーディングエージェントを構築する開発者は、このベンチマークを使用して、異なるラッパー層や対話方法がタスクの成功やAPIコストにどのような影響を与えるかを測定できます。

SOURCES

15. ヘッドレススクリーンショットループ、ローカルコーディングエージェントの視覚的デバッグを可能に

Claude Codeとローカルモデルの両方が、当初はレイトレーシングFPSデモを一度の試行で記述することに苦労していましたが、視覚的なフィードバックを導入することで結果が変わりました。エージェントがスクリーンショットをトリガーし、コードの視覚的出力を検査できるようにすることで、開発者はトークン消費量の増加と引き換えに、ローカルモデルの問題解決能力を大幅に向上させることができます。

  • スクリーンショットトリガーを備えたヘッドレスモードを追加することで、コーディングエージェントの再帰的な視覚的デバッグループが可能になりました。
  • このパターンにより、ローカルのQwen3.6 27Bエージェント(codehamr)とClaude CodeがC言語のレイトレーシングFPSデモを記述できました。
  • エージェントはスクリーンショットを使用してレンダリング結果を検査し、バグを特定し、修正を繰り返しました。
  • 視覚的フィードバックループは、トークン使用量、ランタイム、および壁時計時間を増加させます。

開発者はこの視覚的フィードバックループパターンを実装することで、小規模なローカルモデルが解決できない複雑なUIやレンダリングタスクを解決できるようになります。

SOURCES

16. 最適化されたGemma 4 WebGPUカーネル、M4 Maxで毎秒255トークンを達成

このリリースは、高性能なクライアントサイドLLM実行の実現可能性を示しています。WebGPUカーネルを活用することで、開発者はクラウドAPIに匹敵するかそれを上回る速度でブラウザ内でGemma 4をローカル実行でき、ゼロ遅延でプライバシーを保護するウェブアプリケーションの新たな可能性を切り開きます。

  • 最適化されたGemma 4 WebGPUカーネルは、M4 Maxプロセッサ上で毎秒約255トークンを達成しました。
  • デモとカーネルはHugging Faceで公開されています。
  • 実装には「google/gemma-4-E2B-it-qat-mobile-transformers」モデルが使用されています。
  • この最適化作業は、シャットダウン前のFable 5を使用して完了しました。

開発者は、サーバー側の推論コストを発生させることなく、クライアントハードウェア上で高速なローカルブラウザ内LLM機能をデプロイできます。

SOURCES

17. Anthropic、Claude Agent SDKのトークンベース課金を一時停止

個別のSDK課金を一時停止する決定は、エージェントワークフローのコスト上昇に直面していた開発者に安堵をもたらしました。Anthropicは、標準のAPI料金やサブスクリプションモデルを利用する開発者との整合性を高めるため、価格構造を再評価しています。

  • Anthropicは、先月発表されたClaude Agent SDKのトークンベースの個別課金変更を一時停止しました。
  • Agent SDKの使用料は、引き続きAnthropicの標準API料金で請求されます。
  • 同社は、Claudeサブスクリプションを利用して構築する開発者をより良くサポートするために計画を更新しています。

Claude Agent SDKを使用して構築する開発者は、引き続き標準のAPI料金で請求されるため、予期せぬコスト増加を回避できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。