1. Z.aiがGLM-5.3モデルのオープンウェイトを公開
Z.aiは、8月14日のAPI公開時に定めたスケジュール通り、主力モデル「GLM-5.3」のウェイトを正式に公開しました。この7530億パラメータのMixture-of-Experts(MoE)モデルは、100万トークンのコンテキストウィンドウと12万8000トークンの最大出力を備えています。ウェイトは公開されましたが、Z.aiは年間収益が100億ドルを超える企業に対してセキュリティ審査を義務付ける新しい商用ライセンスを導入しました。モデルはvLLMやSGLangなどのランタイムと互換性がありますが、ローカルでの実行には大規模なハードウェアリソースが必要です。
- • GLM-5.3のオープンウェイトがHugging FaceにてBF16およびFP8形式で利用可能になりました。
- • 今回のリリースは、8月14日のAPI公開時に表明されたオープンソース化の約束を果たすものです。
- • 新しいライセンスにより、年間収益が100億ドルを超える企業は商用利用の前にセキュリティ審査を受ける必要があります。
- • ローカル実行には多大なハードウェアリソースが必要で、2ビット量子化には245GB、8ビット量子化には810GBのメモリが必要です。
- • 本モデルは引き続きvLLM、SGLang、KTransformers、Transformersと互換性があります。
これまでAPI経由でしか利用できなかったフルスケールのGLM-5.3モデルを開発者がセルフホストできるようになり、100万トークンのコンテキストを持つMoEアーキテクチャのローカル展開が可能になりました。
2. CohereがNorth-Micro-Vision-Instructを「Parse 5」APIとして商用化
Cohereは、以前オープンウェイトモデルとしてリリースされた「North-Micro-Vision-Instruct」アーキテクチャを基盤とする商用APIサービス「Parse 5」を開始しました。Parse 5は、PDF、スライド、画像を構造化されたMarkdownに変換するために最適化された23億パラメータの視覚言語モデルで、料金は1000ページあたり1.50ドルです。Cohere API、AWS SageMaker、Microsoft Foundryを通じて利用可能であり、研究目的だった以前のモデルに代わる、本番環境対応の選択肢を提供します。
- • Parse 5は、North-Micro-Vision-Instructアーキテクチャを基盤とした商用APIサービスです。
- • 料金は1000ページあたり1.50ドルです。
- • 9言語をサポートし、構造化されたMarkdownまたはHTMLテーブルとバウンディングボックスを含む「ブロック」モードで出力します。
- • Cohere API、AWS SageMaker、Microsoft Foundryを通じて即時利用可能です。
- • 8192トークンのコンテキストウィンドウと23億パラメータのアーキテクチャを特徴としています。
開発者は、オープンウェイトのNorth-Micro-Vision-Instructモデルでのプロトタイピングから、予測可能な価格設定とエンタープライズサポートを備えた管理型の本番グレードのドキュメント解析サービスへ移行できるようになりました。
3. Agnes AIが低コストAPIを備えた「Agnes 2.5 Pro Beta」をリリース
シンガポールを拠点とするAgnes AIは、エージェント関連のベンチマークで大幅な改善を示したマルチモーダルモデル「Agnes 2.5 Pro Beta」をリリースしました。Artificial Analysis Intelligence Indexで49点を獲得し、Gemini 3.5 FlashやGPT-5.6 Lunaに肉薄する性能を誇ります。100万トークンのコンテキストウィンドウを備え、最大6万5000トークンの出力に対応しています。Agnes AIは、このモデルを無料のオムニモーダルAPIを通じて提供しており、商用価格は100万入力トークンあたり0.10ドル、100万出力トークンあたり0.30ドルという極めて低いレートに設定されています。
- • Agnes 2.5 Pro BetaはArtificial Analysis Intelligence Indexで49点を獲得し、Gemini 3.5 FlashやGPT-5.6 Lunaに次ぐ位置につけました。
- • 100万トークンのコンテキストウィンドウを備え、最大6万5000トークンの出力に対応しています。
- • 商用価格は100万入力トークンあたり0.10ドル、100万出力トークンあたり0.30ドル、100万キャッシュヒットトークンあたり0.01ドルです。
- • テキストと画像の入力モダリティをサポートし、無料のオムニモーダルAPIを通じて利用可能です。
- • 前モデルの約2倍の出力トークン(タスクあたり平均5万トークン)を消費することで、エージェントとしての性能向上を実現しています。
開発者は、100万トークンのコンテキストウィンドウを持つ高性能なエージェントモデルを、無料のオムニモーダルAPIまたは非常に低価格な商用レートで利用できるようになります。
4. Halo Neuroが音声クローンモデル「Sopro V2 Turbo」をオープンソース化
Halo Neuroは、音声クローンモデル「Sopro V2」を発表し、その軽量な1億2000万パラメータの多言語バリアントである「Sopro V2 Turbo」をオープンソース化しました。Sopro V2 Turboはローカル実行に特化して最適化されており、標準的なノートPCのCPUやWebブラウザ上でリアルタイムの音声クローンストリーミングを実現します。このリリースにより、開発者はクラウドホスト型の音声合成APIに代わる、低遅延で軽量な選択肢を得ることになります。
- • Sopro V2 Turboは、1億2000万パラメータの多言語音声クローンモデルです。
- • 完全にオープンソースであり、ノートPCのCPUやWebブラウザ上でローカル実行できるように設計されています。
- • Halo Neuroは、オープンソース版と並行して商用版のSopro V2音声クローンモデルも発表しました。
開発者は、高価なクラウドベースの音声APIに依存することなく、低遅延の多言語音声クローンをクライアントデバイス上で直接展開できるようになります。
5. OpenAI Python SDKがHTTPX2へ移行
公式のOpenAI Python SDKは、基盤となるHTTPクライアントを従来のHTTPXからHTTPX2へ移行しました。この移行により、TLS検証がcertifi CAバンドルからtruststoreライブラリを介したOSネイティブの信頼ストアへ切り替わるなど、いくつかの重要な変更が行われました。カスタム証明書設定、カスタムトランスポート、またはカスタムミドルウェアフックに依存している開発者は、HTTPX2の新しいリクエストおよびレスポンスオブジェクトに対応するようにコードを更新する必要があります。
- • OpenAI Python SDKはHTTPX2を自動的にインストールして使用するようになり、デフォルトのインストールから従来のhttpxパッケージが削除されました。
- • HTTPX2はTLS検証にOSネイティブの信頼ストアを使用するようデフォルト設定されており、certifi CAバンドルに置き換わりました。
- • カスタム証明書が必要な開発者は、SSL_CERT_FILE/DIR環境変数を設定するか、ssl.SSLContextを渡す必要があります。
- • SDKには、タイムアウトと接続プールを管理するためのDefaultHttpx2ClientおよびDefaultAsyncHttpx2Clientヘルパーが導入されました。
- • カスタム認証ハンドラー、フック、トランスポートインターフェースは、HTTPX2のリクエストおよびレスポンスオブジェクトをサポートするように更新する必要があります。
OpenAI Python SDKを使用する開発者は、依存関係の更新や、カスタムTLS検証やカスタムHTTPクライアント設定における破壊的変更に備える必要があります。
6. PydanticがPythonクライアントライブラリ「HTTPX2」の管理を引き継ぐ
PydanticはHTTPXプロジェクトの管理を引き継ぎ、Python向けの次世代HTTPクライアントライブラリとしてHTTPX2をリリースしました。HTTPX2はrequests APIとの互換性を維持しつつ、完全に型注釈された同期・非同期インターフェース、ネイティブなHTTP/2サポート、接続プールを提供します。APIパイプラインを監視するAI開発者にとって重要な点として、HTTPX2にはPydantic Logfire用の組み込みインストルメンテーションが含まれており、OpenTelemetry準拠の可観測性をすぐに利用できます。
- • HTTPX2は、Pydanticの管理下で元のHTTPXプロジェクトを継続する、フル機能のPython用HTTPクライアントライブラリです。
- • HTTP/1.1およびHTTP/2プロトコルをサポートし、完全に型注釈された同期・非同期APIを提供します。
- • Pydantic Logfire用の組み込みインストルメンテーションを備え、OpenTelemetryベースの可観測性をサポートします。
- • HTTPX2はBSDライセンスでリリースされ、100%のテストカバレッジを維持しています。
- • 主な依存関係にはhttpcore2、h11、anyio、truststore、idnaが含まれます。
Python開発者は、LLMプロバイダーへのAPI呼び出しを容易に追跡できる、OpenTelemetryインストルメンテーションを内蔵したモダンで型安全なHTTPクライアントを利用できるようになります。
7. MetaとUIUCが長期エージェント向け「EvoHarness-RL」を発表
Meta AIとUIUCの研究者らは、複雑な長期エンタープライズタスクにおけるAIエージェントのパフォーマンスを向上させるために設計されたフレームワーク「EvoHarness-RL」を発表しました。統一されたBelief(信念)、Progress(進捗)、Experience(経験)のBPEインターフェースを利用することで、このフレームワークはエージェントの相互作用を「追跡(track)」「コミット(commit)」「想起(recall)」「メモ(note)」という4つのコアメタアクションに制限します。評価において、この手法で学習された軽量なQwen3-8Bモデルは、ALFWorldベンチマークで96.9%の成功率を達成し、複数の大規模なフロンティアモデルを上回りました。開発者にとって重要な点として、EvoHarness-RLは既存のオーケストレーションスタックに状態管理レイヤーとして直接統合できるように設計されています。
- • EvoHarness-RLは、統一されたBelief(信念)、Progress(進捗)、Experience(経験)のBPEインターフェースを使用してエージェントの状態を管理します。
- • このフレームワークは、エージェントの相互作用を「追跡」「コミット」「想起」「メモ」という4つのメタアクションに構造化します。
- • EvoHarness-RLで学習したQwen3-8Bモデルは、ALFWorldベンチマークで96.9%の成功率を達成し、より大規模なフロンティアモデルを打ち負かしました。
- • 学習パイプラインは、教師ありハーネスのファインチューニングと、ツール使用を最適化するためのコスト認識型強化学習を組み合わせています。
- • EvoHarness-RLは、現在のツールを置き換えることなく、状態管理レイヤーとして既存のオーケストレーションシステムに追加できます。
開発者は、EvoHarness-RLを既存のエージェントオーケストレーションシステムに状態管理レイヤーとして統合することで、高価なフロンティアAPIにアップグレードすることなくタスクの成功率を向上させることができます。
8. VercelがWebGPUシェーダー展開用ライブラリ「vgpu」をオープンソース化
Vercelは、WebGPUシェーダーの展開を効率化するために設計されたTypeScriptライブラリ「vgpu」をオープンソース化しました。`.wgsl`ファイルを標準的なインポート可能なモジュールとして扱うことで、vgpuはバインディングとレイアウトのビルド時リフレクションを可能にします。このライブラリは汎用性が高く、ブラウザのキャンバス、GoogleのDawnを介したヘッドレスNode.js環境、CIパイプライン用の決定論的モックをサポートしています。gzip圧縮時でわずか25KBという軽量なパッケージには、CLIとホスト型の読み取り専用Model Context Protocol(MCP)サーバーも同梱されています。
- • vgpuは、WebGPUシェーダー(.wgsl)ファイルをインポート可能なモジュールとして扱うMITライセンスのTypeScriptライブラリです。
- • ブラウザキャンバス、Dawnを介したヘッドレスNode.js、CIテスト用の決定論的モックという3つのランタイムをサポートしています。
- • vgpuでコンパイルされた完全なフルスクリーンエフェクトは、CI予算によって強制される約25KB(gzip圧縮時)に収まります。
- • パッケージはnpmのバージョン0.3.1で利用可能であり、CLI、ドキュメント、ホスト型の読み取り専用MCPサーバーが含まれています。
- • 単一のコンテキストハンドルを備え、統合を簡素化するために隠れたグローバル状態を回避しています。
開発者は、ビルド時に型付けされた25KBのライブラリと同梱のMCPサーバーを使用して、高性能なWebGPUシェーダーをWebアプリやAIエージェントに簡単に統合できます。
9. Perplexity Search APIがArtificial Analysis Indexで首位を獲得
Perplexity SearchがArtificial Analysis Search Indexに追加され、低・中・高コンテキストの各バリアントで即座にトップの座を獲得しました。これは、AIエージェントにおける検索APIパフォーマンスの標準化されたベンチマークを確立した8月18日のインデックス立ち上げに続くものです。Perplexityの中規模バリアントは80点を獲得し、ParallelやBrave Searchといった先行するリーダーを上回ると同時に、テストされたプロバイダーの中で最も低いモデル推論コストを維持しました。
- • Perplexity SearchがArtificial Analysis Search Indexのトップに初登場しました。
- • 中規模バリアントは80点を獲得し、先行するリーダーであるParallelやBrave Searchを上回りました。
- • Perplexityはタスクあたりのモデル推論コストで最低額(0.028ドル〜0.034ドル)を達成しました。
- • 中・高コンテキストバリアントのタスクあたりの合計コストは約0.091ドルです。
- • 評価はオープンソースのStirrupエージェントハーネスを使用して実施されました。
開発者は、PerplexityのAPIが他の検索プロバイダーと比較してどうであるかをArtificial Analysisベンチマークで確認できるようになり、エージェントワークフローにおける高精度な検索とコスト効率が裏付けられました。
10. llama.cppのフォールバック動作によりGGUF量子化サイズが誤表示される問題
llama.cppの量子化パイプラインにおけるサイレントなフォールバック動作により、多くのGGUFモデルがファイル名が示すよりも大幅に大きくなっています。テンソルの次元が256で割り切れない場合、量子化器は自動的にIQ4_NLやQ4_0のような高ビットのフォールバック型に置き換えます。443個のGGUFファイルを監査したところ、Nemotron-3.5-Lightningを含む64個が影響を受けており、ラベル付けされたIQ2バリアントが実際には1重みあたり4.58ビットで測定されました。開発者がこれらの不一致を特定できるように、ファイルをすべてダウンロードせずにGGUFテンソル構成を検査する「ggufaudit」という新しいツールがGitHubで公開されました。
- • llama.cppの量子化器は、テンソルの次元が256で割り切れない場合、IQ4_NLやQ4_0のような高ビットのフォールバックに自動的に置き換えます。
- • 25のリポジトリにわたる443個のGGUF量子化を監査した結果、64個のモデルがこのサイレントなフォールバック動作の影響を受けていることが判明しました。
- • Nemotron-3.5-Lightningは大きな影響を受けており、4つのIQ2ランクすべてが、ラベル付けされた低ビットサイズではなく、1重みあたり4.58ビット(bpw)で測定されました。
- • 「ggufaudit」という新しいコマンドラインツールがGitHubで公開され、開発者がGGUFファイルの実際のテンソル構成を検証できるようになりました。
- • この問題は、アップローダーのパイプラインや意図ではなく、モデルのネイティブなテンソル次元によって完全に決定されます。
ローカルモデルを実行する開発者は、新しいggufauditツールを使用して、モデルサイズを肥大化させ、期待されるローカルパフォーマンスを低下させるサイレントなフォールバック置換を検出できます。
11. Qwen3.8-27B向けの新しいGSQ-RCO量子化がリリース
ISTA Deep Algorithms and Systems Labは、Qwen3.8-27Bモデル向けに高度に最適化された一連のGGUF量子化をリリースしました。Gumbel-Softmax Quantization(GSQ)とRiemannian Constrained Optimization(RCO)を活用することで、これらのモデルは低ビットスカラー量子化で通常見られる性能ギャップを埋めています。2.75 bpwバージョン(9.3GB)は、ゼロショット平均で量子化されていないBF16ベースモデルを実際に上回り、3.00 bpwバージョンはAIME25ベンチマークで同等の性能を発揮します。すべてのバージョンは、llama.cpp、Ollama、LM Studioと完全に互換性があります。
- • Gumbel-Softmax Quantization(GSQ)とRiemannian Constrained Optimization(RCO)を使用して量子化されたQwen3.8-27Bがリリースされました。
- • 2.50、2.75、3.00 bpwの3つのGGUFバージョンが利用可能で、ファイルサイズは8.4GBから10.1GBの範囲です。
- • 2.75 bpwバージョンはゼロショット平均で75.70を達成し、量子化されていないBF16ベースモデルのスコア74.34を上回りました。
- • 3.00 bpwバージョンはAIME25ベンチマークで100.00のスコアを記録し、BF16ベースモデルと同等の性能を発揮します。
- • これらのモデルは、llama.cpp、Ollama、LM Studioを含む標準的なローカルランタイムと完全に互換性があります。
ローカルモデルを実行する開発者は、これらの高度なGGUF量子化を使用することで、パフォーマンスをほとんど損なうことなく、コンシューマーハードウェア上で270億パラメータのモデルを展開できます。