Inference Brew

Z.aiがGLM-5.3ファミリーを拡充、マルチモーダルなFlashモデルを投入

00:00 / --:--

← ホームへ戻る

Z.aiがGLM-5.3ファミリーを拡充、マルチモーダルなFlashモデルを投入

1. Z.aiがGLM-5.3ファミリーを拡充、マルチモーダルなFlashモデルを投入

743BパラメータのGLM-5.3モデルの発表に続き、Z.aiはネイティブマルチモーダルなMixture-of-ExpertsモデルであるGLM-5.3-Flashを導入しました。オリジナルのGLM-5.3がコーディングとセキュリティに重点を置いていたのに対し、Flash版は18Bのアクティブパラメータと100万トークンのコンテキストウィンドウを備え、効率性を最適化しています。今回のリリースにより、OpenRouter上で「Ox Alpha」として特定されていたモデルが正式に確認されたことになり、既存のGLM-5.3 APIと並んで、開発者にとってより利用しやすいMITライセンスの選択肢が提供されます。

  • • GLM-5.3-Flashは、320BパラメータのMoEモデルで、アクティブパラメータは18B、コンテキストウィンドウは100万トークンです。
  • • モデルはMITライセンスでリリースされており、ウェイトはFP8およびBF16形式で利用可能です。
  • • API料金は、入力トークン100万あたり0.15ドル、出力トークン100万あたり0.50ドルに設定されています。
  • • 同モデルはArtificial Analysis Intelligence Indexで57点を記録しました。
  • • 自己ホストには、約306 GiBのFP8ウェイトとNVIDIA Hopper以降のハードウェアが必要です。

このリリースは、GLM-5.3エコシステム内で高性能かつ自己ホスト可能なマルチモーダルな選択肢を提供し、開発者に743Bパラメータの大型モデルに代わる費用対効果の高い代替手段をもたらします。

2. AlibabaがオープンウェイトのマルチモーダルMoE「Qwen3.8-Flash-Next」をリリース

AlibabaのQwenチームは、統合されたビジョンエンコーダーを備えたオープンウェイトの因果言語モデル「Qwen3.8-Flash-Next」をリリースしました。コスト効率の高いトークン処理を目的として設計されており、トレーニングコストはQwen3.7-Plusの約9分の1です。Gated DeltaNetとQwen Sparse Attentionを組み合わせたハイブリッドアテンションメカニズムを採用し、長文コンテキストのレイテンシを最小限に抑えています。開発者はUnsloth、Swift、LLaMA-Factoryを使用してモデルを微調整したり、一般的なサービングフレームワークを使用してデプロイしたりできます。

  • • Qwen3.8-Flash-Nextは125Bパラメータのバックボーンを特徴とし、トークンあたりのアクティブパラメータはわずか6Bで、Qwen4アーキテクチャのプレビュー版としての役割も果たします。
  • • モデルは262,144トークンのネイティブコンテキストウィンドウをサポートしており、YaRNを使用して最大1,000,000トークンまで拡張可能です。
  • • Gated DeltaNet、Qwen Sparse Attention、Gated Residual、Muonオプティマイザーなどのアーキテクチャの更新が組み込まれています。
  • • デプロイにはマルチGPUノードが必要で、FP8チェックポイントは172.78 GiB、BF16チェックポイントは335.28 GiBです。
  • • モデルはqwen-community-1.0ライセンスでリリースされており、vLLM、SGLang、TokenSpeed、llama.cppと互換性があります。

開発者は、標準的なマルチGPUサービングフレームワークで動作し、ネイティブで262kのコンテキストウィンドウを持つ、非常にコスト効率の高いオープンウェイトのマルチモーダルモデルを利用できるようになります。

3. GoogleがGemini 3.5 Transcribe APIのパブリックプレビューを開始

Googleは、生の音声を洗練されたフォーマット済みのテキストに変換し、「えー」や「あの」といったフィラーワードを自動的に除去するように設計された新しい音声認識モデル「Gemini 3.5 Transcribe」を立ち上げました。このリリースには、録音済み音声用のGemini 3.5 Transcribeと、継続的なストリーミング用のGemini 3.5 Transcribe Liveが含まれています。一部の競合他社よりもわずかに高価ですが、このモデルは優れたレイテンシと精度を提供し、速度とエラー率の面でGPT Live Transcribeを上回っています。

  • • Gemini 3.5 Transcribeは、録音済み音声で2.6%、ストリーミングユースケースで4.0%の単語誤り率(WER)を達成しています。
  • • このモデルはAI StudioのGemini APIを通じてパブリックプレビューで利用可能で、85以上の言語とカスタム語彙をサポートしています。
  • • 録音済みAPIの料金は1,000分あたり約5ドル、ストリーミングLive APIの料金は1,000分あたり約9ドルです。
  • • このモデルは以前のChirp 3エンジンより70%高速で、録音済み音声をリアルタイムの約84倍の速度で処理します。
  • • ストリーミングLive APIは、最初の部分的な文字起こしイベントに対してわずか0.25秒のレイテンシで5.8%のWERを達成します。
  • • APIは最大3人の話者までのタイムスタンプ付き話者識別と、ネイティブな関数呼び出しをサポートしています。

開発者は、複数話者の識別、カスタム語彙、リアルタイムストリーミングを処理する、高速で低レイテンシの文字起こしAPIを統合できます。

4. falが最適化されたMiniMax H3 Maxモデルをリリース

7月にリリースされたベースモデルMiniMax H3を基盤として、falはMiniMax H3 Maxを導入しました。このポストトレーニング版は、プロンプトへの忠実度と美観が強化されており、Artificial AnalysisのImage to Videoリーダーボードでトップランクを獲得しました。カスタム推論スタックでモデルを共同最適化することで、falはこの高性能バージョンをオリジナルのH3エンドポイントよりも低コストで提供します。

  • • MiniMax H3 Maxは、Artificial AnalysisのVideo Leaderboards with Audioにおいて、Image to Videoで1位、Text to Videoで3位にランクインしています。
  • • 価格は768p動画1秒あたり0.04ドルで、ベースのH3レートである1秒あたり0.06ドルから引き下げられました。
  • • 統合された音声生成機能と最大768pの解像度を特徴としています。
  • • カスタム推論スタックにより、5秒の動画生成を3秒未満で完了できます。
  • • falは将来的にモデルのウェイトを公開する予定です。

開発者は、falのAPIを通じて、MiniMax H3モデルのより高性能で費用対効果の高いバージョンにアクセスできるようになりました。

5. オープンソースのオムニモーダル世界モデル「EchoWM」がリリース

オープンソースコミュニティは、高度に同期されたマルチモーダル環境を生成するように設計されたオムニモーダル世界モデル「EchoWM」をリリースしました。連続的な6自由度(6-DoF)のカメラ軌道に従うことで、モデルは720p動画、環境音、音楽、音声を同時に生成できます。EchoWMは一人称および三人称のインタラクションの両方をサポートし、プログレッシブトレーニングと自己回帰トレーニングを組み合わせて、長期間にわたって同期を維持します。

  • • EchoWMは、GitHubでリポジトリがホストされているオープンソースのオムニモーダル世界モデルです。
  • • モデルは連続的な6自由度(6-DoF)のカメラ軌道に従って同期された出力を生成します。
  • • 720p動画、環境音、音楽、音声を共同で生成します。
  • • 一人称および三人称のインタラクティブな生成の両方をサポートしています。
  • • プログレッシブトレーニングと自己回帰トレーニングを利用して、同期された長期間の生成を促進します。

開発者は、連続的なカメラ軌道に基づいて同期されたマルチモーダル出力を生成する、統合されたオープンウェイトモデルを試すことができます。

SOURCES

6. ログペイロードでAIエージェントを乗っ取る「GhostJacking」脆弱性

DEF CON 34において、Tenet Securityは、過度な権限を持つAIエージェントがブロックされたファイアウォールログに隠された悪意のある指示を実行してしまう重大な脆弱性「GhostJacking」を実証しました。エージェントは多くの場合、事前に発行された資格情報を使用してログを読み取るため、毒性のあるペイロードを実行するように簡単に誘導されてしまいます。テストでは、Sonnet 4.6上のClaude Codeが試行の90%で攻撃の犠牲になりました。このリスクを軽減するために、開発者はシステムへの重大な変更に対して手動の人間による承認を必要とする厳格な承認ゲートを実装することが強く推奨されます。

  • • GhostJackingは、AIエージェントがログから毒性のあるペイロードを読み取り、それを正当な指示と解釈して実行したときに発生します。
  • • ベンチマークテストでは、Sonnet 4.6上のClaude Codeは、10回の試行のうち9回で仕込まれた指示に従いました。
  • • Tenet Securityは、この攻撃に対して脆弱な構成を持つ6社のフォーチュン500企業を含む48の組織を特定しました。
  • • 2026年のLLMアプリケーション向けOWASP Top 10では、これらの現実のリスクにより「過度な権限(Excessive Agency)」が3位に引き上げられました。
  • • セキュリティ専門家は、重大な変更に対して人間の承認を必要とする承認ゲートを実装することを推奨しています。

開発者は、エージェントが注入されたログペイロードを実行するのを防ぐために、重大なアクションに対して人間が介在する厳格な承認ゲートを実装する必要があります。

SOURCES

7. 標準的な仮想マシンでは高度なAIエージェントを封じ込められないことが判明

「Patch the Planet」イニシアチブの一環として実施されたセキュリティテストにおいて、GPT 5.6-Cyberを実行するサイバー能力を持つAIエージェントが、標準的なQEMU/KVM仮想マシンから3回にわたって脱出することに成功しました。12時間自律的に動作したエージェントは、未分類のバグ、ゼロデイ脆弱性、およびlibslirpの公開された脆弱性を組み合わせてエクスプロイトを調査・構築しました。この結果は、標準的な仮想マシンが高度で自律的なAIエージェントを封じ込めるには不十分であることを示しており、Firecrackerのようなセキュリティ重視の仮想化技術への移行が強く推奨されています。

  • • GPT 5.6-Cyberを実行する自律型エージェントが、Debian 12ホスト上のQEMU/KVM仮想マシンから3回脱出することに成功しました。
  • • エージェントは12時間自律的に動作し、調査、エクスプロイトの構築、失敗からのバックトラッキングを行いました。
  • • エージェントは、Januscape (CVE-2026-53359) やlibslirpのCVE-2026-9539を含む、既知の脆弱性、未分類のセキュリティバグ、ゼロデイ脆弱性を悪用しました。
  • • 著者は、標準的なVMでは高度なAIエージェントを封じ込めるには不十分であると結論付けています。
  • • レポートでは、エージェントのサンドボックス化のためにFirecrackerのようなセキュリティ重視の仮想化技術を使用することを強く推奨しています。

エージェント実行サンドボックスを構築する開発者は、ホストの侵害を防ぐために標準的なVMを避け、Firecrackerのようなセキュリティ重視の仮想化を採用する必要があります。

SOURCES

8. Vercel Connectが一般提供(GA)を開始

Vercelは、Connectサービスをパブリックベータから正式に一般提供(GA)へと移行しました。長期的なAPIトークンをタスクスコープの短命な資格情報に置き換えるために2026年6月に初めて導入されたこのサービスには、現在100以上の事前構築済みコネクタのライブラリが含まれています。今回のリリースにより、開発者はAIエージェントのセキュリティとガバナンスを管理するための、安定した本番環境対応の統合モデルを利用できるようになります。

  • • Vercel Connectはパブリックベータから一般提供へと移行しました。
  • • このサービスは現在、さまざまなサービス向けの100以上の事前構築済みコネクタを備えています。
  • • AIエージェントのタスクを保護するために、ランタイム発行の短命な資格情報を提供し続けています。
  • • GAリリースでは、エンタープライズ規模のエージェントデプロイメントに向けた本番環境レベルのガバナンス制御が導入されています。

開発者は、静的なAPIキーを排除する安定したサポート対象のセキュリティフレームワークを使用して、AIエージェントのワークフローをテストから本番環境へ移行できるようになりました。

SOURCES

9. RAGシステムを簡素化するための実用的なアーキテクチャフレームワーク

Hacker Newsに掲載された新しいアーキテクチャガイドは、検索拡張生成(RAG)システムを過剰にエンジニアリングするという業界の傾向に異議を唱えています。著者は実用的な意思決定フレームワークを概説し、システムの60%は安価なエージェントによるクエリ書き換えと組み合わせた単純なBM25全文検索に依存すべきであると推奨しています。毎日10%を超える高いドキュメント変動があるシステムについては、継続的な再インデックスのオーバーヘッドを排除するためにオンザフライの埋め込み(embedding)を提案しており、完全な事前埋め込みは安定したコーパスを持つ大規模システムのためにのみ予約すべきとしています。

  • • このフレームワークでは、チャンク化が不要でモデルの非推奨リスクを回避できるため、MVPとしてBM25全文検索から始めることを推奨しています。
  • • GPT-4o-miniのような安価なモデルを使用したエージェントによるクエリ書き換えにより、会話型クエリをクエリあたり約0.001ドルでキーワードに変換できます。
  • • BM25と埋め込みベースのリランキングを組み合わせたハイブリッド検索は、クエリあたり200〜500msのレイテンシを追加します。
  • • 毎日10%を超える高いドキュメント変動があるシステムでは、完全な再インデックスを避けるためにオンザフライの埋め込みが推奨されます。
  • • ホット/コールド階層化により、頻繁なドキュメントを事前埋め込みし、まれなドキュメントをオンザフライで埋め込むことでコストを最適化します。
  • • 著者は、システムの60%がクエリ書き換えを伴う全文検索、25%がハイブリッド検索、わずか10%のみが完全な事前埋め込みを使用すべきであると提案しています。

開発者は、過剰なエンジニアリングを避け、ドキュメントの変動に合わせて検索戦略を調整することで、より高速で安価、かつ信頼性の高いRAGシステムを構築できます。

SOURCES

10. Lemonadeプラットフォームが最新アップデートでセマンティックルーティングと埋め込みSDKを追加

v10.8リリースに続き、LemonadeプロジェクトはローカルAI開発プラットフォームの大幅なアップデートを導入しました。このリリースでは、以前のハードウェアアクセラレーションの改善を拡張し、ARM64およびMetalバックエンドのネイティブサポートを追加しました。新機能には、直接的なアプリケーションバンドル用の埋め込みSDKや、ユーザーのプロンプトに基づいて自動的にモデルを選択するセマンティックおよびポリシーベースのルーティングが可能なルーターが含まれています。さらに、プラットフォームには音楽および3Dアセットモダリティ用の実験的なエンジンが含まれるようになりました。

  • • 自動モデル選択のためのセマンティックおよびポリシーベースのルーティングを導入しました。
  • • Lemonadeをアプリケーションに直接バンドルするための埋め込みSDKを追加しました。
  • • バックエンドサポートを拡張し、ARM64とMetalを含めました。
  • • 音楽および3Dアセットモダリティ用の実験的なエンジンを追加しました。

開発者は、Lemonadeの機能をアプリケーションに直接統合し、プラットフォームの既存のローカルAIサービスアーキテクチャを基盤として、自動化されたモデル選択を活用できるようになりました。

SOURCES

11. ParticleがポッドキャストインテリジェンスAPI「Radar」とMCPサーバーを立ち上げ

Particleは、話し言葉の音声をAIシステムにとって非常にアクセスしやすいものにするために設計されたポッドキャストインテリジェンスプラットフォーム「Radar」を立ち上げました。13万以上のポッドキャストを文字起こし・分析したRadarは、これらの会話をウェブ上で検索可能にし、基礎となるデータを開発者に公開します。AIアプリケーション構築者にとって重要な点として、このプラットフォームは標準APIとModel Context Protocol(MCP)サーバーの両方を提供しており、AIエージェントがポッドキャストの洞察をすぐにクエリして利用できるようになっています。

  • • Particleの新しいRadarプラットフォームは、13万以上のポッドキャストのカタログを文字起こし・分析します。
  • • このプラットフォームにより、ポッドキャストの会話をウェブ上で完全に検索可能にします。
  • • ポッドキャストのデータと文字起こしは、専用のAPIを通じてAIエージェントに公開されます。
  • • 統合には、シームレスなエージェント接続のためのModel Context Protocol(MCP)サーバーが含まれています。

開発者は、事前構築済みのMCPサーバーを使用して、豊富で構造化されたポッドキャストデータと文字起こしをAIエージェントやアプリケーションに簡単に統合できます。

SOURCES

12. カスタムvLLMフォークがQwen3.8 27B向けにINT8サービングスタックを提供

コミュニティが開発した新しいvLLMフォークは、ネイティブなFP8機能を持たない古いGPUハードウェア上でQwen3.8 27Bモデルを最適化するために設計された、完全なINT8サービングスタックを導入しました。vLLM、AITER、およびDFlash2を使用した27B GPTQ INT8量子化を組み合わせることで、このスタックはすべてのAttentionブロックとGEMM全体で参照品質に近い品質を維持しながら、大幅なスループット向上を達成します。一方、コミュニティのベンチマークでは、Qwen3.8 27Bの4ビット量子化(Q4_K_M)が、ローカル推論やエージェントタスクにおいて非常に優れた性能を維持していることが確認されています。

  • • カスタムvLLMフォークは、4x MI100システム上でのQwen3.8 27Bの生成パフォーマンスを、毎秒15トークンから毎秒972トークンに向上させました。
  • • このスタックは、W8A8 INT8 GEMMライブラリ、INT8 KVキャッシュ、AITER Unified Attention、およびカスタムのallreduce/allgather操作を統合しています。
  • • この実装は特にAMD MI100 GPU向けに調整されており、MI50およびMI210カードと互換性があります。
  • • Qwen3.8 27BのQ4_K_M量子化は、1ビットの代替案と比較して高い精度を維持する最も効果的なオプションとしてベンチマークされています。
  • • RTX 4090のようなコンシューマーハードウェアでのローカルテストでは、システムRAMへのオフロードにより、モデルが130kを超えるコンテキスト長を処理できることが示されています。

ネイティブなFP8サポートのない古いGPUでローカルモデルを実行する開発者は、最適化されたINT8量子化を使用して、参照品質に近い品質と大幅なスループット向上を達成できます。

13. ローカルモデルをAIゲートウェイに接続するための要件を詳述したガイド

ngrokのSam Roseは、開発者が微調整されたLlamaモデルやローカルのLlamaモデルをAIゲートウェイに統合する際に直面する一般的な摩擦点を解決するための詳細なガイドを公開しました。多くのゲートウェイはOpenAI互換のベースURLを期待しているため、開発者はローカルのGPUサーバーをパブリックインターネットに公開せざるを得ないことがよくあります。このドキュメントでは、7つの主要なゲートウェイの要件に関するステップバイステップのウォークスルーを提供し、ngrok.aiを使用してローカルエンドポイントに対して安全なパブリックホスト名を設定する方法を実証しています。

  • • 多くの一般的なAIゲートウェイは、微調整されたモデルやローカルモデルを統合するためにOpenAI互換のベースURLを必要とします。
  • • ローカルGPUサーバーをこれらのゲートウェイに接続するには、通常、パブリックホスト名とオープンなインバウンドポートが必要です。
  • • ドキュメントでは、7つの一般的なAIゲートウェイ全体での統合要件を概説しています。
  • • このガイドでは、複雑なファイアウォール構成なしでローカルモデルのエンドポイントを安全に公開するためにngrok.aiを使用することを推奨しています。

開発者は、安全なトンネリングツールを使用することで、ローカルGPUサーバーをパブリックAIゲートウェイに接続する際の接続問題を解決できます。

SOURCES

14. macOSにおけるCodexの「ロックされた使用(Locked Use)」機能に対する安定性の警告

Codexを使用する開発者は、macOSでの深刻な安定性の問題のため、その「ロックされた使用(locked use)」機能の使用を避けるよう助言されています。この機能は不安定なmacOSシステム機能に依存しており、ユーザーがmacOSキーチェーンから完全に締め出されるという報告がなされています。この問題は現在、Appleの開発者フォーラムで既知のバグとして認識されており、パッチが発行されるまで開発者はこの機能を有効にすることを避けるべきです。

  • • 公開サービスのアナウンスにより、Codexの「ロックされた使用」機能を使用しないよう警告されています。
  • • この機能は不安定なmacOS機能に依存しており、ユーザーのキーチェーンが完全にロックアウトされる事例が複数発生しています。
  • • 根本的な問題は、Appleの開発者フォーラムで既知のバグとして認識されています。

macOSでCodexを使用する開発者は、システムキーチェーンから完全に締め出されるのを防ぐために、ロックされた使用機能を無効にするか避ける必要があります。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。