1. Alibabaがホスト型Qwen3.8-Omni-Flash APIを公開
8月のオープンウェイトモデル「Qwen3.8-Flash-Next」のリリースに続き、Alibabaはホスト型APIサービスとして「Qwen3.8-Omni-Flash」を公開しました。この新しいオムニモーダル版は、テキスト、画像、音声、動画の入力をサポートし、100万トークンのコンテキストウィンドウを備えており、QwenCloudおよびAlibaba Cloud Model Studioを通じて利用可能です。開発者がこのモデルを活用したエージェント構築を行えるよう、Apache-2.0ライセンスの下で「Qwen-MM-Plugins」もリリースされました。
- • Qwen3.8-Omni-Flashは、Qwen3.8-Flash-Nextアーキテクチャのホスト型APIバージョンです。
- • テキスト、画像、音声、動画の入力をサポートし、100万トークンのコンテキストウィンドウを備えています。
- • 価格は入力100万トークンあたり0.15ドル、出力100万トークンあたり0.47ドルです。
- • エージェント構築を支援するQwen-MM-Plugins(Apache-2.0)が含まれています。
- • OmniVideoBenchの精度を67.8に向上させつつ、トークン使用量を45.7%削減しました。
開発者は、モデルを自前でホストすることなく、長尺の動画や音声処理を含むマルチモーダルアプリケーション向けに、Qwen3.8-Flash-Nextアーキテクチャをマネージドサービスとして利用できるようになりました。
2. xAIがマルチリファレンス対応のGrok Imagine Image 2.0をリリース
xAIは、Artificial AnalysisのText to Imageリーダーボードで4位にランクインし、OpenAI以外のモデルとしては最高位となるテキスト・トゥ・イメージおよび編集モデル「Grok Imagine Image 2.0」をリリースしました。このモデルは、テキストからの画像生成、画像編集、および最大5枚の入力画像を使用したマルチリファレンス生成をサポートしています。xAI API、Grok Imagineウェブサイト、Grokアプリ、fal、Replicateを通じて利用可能です。前世代と比較して、知識、テキストレンダリング、照明能力において大幅な性能向上が見られます。
- • xAIがリリースしたGrok Imagine Image 2.0は、Artificial AnalysisのText to Imageリーダーボードで4位にランクインしました。
- • テキストからの画像生成、画像編集、最大5枚の入力画像を用いたマルチリファレンス生成をサポートしています。
- • xAI API、Grok Imagineウェブサイト、Grokアプリ、fal、Replicateを通じて利用可能です。
- • Artificial Analysisリーダーボードにおいて、品質と価格のパレートフロンティアに位置しています。
- • 知識、テキストレンダリング、照明能力において大幅な性能向上が確認されました。
開発者は、最大5枚の入力画像を用いたマルチリファレンス生成をサポートする、非常に競争力がありコスト効率の高い画像生成・編集モデルを統合できます。
3. SpaceXAIが低遅延ストリーミング対応のGrok Voice Transcribe 2.0をリリース
SpaceXAIは、Grok Voice Transcribe 1.0の後継となる新しい音声認識モデル「Grok Voice Transcribe 2.0」をリリースしました。このモデルは、ストリーミングの最終文字起こしにおいて、発話終了から0.49秒で単語誤り率(WER)2.7%を達成し、最初の部分的な文字起こしでは3.4%のWERを記録しました。非ストリーミングタスクではAA-WERで2.3%をスコアし、59モデル中5位にランクイン、約160倍の速度係数を実現しています。精度は高いものの、Muse Voice Transcribe、ElevenLabs Scribe v2 Realtime、Cartesia Ink-2といった競合モデルと比較すると速度は劣ります。
- • SpaceXAIは、前バージョンの1.0を継承するGrok Voice Transcribe 2.0をリリースしました。
- • ストリーミングの最終文字起こしにおいて、発話終了から0.49秒でWER 2.7%を達成しました。
- • ストリーミング文字起こしの価格は1時間あたり0.20ドル(1,000分あたり3.33ドル)、非ストリーミングは1時間あたり0.10ドル(1,000分あたり1.67ドル)です。
- • 非ストリーミングタスクではAA-WERで2.3%を記録し、59モデル中5位、速度係数は約160倍です。
- • ストリーミング価格はCartesia Ink-2(4.00ドル)より安く、ElevenLabs Scribe v2 Realtime(6.50ドル)の約半額です。
開発者は、1時間あたり0.20ドルという競争力のある価格で、高精度かつ低遅延のストリーミング音声文字起こしをアプリケーションに実装できます。
4. Jina AIが低予算GPU向け「jina-ocr-v1」をリリース
Jina AIは、NVIDIA L4のような低予算GPU向けに設計されたエンドツーエンドの視覚ドキュメントパーサー「jina-ocr-v1」をリリースしました。このモデルは、DeepSeek-OCRバックボーン上に構築され、DeepSeek-3B-MoEデコーダーを利用する、総パラメータ数34億(トークンあたりのアクティブパラメータは約5億7000万)のモデルです。FastMTP推論デコーディングヘッドを搭載しており、ロスレスで決定論に近い出力生成が可能です。パーサーはMarkdown形式でコンテンツを出力し、表はHTML、数式はLaTeXでフォーマットされ、NVIDIA A100 40GB GPU単体で毎秒2.57ページの処理能力を実現します。
- • Jina AIは、低予算GPU向けに設計されたエンドツーエンドの視覚ドキュメントパーサー「jina-ocr-v1」をリリースしました。
- • 総パラメータ数は34億で、トークンあたりのアクティブパラメータは約5億7000万です。
- • DeepSeek-OCRバックボーン上に構築され、FastMTP推論デコーディングヘッドを備えたDeepSeek-3B-MoEデコーダーを利用しています。
- • OmniDocBench v1.6で91.14、olmOCR-Benchで83.4のスコアを達成しました。
- • CC BY-NC 4.0ライセンスでリリースされており、商用利用にはJina AIからのライセンスが必要です。
- • Markdown形式で出力し、表はHTML、数式はLaTeXでフォーマットされます。
開発者は、構造化されたMarkdown、HTMLテーブル、LaTeX数式を出力する高精度なドキュメントパーサーを、高いスループットでセルフホストできます。
5. Realtime-Venusが全二重音声・視覚モデルをオープンソース化
Realtime-Venusリポジトリは、「Realtime-Venus-Omni」と「Realtime-Venus-Audio」という2つのチェックポイントをリリースしました。Realtime-Venus-Omniは、MiniCPM-o 4.5をベースに調整された9Bの音声・視覚対話モデルで、プロアクティブな対話、意味的な割り込み処理、トレーニング不要の長尺動画メモリをサポートします。Realtime-Venus-Audioは、音声理解と音声駆動型の会話に特化したチェックポイントです。このシステムはネイティブな全二重会話機能を備えており、話しながら入力を認識できるほか、インストリームのデリゲートリクエストを使用して、会話を中断することなく外部ツールとの統合を処理します。
- • Realtime-Venusリポジトリは、Realtime-Venus-Omni(9B音声・視覚モデル)とRealtime-Venus-Audio(音声特化モデル)をホストしています。
- • ネイティブな全二重会話機能を備えており、話しながら入力を認識することが可能です。
- • Omni-Proactive対話機能により、ユーザーのプロンプトを待たずにイベントに対して応答を開始できます。
- • インストリームのデリゲートリクエストを使用して、会話を中断することなく外部ツールとの統合を処理します。
- • Token2wavリソースと参照音声をバンドルし、テキストとネイティブな音声出力の両方を生成します。
開発者は、意味的な割り込み処理やインストリームでのツール統合が可能な、高度にインタラクティブな音声・動画エージェントを構築できます。
6. 421Mパラメータの非自己回帰型意思決定モデル「Laya」がリリース
開発者のLayaは、インテントルーティング、ファクトチェック、モデレーションの合意形成、プロンプトガードレール、ルーブリック採点、マルチターン会話の軌跡などのタスク向けに設計された、421Mパラメータの非自己回帰型意思決定モデルをリリースしました。このモデルアーキテクチャは、双方向のModernBERT-largeエンコーダーとスクラッチのTransformerヘッドを組み合わせ、型付きスキーマを解決するもので、約35ミリ秒という極めて高速なフォワードパス時間を実現しています。RTX 6000 Pro GPU(VRAM 96GB)単体で、25,000件以上の人間がアノテーションした実世界の例を使用してトレーニングされ、ポリシー勾配強化学習アプローチで最適化されています。
- • Layaは、インテントルーティング、ファクトチェック、モデレーション、ガードレール用の421Mパラメータ非自己回帰型意思決定モデルです。
- • 双方向のModernBERT-largeエンコーダーとスクラッチのTransformerヘッドを組み合わせ、型付きスキーマを解決します。
- • 約35ミリ秒という極めて高速なフォワードパス時間を実現しています。
- • RTX 6000 Pro GPU単体で、25,000件以上の人間がアノテーションした実世界の例を使用してトレーニングされました。
- • Layaは、専用のHugging FaceスペースおよびGitHubリポジトリでテスト可能です。
開発者は、フォワードパス時間がわずか35ミリ秒という、極めて高速で専門性の高いルーティングおよびモデレーションモデルをローカルで実行できます。
7. オープンソースのストリーミングASRモデル「Confucius4-R2T2」がリリース
「Confucius4-R2T2」と呼ばれる新しいリアルタイムストリーミング自動音声認識(ASR)モデルがオープンソース化されました。このモデルは、音声エージェント向けに特別に設計された17億パラメータのシステムです。GitHubおよびHugging Faceからアクセス可能で、開発者はリアルタイムの音声認識タスクをセルフホストできます。
- • Confucius4-R2T2は、オープンソースのリアルタイムストリーミング自動音声認識(ASR)モデルです。
- • 17億パラメータを備え、音声エージェント向けに特別に設計されています。
- • GitHubおよびHugging Faceからアクセス可能です。
開発者は、GitHubやHugging Faceから直接、低遅延で音声エージェントに最適化された音声認識モデルをセルフホストできます。
8. Claude CodeがWindowsネイティブ対応とAGENTS.md統合を追加
Anthropicは、先週リリースされたプラグイン評価ワークフローを基盤として、Claude Codeの機能を拡張しました。今回のアップデートでは、Windowsへのネイティブインストールサポート、PDF読み取り機能、プロジェクト設定用のAGENTS.mdファイルの読み取り機能が追加されました。また、マルチエージェントオーケストレーションのための動的ワークフローや新しいプロキシ設定オプションが導入され、Claude Opus 4.8、4.5、Sonnet 4.6を含むモデルサポートも拡大されました。
- • Claude CodeがWindowsネイティブインストールとPDFファイルの読み取りをサポートしました。
- • AGENTS.mdを読み取り、プロジェクト固有の指示を実行します。
- • 新しい動的ワークフローにより、複雑なマルチエージェントタスクのオーケストレーションが可能になりました。
- • Claude Opus 4.8、4.5、Sonnet 4.6、およびMantle経由のAmazon Bedrockをサポートしました。
- • 環境変数「CLAUDE_GATEWAY_PROXY_IS_EGRESS_BOUNDARY=1」により、フォワードプロキシをサポートします。
開発者はクロスプラットフォームでのアクセシビリティとプロジェクトレベルの設定制御が向上し、Claude Codeのエージェントワークフローがさらに成熟しました。
9. AIコーディングエージェント「ZCode」がGit履歴をAliyun OSSへ密かにアップロード
ZhipuのAIコーディングデスクトップアプリ「ZCode」に対するセキュリティ調査により、同ソフトウェアがユーザーのワークスペースを密かにパッケージ化し、Aliyun OSSにアップロードしていることが判明しました。収集されるデータには、.git履歴全体、LFSアセットキャッシュ、reflogs、グローバル設定が含まれており、.gitディレクトリがペイロードの約86.6%を占めています。このバックグラウンドでのキャプチャおよびアップロードプロセスは、ユーザーがログインしている限り起動時に無条件で実行され、「エクスペリエンスの最適化」や「リポジトリスナップショットのインデックス作成」といったUI設定を完全に無視します。アップロードされたアーカイブは公開鍵によるエンベロープ暗号化が施されており、ユーザー自身がアップロードしたファイルにアクセスしたり復号したりすることはできません。
- • ZCodeは、.git履歴、LFSアセットキャッシュ、reflogsを含むユーザーワークスペースを密かにパッケージ化・暗号化し、Aliyun OSSにアップロードします。
- • バックグラウンドキャプチャはログイン時に起動時無条件で実行され、UIのトグル設定を無視します。
- • アップロードされたアーカイブは公開鍵で暗号化されており、秘密鍵はZ.aiのみが管理しています。
- • .gitディレクトリがペイロードの約86.6%を占めており、過去のAPIキーや削除された機密設定が流出するリスクがあります。
- • ユーザーは、macOSのchflagsやLinuxのchattrを使用して「~/.zcode/v2/checkpoints」ディレクトリに不変フラグを設定することで、アップロードプロセスをブロックできます。
ZCodeを使用している開発者は、過去のAPIキー、削除された設定、機密コードの流出を防ぐため、バックグラウンドでのアップロードを直ちにブロックする必要があります。
10. MiniMaxがターミナル版「MiniMax Code」をオープンソース化
MiniMaxは、ターミナル版「MiniMax Code」をMITライセンスの下、GitHubでオープンソース化しました。今回のリリースは0.4.12のソースプレビューであり、デスクトップアプリケーションのソースコードは含まれていません。リポジトリには、インタラクティブなTUI、ヘッドレス実行、コード編集、シェルコマンド、diff、テスト検証、権限制御、サンドボックス機能が含まれています。サブエージェント、プラグイン、スキル、Model Context Protocol(MCP)、およびOpenAI/Anthropic互換プロバイダーを使用したBring Your Own Key(BYOK)をサポートしています。
- • MiniMaxは、ターミナル版MiniMax Code(v0.4.12ソースプレビュー)をMITライセンスでGitHubにオープンソース化しました。
- • インタラクティブなTUI、ヘッドレス実行、コード編集、シェルコマンド、diff、サンドボックス機能を備えています。
- • サブエージェント、プラグイン、スキル、MCP、OpenAI/Anthropic互換プロバイダー向けのBYOKをサポートしています。
- • デスクトップアプリケーションのソースコードは含まれていません。
- • 公開パッケージとソースチェックアウトの間で、バージョン番号が一致していてもビルドの来歴が同一であるとは限りません。
開発者は、サブエージェント、プラグイン、カスタムLLMバックエンドをサポートする、カスタマイズ性の高いMITライセンスのターミナルコーディングエージェントを採用できます。
11. Notionがエージェント指示管理のための「Skills API」を開発者プラットフォームに追加
AIエージェント向け開発者プラットフォームの2026年5月の立ち上げに続き、Notionは「Skills API」を導入しました。この新しいツールにより、チームはエージェントの指示を共同で編集・配布できるようになり、GitHub同期やVercelのスキルインストーラーと統合することで、エージェント環境全体へのデプロイを効率化できます。
- • 新しいSkills APIでNotion開発者プラットフォームを拡張しました。
- • エージェント指示の共同編集と配布を可能にします。
- • GitHub同期およびVercelのスキルインストーラーを介したデプロイをサポートします。
このアップデートは、エージェントの指示を大規模に管理・共有するために必要なインフラを提供し、プラットフォームをワークスペース統合ハブから共同エージェント開発環境へと進化させます。
12. NVIDIAがエージェントハーネス「SoL-Pi」をHugging Faceでオープンソース化
NVIDIAは、SoL-Piプロジェクトを拡大し、エージェントハーネス全体をHugging Faceでオープンソースツールとしてリリースしました。これは、Piコーディングエージェントを最適化するために設計されたSoL-Pi拡張機能の以前のリリースに続くものです。新しいハーネスは、再帰的な自動リサーチループを活用してトークン通信量を最大49%削減し、開発者がさまざまなエージェントワークフロー全体でAPIコストを削減するためのより広範なフレームワークを提供します。
- • NVIDIAは、SoL-PiエージェントハーネスをHugging Faceでオープンソース化しました。
- • このリリースは、以前発表されたPiコーディングエージェント用のSoL-Pi拡張機能を拡張するものです。
- • ハーネスは再帰的な自動リサーチループを使用して、トークン通信量を44.7%から49.0%削減します。
- • 開発者は、エージェントのパフォーマンスを維持しながら、APIコストを約3分の1削減できます。
開発者は、SoL-Piハーネス全体にアクセスすることで、初期のPiコーディングエージェント拡張機能を超えて、より幅広いエージェントアプリケーションでトークン使用量を最適化し、APIコストを削減できるようになりました。
13. ローカルLLM向けオープンソースエージェントハーネスのランキングガイドが公開
2026年9月18日に公開されたガイドでは、ライセンス、ドキュメント、メンテナンス、安全性の観点から、ローカルLLM向けのオープンソースエージェントハーネス11選をランク付けしています。このガイドでは、OpenCode、Goose、Cline、OpenHands、Aiderなどが取り上げられています。コンテキストウィンドウを少なくとも64,000トークンに設定し、モデルがツール呼び出しをサポートしていることを確認するなどの一般的なベストプラクティスが概説されています。また、OpenHandsがQwen3.6-35B-A3Bの使用を推奨し、少なくとも24GBのVRAMまたはApple Silicon上の64GBのユニファイドメモリを必要とするなど、具体的なハードウェア要件も詳述されています。
- • OpenCode、Goose、Cline、OpenHands、Aiderを含む11のオープンソースエージェントハーネスをランク付けしています。
- • 一般的なベストプラクティスとして、コンテキストウィンドウを少なくとも64,000トークンに設定し、ツール呼び出しをサポートするモデルの使用を推奨しています。
- • OpenHandsはQwen3.6-35B-A3Bの使用を推奨し、少なくとも24GBのVRAMまたはApple Silicon上の64GBのユニファイドメモリが必要です。
- • Gooseは、Linux FoundationのAgentic AI Foundationの下で、Ollama、LM Studio、Docker Model Runnerなどのランタイムをサポートしています。
- • Aiderは、リポジトリマップと特定のテキストベースの編集フォーマットを使用することで、弱いツール呼び出し能力を管理しています。
開発者は、具体的なハードウェア制約とライセンス条件に基づいて、適切なローカルエージェントフレームワークを迅速に評価・選択できます。
14. コーディングエージェントの最適なハーネス設計に関する実証研究
新しい実証研究では、SWE-Bench VerifiedとTerminal-Bench 2.1を使用して、計画、アクションスペース、コンテキスト管理を分析するために、176の異なる設定でコーディングエージェントを評価しました。その結果、厳しい計算予算の下ではコンテキスト管理がパフォーマンスにとって最も重要な要素であり、LLMベースの要約の前にルールベースの削除(elision)を段階的に行うことが最も効率的な戦略であることが判明しました。さらに、計画は弱いモデルにとっては精度の足場として、強いモデルにとってはコスト削減メカニズムとして機能し、事前定義されたツールはbash習熟度が低いモデルのパフォーマンスを向上させることがわかりました。
- • 研究者は、SWE-Bench VerifiedとTerminal-Bench 2.1を使用して、4つのモデルで176の設定を評価しました。
- • 厳しい計算予算の下では、コンテキスト管理がパフォーマンスにとって最も重要な要素であると特定されました。
- • LLMベースの要約の前にルールベースの削除を段階的に行うことが、最も効率的なコンテキスト管理戦略であることが証明されました。
- • 計画は、弱いモデルにとっては精度の足場として、強いモデルにとってはコスト削減メカニズムとして機能します。
- • 事前定義されたツールはbash習熟度が低いモデルのパフォーマンスを向上させますが、bash対応モデルはbashインターフェースのみを使用して効果的に動作できます。
カスタムコーディングエージェントを構築する開発者は、構造化されたコンテキスト管理と適応的な計画を通じて、パフォーマンスを最適化し、APIコストを削減できます。
15. エキスパートストリーミングにより64GB Macで95.5 GiBのQwen3.8-Flash-Nextを実行
開発者は、ルーティングされたエキスパートをSSDに保持することで、64GBのRAMを搭載したMacで95.5 GiBのQwen3.8-Flash-Nextモデルを実行できるようになりました。このセットアップには、エキスパートストリーミングをサポートするためのllama.cppのカスタムフォークと、nitinpanj/qwen38-flash-next-v3チェックポイントが必要です。64GBのRAMを搭載したM5 Proでは、モデルは4kコンテキストで毎秒約367トークンのプロンプト処理速度を達成し、ドラフトヘッドを有効にすると生成速度は毎秒27.6トークンに達します。パフォーマンスは、ギャザーベースのスパースアテンションとMetal MoEフュージョンによってさらに強化されます。
- • 95.5 GiBのQwen3.8-Flash-Nextモデルは、ルーティングされたエキスパートをSSDに保持することで、64GBのMacで実行可能です。
- • このセットアップには、エキスパートストリーミングをサポートするllama.cppのカスタムフォークと、nitinpanj/qwen38-flash-next-v3チェックポイントが必要です。
- • 64GBのRAMを搭載したM5 Proでは、ドラフトヘッドを有効にすると生成速度は毎秒27.6トークンに達します。
- • ギャザーベースのスパースアテンションにより、62kコンテキストで19%、130kコンテキストで50%のパフォーマンス向上が見られました。
- • 64GBのApple Siliconマシンにおけるエキスパートキャッシュの実用的な上限は36 GiBです。
開発者は、高価なマルチGPUセットアップを必要とせずに、標準的なApple Siliconハードウェア上で、大規模で高品質なMixture-of-Expertsモデルをローカルで実行できます。