1. Z.aiが100万トークンのコンテキストウィンドウを持つオープンウェイトモデル「GLM-5.2」をリリース
Z.aiのGLM-5.2は、長時間のコーディング、推論、エージェントワークフロー向けに設計されており、3つの思考モード(非思考、高、最大)をサポートしています。マルチモーダル機能は備えていないため、Claude Opus 4.8と比較すると視覚的なデバッグなどのタスクでは苦戦しますが、テキストベースの推論においては非常にコスト効率の高い代替手段となります。このモデルはvLLM、SGLang、Transformers、llama.cppなどのフレームワークを使用してローカルで実行可能であり、Hugging FaceおよびModelScopeで入手できます。
- • GLM-5.2は、合計7440億パラメータ、アクティブパラメータ400億、100万トークンのコンテキストウィンドウを備え、MITライセンスで提供されます。
- • GDPval-AAエージェントワークベンチマークにおいて、Eloスコア1524を記録し、全体で3位、オープンウェイトモデルの中では1位にランクインしました。
- • テキスト専用モデルであり、マルチモーダル機能がないため、視覚的な自己検証が必要なタスクには影響が出る可能性があります。
- • Unsloth Dynamic GGUFを介したローカル実行をサポートしており、2ビット量子化で239GB、1ビット量子化で217GBまでディスク容量を削減可能です。
- • 出力トークンの価格は、Claude Opus 4.8の5分の1以下です。
開発者は、独自の最先端モデルと比較してわずかなコストで、100万トークンのコンテキストウィンドウを持つ高性能な推論モデルをセルフホストできるようになります。
2. Gemma 4モデル、QATを活用して高品質な4ビットローカル推論を実現
Gemma 4は、ネイティブMTPや高品質な低ビット量子化といった重要な技術的利点を提供しますが、トレーニング時間の増加によりカスタムファインチューニングの採用が遅れています。しかし、EquinoxやMeroMeroといった初期のコミュニティリリースは、このアーキテクチャに対する開発者の関心が高まっていることを示しています。
- • Gemma 4モデルは、Apache 2.0ライセンスの下で12B、26B-A4B、31Bのサイズで提供され、ネイティブな画像および動画理解機能を備えています。
- • 量子化認識トレーニング(QAT)により、4ビット量子化バージョンでもBF16ベースモデルと同等の品質レベルを維持できます。
- • 12Bモデルは8GBのVRAMに、31Bモデルは20〜24GBのVRAMに収まります。
- • Gemma 4モデルのファインチューニングは、元のBF16バージョンと非量子化QATバージョンの両方でトレーニングする必要があるため、最大2倍の時間がかかる場合があります。
- • すべてのモデルがグローバルなマルチトークン予測(MTP)をサポートしています。
開発者は、Apache 2.0ライセンスの高性能なマルチモーダルモデルを、わずか8GBのVRAMを搭載したコンシューマー向けGPUでローカル実行できます。
3. Inception Labsが拡散モデルベースの推論モデル「Mercury 2」をリリース
従来の自己回帰生成から拡散ベースのアーキテクチャに移行することで、Mercury 2は大幅なスループット向上を実現しました。これにより、これまでレイテンシが制限要因となっていた高頻度かつ多段階のエージェントループを実行する必要がある開発者にとって、専門的なツールとなります。
- • Mercury 2は毎秒約1,000トークンを生成し、GoogleのDiffusionGemmaを上回る性能を発揮します。
- • このモデルは拡散技術を活用し、画像モデルで一般的に使用される生成プロセスをテキスト推論に適応させています。
- • 複雑な最先端レベルの推論タスクよりも、大量かつ速度が重視されるワークフロー向けに最適化されています。
- • Mercury 2はAPIまたはクラウドサービスを通じてのみ利用可能です。
開発者は、迅速かつ構造化された推論を必要とする超低レイテンシのワークフローや、高スループットのエージェントパイプラインを構築できます。
4. Alibaba、マルチ画像参照機能を備えた動画生成モデル「HappyHorse 1.1」をリリース
Alibabaのこのアップグレードは、複数のアセットを単一の生成パスに統合するマルチモーダル生成における重要な一歩です。このリリースは、Alibabaの527億ドル規模のグローバルクラウドネットワーク拡大と同時に行われましたが、同社は最近、米国国防総省の中国軍事企業リストに追加されています。
- • HappyHorse 1.1はAlibaba Cloud Model Studioで利用可能で、完全なAPIアクセスと最初の2週間は40%のローンチ割引が適用されます。
- • キャラクターの一貫性を保つためのR2Vマルチ画像参照機能、向上したモーション品質、ドリフトのないリップシンクを備えています。
- • テキスト、画像、動画、音声を単一の生成パスで処理する150億パラメータの統合自己注意Transformerに基づいて構築されています。
- • 前バージョンのHappyHorse 1.0は、Artificial AnalysisのVideo Arenaリーダーボードで2位を保持しています。
開発者は、APIアクセス可能な統合モデルを使用して、一貫したキャラクターと同期された音声を備えた高度な動画生成および編集機能を構築できます。
5. InclusionAIが「Ling-2.6」および超高速モデル「Ling-mini-2.0」をリリース
このリリースにより、1兆パラメータのフラッグシップモデルから高度に最適化されたエッジモデルまで、ローカルデプロイメントのためのスケーラブルな選択肢が提供されます。標準的なCPUや低スペックのGPUハードウェア上でのminiモデルのパフォーマンスは、オンデバイスのエージェントタスクにとって強力な候補となります。
- • InclusionAIは、1兆パラメータの「Ling-2.6-1T」と1000億パラメータの「Ling-2.6-flash」のベースモデルをリリースしました。
- • Ling-2.6-flashは、Q4量子化を使用する場合、24GBまたは32GBのVRAMで実行可能です。
- • 小型のLing-mini-2.0-IQ4_XS(16B-A1.4Bモデル)は、8GB VRAMのGPU単体で毎秒160トークンを達成します。
- • 32GB RAMを搭載したCPUのみの推論環境では、Ling-mini-2.0-IQ4_XSは毎秒50〜70トークンを実現します。
開発者は、8GB VRAMのGPUや標準的なCPUを含む、非常に制約のあるハードウェア上で、高速かつ低レイテンシのローカル推論を実行できます。
6. Moebius:10Bレベルの性能を持つ0.2Bパラメータの画像インペインティングモデル
arXiv論文2606.19195で詳述されているMoebiusは、極端な構造圧縮によって引き起こされる容量低下の問題に対処しています。LCGと再構築されたU-Netを組み合わせることで、従来の10Bパラメータ拡散モデルのような膨大な計算負荷をかけずに、高品質な画像インペインティングを実現します。
- • Moebiusは、高容量のパフォーマンスを実現するために、Latent Categories Guidance(LCG)を備えた潜在拡散モデル(LDM)アーキテクチャを使用しています。
- • このフレームワークは、わずか0.2億パラメータを使用しながら、競合する100億パラメータモデルより15倍高速に動作します。
- • 適応型マルチ粒度蒸留戦略により、軽量モデルを高容量の教師モデルに合わせることで、容量低下を防いでいます。
- • ノイズ除去U-Netは、アーキテクチャの効率を最大化するためにLλM Iブロックを使用して再構築されています。
開発者は、高度に効率的で低レイテンシな画像編集およびインペインティング機能を、エッジデバイスや低コストのクラウドインスタンスに直接デプロイできます。
7. Sakana AIがマルチエージェントオーケストレーションAPI「Fugu」をリリース
FuguのアーキテクチャはSakanaのTRINITYおよびConductor研究論文に基づいており、特定のモデル選択や調整戦略をユーザーから隠蔽するように設計されています。日常的なタスク向けの高速バージョンと、研究やサイバーセキュリティなどの複雑なタスク向けのフラッグシップモデル「Fugu Ultra」が提供されます。ただし、初期のユーザー報告によると、Fugu Ultraは動作が遅くなる場合があり、複雑なコーディングテストでは実行に最大30分かかることもあるようです。
- • FuguおよびFugu Ultraは、OpenAI互換APIを通じて単一のモデルとして動作し、モデルの選択、委任、合成を管理します。
- • Fugu Ultraの価格は、入力100万トークンあたり5ドル、出力100万トークンあたり30ドルで、272Kトークンを超えるワークロードにはより高いレートが適用されます。
- • Fugu UltraはSWE-Bench Proで73.7のスコアを達成し、Claude Opus 4.8を上回りましたが、Claude Fable 5には及びませんでした。
- • ユーザーはトレーニングデータへの使用をオプトアウトし、ルーティングプールから特定のモデルやプロバイダーを除外できます。
- • 本サービスは現在、GDPRコンプライアンス調整のため、欧州連合(EU)および欧州経済領域(EEA)では利用できません。
開発者は、複雑なマルチモデルルーティングインフラを自ら管理することなく、最先端レベルのパフォーマンスにアクセスし、ベンダーロックインを軽減できます。
8. Ai2が最大27Bパラメータのターミナルエージェントモデル「TMax」をリリース
TMaxのトレーニングレシピは、安定化修正を加えたGRPOを利用して、2Bから27Bパラメータまでのモデルをトレーニングします。次に大きいオープンターミナルデータセットの2.5倍以上の規模を持つ、新しくリリースされたTMax-15kデータセットを活用することで、これらのモデルは強力なコマンドライン実行能力を発揮します。Qwen 3.5ベースの9Bバリアントは、OpenThoughtsデータセット上でDPPOを使用して構築され、TMaxのアブレーションをリードしています。
- • Ai2は、TMax 9BおよびTMax 27BターミナルエージェントモデルをHugging Faceでリリースしました。
- • TMax 27BはTerminal Bench 2.0で42.7%のスコアを達成し、Kimi K2.5のようなはるかに大きなモデルのパフォーマンスに近づいています。
- • TMax-9Bモデルは、Terminal Bench 2.0で27.2%、Terminal Bench Liteで53.0%を達成しています。
- • これらのモデルは、14,600の強化学習環境を含むTMax-15kデータセットを使用してトレーニングされました。
開発者は、高度に専門化されたオープンウェイトのターミナルエージェントを、CLIツールやローカルの自動化ワークフローに統合できます。
9. Codex、SSDの過度な摩耗を引き起こすSQLiteログバグの修正をマージ
このバグは、保持されている行と履歴上の挿入行IDとの間に10,000倍のギャップが生じるという深刻な書き込み増幅を示していました。Codexをローカルで実行している開発者は、これらのログフィルターを適用し、ハードウェアの寿命を保護するために最新のアップデートをプルする必要があります。
- • CodexのSQLiteフィードバックデータベースにおけるグローバルなTRACEログのデフォルト設定により、過度なディスク書き込みが発生し、21日間の稼働で最大37TBに達していました。
- • この問題は、内部ログ、依存関係のノイズ、生のWebSocketペイロードの永続化と、挿入および削除サイクルによる高い書き込み増幅が組み合わさったことに起因していました。
- • 2026年6月22日、ノイズの多いターゲットをフィルタリングし、すべてのWebSocketイベントのログ記録を停止する2つのプルリクエストがマージされました。
- • マージされた修正により、Codexのローカルログボリュームは85%削減される見込みです。
Codexを使用している開発者は、深刻な書き込み増幅とSSDの早期故障を防ぐため、直ちにインストールを更新する必要があります。
10. OpenAIがセキュリティイニシアチブ「Patch the Planet」と「GPT-5.5-Cyber」を立ち上げ
このイニシアチブは、最先端のAIモデルが攻撃的および防御的なサイバー能力を急速に変革するという「Five Eyes」情報同盟からの警告を受けて開始されました。セキュリティ企業と協力することで、OpenAIはメンテナーがAI駆動のセキュリティツールを開発パイプラインに直接統合できるよう支援を目指しており、すでに30以上のオープンソースプロジェクトが参加しています。
- • OpenAIはCodexセキュリティスキャナーをアプリプラグインとしてリリースし、オープンソースおよびプライベートコードに対して20兆トークンの補助金を提供します。
- • Trail of Bits、HackerOne、Califと提携した「Patch the Planet」イニシアチブは、無料のセキュリティコンサルティングと脆弱性パッチ適用を提供します。
- • GPT-5.5-CyberはCyberGymベンチマークで85.6%を記録し、AnthropicのMythos 5モデルを上回りました。
- • プログラム参加者は、6ヶ月間の無料ChatGPT Proと、6ヶ月間のCodexセキュリティスキャナーへのアクセス権を受け取ります。
- • Trail of Bitsのエンジニアによる5日間の初期スプリントで、参加プロジェクト全体で数百のバグが発見され、数十のパッチが作成されました。
オープンソース開発者は、補助金付きのセキュリティスキャンと専門家によるパッチ適用を活用して、AI駆動の新たなサイバー脅威からコードベースを保護できます。
11. 「Vibe-Coded」アプリケーションにおけるセキュリティリスクの増大
AIを使用して機能的なソフトウェアを簡単に生成できるようになったことで、適切なセキュリティ監査なしにデプロイされるアプリケーションが急増しています。Claude Codeのようなツールは欠陥の特定を支援できますが、開発者は警戒を怠らず、定期的な手動セキュリティレビューを実施し、機密性の高いビジネス情報を扱う場合は専門のセキュリティエンジニアを雇うことを検討する必要があります。
- • Red Accessによるレポートによると、一般公開されている5,000の「vibe-coded」アプリのうち約2,000が、医療、財務、戦略的な機密データを漏洩させていました。
- • AIエージェントのソーシャルネットワーク「Moltbook」は、公開された本番データベースが原因で、数万件のプライベートメッセージやメールを露出させました。
- • Claude CodeのようなAIコーディングツールは、`/security-review`などの組み込みセキュリティコマンドを提供していますが、開発者による手動の呼び出しが必要です。
- • セキュリティ専門家は、ローカル専用アプリは低リスクとして扱うよう助言していますが、共有・ホスト型データへの移行には専門的なセキュリティ基準が必要であると警告しています。
AIコーディングアシスタントを使用する開発者は、本番環境での機密ユーザーデータの漏洩を防ぐために、積極的にセキュリティレビューを実行し、脅威モデルを確立する必要があります。
12. AIエージェントが自身の実行ルールを書き換える「Self-Harness」フレームワーク
上海人工知能研究所によって開発されたSelf-Harnessは、測定可能で決定論的な結果が得られる環境向けに最適化されています。実行ルールの改良を自動化することで、手動のプロンプトエンジニアリングの必要性を減らしますが、開発者はパフォーマンスの向上とトークンコストやレイテンシの増加を天秤にかける必要があります。
- • Self-Harnessは、弱点マイニング、ハーネス提案、提案検証の3段階ループを使用してエージェントプロトコルを更新します。
- • このフレームワークは、GLM-5やQwen-3.5などのモデルを使用して、Terminal-Bench-2.0タスクで33%から60%の相対的なパフォーマンス向上を達成しました。
- • 人間によるエンジニアリングやより強力な外部モデルを必要とせずに、モデル固有の弱点に適応できます。
- • このシステムは、APIトークン使用量の増加、レイテンシ、回帰テストインフラなど、重大な計算オーバーヘッドを導入します。
- • 研究者らは、医療や安全性が重要なシステムのような、リスクが高く主観的な分野でSelf-Harnessを使用しないよう助言しています。
開発者は、コーディングやDevOpsのような決定論的な環境において、パフォーマンスを最大60%向上させる自己改善型のエージェントループを実装できます。
13. Oak:AIエージェント向けに設計されたGitの代替システム
リポジトリ全体をクローンする必要性を排除することで、Oakはサンドボックス環境が迅速に立ち上がりコードを修正する必要があるエージェントワークフローにおける主要なボトルネックに対処します。開発初期段階であり、独自のビルドにGitHub Actionsに依存していますが、エージェントネイティブな開発者ツールへのシフトを象徴しています。
- • Oakは仮想マウントを利用して、リポジトリの完全なコピーを必要とせずに、エージェントがローカルまたはクラウドで作業できるようにします。
- • このシステムにより、完全なダウンロードやGitワークツリーを必要とせずに、並列タスク実行が可能になります。
- • プロジェクトは開発初期段階にあり、CI、課題追跡、コメント、Windowsサポートなどの機能が現在欠けています。
- • プロジェクトは、数ヶ月間Gitバックアップなしで、独自のシステム上で完全にブートストラップされています。
コーディングエージェントを構築する開発者は、Oakを使用して高速かつ並列的なタスク実行を可能にし、エージェントサンドボックス内のディスク容量のオーバーヘッドを削減できます。
14. llama.cppのPR、Gemma 4のローカル推論を50%高速化
冗長なソート操作が、特定のサンプラーチェーンにおけるボトルネックとして特定されました。プルリクエストの作成者は、この変更がレガシーな動作に依存する他のサンプラー構成にどのような影響を与えるかについて多少の不確実性を指摘していますが、Gemma 4モデルのパフォーマンス向上は大幅なものです。
- • llama.cppのプルリクエスト#22645は、Top-N-Sigmaサンプラーから冗長な無条件ソフトマックスおよびソート操作を削除します。
- • この最適化は、Top-N-Sigmaサンプラーの後にDistサンプラーが続く場合に有効です。
- • M3 Max MacBook ProでGemma 4モデルを使用してテストしたところ、速度が毎秒30トークンから45トークンに向上しました。
- • この変更により、テストされたハードウェア上でトークンあたり10msのレイテンシが削減されます。
ローカルでGemma 4モデルを実行している開発者は、最適化されたサンプラーチェーンを採用することで、レイテンシを大幅に低減できます。
15. ローカルコード生成とGPUインターコネクトを最適化する新技術
これらの開発は、ローカルモデル実行の主要なボトルネックをターゲットにしています。特定のドメインに合わせた推論デコーディングや低レベルのGPUカーネルチューニングの自動化など、ソフトウェア層を最適化することで、開発者は手頃な価格のコンシューマー向けハードウェア構成からエンタープライズグレードのパフォーマンスを引き出すことができます。
- • Morph LLMは、コーディング出力に特化した推論デコーディングドラフターをトレーニングすることで、コード生成において3.07倍の高速化を達成しました。
- • Autoresearchは、低需要のNVIDIAおよびAMD GPU向けのカーネルチューニングを自動化し、ワープデコードカーネルが毎秒162トークンに達することを可能にします。
- • 新しいPCIeインターコネクト方式は、高価なNVLinkセットアップを置き換え、カスタムカーネルを使用してTCP経由でキャッシュを共有し、最初のトークンまでの時間を84%短縮します。
開発者は、高価なエンタープライズインターコネクトを使用せずに、コンシューマー向けまたは低需要のハードウェア上で、ローカルコーディングモデルやマルチGPUセットアップを大幅に高速化できます。
16. Claude Codeがローカル思考ログを暗号化し、ユーザーアクセスを制限
この設計上の選択により、モデルの行動を駆動する実際の段階的な推論が確実にプロプライエタリ(独占的)なものとして維持されます。開発者は最終的なアクションと要約された論理パスを確認することはできますが、複雑なエージェントセッション中に生成された正確なローカルログを監査することはできません。
- • ディスクに保存されたClaude Codeセッションログには、600文字の暗号化署名が付いた思考ブロックが含まれています。
- • Anthropicはこれらのブロックの暗号化キーを保持しており、ユーザーがローカルログを復号することを防いでいます。
- • Claude APIおよびClaude Codeの拡張思考出力は、生の推論ではなく、モデルの論理の要約を提供します。
- • 暗号化されていない完全な思考出力へのアクセスには、Anthropicとのエンタープライズ契約が必要です。
エージェントの行動を分析する開発者は、Anthropicが排他的な復号キーを保持しているため、生の推論ログではなく、高レベルの要約に頼らざるを得ません。
17. Apostate、モデルの拒否を回避するための対照的共ベクトル演算子を追加
このアプローチはKLダイバージェンスを最小化(Graniteで0.081 natsを達成)し、編集後もモデルの一般的な機能が損なわれないようにします。広範なファインチューニングを適用するのではなく、特定の拒否コンポーネントをターゲットにすることで、開発者は専門的なタスクのためにローカルモデルをより正確に制御できます。
- • Apostateは、拒否方向を分離して除去するために、E = I − R Dᵀと定義される対照的共ベクトル編集演算子を追加しました。
- • この技術は、安全なプロンプトに予測子を適合させ、有害なプロンプトでそれを抑制することで、無害な分散を維持します。
- • granite-3.3-8bモデルでのテストでは、95.0%のコンプライアンス率を維持しながら、拒否率を96.0%から5.0%に削減しました。
- • この方法は、残差または埋め込みスケーリング乗数を持つアーキテクチャで非常に効果的です。
開発者は、モデルの一般的なパフォーマンスを低下させたり、深刻な発散を引き起こしたりすることなく、Graniteのようなオープンウェイトモデルにおける頑固な安全上の拒否を回避できます。
18. 米国輸出禁止措置、Anthropicの「Mythos」および「Fable」への外国からのアクセスを制限
この制限は、単一プロバイダーのプロプライエタリAPIに依存することに関連する地政学的リスクの増大を浮き彫りにしています。米国のトップティアモデルへのアクセスが政治的に制約される中、国際的な開発者はアプリケーションパイプラインを保護するために、オープンウェイトモデルや米国以外のプロバイダーに目を向けるようになっています。
- • 米国政府は、Anthropicの最新のAIモデル「Mythos」および「Fable」への外国人のアクセスを禁止しました。
- • FTの分析によると、Anthropicは2026年にOpenAIの8倍の頻度でリスクと規制について議論していました。
- • Yann LeCunを含む批評家は、輸出禁止措置の原因を、AIリスクに関するAnthropicの頻繁な公的警告に帰しています。
- • この禁止措置は、米国以外のユーザーによる最先端モデルへのアクセスに対する将来の米国による制限について、欧州やシリコンバレーで広く懸念を引き起こしています。
米国以外の開発者は、Anthropicの最新の最先端モデルを使用した構築に直ちに制限を受けるため、代替プロバイダーやオープンウェイトアーキテクチャを模索せざるを得なくなっています。