1. NVIDIAのGroq 3 LPX推論アクセラレータが本格量産へ
Gemma 4 31Bで毎秒3,400トークンというベンチマーク結果を実証したことを受け、NVIDIAはGroq 3 LPX推論アクセラレータラックの本格量産を正式に開始しました。Vera Rubinプラットフォームを拡張するこれらのシステムは、高速なエージェント型AIワークロード向けに設計されており、今年後半に稼働を開始する予定です。
- • NVIDIAのGroq 3 LPX推論アクセラレータチップが本格量産を開始しました。
- • システムは今年後半に稼働を開始する予定です。
- • 量産ユニットは、エージェント型AIワークロードにおいて最近のベンチマークで観測された毎秒3,400トークンの性能を維持するように設計されています。
本格量産への移行は、デモンストレーション段階の性能から、超低遅延推論を求める開発者向けの商用利用可能な段階への転換を意味します。
2. IBMがネイティブ推論機能を備えたGranite 4.2モデルファミリーをリリース
デコーダーのみの密なTransformerアーキテクチャに基づいて構築されたGranite-4.2-30Bモデルは、Grouped Query Attention、Rotary Position Embedding、およびSwiGLU活性化関数を採用しています。柔軟な思考モードにより、開発者はクエリごとにモデルの推論深度をカスタマイズでき、コストと遅延の両方を最適化できます。
- • Granite 4.2ファミリーには、30Bのフラッグシップモデル、8Bの中規模モデル、3Bのコンパクトモデルが含まれ、すべてApache 2.0ライセンスでリリースされています。
- • すべてのモデルがネイティブな思考の連鎖推論機能を備えており、数学、コーディング、多段階の問題解決における性能を向上させています。
- • モデルは3つの柔軟な思考モード(フル思考、非思考、低負荷)をサポートし、深度と遅延のバランスを調整可能です。
- • ファミリー全体で512Kのコンテキストウィンドウをサポートし、長いドキュメントやエージェントワークフローに対応します。
- • 推論拡張ツール呼び出し機能により、関数呼び出しの精度が向上しています。
開発者は、遅延と深度のバランスを調整できる柔軟な思考モードを備えた、商用利用に適した高性能な推論モデルをセルフホストまたは統合できます。
3. MicrosoftがMAI-Image-2.6-Previewをリリース、リーダーボードでトップランクを獲得
このモデルは、テキストから画像への生成と画像編集の両方の機能をサポートしています。照明やUI/UXデザインなどのカテゴリにおいて、MAI-Image-2.6-PreviewとGPT Image 2は数Eloポイント以内の性能差であり、開発者にとって非常に競争力のある選択肢となっています。
- • MicrosoftはMAI-Image-2.6-Previewを発表し、テキストレンダリング、3D画像、ポートレート品質、フォトリアリスティックな出力が向上しました。
- • このモデルはArtificial Analysisの画像編集リーダーボードで初登場1位となり、MAI-Image-2.5-Pro、Reve 2.1、GPT Image 2を上回りました。
- • テキストから画像への生成カテゴリでは、OpenAIのGPT Image 2に次ぐ2位にランクインしています。
- • 現在、MAI PlaygroundおよびMicrosoft Foundryのプライベートプレビューで利用可能です。
- • MAI-Image-2.6-Previewは、Material、Knowledge、Frontier、Retail & Ecommerce、Marketing & Advertisingを含む19のカテゴリリーダーボードのうち5つで首位を獲得しています。
画像編集や生成機能を構築する開発者は、GPT Image 2と比較検討できる新しい高性能なモデルの選択肢を得ました。
4. Breeze TTS 2がオープンウェイトTTSリーダーボードでFish Audio S2 Proを追い抜く
2026年5月のベンチマークレポートを受けて、Artificial AnalysisのSpeech Arenaはランキングを更新し、Breeze TTS 2を追加しました。この新しいモデルはElo 1,215でオープンウェイトカテゴリをリードし、前リーダーのFish Audio S2 Proを90ポイント上回りました。Breeze TTS 2は高品質な音声生成と50言語のサポートを提供しますが、S2 Proと比較してホスティングの速度が遅く、コストも高くなっています。
- • Breeze TTS 2は、Artificial AnalysisのProvider Voices Speech Arenaにおけるオープンウェイトのテキスト読み上げモデルのリーダーとなりました。
- • Elo 1,215を保持しており、前リーダーのFish Audio S2 Proより90ポイント高い評価です。
- • 50言語をサポートしており、Hugging Faceで利用可能です。
- • Breeze TTS 2は100万文字あたり34ドルで毎秒45文字を処理しますが、Fish Audio S2 Proは100万文字あたり15ドルで毎秒102文字を処理します。
開発者は音声機能向けに新しい最高性能のオープンウェイトモデルを選択できるようになりましたが、前リーダーと比較した性能とコストのトレードオフを考慮する必要があります。
5. Qwen3.8-Flash-Nextがリリース予定、高いメモリ要件が予想される
コミュニティの初期議論では、開発者が十分なハードウェアを持っていれば、重みが公開された後にこのモデルのアーキテクチャがローカル環境で非常に扱いやすくなる可能性があると指摘されています。Unslothは、ローンチに備えてディスク容量を確保するようユーザーに助言しています。
- • Qwen3.8-Flash-Nextは明日リリース予定であり、UnslothによるDay-0サポートが発表されています。
- • 実用的な4ビット量子化には80〜90GBのメモリが必要と推定されています。
- • メモリフットプリントは、メインの重みに約58GB、n-gramテーブルに24GBを要します。
- • モデルの大きなn-gramテーブルはアクセス頻度が低いため、システムRAMへのオフロードに適しています。
この次期モデルをセルフホストする予定の開発者は、十分なディスク容量と高VRAMのハードウェア構成を準備する必要があります。
6. 匿名モデルOx AlphaがOpenRouterのローンチ記録を更新
その起源やトレーニングに関する公式なメタデータがないにもかかわらず、Ox Alphaモデルは無料かつ互換性のあるAPIエンドポイントを提供しているため、開発者に広く採用されています。
- • OpenCodeユーザーは、Ox Alphaモデルの提供開始から最初の4日間で26兆トークンを処理しました。
- • 32万7,000人以上のユニークユーザーと830万回以上の完了セッションを記録しました。
- • Ox Alphaは現在、OpenAI互換エンドポイントを通じて無料で利用可能です。
- • OpenCodeのモデルページには、作成者、リリース日、知識のカットオフ、出力制限のメタデータが記載されていません。
開発者は非常に人気のある無料のOpenAI互換エンドポイントをワークフローに統合できますが、モデルに関するメタデータは依然として不足しています。
7. Perplexityがローカルエージェント実行用のポータブルコンピュータを発売
Portable Computerは、エージェントハーネス、オーケストレーター、プランナー、ツールルーター、および事後学習済みモデルを単一のパッケージアプリケーションに統合しています。現在、Pro、Max、またはEnterpriseサブスクリプションを持つLinuxユーザーが利用可能で、Windowsサポートは9月に予定されています。Perplexityの53タスクのLocal Knowledge Work Benchにおいて、このプラットフォームはPPLX 27Bモデルを使用して85.4%のスコアを記録し、ドキュメント理解やWebリサーチにおいてPiやHermesなどの既存のオープンソースハーネスを上回りました。
- • Perplexityは、ローカルモデル、エージェントハーネス、セキュリティサンドボックスをバンドルしたローカルファーストなエージェントプラットフォーム「Portable Computer」をリリースしました。
- • このプラットフォームは、Nvidia RTX GPUまたは少なくとも24GBのVRAMを搭載したDGX Sparkハードウェアを備えたLinuxマシンで動作します。
- • ローンチ時にサポートされるモデルにはQwen 3.8 27BとPPLX 27Bが含まれ、将来的にNvidiaのNemotron 3.5 Lightningのリリースが計画されています。
- • コードとツールの実行は、ファイルシステムとネットワークアクセスを制限するOS強制のサンドボックス内で行われます。
- • ハイブリッド機能により、PIIチェック後にClaude Opus 5などのクラウドベースのフロンティアモデルへ複雑なタスクをエスカレーションできます。
開発者は、トークンあたりのクラウドコストを発生させることなく、機密データを安全に保ちながら、複雑なエージェントワークフローを自身のハードウェア上でローカルに実行できます。
8. Headlongが永続的エージェント向けのBashベースのマイクロハーネスをオープンソース化
Laude Instituteチームは、このフレームワークを使用してAudelという共有エージェントをテストしており、人間の介入なしにgitブランチの監査、コードのレビュー、バグの自己修正を行う能力を実証しています。HeadlongはGitHubでアルファ版の研究用ソフトウェアとしてリリースされており、1行のインストールスクリプトが提供されています。ユーザーは、支出制限付きのAPIキーを使用してサンドボックス内で実行することが推奨されています。
- • Headlongは、1万行未満のBashコードで記述されたオープンソースのエージェントマイクロハーネスです。
- • 反応型エージェントとは異なり、Headlongエージェントは外部入力なしで独立して思考やプロジェクトを生成します。
- • このフレームワークは、メモリを管理するために古い軌跡エントリを段階的に要約する圧縮アルゴリズムを使用しています。
- • エージェントの軌跡はJSONLファイルのDAGとして保存され、思考と行動の構造化された履歴を提供します。
- • Headlongエージェントを継続的に実行するコストは、モデルと頻度に応じて1時間あたり1ドルから2ドルです。
開発者は、外部トリガーを必要とせずに継続的に実行される、自律的で自己修正可能なエージェントをデプロイできます。
9. AnthropicがClaudeチャットとClaude Coworkのメモリシステムを統合
共有メモリ機能により、ユーザーはプロジェクトの詳細、好み、コンテキストを繰り返す必要がなくなります。Claudeはデフォルトで健康、宗教、政治などの機密トピックを保存せず、犯罪歴や識別番号などの特定のカテゴリは一切保存されません。
- • AnthropicはClaudeチャットとClaude Coworkのメモリシステムを統合し、双方向のコンテキスト共有を可能にしました。
- • Claudeはセッション後に要約するのではなく、会話中に動的にメモリへトピックを追加するようになりました。
- • メモリ機能は、Web、デスクトップ、モバイルプラットフォームのFree、Pro、Maxプランでデフォルトで有効になっています。
- • EnterpriseおよびTeamsティアのユーザーの場合、メモリ機能はデフォルトで無効になっており、組織の資格要件が適用されます。
- • ユーザーは設定メニューのメモリセクションから、保存されたトピックの管理、表示、編集、削除が可能です。
ClaudeとCoworkを使用する開発者は、AIにプロジェクトの詳細を繰り返し説明することなく、ワークフロー全体で統一されたコンテキストを維持できます。
10. KeenableがAIエージェント向けに最適化されたWeb検索インデックスを立ち上げ
元Yandex幹部のAndrey Styskin氏とAI科学者のMatthias Petri氏によって設立されたKeenableは、AIエージェント向けに検索インフラを最適化することを目指しています。同社は現在、米国と欧州で15名のエンジニアを雇用しており、年末までに人員を倍増させる計画です。
- • Keenableは、AI向けのWeb検索インフラを構築するために、Accelが主導する2,600万ドキュメントのシード資金を調達し、ステルス状態から脱却しました。
- • 同社は1,000億以上のドキュメントを含むWeb検索インデックスを開発しました。
- • KeenableのAPIは現在、音声AI企業のGradiumを含む複数のAIラボや推論プロバイダーによって本番環境で使用されています。
- • 同社は、AIシステムが複数のWebソースから情報を合成するのを支援するための独自のWebクエリ言語を開発しています。
- • Keenableは、特定のタスクに合わせてインデックス構造を微調整することで、エージェントクエリに対してよりコスト効率の高いソリューションを提供すると主張しています。
RAGやエージェント型の検索ワークフローを構築する開発者は、従来の検索エンジンの代わりに、非常にコスト効率が高くタスクに最適化された検索APIにアクセスできます。
11. WorkflowがAIパイプライン用のドラッグ&ドロップキャンバスをリリース
このツールは、各ノードで中間出力を可視化し続けることで、AIパイプラインの構築とデバッグのプロセスを簡素化します。Spacesとのシームレスな統合と自動REST API生成により、迅速なプロトタイピングのための非常に生産性の高いツールとなっています。
- • Workflowは、AIパイプラインを構築するためのドラッグ&ドロップキャンバスを備えています。
- • このプラットフォームでは、パイプライン内のすべてのノードが独立して実行され、中間出力が可視化されます。
- • WorkflowはSpacesへのワンコマンドデプロイをサポートしています。
- • Workflowキャンバスで作成されたグラフ全体がREST APIとして機能します。
開発者は複雑なAIグラフを迅速にプロトタイプ化し、単一のコマンドでSpacesにデプロイでき、すべてのノードを独立したAPIとして公開できます。
12. MaiaoがGitHubとGitLab向けにGerritスタイルのスタックプルリクエストを実現
Maiaoは、利用可能な場合にGitHubとGitLabのネイティブスタッキング機能と統合し、プログレッシブエンハンスメントとして扱います。また、セルフホストインスタンスの手動構成もサポートしており、さまざまなチームワークフローに非常に適応可能です。
- • Maiaoはadevinta/maiaoのコミュニティ管理フォークであり、現在はrunetes/maiaoでホストされています。
- • このツールは、ブランチ内のコミットごとに1つのPR/MRを作成し、親子の依存関係を持たせることで、スタックされたプルリクエストやマージリクエストを可能にします。
- • 主な機能には、自動スタッキング、gitフックによるChange-ID追跡、マージ時の自動リベース、git commit --fixupのサポートが含まれます。
- • MaiaoはリモートURLからgitプロバイダーを自動検出し、GitHub、GitLab、Gitea、Forgejo、Bitbucket Cloud、Cursor Originをサポートしています。
- • このプロジェクトはオープンソースであり、MITライセンスの下で配布されています。
開発者は、個々のコミットを親子のプルリクエストとして自動的にスタックすることで、複雑で依存関係のあるコード変更をより効率的に管理できます。
13. Liquid AIがオンデバイスベンチマークスイート「Pipette」をリリース
品質メトリクスはNVIDIA H100リファレンスシステムで評価され、オンデバイスの性能データと照合されます。テスト手法には、固定トークン形状、貪欲デコード、熱/負荷条件の検証が含まれており、MacBook Pro(M5 Max搭載)やiPhone 17 Proなどのデバイスで初期の検証済み結果が公開されています。
- • Liquid AIは、エッジデバイス上で基盤モデルをベンチマークするためのオープンソースプラットフォーム「Pipette」を立ち上げました。
- • このプラットフォームは、独立した手法の検証を提供するためにArtificial Analysisと提携して開発されました。
- • Pipetteは、モデル、量子化、ランタイム、デバイスを含む完全なデプロイ構成に基づいて性能を測定します。
- • ローンチデータセットは、macOS、iOS、Windows、Androidにまたがる30以上のモデルで1,000以上の構成をカバーしています。
- • PipetteはApache 2.0ライセンスでリリースされており、公開結果データセット、ダッシュボード、ネイティブベンチマークアプリが含まれています。
エッジデバイスにモデルをデプロイする開発者は、Pipetteを使用して、さまざまなハードウェアおよび量子化構成にわたる検証済みの独立した性能データを入手できます。
14. 推論的プログラムツール呼び出しが再帰的LLMの遅延を最適化
計算と実行時間をオーバーラップさせることで、sPTCはエージェントワークフローにおける遅延のボトルネックに対処します。これは、高遅延の外部ツールや再帰的なコンテキスト生成に依存するシステムに特に効果的です。
- • 推論的プログラムツール呼び出し(sPTC)は、トークン生成中にツール呼び出しを事前実行することで、再帰的言語モデルを最適化します。
- • この手法はJITコンパイラと同様に機能し、1〜1.2倍のランタイム高速化を提供します。
- • sPTCは、非ブロッキングツール呼び出しの並列実行を可能にすることで、高遅延ツールに関連する遅延を削減します。
- • この技術は、メモリバウンドなローカルLLMや高ボリュームのサービングシステムにおける性能を向上させるように設計されています。
開発者は、高遅延の外部ツールに依存する再帰的な言語モデルワークフローの遅延を大幅に削減できます。
15. セキュリティ研究によりAndroidのC2PAカメラアプリの脆弱性が露呈
Pixelカメラアプリは、C2PA適合プログラムで最高のセキュリティ評価であるAssurance Level 2を保持しています。Buchanan氏の研究は、Key AttestationやPlay Integrityに依存するC2PA適合Androidアプリも同様に脆弱であることを示しており、開発者はAndroidデバイスからのC2PA署名を完全に信頼することはできません。
- • 研究者のDavid Buchanan氏は、Android上のC2PAカメラアプリがルート権限昇格(LPE)の悪用に対して脆弱であることを実証しました。
- • デバイスがルート化されると、攻撃者は「keystork」というツールを使用して、ハードウェアベースのStrongBoxを介し、C2PAキーで任意のデータに署名できます。
- • ハードウェア障害注入攻撃はAndroidデバイスをハードウェアレベルでルート化できるため、これらの脆弱性に現実的なパッチを当てることは不可能です。
- • CVE-2026-43499などのソフトウェアベースのLPE悪用により、完全にパッチが適用されたGoogle Pixelデバイスをワンクリックでルート化できます。
- • Googleは脆弱性レポートを「修正不可(実行不可能)」としてクローズしましたが、7,500ドルの報奨金を授与しました。
画像の真正性のためにC2PAメタデータに依存する開発者は、ハードウェアレベルおよびソフトウェアレベルのルート権限の悪用により、攻撃者が署名を偽造できる可能性があるという事実を考慮する必要があります。
16. 専門家によるLLMリスクランキングと実際のインシデントの乖離が明らかに
2026年8月4日にリリースされたOWASP GenAI LLM Top 10 2026は、実務者の投票を75%、インシデントデータを25%の比率で重み付けしています。この研究は、永続的なメモリ汚染やMCPツールインターフェースの悪用などのカテゴリはインシデント記録が少ないものの、依然としてHighおよびCriticalのCVE評価を受けており、外部の認可ゲートが重要な防御策であることを示唆しています。
- • arXivでの分析により、専門家のLLMリスクランキングと実際のインシデントデータを比較したところ、統計的に検出可能な一致は見られませんでした(Cohenのカッパ係数0.20)。
- • プロンプトインジェクションは専門家によって1位にランクされていますが、インシデント記録では12位に過ぎず、これは標準的なスキャナーから見えにくいためと考えられます。
- • 誤情報は専門家によって13位にランクされていますが、実際のインシデントでは2位であり、最も大きな不一致を示しています。
- • Steve Wilson氏は、エージェントが許可されていないインフラストラクチャの変更を実行するのを防ぐために、LLMの外側に認可ゲートを実装することを推奨しています。
- • CrowdStrikeの2026年グローバル脅威レポートでは、2025年に90以上の組織で悪意のあるプロンプトインジェクションが文書化されました。
開発者は、プロンプトインジェクションのような目に見えない攻撃が公開インシデント記録で過小評価されている可能性があることを理解することで、セキュリティ対策の優先順位をより適切に設定できます。
17. SWE Refactor Benchがリポジトリ移行におけるコーディングエージェントを評価
このベンチマークは、複雑な多段階のリポジトリ移行に直面した際のコーディングエージェントの現在の限界を浮き彫りにしています。低い生存率は、エージェントがローカル編集には優れているものの、スタック全体の移行が依然として大きな課題であることを示しています。
- • Einsiaは、長期にわたるリポジトリ全体のソフトウェアスタック移行においてコーディングエージェントを評価するためにSWE Refactor Benchをリリースしました。
- • このベンチマークには、SQLite、zlib、libsodium、GraphHopperなどのプロジェクトにわたる20の現実的な移行タスクが含まれています。
- • タスクは、CからRust、MavenからGradle、POSIXからWebAssemblyへの移行を含む複雑な移行をテストします。
- • 合計520回の実行のうち、3つのステージすべてを通過したのは28回のみで、生存率は5.4%と低くなっています。
- • ベンチマークに含まれる20のタスクのうち13は、テストされたどのエージェントによっても解決されませんでした。
開発者はこのベンチマークを使用して、コーディングエージェントが長期にわたる多段階の移行タスクをどの程度うまく処理できるかを現実的に評価できます。
18. ツール呼び出しにおけるQwen3.6-35B-A3Bバリアントのベンチマーク評価
このベンチマークは、Ornith 1.5やTiel-Coderのような微調整されたバリアントが、ベースのQwen3.6-35B-A3Bモデルよりも大幅に優れたツール呼び出し機能を提供することを示しています。しかし、ツールを多用するエージェントワークフローには、Qwen3.8-27Bモデルが依然として優れた選択肢です。
- • Ornith 1.5とTiel-Coderは、tool-eval-bench 2.6.0を使用したツール呼び出しベンチマークにおいて、Qwen3.6-35B-A3Bの最高性能バリアントでした。
- • 両方のトップバリアントはQwen3.6-27Bを上回りましたが、平均スコア152.6ポイントを達成したQwen3.8-27Bには及びませんでした。
- • オリジナルのQwen3.6-35B-A3Bは、テストされたモデルの中で最も低い131.5ポイントでした。
- • テストプロセスには、32GB V100ハードウェア上で300時間以上のGPU時間を使用し、13のGGUFファイルにわたる65回の実行が含まれていました。
- • モデルは、コンテキスト長262,144、コンテキスト圧力50%でllama.cppバージョン0.1.0-devを使用して実行されました。
ツール呼び出しタスクのためにモデルを選択する開発者は、これらのベンチマーク結果を使用して、最もパフォーマンスの高い微調整バリアントを選択できます。
19. Papers with Codeがハイブリッド検索エンジンアーキテクチャの詳細を公開
検索インフラは、Papers with Code Webサイトの関連論文機能を支えています。pgvectorとQwen埋め込み、Hugging Faceツールを組み合わせることで、このアーキテクチャは本番環境の検索において非常に実用的でオープンソースフレンドリーなスタックであることを実証しています。
- • Papers with Codeの検索エンジンは、データ管理のためにpgvector拡張機能を備えたPostgreSQLを使用して構築されています。
- • システムはAlibaba Qwen 3-Embedding-0.6Bモデルを利用して埋め込みを生成します。
- • 埋め込みは、Hugging Face Jobsを搭載したNVIDIA L4 GPU上で計算されます。
- • 検索エンジンは、最適な検索結果を得るためにハイブリッド検索を実装しています。
- • ライブ埋め込みエンドポイントはHugging Face Inference Endpointsを通じて提供され、システムアーティファクトはBucketsに保存されます。
開発者は、この実績のある本番グレードのハイブリッド検索スタックを、自身のRAGやドキュメント検索アプリケーションのために複製できます。
20. AppleがM5 MaxおよびM5 Ultraチップを搭載したMac Studioを発表
Mac Studioは、Siri AIとApple Intelligenceを含むmacOS 27で動作します。Wi-Fi 7、Bluetooth 6、Thunderbolt 5接続を導入しています。価格はM5 Maxモデルが2,499ドルから、M5 Ultraモデルが5,499ドルからです。
- • AppleはM5 MaxおよびM5 Ultraチップを搭載した新しいMac Studioを発表し、2026年8月25日に予約開始、2026年9月22日に一般販売が開始されます。
- • M5 Ultraモデルは、最大512GBのユニファイドメモリ、36コアCPU、最大80コアGPUをサポートしています。
- • M5 Maxモデルは2,499ドルからで、18コアCPU、最大40コアGPU、最大128GBのユニファイドメモリが含まれています。
- • 複数のMac StudioシステムをThunderbolt 5でクラスタリングすることで、最大3倍高速なAI推論性能を実現できます。
- • 新しいMac Studioは、前世代と比較して最大4.3倍高速なAI性能と2倍高速なストレージを提供します。
開発者は、最大512GBのユニファイドメモリを使用して、単一のワークステーション上で大規模なローカルLLMやMoEモデルを実行できます。
21. AppleがM6およびM5 Proチップを搭載したMac miniを発表
新しいMac miniはmacOS 27で動作し、Siri AIと拡張されたApple Intelligence機能を導入しています。M5 ProモデルはThunderbolt 5ポートを備え、両モデルともWi-Fi 7、Bluetooth 6、2.5Gb Ethernetが含まれています。デバイスは50%のリサイクル素材で構成されており、筐体には100%リサイクルアルミニウムが使用されています。
- • AppleはM6およびM5 Proチップを搭載した新しいMac miniを発表し、2026年8月25日に予約開始、2026年9月22日に一般販売が開始されます。
- • M6搭載のMac miniは899ドルからで、12コアCPUと、各コアにニューラルアクセラレータを備えた12コアGPUが含まれています。
- • M5 Proモデルは1,699ドルからで、307GB/sの帯域幅を持つ最大64GBのユニファイドメモリをサポートしています。
- • アップデートされたMac miniは、前世代より最大2倍高速な性能を発揮するデュアル16コアNeural Engineを備えています。
- • ベースモデルには16GBの標準ユニファイドメモリが付属し、最大32GBまで構成可能で、最大170GB/sのメモリ帯域幅を備えています。
ローカルモデルを実行する開発者は、大幅にアップグレードされたニューラルエンジンとメモリ帯域幅を備えた、非常にコンパクトでコスト効率の高いデスクトップオプションを得ることができます。
22. NVIDIAがエッジAIおよびロボティクス向けにJetson Orin Nano 2を導入
WingやMatic Robotsなどの企業は、ドローンや家庭用ロボット向けにJetson Orin Nano 2をすでに評価しています。このハードウェアは、現在世界中で300万人以上の開発者と1万社以上の企業が使用しているNVIDIAのロボティクススタックと統合されています。
- • NVIDIAは、78 TOPSのAIコンピューティング、8GBのメモリ、8コアArm CPUを備えたJetson Orin Nano 2を導入しました。
- • このデバイスは、同じコンパクトなフォームファクタ内でJetson Orin Nano Superの推論性能を倍増させます。
- • 15ワットモードでは、同等のピーク性能を発揮しながら、前世代よりも40%少ない電力で動作します。
- • ハードウェアは、NVIDIA Cosmos、Nemotron、Gemma 4、Qwen 3を含むオープンモデルをネイティブにサポートしています。
- • NVIDIAは、2027年前半にモジュールと開発者キットを利用可能にする予定です。
エッジAI、ドローン、またはロボティクスアプリケーションを構築する開発者は、非常に効率的でコンパクトなハードウェアモジュール上で、より大きなオープンモデルをローカルにデプロイできます。
23. Llama.cppフォークが高速推論のための適応型推論を導入
トークン提案を動的に調整することで、適応型推論機能は推論エンジンの性能をその場で最適化します。これにより、コンシューマーハードウェア上でローカルLLMを実行する開発者にとって大幅な高速化が実現します。
- • Llama.cppの新しいフォークは、Qwen3.8のようなモデルの性能を最適化するために適応型推論を導入しました。
- • 適応型推論は、コンテンツタイプに基づいて最小および最大のトークン提案値を自動的に調整します。
- • この機能は、メインラインのLlama.cppと比較してトークン生成速度を最大50%向上させます。
- • Strix Haloシステムでは、この実装により構造化コンテンツの生成速度が44t/sから65t/sに向上しました。
ローカルモデルを実行する開発者は、ハードウェアをアップグレードすることなく、特に構造化されたコンテンツに対して、大幅に高速な推論速度を達成できます。