Inference Brew

Metaが30Bのオープンウェイト・エージェントモデル「Muse Glimmer」をリリース

00:00 / --:--

← ホームへ戻る

Metaが30Bのオープンウェイト・エージェントモデル「Muse Glimmer」をリリース

1. Metaが30Bのオープンウェイト・エージェントモデル「Muse Glimmer」をリリース

Metaは、Llama 4以来となるオープンウェイトモデル「Muse Glimmer」をリリースし、オープンウェイトAI戦略に回帰しました。より大規模な「Muse Spark」モデルから蒸留されたMuse Glimmerは、エンドツーエンドのタスク完了やツール呼び出しといった、ローカルで常時稼働するエージェントワークフロー向けに特別に設計されています。本モデルはOllama、LM Studio、vLLM、SGLangなどの主要なローカルランタイムと互換性があり、Hugging Faceからダウンロード可能です。

  • • Muse Glimmerは、マルチモーダルなテキストおよび画像入力に対応する18億パラメータの知覚エンコーダーを備えた、300億パラメータの密な因果変換器(dense causal transformer)です。
  • • 本モデルは寛容なApache 2.0ライセンスでリリースされており、商用利用、改変、再配布が制限なく可能です。
  • • 128,000トークンを超えるコンテキスト長をサポートし、4ビット量子化を使用して24GB〜32GBのVRAMを搭載したコンシューマー向けGPUで動作するように最適化されています。
  • • DFlash推論デコードが含まれており、Metaの報告によるとNvidia RTX 5090上で最大3.1倍の生成速度向上を実現します。
  • • Metaは、より強力な「Muse Spark 1.2」モデルのウェイトを近い将来リリースする計画を発表しました。

開発者は、クラウドAPIに依存することなく、コンシューマー向けハードウェア上で高性能かつ許容範囲の広いオープンウェイトのエージェントモデルをローカルで実行できるようになります。

2. CactusがエッジLLMの次世代モデル「Needle 2」を発表

2026年5月にリリースされた2600万パラメータの初代Cactus Needleを基盤として、Cactusは「Needle 2」を立ち上げました。この新しいイテレーションは2ビットに圧縮された4500万パラメータのモデルで、わずか28MBのRAMで動作可能です。初代モデルが一般的なローカル実行に焦点を当てていたのに対し、Needle 2は構造化抽出やツール呼び出しといったエージェントタスクに特化して最適化されており、Raspberry Pi 5やMeta Quest 3Sなどのデバイスで大幅に高いトークンスループットを実現します。

  • • Needle 2は2ビットに圧縮された4500万パラメータのモデルで、28MBのRAMを必要とします。
  • • 構造化抽出とツール呼び出しのネイティブサポートを追加することで、初代Cactus Needleを改良しています。
  • • Raspberry Pi 5で500トークン/秒、Meta Quest 3Sで1500トークン/秒の速度を実現します。
  • • ローカル実行とクラウド実行を管理するための学習済み信頼度スコアが含まれています。
  • • トークンあたり70 MFLOPsの効率を持つSimple Attention Networksを使用しています。

このリリースは、Cactus Needleシリーズを前進させ、初期の2600万パラメータモデルの能力を超えて、極めて制約の厳しいハードウェア上でのより複雑なエージェントワークフローを可能にします。

SOURCES

3. AnthropicがClaude Codeの分類器手数料を廃止

2026年8月14日からClaude Codeのデフォルト設定がオートモードになるという最近の発表に基づき、Anthropicはサービスをさらに更新し、すべての分類器オーバーヘッド料金を廃止しました。即時有効となるこの変更により、潜在的に危険なコマンドを傍受する安全分類器に関連していた追加コストが削除されます。

  • • Anthropicは、有料プランのClaude Codeユーザーに対するすべての分類器オーバーヘッド料金を即時廃止しました。
  • • これは、2026年8月14日から開始される新しいセッションのデフォルト設定としてオートモードへ移行するという以前の発表に続くものです。
  • • 分類器は引き続きアクティブであり、破壊的なアクションをブロックし、必要な場合に手動承認をトリガーします。
  • • 新しい安全機能には、データ流出に対するハード拒否や、アクション前のgitステータスチェックが含まれます。

分類器料金の廃止により、自律型エージェントワークフローの実行コストが下がり、Pro、Max、Teamプランの開発者にとってデフォルトのオートモードがより利用しやすくなります。

SOURCES

4. Rustで書かれた15MBのオフラインコーディングエージェント「Ante」が登場

Anteは、Claude Codeのようなターミナルコーディングツールの軽量かつ高効率な代替手段として、アルファプレビュー版がリリースされました。Rustで書かれたこの単一バイナリは、独自のローカルllama.cppインスタンスを管理してGGUFモデルをオフラインで実行し、メモリ、CPU、ディスクI/Oの使用量を大幅に削減します。テレメトリはデフォルトで有効になっていますが、ANTE_TELEMETRY環境変数をoffに設定することで完全に無効化できます。

  • • Anteは、macOSおよびLinux向けの約15MBのRustバイナリコーディングエージェントで、完全なオフライン動作をサポートしています。
  • • APIキーやインターネットアクセスなしでGGUFモデルをローカルで実行するための、組み込みの管理型llama.cppを備えています。
  • • 12以上のLLMプロバイダーをサポートし、環境変数やJSONカタログを介したカスタムプロバイダー設定が可能です。
  • • DeepSeek V4 Flashモデルと組み合わせた場合、Terminal-Bench 2.1で82.7%の成功率を報告しています。
  • • SDK、プロトコル、評価パイプラインはApache 2.0ライセンスで提供され、コアハーネスはプリビルドバイナリとして配布されます。

開発者は、APIコストを発生させたりコードを外部サーバーに送信したりすることなく、ローカルハードウェア上で非常に効率的かつ完全にオフラインのコーディングエージェントを実行できます。

SOURCES

5. Spotifyがコーディングエージェントオーケストレーター「Xirp」をオープンソース化

Spotifyは、複数のAIコーディングエージェントをオーケストレーションするために設計された社内開発者ツール「Xirp」のパブリックベータ版を公開しました。Xirpを使用すると、開発者はClaude Code、Gemini CLI、OpenAI Codexなどのエージェントを並行して実行・比較でき、数万回に及ぶ社内セッションで洗練されたワークフローを活用してエージェント開発を効率化できます。

  • • Spotifyは、社内ツール「Xirp」をパブリックベータとしてリリースしました。
  • • Xirpを使用すると、ユーザーはClaude Code、Gemini CLI、OpenAI Codexエージェントを並行して実行できます。
  • • このツールは、Spotifyにおける36,000回以上のコーディングエージェントセッションを通じて社内で実戦テストされています。

開発者は、単一の統合インターフェース内で、複数の最先端コーディングエージェントを同時に比較、実行、オーケストレーションできます。

SOURCES

6. Jurorが並列LLMを使用したオープンソースのPRレビューを提供

Jurorは、Greptileのような商用PRレビューツールのオープンソース代替として立ち上げられました。GitHub ActionまたはCLIツールとして実行されるように設計されたJurorは、LLMの「陪審員団」を調整してコードの差分を分析し、コードを認識する類似性判定と審判モデルを使用して重複するレポートを統合します。このツールは、資格情報を分離し読み取り専用アクセスを強制することでセキュリティを優先しており、設定されたモデルプロバイダーへの直接API呼び出し以外でコードがローカルランナー環境から決して流出しないようにしています。

  • • Jurorは複数の最先端モデルを並列実行してGitHubのプルリクエストをレビューし、審判モデルを使用して結果を重複排除します。
  • • このツールは完全にユーザー自身のGitHub Actionsランナー上で実行され、モデルAPI呼び出し以外ではコードを安全に保ちます。
  • • OpenAI、Anthropic、xAI、Fireworksを含む複数のAPIプロバイダーをサポートし、カスタマイズ可能な陪審員プリセットを備えています。
  • • セキュリティ機能には、ハーネスごとの資格情報の分離、読み取り専用リポジトリアクセス、設定改ざんを防ぐためのベースリビジョンポリシーが含まれます。
  • • 各レビューは、使用されたモデル、所要時間、推定コストを詳述したコストレシートを生成します。

開発者は、ソースコードをサードパーティのSaaSプラットフォームに公開することなく、複数のLLMを活用する安全なセルフホスト型のコードレビューアシスタントを導入できます。

SOURCES

7. AWS ContinuumがClaude CodeとCodexを統合し、脆弱性修復を自動化

BedrockでのOpenAIのCodexの利用可能性とAnthropicのClaude Codeセキュリティプラグインの先行リリースに基づき、AWSは両ツールをContinuumプラットフォームに統合しました。Black Hat USA 2026で発表されたこの統合により、開発者はエージェントチームループを使用して脆弱性修復のライフサイクルを自動化できるほか、AI関連のコストハーベスティングを監視する新しいGuardDutyや、Security Hubの無料AIインベントリツールも利用可能になります。

  • • AWS Continuumは、脆弱性修復のためにエージェントチームループ内でClaude CodeとOpenAI Codexをオーケストレーションします。
  • • このプラットフォームは、コードの脆弱性の発見、優先順位付け、検証、修復を自動化します。
  • • AWS GuardDutyは、不正なAI推論(コストハーベスティング)を検出するためにデータプレーンイベントを監視するようになりました。
  • • AWS Security Hubは、サプライチェーン保護カテゴリと無料のAIインベントリ機能を追加しました。

この統合は、AWSクラウド環境内での統一された自動修復ループを提供することで、単体ツールの利用を超えた価値をもたらします。

SOURCES

8. AnthropicがClaude 3.5 Sonnetの価格引き上げ計画を撤回

Anthropicは、2026年8月31日に終了予定だったClaude 3.5 Sonnetの導入価格を恒久的に維持すると発表しました。この更新により、入力100万トークンあたり3ドル、出力100万トークンあたり15ドルに引き上げるという以前の計画は無効となり、開発者向けの現在の2ドル/10ドルのレートが維持されます。

  • • 入力100万トークンあたり2ドル、出力100万トークンあたり10ドルという導入価格が恒久化されました。
  • • 2026年9月1日に予定されていた3ドル/15ドルへの価格引き上げはキャンセルされました。
  • • この変更により、Claude 3.5 Sonnet上に構築されたアプリケーションの長期的なコスト安定性が確保されます。

開発者はClaude 3.5 Sonnetの現在の低価格を無期限に利用できるため、9月に予定されていた価格引き上げに合わせて予算予測を調整する必要がなくなりました。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。