1. Poolsideが225BパラメータのMixture-of-Expertsモデル「Laguna M.1」をリリース
Poolsideは、エージェントによるコーディングや長期的なタスクに最適化された225BパラメータのMixture-of-Experts(MoE)モデル「Laguna M.1」をリリースしました。Apache 2.0ライセンスで公開されたこのモデルは、トークンあたり23Bパラメータをアクティブ化し、262,144トークンのコンテキストウィンドウをサポートします。Laguna M.1は、ツール呼び出し間でのインターリーブ思考(interleaved thinking)をネイティブサポートしており、コーディングベンチマークにおいて、SWE-bench Verifiedで74.6%、SWE-bench Proで49.2%という強力なパフォーマンスを発揮します。
- • Laguna M.1は、合計225BパラメータのMoEモデルで、トークンあたり23Bのアクティブパラメータを持ち、Apache 2.0ライセンスでリリースされています。
- • このモデルは70層(3層の密なSwiGLU、67層の疎なMoE)で構成され、256の専門家(エキスパート)とtop-k=16のルーティングを備えています。
- • RoPEとYaRNを使用して262,144トークンのコンテキストウィンドウをサポートしています。
- • ツール呼び出し間でのインターリーブ思考をネイティブサポートしており、リクエストごとに切り替え可能です。
- • SWE-bench Verifiedで74.6%、SWE-bench Multilingualで63.1%、SWE-bench Proで49.2%のスコアを記録しています。
開発者は、インターリーブ思考のネイティブサポートと262kのコンテキストウィンドウを備えた、非常に高性能なオープンウェイトのコーディングモデルを利用できるようになります。
2. 多言語埋め込みおよびColBERTモデル「LFM2.5」がリリース
Liquid AIは、350Mパラメータの新しい検索モデルを2つリリースしました。密なバイエンコーダーである「LFM2.5-Embedding-350M」と、遅延インタラクション(late interaction)リトリーバーである「LFM2.5-ColBERT-350M」です。既存のRAGパイプラインのドロップイン代替品として設計された両モデルは、11言語にわたってクラス最高の多言語精度を実現します。基盤となるLFM2バックボーンのおかげで、はるかに小さなモデルに匹敵する高い推論速度を維持しつつ、高速なインデックス作成と多言語検索を促進します。
- • LFM2.5-Embedding-350Mは、11言語にわたる多言語検索用に設計された密なバイエンコーダーです。
- • LFM2.5-ColBERT-350Mは、トークンごとに1つのベクトルを保存し、MaxSimを使用して多言語マッチングを行う遅延インタラクションリトリーバーです。
- • 両モデルとも350Mパラメータで、既存のRAGパイプラインのドロップイン代替品として設計されています。
- • LFM2バックボーンにより、より小さなモデルに匹敵する推論速度を実現し、サイズに対してクラス最高の多言語精度を提供します。
開発者は、350Mパラメータというコンパクトなサイズで11言語をサポートする、高精度かつ高速な多言語検索モデルを使用してRAGパイプラインをアップグレードできます。
3. North Mini Code 1.0が4ビット量子化とOllamaサポートに対応
CohereLabsは、North Mini Code 1.0モデルの4ビット量子化バージョンをHugging Faceでリリースしました。この量子化によりメモリ要件が約20GBに削減され、Macなどの標準的なハードウェア上でモデルをローカル実行できるようになりました。このモデルは現在、Ollamaおよびその他のllama.cppベースのランタイムで完全にサポートされており、OpenRouter API経由でも引き続きアクセス可能です。
- • CohereLabsは、North Mini Code 1.0モデルの4ビット量子化バージョンをHugging Faceでリリースしました。
- • 4ビット量子化モデルは、ローカルハードウェアで実行するために約20GBのメモリを必要とします。
- • North Mini Code 1.0は、Ollamaおよびllama.cppベースの他のローカルランタイムでサポートされるようになりました。
- • このモデルはOpenRouter API経由でも利用可能です。
開発者は、わずか20GBのメモリを搭載したMacなどの標準的なハードウェア上で、North Mini Code 1.0モデルをローカル実行できるようになりました。
4. LiteLLM、Langflow、Microsoft Copilotにおける重大な脆弱性が開示
一連の重大なセキュリティ開示が、人気のあるAI開発者ツールを標的にしています。Obsidian Securityは、LiteLLMゲートウェイにおいて、権限の低いユーザーがリモートコードを実行し、プロバイダーのAPIキーにアクセスできる3つのCVEチェーンを明らかにしました。また、LiteLLMのMCPテストエンドポイントにおけるコマンドインジェクションの脆弱性がCISAのKEVリストに追加されました。さらに、Langflowのパストラバーサルの脆弱性(CVE-2026-5027)が悪用されていると報告されており、Microsoft 365 Copilotには「SearchLeak」と呼ばれるデータ流出チェーンの脆弱性が見つかりました。
- • Obsidian Securityは、LiteLLMゲートウェイにおける3つのCVEチェーン(CVE-2026-47101、CVE-2026-47102、CVE-2026-40217)を公開し、リモートコード実行とプロバイダーキーへのアクセスを可能にしました。
- • LiteLLMは、MCPテストエンドポイントにおけるコマンドインジェクションの脆弱性(CVE-2026-42271)にも直面しており、6月22日の修正期限付きでCISA KEVリストに追加されました。
- • 認証なしでリモートコード実行を可能にするLangflowのパストラバーサルの脆弱性(CVE-2026-5027)は、MuddyWaterによって積極的に悪用されています。
- • Varonisは、Microsoft 365 Copilot Enterprise Searchにおける重大な流出チェーンであるSearchLeak(CVE-2026-42824)を公開しました。
- • 6月1日、「Mini Shai-Hulud」ワームを含むサプライチェーン攻撃により、32個のRed Hat Cloud Services npmパッケージが侵害されました。
LiteLLMまたはLangflowを使用している開発者は、リモートコード実行やプロバイダーAPIキーへの不正アクセスを防ぐため、直ちにインスタンスにパッチを適用する必要があります。
5. Anthropicがインタラクティブワークスペース向け「Claude Code Artifacts」をローンチ
Anthropicは、ターミナルベースの開発者ツール「Claude Code」をアップデートし、Artifactsのサポートを追加しました。Claude TeamおよびEnterpriseのサブスクライバーが利用可能なこの機能により、開発者はターミナルセッションの出力をライブでインタラクティブかつ共有可能なHTMLウェブページとしてレンダリングできます。これらのステートレスで自己完結型のページ(最大16 MiB)は、AIエージェントの作業に合わせてリアルタイムで更新されます。エンタープライズセキュリティを維持するため、Anthropicはすべての外部ネットワークリクエストをブロックする厳格なコンテンツセキュリティポリシー(CSP)を適用し、生成されたワークスペースをデフォルトで安全かつプライベートに保ちます。
- • AnthropicはClaude TeamおよびEnterpriseサブスクライバー向けに、Claude Code用Artifactsを導入しました。
- • この機能は、ターミナルセッションの作業をライブでインタラクティブかつ共有可能なHTMLウェブページに変換します。
- • ウェブページはAIエージェントの作業に合わせてリアルタイムで更新され、永続的なURLからアクセス可能です。
- • Artifactsはステートレスで自己完結型のHTMLページであり、レンダリング後の最大サイズは16 MiBです。
- • Anthropicは、セキュリティのためにすべての外部ネットワークリクエスト(fetch、XHR、WebSocket)をブロックする厳格なコンテンツセキュリティポリシー(CSP)を適用しています。
- • アクセスはデフォルトでプライベートであり、組織の認証済みメンバーに制限されています。
開発者は、ターミナルベースのClaude Codeセッションから直接、ライブでインタラクティブな視覚的ダッシュボードやシステム図を即座に生成・共有できるようになりました。
6. Elasticが永続メモリレイヤーを備えた「Agent Builder」をローンチ
Elasticは、Elastic Cloud上でAgent Builderの一般提供を開始し、Elasticsearch上に構築された永続的なエージェントメモリレイヤーを導入しました。このアーキテクチャは、メモリをエピソード、セマンティック、プロシージャルのインデックスに分離し、BM25とJina v5の密なベクトルを使用したハイブリッド検索パイプラインを活用します。このシステムは、CursorやClaude Desktopとのシームレスな統合のためにModel Context Protocol(MCP)をネイティブサポートしており、ドキュメントレベルのセキュリティを通じて厳格なマルチテナント分離を強制します。
- • ElasticのAgent BuilderがElastic Cloudで一般提供開始されました。
- • アーキテクチャは、エピソード、セマンティック、プロシージャルの3つのElasticsearchインデックスを使用してメモリを管理します。
- • システムは、RRFおよびJina v2クロスエンコーダーリランカーと融合したハイブリッド検索パイプライン(BM25およびJina v5密ベクトル)を採用しています。
- • Claude DesktopやCursorなどのクライアントとの統合のためにModel Context Protocol(MCP)をサポートしています。
- • マルチテナント分離は、Elasticsearchのドキュメントレベルセキュリティ(DLS)を使用してクラスターレベルで強制されます。
- • 評価において、システムはテナント間の漏洩ゼロで0.89の平均R@10を達成しました。
開発者は、既存のElasticsearchインフラストラクチャを使用して、高い再現性とネイティブなMCP統合を備えた堅牢なマルチテナントエージェントメモリレイヤーを実装できます。
7. MCP向けゼロタッチOAuth拡張機能が安定版に到達
Model Context Protocol(MCP)のEnterprise-Managed Authorization(EMA)拡張機能が安定版に到達しました。EMAにより、組織はOktaなどの既存のIDプロバイダーを通じてMCPサーバーへのアクセスを一元管理でき、ユーザーごとのOAuth設定や繰り返される同意プロンプトが不要になります。Anthropicはすでにこの拡張機能をClaude、Claude Code、Coworkの共有MCPレイヤーに統合しており、VS CodeやSupabase、Linear、Figmaなどのプラットフォームもサポートしています。
- • Model Context Protocol(MCP)のEnterprise-Managed Authorization(EMA)拡張機能が安定版に到達しました。
- • EMAにより、組織はIDプロバイダーを通じてMCPサーバーへのアクセスを一元管理でき、ユーザーごとのOAuthプロンプトが不要になります。
- • この拡張機能は、ゼロタッチ設定のためにIdentity Assertion JWT Authorization Grant(ID-JAG)を使用します。
- • Oktaが最初のサポート対象IDプロバイダーであり、Cross App Access(XAA)プロトコルを利用しています。
- • AnthropicはClaude、Claude Code、Coworkの共有MCPレイヤーにEMAを実装しており、VS Codeもサポートを追加しました。
- • サポートされているプラットフォームには、Supabase、Linear、Figma、Canva、Atlassian、Asanaが含まれます。
開発者は、個々のユーザーが繰り返しOAuth同意プロンプトを完了させる必要なく、エンタープライズ環境でMCPサーバーを構築およびデプロイできます。
8. Arborフレームワークが自律的なソフトウェア最適化を自動化
中国人民大学とMicrosoft Researchの研究者は、複雑なソフトウェアシステムの最適化を自動化するために設計されたオープンソースフレームワーク「Arbor」を発表しました。Arborは、最適化プロセスを、長期的なコーディネーターエージェントによって管理される仮説、実験、証拠の分岐ツリーとして構造化し、短期的なエグゼキューターエージェントが分離されたgitワークツリーで変更をテストします。ベンチマークにおいて、Arborは同じ計算予算の下でClaude CodeやCodexのような標準的なコーディングエージェントの2.5倍以上のパフォーマンス向上を実現し、標準的なGitワークフローと直接統合してコードレビューを容易にします。
- • Arborは、複雑なソフトウェアシステムの自律的な最適化を自動化するために設計されたフレームワークです。
- • このフレームワークは、長期的なコーディネーターエージェントを使用して研究戦略を管理し、分離されたgitワークツリーで短期的なエグゼキューターエージェントを使用します。
- • 研究を、仮説ツリーリファインメント(HTR)を介して仮説、実験、証拠を追跡する分岐ツリー構造に整理します。
- • Arborは、同じ計算予算の下でCodexやClaude Codeの2.5倍以上のパフォーマンス向上を実現しました。
- • BrowseCompタスクにおいて、ArborはClaude Codeの53.33%と比較して、精度を67.67%に向上させました。
- • このフレームワークは既存のGitワークフローと統合されており、開発者はマージ前に最適化されたブランチをレビューできます。
開発者は、長期的なコーディネーターエージェントをデプロイして、標準的なコーディングエージェントよりも2.5倍優れたパフォーマンスで複雑なソフトウェアシステムを自律的に最適化できます。
9. Vercelが永続的なエージェントトークンを置き換える「Connect」をローンチ
Vercelは、AIエージェントのデプロイメント専用に設計されたセキュリティ機能である「Connect」のパブリックベータ版を開始しました。漏洩した場合に重大なセキュリティリスクをもたらす長期的な永続プロバイダートークンに依存する代わりに、Connectはランタイム認証情報交換システムを実装しています。このプラットフォームは、短命でタスクスコープ化された認証情報を自動的に発行し、タスクを実行する自律エージェントの攻撃対象領域を最小限に抑えます。
- • VercelはConnectのパブリックベータ版を開始しました。
- • Connectは、長期的なプロバイダートークンをランタイム認証情報交換システムに置き換えます。
- • このシステムは、AIエージェント向けに短命でタスクスコープ化された認証情報を発行します。
- • このアップデートは、共有された永続的なアクセストークンに関連するセキュリティリスクを軽減することを目的としています。
開発者は、リスクの高い長期的なAPIトークンをエフェメラル(一時的)でタスクスコープ化された認証情報に置き換えることで、エージェントのデプロイメントを保護できます。
10. Claude内にReplit統合がローンチ
ReplitはClaude内への直接統合を開始し、開発者が初期の設計に関する会話からアクティブな開発へシームレスに移行できるようにしました。この統合により、AIが生成したコードプロトタイプを取得し、Replitのクラウドベースの開発環境内で直接開くというワークフローが効率化されます。
- • ReplitがClaudeに統合されました。
- • この統合は、設計から開発への移行を可能にするように設計されています。
Claudeを使用する開発者は、設計やコードプロトタイプをReplitの開発環境へ直接移行できるようになりました。
11. AA-Briefcaseベンチマークが長期プロジェクトにおけるモデルを評価
複雑で長期的なナレッジワークにおいてAIモデルをテストするために、「AA-Briefcase」と呼ばれる新しいエージェント評価ベンチマークが開始されました。業界の専門家によって開発されたこのベンチマークは、25,000件以上のSlackメッセージや3,500件以上のメールを含む、数千の断片化された入力にわたってモデルが推論することを要求することで、現実世界の組織コンテキストをシミュレートします。Claude Fable 5が現在ベンチマークをリードしていますが、タスクあたりの平均コストは31ドルと高く、Claude Opus 4.8の10.40ドル、GLM-5.2の2.40ドルと比較されます。
- • AA-Briefcaseは、複雑な数週間のプロジェクトにおける長期的なナレッジワークでAIモデルを評価するために設計された新しいベンチマークです。
- • モデルは、社内ドキュメント、会議の議事録、25,000件以上のSlackメッセージ、3,500件以上のメールを含む、数千の断片化された入力にわたって推論する必要があります。
- • Claude Fable 5がEloスコア1587でベンチマークをリードし、Claude Opus 4.8が1356、GLM 5.2が1266で続いています。
- • タスクあたりの平均コストは、Claude Fable 5が31ドル、Claude Opus 4.8が10.40ドル、GLM-5.2(最大)が2.40ドルです。
- • パブリックデモンストレーションシナリオである「AA-Briefcase Lite」がHugging Faceで利用可能です。
開発者はこのベンチマークを使用して、さまざまなモデルが複雑な現実世界のエンタープライズワークフローをどの程度処理できるかを評価し、関連するAPIコストを見積もることができます。
12. NvidiaがXR AIプラットフォームをパブリックベータでローンチ
Nvidiaは、拡張現実(XR)デバイスをGPUアクセラレーションAIサービスに接続するための基盤を提供する「Nvidia XR AI」をパブリックベータ版としてリリースしました。このプラットフォームには、開発者がAIグラス、ARグラス、XRヘッドセット用のインテリジェントエージェントを構築できるようにするオープンソースライブラリが含まれています。これらのエージェントは、リアルタイムの視覚入力を処理し、ユーザーの意図を解釈し、エンタープライズツールを呼び出し、アクティブなXRセッション内で直接応答を提供できます。
- • Nvidia XR AIは、拡張現実(XR)デバイスをGPUアクセラレーションAIサービスに接続するためにパブリックベータ版として開始されました。
- • このプラットフォームは、クラウド、データセンター、ワークステーション、またはエッジで実行されるAIサービスをサポートしています。
- • 開発者がAIグラス、ARグラス、XRヘッドセット用のインテリジェントエージェントを構築するためのオープンソースライブラリが利用可能です。
- • ライブラリで構築されたエージェントは、視覚入力を処理し、意図を理解し、エンタープライズツールを呼び出し、XRセッション内で応答できます。
開発者は、視覚入力を処理し、意図を理解し、エンタープライズツールをリアルタイムで呼び出すARグラスやXRヘッドセット用のインテリジェントエージェントを構築できます。
13. TesterArmyがエージェント型Webおよびモバイルアプリテストプラットフォームをローンチ
YC P26企業であるTesterArmyは、Webおよびモバイルアプリケーションのエンドツーエンドチェックを自動化するために設計されたエージェント型テストプラットフォームをローンチしました。このプラットフォームにより、開発者は自然言語でテストケースを定義でき、それらはデプロイ前および本番環境の両方でAIエージェントによって実行されます。TesterArmyはGitHubと直接統合してスケジュール設定を行い、重要なフローでバグが検出された場合にSlackやDiscordを通じてアラートを送信します。
- • TesterArmyは、デプロイ前および本番環境でエンドツーエンドのチェックを実行するエージェント型テストプラットフォームです。
- • ユーザーは自然言語でテストを定義し、AIエージェントによって実行および管理されます。
- • このプラットフォームは、テストのスケジュール設定のためにGitHubと統合され、SlackやDiscord経由でアラートを送信します。
- • 30以上のチームが、オンボーディング、チェックアウト、AIチャットフローのバグを特定するために毎日この製品を使用しています。
開発者は、自然言語のテスト定義を使用して、オンボーディングやチェックアウトなどの重要なアプリケーションフローのエンドツーエンドテストを自動化できます。
14. Hermesがレガシーエージェント構成用の移行ツールを導入
Hermesは、「hermes claw migrate」コマンドからアクセス可能な移行ユーティリティをリリースしました。これは、レガシーなOpenClaw、Clawdbot、Moldbotの構成をインポートするために設計されています。このツールはデフォルトディレクトリを自動的にスキャンし、ペルソナ、メモリ、ワークスペースファイル、スキル、MCPサーバーを移行します。環境ファイルから標準のAPIキーを解決しますが、ファイルや実行ソースに依存するSecretRefオブジェクトは開発者が手動で構成する必要があります。
- • 「hermes claw migrate」コマンドは、レガシーなOpenClaw、Clawdbot、またはMoldbotの構成をHermesにインポートします。
- • このツールは、~/.clawdbot/や~/.moltbot/のようなレガシー構成ディレクトリを自動的に検出します。
- • 移行されるデータには、ペルソナ、メモリ、指示、ワークスペースファイル、スキル、MCPサーバーが含まれます。
- • APIキーは、構成値、環境ファイル、エージェント認証プロファイルから解決されます。
- • ファイルや実行ソースを使用するSecretRefオブジェクトは自動的に解決できないため、手動で追加する必要があります。
開発者は、単一のCLIコマンドを使用して、メモリ、スキル、APIキーを含むレガシーエージェント構成をHermesプラットフォームに簡単に移行できます。
15. 実世界のワークロードテストがトークン圧縮ツールの実際の節約額を測定
3つの人気トークン節約ツール(rtk、headroom、caveman)の実世界評価により、API請求に対する実際のインパクトが宣伝よりも大幅に低いことが明らかになりました。合計6億1400万トークンに及ぶ500回のClaude Codeセッションでテストした結果、これらのツールによる合計節約額はわずか3.7%でした。ツールはターゲットとするペイロードの圧縮には成功しましたが、システムプロンプト、ファイル読み取り、キャッシュされたトークンを最適化せず、機密コードやAPIキーへのアクセスによるセキュリティリスクを導入するため、全体的な請求削減は大幅に希薄化されました。
- • 3つのトークン節約ツール(rtk、headroom、caveman)が、合計6億1400万トークン、ベースライン支出926ドルの500回のClaude Codeセッションでテストされました。
- • 達成された実世界の合計節約額はわずか3.7%(34.12ドル)で、headroomが2.8%、rtkが0.5%、cavemanが0.4%でした。
- • ツールの宣伝されていた圧縮率は正確であることが確認されましたが、それはターゲットとする特定のペイロードに対してのみでした。
- • 全体的な請求への影響が低いのは「分母効果」によるもので、高圧縮のトリックはシステムプロンプト、ファイル読み取り、キャッシュされたトークンには適用されません。
- • このテストは、これらのツールがコード、プロンプト、APIキーへのアクセスを必要とするというセキュリティリスクを強調しました。
高圧縮のトリックはキャッシュされたプロンプトやファイル読み取りには適用されないため、開発者はトークン圧縮ツールから宣伝されているよりもはるかに低い実世界のコスト削減を予想すべきです。
16. 分析がRTKトークン圧縮ツールの運用リスクに警告
RTKターミナル出力圧縮ツールに対する技術的な分析により、本番エージェントワークフローにおけるその実現可能性について懸念が提起されました。RTKはCLI出力を圧縮することで60〜90%のトークン節約を主張していますが、批評家は、この指標がファイル読み取りやシステムプロンプトのような主要なコスト要因を無視していると指摘しています。さらに、CLI出力の脆い解析は、重要なスタックトレースやコンパイラコンテキストを削除するなどの運用リスクを導入し、コーディングエージェントがサイレントに失敗する原因となる可能性があります。
- • RTKは、LLMエージェントのトークン使用量を削減するためにターミナル出力を圧縮するように設計されており、60〜90%の節約を主張しています。
- • 技術的な批判は、この節約指標が生のコマンドライン出力にのみ適用され、ファイル読み取りやシステムプロンプトを無視しているため、誤解を招くと主張しています。
- • 批評家は、RTKがスタックトレースやコンパイラコンテキストのような重要な情報を削除することで、サイレント障害を引き起こす可能性があると警告しています。
- • RTKは現在、その影響を検証するためのSWE-benchのような厳格なタスク成功率ベンチマークを欠いています。
- • このツールは、標準的なツールアップデートで壊れる可能性のあるCLI出力の脆い解析に依存しています。
コーディングエージェントにトークン圧縮ツールを使用する開発者は、わずかなコスト削減と、コンテキストが削除されることによるエージェントのサイレント障害のリスクを比較検討する必要があります。