1. Mistral AIがLean 4コード検証向けにLeanstral 1.5をリリース
Mistral AIの新しいLeanstral 1.5は、総パラメータ数119B、トークンあたりのアクティブパラメータ数6.5BのMixture-of-Expertsモデルです。このモデルは256kトークンのコンテキスト長を特徴とし、マルチモーダル入力をサポートしています。トレーニングは、ミッドトレーニング、教師ありファインチューニング、CISPOを用いた強化学習の3段階で行われました。57のリポジトリを用いた実環境テストでは、11件の重大なバグを特定し、そのうち5件はGitHubでこれまで報告されていなかったものです。Hugging Faceのウェイト、無料API、またはvLLM 0.24.0以降を使用したセルフホスティングで利用可能です。
- • Mistral AIはLeanstral 1.5をApache 2.0ライセンスでリリースし、Hugging Faceのウェイト、無料API、またはvLLM 0.24.0以降でのセルフホスティングで利用可能。
- • このモデルは総パラメータ数119B、トークンあたりのアクティブパラメータ数6.5BのMixture-of-Expertsアーキテクチャを採用。
- • 256kトークンのコンテキスト長を備え、テキストや画像を含むマルチモーダル入力をサポート。
- • Leanstral 1.5はminiF2Fベンチマークで100%の成功率を達成し、PutnamBenchの672問中587問を解決。
- • 57のリポジトリを用いた実環境テストで11件のバグを特定し、そのうち5件はGitHubで未報告のもの。
開発者は、このオープンウェイトモデルや無料APIを活用することで、ソフトウェアの正確性検証を自動化し、コードベース内のバグを特定できます。
2. Interfazeが多言語音声拡散ASRモデルをオープンソース化
Interfazeは、初のオープンソース多言語音声拡散ASRモデルとして「diffusion-gemma-asr-small」を公開しました。英語、ドイツ語、フランス語、スペイン語、ヒンディー語、中国語をサポートしています。このモデルは、凍結された26BパラメータのDiffusionGemmaバックボーンの上にトレーニングされた約42Mパラメータのアダプターで構成され、特徴抽出器として凍結されたWhisperエンコーダーを利用しています。多くの拡散LLMとは異なり、均一なランダムトークン拡散を採用しているため、文字起こしのコストはトランスクリプトの長さではなく、ノイズ除去ステップ数に比例します。アダプターはApache-2.0ライセンスでリリースされています。
- • Interfazeは、英語、ドイツ語、フランス語、スペイン語、ヒンディー語、中国語をサポートする多言語音声拡散ASRモデル「diffusion-gemma-asr-small」をオープンソース化。
- • 凍結された26BパラメータのDiffusionGemmaバックボーン上にトレーニングされた約42Mパラメータのアダプターを使用。
- • 均一なランダムトークン拡散と、特徴抽出器として凍結されたWhisperエンコーダーを採用。
- • 文字起こしコストはトランスクリプトの長さではなく、ノイズ除去ステップ数に比例する。
- • アダプターはApache-2.0ライセンスでリリース(基盤モデルはそれぞれのライセンスに従う)。
- • LibriSpeechでのベンチマークでは、他の拡散ベースASRモデルを上回るが、自己回帰型Whisperモデルには及ばない。
開発者は、文字起こしコストがトランスクリプトの長さではなくノイズ除去ステップ数に依存する、オープンソースの非自己回帰型音声認識モデルを利用できるようになります。
3. WaferがAMD MI355X上でGLM 5.2を実行、Blackwellの2倍のコスト効率を実現
Waferは、AMD MI355Xハードウェア上でGLM 5.2モデルを実行し、ノードあたり2626 tok/sの総スループットと、213 tok/sのシングルストリーム性能を達成しました。この推論性能は、同等のNVIDIA Blackwellハードウェアと比較して2倍以上低いコストで実現されています。Waferはsglang推論フレームワークを活用し、AMD Quarkを使用してGLM-5.2モデルをMXFP4に量子化しました。チームはsglangのROCmイメージに2つの修正を加え、推論デコーディングを有効にすることでシングルストリームスループットを約3倍向上させ、GLM-5.2のfp4形状に合わせてMoEカーネル選択を手動調整することでプリフィル性能を改善しました。
- • WaferはAMD MI355X上でGLM 5.2を実行し、ノードあたり2626 tok/sの総スループットと213 tok/sのシングルストリーム性能を達成。
- • 同等のNVIDIA Blackwellハードウェアと比較して2倍以上低いコストで推論性能を実現。
- • sglang推論フレームワークを利用し、AMD QuarkでGLM-5.2をMXFP4に量子化。
- • sglangのROCmイメージに修正を加え、推論デコーディングを有効化し、シングルストリームスループットを約3倍向上。
- • GLM-5.2のfp4形状に合わせてMoEカーネル選択を手動調整し、プリフィル性能を改善。
推論コストの最適化を目指す開発者は、AMD MI355Xハードウェアとsglangを活用することで、NVIDIAの最新チップの数分の一のコストで高スループット性能を実現できます。
4. エージェント型コーディングおよび長期タスク向け「Laguna XS 2.1」リリース
Laguna XS 2.1は、エージェント型コーディングと長期タスクに特化して最適化されています。このモデルはSWE-bench Multilingualベンチマークで5.4ポイントの向上を達成し、スコアは63.1%となりました。OpenMDW-1.1ライセンスでリリースされており、Hugging FaceからのダウンロードまたはAPI経由で利用可能です。リソース効率の高いデプロイをサポートするため、3つの量子化チェックポイントが含まれています。
- • Laguna XS 2.1は、エージェント型コーディングに最適化された33BパラメータのMixture-of-Expertsモデル。
- • SWE-bench Multilingualベンチマークで63.1%のスコアを達成し、5.4ポイントの向上を実現。
- • OpenMDW-1.1ライセンスでリリースされ、Hugging FaceまたはAPI経由で利用可能。
- • リソース効率の高いデプロイをサポートするため、3つの量子化チェックポイントを提供。
開発者は、多言語ソフトウェアエンジニアリングのパフォーマンスを向上させ、リソース効率の良いローカルデプロイ用の量子化チェックポイントを提供する新しいオープンウェイトのコーディングモデルを選択肢に加えることができます。
5. Micro-Worldがアクション制御可能なインタラクティブ世界モデルをリリース
Micro-Worldは、高品質なオープンドメインのシーンを生成するために設計された、アクション制御可能なインタラクティブ世界モデルです。Wan2.1モデルファミリーをベースにしており、Image-to-World (I2W) および Text-to-World (T2W) の両方のバリエーションが含まれています。T2Wモデルはアクション注入にControlNetを使用し、I2Wモデルは軽量なパラメータフットプリントのためにadaLNを使用しています。プロジェクトは、モデルのウェイト、完全なトレーニングおよび推論コード、そしてキュレーションされたデータセットをGitHubで公開しました。
- • Micro-Worldは、オープンドメインのシーンを生成するために設計されたアクション制御可能なインタラクティブ世界モデル。
- • Wan2.1ファミリーをベースにしており、Image-to-World (I2W) および Text-to-World (T2W) のバリエーションを含む。
- • T2Wモデルはアクション注入にControlNetを使用し、I2Wモデルは軽量なパラメータフットプリントのためにadaLNを使用。
- • モデルのウェイト、完全なトレーニングおよび推論コード、キュレーションされたデータセットをGitHubで公開。
開発者は、これらのオープンソースのウェイトとトレーニングコードを使用して、インタラクティブでアクション制御可能なビデオやシーン生成機能を構築できます。
6. ポルトガル政府がオープンウェイトLLM「AMALIA 9B」をリリース
ポルトガル政府は、9BパラメータのLLM「AMALIA」のリリースを発表しました。このモデルは、SFT(教師ありファインチューニング)およびDPO(直接選好最適化)の両バージョンがHugging Faceで公開されています。AMALIA LLMプロジェクトはApache 2.0ライセンスでリリースされており、モデルの詳細を記した研究論文がarXiv(識別子2603.26511)で公開されています。
- • ポルトガル政府が9BパラメータのLLM「AMALIA」をリリース。
- • SFTおよびDPO(直接選好最適化)の両バージョンがHugging Faceで利用可能。
- • Apache 2.0ライセンスでリリース。
- • モデルの詳細を記した研究論文がarXiv(識別子2603.26511)で公開。
開発者は、ローカルデプロイやファインチューニング用にSFTおよびDPOで最適化された、新しいApache 2.0ライセンスの9Bモデルを利用できます。
7. Meituan-LongcatがLongCat 2.0のFP8およびINT8モデルウェイトを公開
Meituan-longcatは、LongCat 2.0モデルの2つの量子化バージョンのモデルウェイトを公開しました。LongCat-2.0-INT8およびLongCat-2.0-FP8の両方のモデルウェイトが、Hugging Faceプラットフォームからダウンロード可能になりました。
- • Meituan-longcatがLongCat-2.0-INT8のモデルウェイトをHugging Faceで公開。
- • Meituan-longcatがLongCat-2.0-FP8のモデルウェイトをHugging Faceで公開。
開発者は、LongCat 2.0モデルの量子化バージョンをダウンロードし、ローカル環境や独自の推論パイプラインで実行できるようになりました。
8. pxpipeプロキシがコンテキストを画像化しClaude Codeのトークンコストを削減
pxpipeは、システムプロンプト、ツールドキュメント、過去の履歴などの膨大なコンテキストをコンパクトなPNG画像に変換することで、Claude Codeの入力トークンコストを削減するローカルプロキシです。このシステムは、画像トークンのコストがピクセル寸法によって固定されているという事実を利用しており、コードやJSONのような高密度なコンテンツをテキストよりも効率的に表現できます。主にClaude Fable 5モデル向けに調整されており、画像化されたコンテンツの読み取りベンチマークで100/100を達成しています。このツールは非可逆的であり、ID、ハッシュ、シークレットなどの正確な逐語的再現は、画像化されたコンテンツに保存される場合、信頼性が低くなります。
- • pxpipeは、膨大なコンテキスト(システムプロンプト、ツールドキュメント、履歴)をコンパクトなPNG画像に変換し、Claude Codeの入力トークンコストを削減するローカルプロキシ。
- • ピクセル寸法に基づく固定画像トークンコストを利用し、エンドツーエンドのトークン料金を約59%から70%削減。
- • 主にClaude Fable 5モデル向けに調整されており、画像化されたコンテンツの読み取りベンチマークで100/100を達成。
- • 非可逆的なツールであるため、ID、ハッシュ、シークレットなどの正確な逐語的再現は信頼性が低い。
- • SWE-bench Proテストでは、pxpipe有効インスタンスは14/19の解決率を達成(対照群は15/19)。
- • ユーザーは`npx pxpipe-proxy`でプロキシをデプロイし、`ANTHROPIC_BASE_URL`環境変数経由でClaude Codeを接続可能。
開発者は、固定された画像トークン価格を利用することで、Claude Code使用時のAPI料金を大幅に削減できますが、シークレットの正確な再現性には注意が必要です。
9. Appleが自動Webデバッグ用のSafari MCPサーバーを導入
AppleのSafari Technology Preview 247では、Web開発者向けに設計されたModel Context Protocolサーバーである「Safari MCPサーバー」が導入されました。このサーバーにより、MCP互換エージェントがSafariブラウザウィンドウに接続し、Webアプリケーションのデバッグやトラブルシューティングを行うことができます。接続されたエージェントは、DOM、ネットワークリクエスト、スクリーンショット、コンソール出力などのブラウザデータにアクセスできます。このツールは完全にローカルマシン上で動作し、キャプチャされたデータはAppleではなくエージェントに直接送信され、自動入力などの個人ブラウザデータにはアクセスしません。
- • Safari Technology Preview 247でWeb開発者向けのSafari MCPサーバーを導入。
- • MCP互換エージェントがSafariブラウザウィンドウに接続し、Webアプリケーションのデバッグやトラブルシューティングが可能。
- • 接続されたエージェントはDOM、ネットワークリクエスト、スクリーンショット、コンソール出力などのブラウザデータにアクセス可能。
- • ツールは完全にローカルマシン上で動作し、キャプチャされたデータはエージェントに直接送信される。
- • 使用するには、Safari Technology Previewをインストールし、ブラウザ設定でリモート自動化と外部エージェントを有効にする必要がある。
開発者は、AIエージェントにSafari内のDOM、ネットワークリクエスト、スクリーンショット、コンソールログを自律的に検査させ、Webアプリケーションのデバッグを自動化できるようになりました。
10. Cognitionがコードベース全体の脆弱性検出を行う「Devin Security Swarm」を立ち上げ
Cognitionは、複雑なコードベース内のセキュリティ脆弱性を特定するために設計された専門ツール「Devin Security Swarm」を立ち上げました。このシステムは、コードベース全体の推論を可能にする「Agentic MapReduce」と呼ばれる新しいアーキテクチャに基づいています。このプロセスは、リポジトリ全体でシグナルをマッピングし、境界のあるシャード全体でエージェントにタスクを分散し、調査結果を単一のレポートに集約し、分離されたサンドボックス内で脆弱性を検証します。Cognitionは、このアーキテクチャの詳細を記した技術ドキュメントを公開しています。
- • Cognitionが複雑なコードベース内のセキュリティ脆弱性を特定する「Devin Security Swarm」を導入。
- • 新しい「Agentic MapReduce」アーキテクチャを使用してコードベース全体の推論を実行。
- • リポジトリ全体でシグナルをマッピングし、タスクを分散し、結果を集約してサンドボックス内で脆弱性を検証。
- • Agentic MapReduceアーキテクチャの詳細を記した技術ドキュメントを公開。
開発者は、このエージェントシステムを活用してリポジトリ全体を自動スキャンし、潜在的なセキュリティ欠陥をマッピングして、分離されたサンドボックス内で検証できます。
11. Model Context Protocolトラフィック用ライブTUIデバッガー「mcpsnoop」が登場
mcpsnoopは、AIクライアントとサーバー間のModel Context Protocol (MCP) トラフィックをデバッグするために設計された透過的プロキシツールです。このツールはデータパス上に配置され、ユーザーはターミナルUIでライブのJSON-RPCフレームを表示できます。主な機能には、ハングアップした呼び出しの検出、機能検査、フレーム検索、キャプチャされたツール呼び出しの再生機能が含まれます。ユーザーは、クライアントのMCP設定でサーバーコマンドをラップするか、ストリーム可能なHTTPサーバーのリバースプロキシとして実行することでmcpsnoopを統合できます。
- • mcpsnoopは、MCPトラフィックをデバッグするためにデータパス上に配置される透過的プロキシツール。
- • ターミナルUIでライブのJSON-RPCフレームを表示し、フレーム検索、機能検査、ハングアップ検出をサポート。
- • キャプチャされたツール呼び出しを再生してサーバーの動作をテスト可能。
- • インストールは`go install`またはHomebrew経由でサポートされており、現在はプレ1.0ステータス。
- • ユーザーのクライアント設定で指定されたサーバーのみを実行する。
MCPサーバーを構築する開発者は、ライブのJSON-RPCフレームを簡単に検査し、ハングアップした呼び出しを検出し、ツール呼び出しを再生することでデバッグを効率化できます。
12. オープンソースのローカルファーストAIブラウザエージェント「WebBrain」が登場
WebBrainは、Emre Sokullu氏によって作成された、MITライセンスの無料オープンソースAIブラウザエージェントです。ブラウザのサイドパネル内で動作し、ローカルモデル(llama.cppやOllamaなど)で完全に実行するか、クラウドAPIに接続できます(最適なパフォーマンスにはQwen 3.6 35Bを推奨)。読み取り専用タスク用の「Ask」モードと、Chrome DevTools Protocolを介してページと対話する「Act」モードの2つのモードを備えています。WebBrainはセキュリティファーストのアプローチで設計されており、重要なアクションには承認が必要で、直接的なAPI呼び出しの代わりに可視UIを使用して変更を行います。
- • WebBrainは、ChromeおよびFirefox向けのMITライセンスの無料オープンソースAIブラウザエージェント。
- • ブラウザのサイドパネルで動作し、ローカルモデル(llama.cpp、Ollama)またはクラウドAPIをサポート(Qwen 3.6 35Bを推奨)。
- • 読み取り専用タスク用の「Ask」モードと、Chrome DevTools Protocolを介してページと対話する「Act」モードを搭載。
- • セキュリティファーストのアプローチを採用し、重要なアクションには承認が必要。
- • デバイスプロファイルごとに月額5ドルの管理オプション「WebBrain Cloud」も利用可能。
開発者は、このオープンソースエージェントを使用して、Ollamaやllama.cppなどのモデルでブラウザベースのワークフローをローカルで自動化できます。
13. SGLangチームがエージェントワークフローを再利用可能なプレイブックに標準化
SGLangチームは、ワークフローを再利用可能な資産に変換することで、エージェント開発プロセスを標準化しています。これらの資産には、SKILL.mdファイル、ベンチマーク契約、レビューループ、および本番環境のデバッグプレイブックが含まれます。チームはエージェントの価値を、実行、テスト、レビューが可能な手続き型のエンジニアリング知識として定義しています。
- • SGLangチームはエージェントワークフローを再利用可能なSKILL.mdファイルとベンチマーク契約に変換中。
- • レビューループと本番環境のデバッグプレイブックが含まれる。
- • エージェントの価値を、実行、テスト、レビューが可能な手続き型のエンジニアリング知識として定義。
開発者は、SGLangエコシステム内でエージェントワークフローをエンジニアリング、テスト、レビューするための構造化された実行可能なフレームワークを得ることができます。
14. llama.cppが実験的な粒子散乱サンプラーを追加
散乱サンプラーは、llama.cppに追加された実験的な機能で、top-K候補間の次トークン確率分布を平滑化します。これは、温度を上げることで発生する、弱いテールトークンを引き込んでしまうといった副作用なしに、生成の硬直性を減らすように設計されています。このサンプラーは、top-K、top-P、min-P、XTCなどの他のフィルターが候補媒体を定義した後に動作し、ランク距離に基づくガウス平滑化カーネルを使用して、生存している強力な候補間で確率質量を再分配します。デフォルトでは無効になっており、デフォルトのサンプラーチェーン内のXTCと温度の間に配置されています。
- • llama.cppが、top-K候補間の次トークン確率分布を平滑化する実験的な「散乱サンプラー」を追加。
- • ランク距離に基づくガウス平滑化カーネルを使用して、生存している強力な候補間で確率質量を再分配。
- • 他のフィルター(top-K、top-P、min-P、XTCなど)の後に動作し、XTCと温度の間に配置される。
- • エントロピーに基づく適応強度、繰り返しトークンの吸収、衝突ゲーティングなどのオプション機能がある。
- • デフォルトでは無効。クリエイティブな執筆には推奨されるが、厳密なコーディングや数学タスクには不向き。
開発者は、このサンプラーを使用して、弱いテールトークンを避けつつ、クリエイティブな生成やロールプレイにおける硬直性を減らすことができますが、厳密なコーディングや数学タスクにはリスクがあります。
15. lift-pdfを使用したスキーマガイド付き請求書抽出パイプラインのチュートリアル
新しいチュートリアルでは、lift-pdfを使用して合成請求書PDFを構造化JSONに変換する、エンドツーエンドの買掛金抽出パイプラインを実演しています。このパイプラインは、請求書解析をスキーマガイド付きのドキュメント理解として構成し、ベンダーID、PO番号、明細項目、支払い状況などのフィールドをターゲットにしています。実装では、オプションの4ビットNF4量子化を備えたGPU対応モデル読み込みと、パフォーマンスを最適化するための再利用可能なInferenceManagerを使用しています。合成請求書はReportLabを使用して生成され、数学的な一貫性を確保しており、パイプラインにはフィールドレベルの精度を計算し、抽出されたデータをpandasベースの買掛金元帳に変換する検証ステップが含まれています。
- • lift-pdfを使用して合成請求書PDFを構造化JSONに変換するエンドツーエンドの買掛金抽出パイプラインのチュートリアル。
- • ベンダーID、PO番号、明細項目、支払い状況などのフィールドをターゲットにし、小計と税込み合計の分離などの課題に対処。
- • GPU対応モデル読み込みとオプションの4ビットNF4量子化、再利用可能なInferenceManagerを使用。
- • フィールドレベルの精度を計算し、抽出データをpandasベースの買掛金元帳に変換する検証ステップを含む。
- • チュートリアルは再現可能なColabノートブックとして提供。
開発者はこのパターンを実装することで、請求先住所の区別など、複雑な抽出課題を処理する高精度なドキュメントインテリジェンスパイプラインを構築できます。
16. AIエージェントを実環境タスクで評価する「CursorBench 3.1」リリース
CursorBench 3.1は、AIエージェントのパフォーマンスを評価するために設計されたベンチマークとしてリリースされました。このベンチマークは、曖昧で複数ファイルにまたがるタスクを使用してエージェントをテストします。すべてのタスクは実際のCursorユーザーセッションから収集されており、エージェント型コーディングツールに対して現実的な評価環境を提供します。
- • CursorBench 3.1は、AIエージェントのパフォーマンスを評価するために設計されたベンチマーク。
- • 曖昧で複数ファイルにまたがるタスクを使用してエージェントをテスト。
- • すべてのタスクは実際のCursorユーザーセッションから収集。
開発者はこのベンチマークを使用して、コーディングエージェントが複雑で複数ファイルにまたがる曖昧な実環境シナリオをどれだけ効果的に処理できるかを測定できます。