1. Microsoftが推論モデル「MAI-Thinking-1」を含むMAIモデルファミリーを発表
MicrosoftはBuild 2026において、自社製AIモデルの開発強化を示す7つの新しいモデルを発表しました。目玉となる「MAI-Thinking-1」は、クリーンなデータでゼロから学習された350億パラメータの推論モデルで、ソフトウェアエンジニアリングのベンチマークにおいて主要モデルに匹敵する性能を発揮します。開発者向けには、VS CodeやGitHub Copilotに直接統合される「MAI-Code-1-Flash」や、Microsoft Foundryで利用可能な超高速音声認識モデル「MAI-Transcribe-1.5」も提供されます。
- • MAI-Thinking-1は、350億のアクティブパラメータと128Kのコンテキストウィンドウを持つ中規模推論モデルで、クリーンなデータからゼロから学習されました。
- • MAI-Code-1-Flashは、GitHub CopilotおよびVisual Studio Codeに統合された、推論効率の高いコーディングモデルです。
- • MAI-Transcribe-1.5は、リアルタイムの約276倍の速度で文字起こしが可能で、Artificial Analysisのリーダーボードで2.4%の単語誤り率(WER)を達成した音声認識モデルです。
- • MAI-Transcribe-1.5はMicrosoft Foundry経由で1,000分あたり6ドルで提供され、43言語に対応しています。
- • その他のモデルには、テキストから画像を生成するMAI-Image 2.5や、15の新言語に対応したMAI-Voice-2が含まれます。
開発者は、GitHub CopilotやVisual Studio Codeなどのツールに直接統合された、Microsoftの新しい専門的な自社製モデルスイートを利用できるようになります。
2. Alibabaがマルチモーダルエージェントモデル「Qwen3.7-Plus」をリリース
AlibabaのQwenチームは、エージェントワークフローに最適化されたクローズドソースのマルチモーダルモデル「Qwen3.7-Plus」をリリースしました。このモデルは視覚と言語の能力を統合し、GUIとCLIの操作を融合できるハイブリッドエージェントとして機能します。100万トークンのコンテキストウィンドウを備え、そのうち25万6000トークンが内部の思考プロセス(Chain-of-Thought)に割り当てられています。また、推論状態を維持するための新しいAPIパラメータ「preserve_thinking」も導入されました。標準入力の価格は100万トークンあたり0.40ドルと非常に競争力のある設定です。
- • Qwen3.7-Plusの価格は、入力トークンが100万あたり0.40ドル、キャッシュされた読み取りトークンが100万あたり0.04ドルです。
- • 100万トークンのコンテキストウィンドウを備え、そのうち25万6000トークンが内部の思考プロセス処理専用となっています。
- • 新しい「preserve_thinking」APIパラメータにより、開発者はマルチターンの会話を通じて内部の論理ループを維持できます。
- • 本モデルはプロプライエタリ(クローズドソース)であり、Alibaba CloudのBailianプラットフォーム(Model Studio)の国際エンドポイントからアクセス可能です。
- • Terminal Bench 2.0-Terminusで70.3、ScreenSpot Proで79.0を記録し、LM Arena Vision Arenaで総合16位にランクインしました。
開発者は、視覚インターフェースとコマンドラインインターフェースを組み合わせた複雑なマルチモーダルエージェントループを、従来モデルよりも大幅に低いコストで構築できます。
3. Microsoft、AIエージェント向けOSレベルのサンドボックス「MXC」を発表
Microsoftは、Windows上でAIエージェントを安全に実行するために設計されたセキュリティ層「Microsoft Execution Containers (MXC)」を導入しました。MXCを使用すると、開発者は実行時にOSカーネルレベルで強制されるアクセス境界を定義でき、エージェントの実行をユーザーのデスクトップ、クリップボード、入力デバイスから隔離することで、UIスプーフィングや入力インジェクションを防ぐことができます。このシステムは、軽量なプロセス分離からマイクロVMまで幅広いサンドボックスオプションをサポートしており、現在SDKサポート付きの早期プレビュー版が提供されています。
- • MXCは、実行時にWindows OSカーネルレベルで強制される、AIエージェント向けのポリシー駆動型実行層を提供します。
- • サンドボックスの範囲は、軽量なプロセス分離からマイクロ仮想マシン、フルクラウドインスタンスまで多岐にわたります。
- • MXCは、エージェントの実行をユーザーのデスクトップ、クリップボード、UI、入力デバイスから隔離します。
- • すべてのエージェントは、監査可能性とガバナンスのために、ローカルまたはMicrosoft EntraベースのIDに紐付けられます。
- • OpenAI、Nvidia、Manus、Nous Research、OpenClawなどのパートナーが、MXCを自社のフレームワークに統合しています。
- • MXCは現在、開発者が封じ込めポリシーをテストし、SDKに対して構築を行うための早期プレビュー版として提供されています。
開発者は、カーネルレベルで強制される厳格なセキュリティ境界を備えた自律型エージェントを構築・実行でき、UIスプーフィングや入力インジェクションなどのリスクを軽減できます。
4. Microsoft、オープンソースのAI評価フレームワーク「ASSERT」をリリース
Microsoftは、AIアプリケーションのテストを簡素化するために設計されたフレームワーク「ASSERT (Adaptive Spec-driven Scoring for Evaluation and Regression Testing)」をオープンソース化しました。ASSERTはAIを活用し、目標、ポリシー、制約の自然言語による記述を、構造化されたスコアリング付きのテストケースに変換します。実行中、フレームワークはターゲットシステムの中間アクションやツール呼び出しを記録するため、開発者は障害箇所を調査し、ポータブルなポリシーファイルを使用してカスタムエージェントポリシーを強制できます。
- • ASSERT (Adaptive Spec-driven Scoring for Evaluation and Regression Testing) はオープンソースのフレームワークです。
- • 目標、ポリシー、動作の自然言語による記述を、構造化されたスコアリング付きのテストに変換します。
- • フレームワークは問題シナリオを生成し、ターゲットシステムに対して実行し、中間アクションとツール呼び出しを記録します。
- • 開発者は、システムコンテキスト、ツール、制約を提供することで評価をカスタマイズできます。
- • チームはポータブルなポリシーファイルを使用して、カスタムエージェントポリシーを定義できます。
開発者は、プレーンテキストを使用して、AIアプリケーションの再現可能な回帰テストや動作評価を簡単に作成できます。
5. Mistralがオープンソースの検索ツールキットをパブリックプレビューでリリース
Mistralは「Search Toolkit」をパブリックプレビューでリリースしました。このオープンソースフレームワークは、データ取り込み、検索、評価を単一の共有インターフェース内に統合することで、本番環境のAIパイプラインを効率化し、開発者がRAGシステムを構築・ベンチマークしやすくするように設計されています。
- • Search Toolkitがパブリックプレビューでリリースされました。
- • これはオープンソースのフレームワークです。
- • データ取り込み、検索、評価を共有インターフェース内で統合します。
本番環境のRAGパイプラインを構築および評価するための、標準化されたオープンソースインターフェースを提供します。
6. Perplexityがエージェント検索用SDK「Search as Code」を導入
Perplexityは、AIアプリケーションの検索アーキテクチャを近代化するために設計されたSDK「Search as Code (SaC)」を導入しました。SaCはモノリシックな検索システムから脱却し、AIモデルに検索プロセスに対する直接的な制御権を与えることで、特定のタスクに合わせて検索パイプラインを動的に構成できるようにします。Perplexityによると、このエージェント型検索アプローチはパフォーマンスとコスト効率を向上させ、WANDRのような複雑なベンチマークで競合他社を上回る結果を出しています。
- • Search as Code (SaC) は、検索プロセスに対するモデルの直接制御を可能にするSDKを提供します。
- • モデルは特定のタスクに合わせて検索パイプラインを構成できます。
- • SaCはベンチマーク、特にWANDRのような複雑なタスクにおいて競合他社を上回りました。
- • PerplexityはSaCを、堅牢で費用対効果の高いエージェント型検索機能として位置づけています。
開発者は、LLMによって直接制御される、タスク固有の高度にカスタマイズされた検索パイプラインを構築でき、モノリシックな検索システムを凌駕できます。
7. TinyFishがオープンソースのマルチエージェントデータ抽出システム「BigSet」をリリース
TinyFishは、自然言語の記述から構造化されたデータセットを生成するために設計された、AGPL-3.0ライセンスのオープンソースマルチエージェントシステム「BigSet」をリリースしました。Docker経由で動作するBigSetは、スキーマ推論モデルがデータ構造を定義し、オーケストレーターが並列サブエージェントを調整してデータを抽出する2層アーキテクチャを採用しています。このシステムは、スケジュールされた更新、CSV/XLSXへのエクスポート機能を備え、データセットIDをJavaScriptクロージャ内に隔離することでプロンプトインジェクションから保護します。
- • BigSetは、AGPL-3.0ライセンスの下で提供されるオープンソースのマルチエージェントシステムです。
- • 2層のエージェントアーキテクチャを使用しています。スキーマ推論モデルが構造を定義し、オーケストレーターエージェントが抽出のための並列サブエージェントを管理します。
- • システムはスケジュールされたデータセット更新(30分から毎週まで)と、CSVまたはXLSXへのエクスポートをサポートしています。
- • Docker経由でセルフホストされ、TinyFish、OpenRouter、ClerkのAPIキーが必要です。
- • データセットIDをLLMからアクセスできないJavaScriptクロージャ内にキャプチャすることで、プロンプトインジェクションを防ぎます。
開発者は、プロンプトインジェクション保護機能を備えた、Webソースから構造化データを抽出・更新するためのセルフホスト型並列エージェントシステムをデプロイできます。
8. Microsoft、ローカルAI開発用「Surface RTX Spark Dev Box」を発表
Microsoftは、AIワークロードをクラウドベースのトークン課金からローカルの固定コストハードウェアに移行するために設計された小型デスクトップPC「Surface RTX Spark Dev Box」を発表しました。NvidiaのBlackwellアーキテクチャを採用したArmベースのRTX Sparkプロセッサを搭載し、1ペタフロップスのAI演算能力と128GBのユニファイドメモリを備えており、開発者は1200億パラメータを超えるモデルをローカルで実行できます。このユニットはWindows 11 Proで動作し、WSL 2、VS Code、Pythonなどの必須開発ツールがプリインストールされています。
- • Surface RTX Spark Dev Boxは、NvidiaのBlackwellアーキテクチャRTX Sparkプロセッサと128GBのユニファイドメモリを搭載しています。
- • 1ペタフロップスのAI演算能力を誇り、1200億パラメータを超えるモデルをローカルで実行するように設計されています。
- • 100ワットの熱設計電力(TDP)で、ヒートシンクとして機能するパッシブ冷却式の金属製3Dプリントシャーシを採用しています。
- • Windows 11 Proがプリインストールされており、WSL 2、VS Code、GitHub Copilot、Git、Python、Node.jsが設定済みです。
- • 2026年後半にMicrosoft.comを通じて米国で発売予定です。価格は未定です。
開発者は、クラウドのトークン課金を回避し、最大1200億パラメータのモデルを実行可能な専用のローカルハードウェアオプションを利用できます。
9. OpenAI、Codexプラットフォームを更新し、Sitesと役割別プラグインを導入
OpenAIは、ドキュメント編集とアプリケーション作成の効率化を目的とした機能を含む、エージェント型AIプラットフォーム「Codex」の重要なアップデートを発表しました。このアップデートでは、ビジネスおよびエンタープライズ層向けにプレビュー版として提供される、静的なテキストやデータをインタラクティブなOpenAIホスト型のWebアプリケーションに変換するツール「Sites」が導入されました。さらに、新しい「Annotations」ツールにより、ドキュメント全体を再生成することなく特定のセクションをローカルで編集可能になり、データ分析や製品設計などのタスク向けに6つの新しい役割別プラグインが追加されました。
- • 新しいSites機能(ビジネス/エンタープライズ向けプレビュー)は、静的なデータやテキストドキュメントを、OpenAIがホストする機能的なWeb内部アプリケーションに変換します。
- • Annotationsツールを使用すると、ドキュメント全体を再生成することなく、スプレッドシートやスライドなどの特定のセクションをローカルで編集できます。
- • 6つの役割別プラグインカテゴリには、データ分析や製品設計など、62のビジネスアプリケーションと110の自動化スキルが集約されています。
- • 機能は、OpenAIのプロプライエタリなエンタープライズライセンスの下、Codex CLIおよびデスクトップアプリからアクセス可能です。
- • 価格は既存のサブスクリプション層(Plus月額20ドル、Pro月額100ドル)または座席数不要の従量課金モデルに統合されています。
開発者やエンタープライズチームは、静的なデータやドキュメントから直接、インタラクティブなホスト型Webアプリケーションを構築・共有できます。
10. CursorがTeamsプランの制限を拡大し、プレミアムシートを導入
CursorはTeamsプランのアップデートを発表し、集中的な開発ワークフローにより適応できるように利用制限を拡大しました。同社は、ヘビーなエージェントユーザー向けに特別に調整された新しいプレミアムシート層を導入し、チームが利用コストを管理・監視できるようにするための新しい管理用支出管理機能も追加しました。
- • CursorはTeamsプランの利用制限を拡大しました。
- • ヘビーなエージェントユーザー向けに特別に設計された新しいプレミアムシートを導入しました。
- • 管理者が利用状況を管理するための新しい支出管理機能を追加しました。
Cursorを使用して集中的なエージェント型コーディングワークフローを行うチームは、より高い制限とより優れたコスト管理機能を利用できます。
11. KapaがRAG向けのインデックス時画像処理戦略を共有
Kapaは、技術ドキュメントを扱うRAGシステム向けの画像インデックス戦略の詳細を共有しました。クエリ時に高コストなマルチモーダル処理を実行する(多くの場合、ペイロード制限に達する)のではなく、Kapaはインデックス時にビジョンモデルを使用して画像を記述し、キャプションを個別のテキストチャンクとして保存します。このアプローチにより、クエリごとのオーバーヘッドをテキストのみのシステムのわずか1%〜6%に削減し、ゼロショット分類器で不要な画像をフィルタリングします。初期の顧客プロジェクトでは、94%〜99%の正確な画像配置を達成しました。
- • Kapaは、クエリ時に画像を処理するのではなく、インデックス時にビジョンモデルを使用してテキスト記述を生成することで画像を処理します。
- • この手法により、クエリごとのオーバーヘッドをテキストのみのシステムと比較して1%〜6%に削減し、クエリ時のペイロード制限を回避します。
- • ゼロショット分類器を使用して、ロゴやバナーなどの不要な画像をフィルタリングします。
- • ビジョンモデルに周囲のテキストコンテキストを提供することで、キャプションの品質が向上します。
- • キャプションを個別のチャンクとして保存する方が、インラインで埋め込むよりも費用対効果が高くなります。
画像が多い技術ドキュメントに対してRAGシステムを構築する開発者にとって、非常に費用対効果が高く信頼性の高いアーキテクチャパターンを提供します。
12. Microsoft、Fabric向け「Microsoft IQ」と「Rayfin SDK」を発表
エンタープライズAIにおけるデータサイロとコンテキストの課題に対処するため、Microsoftは「Microsoft IQ」とオープンソースの「Rayfin SDK」を発表しました。Microsoft IQは、Work、Foundry、Fabric、Webソース全体でコンテキストを統合します。Rayfin SDKとCLIを使用すると、開発者はエージェントが構築したアプリケーションをMicrosoft Fabricに直接デプロイし、アプリケーションデータをMicrosoft OneLakeにルーティングして、ガバナンスの効いた本番バックエンドを維持できます。
- • Microsoft IQは、Work IQ、Foundry IQ、Fabric IQ、Web IQの4つのコンテキストソースを統合します。
- • Rayfinは、エージェントが構築したアプリケーションをMicrosoft Fabricに直接デプロイするために設計されたオープンソースのSDKおよびCLIです。
- • Rayfinは、組織のコンテキスト層の外側にデータサイロが形成されるのを防ぐため、アプリケーションデータをMicrosoft OneLakeにルーティングします。
- • Fabric IQ内のオントロジーは、今後数ヶ月以内に一般提供される予定です。
エンタープライズエージェントを構築する開発者は、アプリケーションデータをガバナンスの効いたOneLakeバックエンドに直接ルーティングすることで、データサイロを防ぐことができます。
13. OpenAI CookbookがAmazon Bedrockでの本番ワークフロー構築ガイドを公開
OpenAI Cookbookは、Amazon BedrockでホストされるOpenAIモデルを使用して本番ワークフローを構築する方法を詳述した新しいガイドをリリースしました。このチュートリアルでは、Responses APIを使用して、構造化出力、ツール呼び出し、ファイル入力などの主要な開発者機能を紹介し、状態管理やプロンプトキャッシングなどの運用上のベストプラクティスも網羅しています。
- • このガイドでは、Amazon BedrockでホストされるOpenAIモデルを使用して本番ワークフローを構築する方法を実演しています。
- • Responses APIを使用して、構造化出力、ツール呼び出し、ファイル入力を紹介しています。
- • 状態管理やプロンプトキャッシングを含む運用上のベストプラクティスを網羅しています。
Bedrock上で構造化出力、ツール呼び出し、プロンプトキャッシングを実装するための、具体的で実行可能なコードパターンを提供します。
14. Gemma 4 E4BがLiteRTエンジンで2.4倍の高速化を達成
コミュニティのベンチマークにより、Gemma 4 E4BモデルをGoogleのLiteRTエンジンで実行すると、llama.cpp GGUF形式と比較してテキスト生成速度が2.4倍向上することが実証されました。NVIDIA 4060tiでテストしたところ、マルチトークン予測を備えたLiteRT-LM 4Bモデルは毎秒157.2トークンを達成しました。GitHubでOpenAI互換エンドポイントを公開するためのPythonラッパーが利用可能ですが、決定論的な出力、リクエストバッチ処理の欠如、Linuxのみのサポートなど、現在のエンジンの制限に注意する必要があります。
- • NVIDIA 4060ti GPUでのテストでは、マルチトークン予測(MTP)を備えたLiteRT-LM 4Bが毎秒157.2トークンを達成し、llama.cpp GGUFの毎秒66.3トークンと比較されました。
- • 画像キャプションのパフォーマンスは、ビジョンエンコーダーがボトルネックとなり、1.1倍のわずかな高速化にとどまりました。
- • LiteRTモデル用にOpenAI互換エンドポイントを作成するためのPythonラッパーが開発され、GitHubで公開されています。
- • 現在のLiteRT-LMの制限には、温度設定に関係なく決定論的な出力、シングルセッション操作、リクエストバッチ処理の欠如、Linuxのみのサポートが含まれます。
Linux上でローカルモデルを実行する開発者は、LiteRTとマルチトークン予測を活用することで、推論レイテンシを大幅に削減できます。
15. 6GB GPUで20種類の小型LLMを反復タスク向けに評価するベンチマーク
ある開発者が、ファイル整理やログトリアージなどの反復タスク向けに、予算重視の6GB RTX 4050 GPUで20種類の小型LLMを評価するベンチマークを公開しました。この研究では、ツール呼び出し、JSONの厳密さ、指示への忠実度についてモデルをテストし、コンテキストを1kから32kトークンにスケーリングすると、すべてのモデルで20%〜35%の速度低下が発生することがわかりました。LFM2.5-1.2B-Instructは高速で低VRAMのオプションとして、Granite-4.1-3Bは堅実なベースラインとして、LiquidAIのLFM2.5-8B-A1Bは最高のオーケストレーターとして強調されました。
- • この評価では、ツール呼び出し、JSONの厳密さ、指示への忠実度、パスのハルシネーションに関する6つのプローブセットを使用して、6GB GPU上で20種類の小型モデルをテストしました。
- • コンテキストが1kから32kトークンにスケーリングされると、すべてのモデルで生成速度が20%〜35%低下しました。
- • LFM2.5-1.2B-Instructは高速で低VRAMのオプションとして特定され、Granite-4.1-3B (instruct) はVRAMあたりの品質ベースラインとして機能しました。
- • LiquidAIのLFM2.5-8B-A1Bビルドが最高のオーケストレーターとして選ばれ、速度と使用可能なコンテキストにおいて高密度な8Bモデルを上回りました。
- • サードパーティのファインチューンモデルでは、ハルシネーションによる関数名や壊れたチャットテンプレートなどの問題が頻繁に見られました。
バックグラウンド自動化タスク用に小型のローカルモデルを選択する開発者にとって、具体的なパフォーマンスと品質のベースラインを提供します。
16. 開発者がQwen3.6-27Bをローカルマルチエージェントオーケストレーターとして評価
ある開発者が、47のコーディングワークフローにわたるマルチエージェントオーケストレーターにおいて、ClaudeをローカルのQwen3.6-27Bモデル(RTX 3090上でQ6_K量子化)に置き換えた2週間の評価結果を共有しました。Qwenはプラン生成において95%のスキーマ妥当性を達成しましたが、JSONツール呼び出しにおいて12%のフォーマットエラー率を示し(Claudeは0.5%)、14Kトークンを超えると長文コンテキストのドリフトに悩まされました。著者は、Qwen3.6-27Bは構造化出力の強制と失敗時の再計画ロジックを組み合わせた場合にのみ、ローカルマルチエージェントシステムとして実行可能であると結論付けました。
- • Qwen3.6-27B(Q6_K量子化、RTX 3090上で22GB VRAM)を、OpenYabbyオーケストレーター内の47のマルチステップコーディングワークフローで2週間テストしました。
- • モデルはプラン生成において95%のスキーマ妥当性を達成し、6ターンごとに事実を抽出することに成功しました。
- • JSONツール呼び出しにおいて12%のフォーマットエラー率を示し、Claudeの0.5%と比較されました。
- • 2番目のQwenインスタンスを使用した自動レビュープロセスにより、Claudeが特定したであろうバグの約60%を捕捉しました。
- • モデルは14kトークンを超えると長文コンテキストのドリフトに悩まされ、47回の実行のうち3回でサブエージェントの失敗を検出できませんでした。
エージェントワークフローにおいて商用APIをローカルモデルに置き換える際の、実用的な制限と必要なガードレール(構造化出力の強制など)を強調しています。
17. AMD MI300XアクセラレータでのDeepSeek-V4-Flashの最適化
技術的な詳細調査により、同等のNvidiaハードウェアよりも低いレンタル価格で192GBのHBM3メモリを提供するAMDのMI300Xアクセラレータ上で、DeepSeek-V4-Flashを立ち上げるプロセスが詳述されています。MI300Xは新しいAMDチップで使用されるOCP標準のFP8と互換性のない「fnuz」FP8ダイアレクトを使用しているため、開発者はカスタムソフトウェアの回避策とROCm固有のヘルパーを実装しました。これらの最適化により、vLLMにおける互換性の問題が解決され、GPUあたり毎秒2,699出力トークンという高スループットのパフォーマンスが達成されました。
- • AMD MI300Xは192GBのHBM3メモリを搭載しており、NVIDIA H100の80GB容量の2倍以上です。
- • MI300X上でvLLMとDeepSeek-V4-Flashを実行するには、FP8ダイアレクトの非互換性のため、カスタムソフトウェアの回避策が必要でした。
- • MI300Xは「fnuz」FP8ダイアレクトを使用しており、これは新しいAMDチップで使用されるOCP標準のFP8とは指数バイアスが異なります。
- • AMDのAITERチューニングカーネルライブラリのカバー範囲が不均一であるため、カスタムROCm固有のヘルパーが必要でした。
- • 最適化により、GPUあたり毎秒2,699出力トークンを達成し、8.6%のパフォーマンス向上を実現しました。
容易に入手可能なAMDハードウェア上で、DeepSeekモデルの高スループットで費用対効果の高いローカルホスティングが可能になります。
18. ローカルRAG解析のためのWeb検索APIの比較
コミュニティの議論により、ローカルRAG解析用にクリーンでノイズのないMarkdownを返すように最適化されたWeb検索APIの評価がまとめられました。Brave SearchのLLM Context APIとExa(旧Metaphor)は、事前にフォーマットされたMarkdownチャンクを直接提供する点で強調され、Parallel AIのExtract APIはJavaScriptを多用するページを圧縮する点で注目されました。その他、You.comのデベロッパーインデックス、Tavily、FirecrawlやJina ReaderのようなURLからMarkdownへの変換ツールについても議論されました。
- • Brave Searchは、関連性順にランク付けされた、事前にフォーマットされたMarkdownチャンクを返すLLM Context APIを提供しています。
- • Parallel AIは、JavaScriptを多用するページをトークン密度の高いMarkdownに圧縮するように設計されたExtract APIを提供しています。
- • You.com APIは、生のMarkdown出力を持つデベロッパーインデックスを提供しています。
- • Exa(旧Metaphor)は、LLM専用に構築されたネイティブのMarkdown抽出機能を備えています。
- • Tavilyは人気がありますが、トークンオーバーヘッドとノイズフィルタリングに関して賛否両論があり、FirecrawlとJina ReaderはURLからMarkdownへの変換で注目されています。
開発者がトークンオーバーヘッドを最小限に抑え、RAGパイプラインにおけるカスタムスクレイピングミドルウェアの必要性を排除する検索APIを選択するのに役立ちます。
19. Hugging Faceがモデルのハードウェア互換性チェックを導入
Hugging Faceは、モデルリポジトリページに直接ハードウェア互換性チェック機能を導入しました。このツールを使用すると、開発者は特定のモデルサイズや量子化レベルがローカルのハードウェア構成で実行できるかどうかを即座に確認でき、ローカルデプロイメントのためのモデル選択プロセスを効率化できます。
- • Hugging Faceは、プラットフォーム上のモデル向けにハードウェア互換性チェック機能を導入しました。
- • この機能は、開発者がモデル(6BパラメータのdphnAI X1 Trinity Nanoなど)が自分のハードウェア構成で実行できるかどうかを評価するのに役立ちます。
特定のモデルサイズや量子化が自分のハードウェアで実行できるかどうかを即座に開発者に示すことで、ローカルモデルの選択を簡素化します。