Inference Brew

Mercury 2.5リリース:高速化とコンテキストウィンドウの拡大

00:00 / --:--

← ホームへ戻る

Mercury 2.5リリース:高速化とコンテキストウィンドウの拡大

1. Mercury 2.5リリース:高速化とコンテキストウィンドウの拡大

6月にリリースされたMercury 2の基盤を強化したバージョン2.5では、スループットの向上、大幅に拡大されたコンテキストウィンドウに加え、調整可能な推論機能やスキーマ準拠のJSON出力などの新機能が追加されました。このアップデートにより、開発者はリアルタイム音声エージェントや複雑なエージェントワークフローにおいて、より高いパフォーマンスを実現できます。

  • • Mercury 2.5は生成速度を毎秒1,107トークンに向上させ、260Kトークンのコンテキストウィンドウを追加しました。
  • • 新機能として、調整可能な推論、並列ツール呼び出し、スキーマ準拠のネイティブJSON出力が追加されました。
  • • 標準価格は入力100万トークンあたり0.20ドル、出力100万トークンあたり0.75ドルで、期間限定のローンチ割引も提供されます。
  • • 初期導入企業からは、中央値で170msのレイテンシと、コンテキスト圧縮コストの90%削減が報告されています。
  • • 本モデルはInception API、Baseten、OpenRouterを通じて即座に利用可能です。

開発者は、競争力のある価格設定を維持しつつ、リアルタイム音声エージェントや複雑なエージェントワークフローのために、より高いパフォーマンスと拡張されたコンテキスト機能を活用できるようになります。

SOURCES

2. OpenAIがChatGPT Images 2.5と新しいAPIモデルをリリース

ChatGPT Images 2.5は、ChatGPT、ChatGPT Work、およびCodexユーザー向けにデスクトップ、モバイル、Webプラットフォームで利用可能です。このリリースはマルチモーダルな速度と制御における大きな前進であり、開発者はスケッチや局所的な編集を通じて画像生成をより細かくガイドできるようになります。

  • • OpenAIは、汎用向けの「GPT-Image-2.5 Flare」と、高精度なクリエイティブワークフロー向けの「GPT-Image-2.5 Sunburst」という2つの新しいAPIモデルをリリースしました。
  • • 新しい画像エンジンは、前バージョンのImages 2.0と比較して画像生成のレイテンシを最大50%削減します。
  • • 人物やペットの容姿を維持する能力が向上し、画一的なAI特有の美学から脱却しています。
  • • 新しい編集機能には、参照ガイドを直接描画できる「Sketch」や、以前の編集内容を維持しながら特定の領域を修正するツールが含まれます。
  • • モデルには、自動不可視透かしやAI生成コンテンツを識別するためのC2PAメタデータなどの安全対策が組み込まれています。

開発者は、より高速で忠実度の高い画像生成と、スケッチによる正確な編集ワークフローをアプリケーションに直接統合できるようになります。

3. inclusionAIがLing-3.0-flashファミリーにマルチモーダルVLモデルを追加

8月初旬にリリースされたLing-3.0-flashアーキテクチャを基盤として、inclusionAIはLing-3.0-flash-VLを導入しました。この新しいマルチモーダルバリアントは、既存のモデルファミリーにネイティブな画像および動画理解機能を追加し、スパースMoE設計と空間時間推論のための特殊なVideoRoPEコンポーネントを活用しています。

  • • Ling-3.0-flash-VLは124BパラメータのスパースMoEモデルで、トークンあたり5.5Bパラメータをアクティブ化します。
  • • モデルは100万トークンのコンテキストウィンドウをサポートしています。
  • • ViTビジュアルエンコーダーと2層のMLPプロジェクターを統合し、ネイティブなマルチモーダル処理を実現しています。
  • • 特殊なVideoRoPEコンポーネントにより、正確なイベント特定と動画編集が可能です。
  • • 本モデルは現在Hugging Faceで利用可能です。

このリリースによりLing-3.0-flashエコシステムが拡張され、開発者は複雑な推論タスクのために膨大な動画や画像入力を処理できる高容量のマルチモーダルモデルを利用できるようになります。

SOURCES

4. DeepSeekがFlash APIをV4.1にアップグレード、ネイティブマルチモーダル対応

V4-Flashシリーズを基盤とするDeepSeekは、V4.1 Flashモデルをベータ版として導入しました。このアップデートは、既存の価格体系を維持しながらネイティブなマルチモーダルサポートを統合することで、従来のV4-Flash APIを前進させるものです。開発者はAPIモデル文字列を更新することで、このアップグレードされたアーキテクチャにアクセスでき、Flashエコシステムの進化を継続できます。

  • • DeepSeek V4.1 Flashは、ネイティブなマルチモーダルサポートを備えた新しいアーキテクチャを導入しています。
  • • ベータ版は、APIモデル名を「deepseek-v4.1-flash-expires-on-0910」に設定することでアクセス可能です。
  • • 価格は以前のV4-Flashモデルと同一です。
  • • ベータ版には、アカウントあたり毎分20リクエストのレート制限が含まれています。

開発者はAPIモデル文字列を更新するだけで、V4-Flashエコシステムで確立された機能を基盤としつつ、アップグレードされたネイティブマルチモーダル対応のFlashモデルにアクセスできるようになります。

SOURCES

5. Reductoがシングルパス文書解析モデル「r-1」をリリース

テキスト、テーブル構造、レイアウト、読み取り順序、フォーマットを単一のパスに統合することで、r-1はマルチステージパイプラインのレイテンシと複合的なエラーを回避します。Reductoは今後、r-1 miniモデルや自動ページ単位ルーティング機能でラインナップを拡大する予定です。

  • • r-1モデルは文書を1回のフルページパスで処理し、複雑なマルチステージのエージェント型OCRパイプラインを置き換えます。
  • • Reductoは、従来の文書解析パイプラインと比較してエラー率が20%削減されたと報告しています。
  • • 価格は1ページあたり1セントの定額で、従来のモデルの3〜6セントから引き下げられました。
  • • 本モデルはReductoのV3 Parse APIを通じてプレビュー版として利用可能であり、有効にするには特定の構成フラグが必要です。
  • • Reductoは、他のパーサーとの比較検証を行う組織に対して最大5,000ドル分のクレジットを提供しています。
  • • 現在、r-1モデルのオープンウェイト版やローカルでのセルフホスティングオプションはありません。

開発者は、RAGパイプラインにおけるテキスト、テーブル、レイアウト抽出の精度を向上させながら、文書取り込みコストを大幅に削減できます。

SOURCES

6. Anthropicがセキュリティ警告を拡大、APIおよびサブスクリプショントークンの盗難に対応

情報窃取マルウェアに対する以前のセキュリティ対策を基盤として、Anthropicは現在、ClaudeのAPIおよびサブスクリプショントークンを盗もうとする継続的な試みについて加入者に警告しました。この事態は、不正アクセスの試みがセッションハイジャックを超えて進化していることを示しており、開発者はAPIキーの監査と請求ダッシュボードでの異常な使用状況の監視を行う必要があります。

  • • Anthropicは、ClaudeのAPIおよびサブスクリプショントークンの盗難に関する新たな警告を発しました。
  • • これは、情報窃取マルウェアによるセッションハイジャックを軽減するための以前の取り組みに続くものです。
  • • 開発者はAPIキーをローテーションし、不正な使用の急増がないか請求ダッシュボードを監視することが推奨されます。

開発者は、不正な請求を防ぐために、セキュリティ監査の対象をセッション管理だけでなく、アクティブなAPIキーやサブスクリプション認証情報にまで拡大する必要があります。

SOURCES

7. NVIDIAがRust-for-GPUイニシアチブを拡大、新しいSIMTコンパイラを導入

NVIDIAは、Rust-for-GPUの取り組みを「CUDA Rust」イニシアチブとして正式化しました。これは、以前リリースされたcutile-rs(タイルベースのシステム)を拡張し、SIMT実行モデル向けに設計された新しいトラック「cuda-oxide」を導入するものです。cutile-rsはJITコンパイルされたタイルベースのカーネル向けに引き続き利用可能ですが、cuda-oxideはRust MIRをPTXにコンパイルするパスを提供します。これには固定されたnightlyツールチェーンとcompute capability 8.0以上のハードウェアが必要です。両プロジェクトは現在アルファ版です。

  • • 「CUDA Rust」イニシアチブは、既存のcutile-rsと新しいcuda-oxideプロジェクトの両方を包含するようになりました。
  • • cuda-oxideは、Rust MIRをPTXにコンパイルすることでSIMT実行モデルをターゲットにしています。
  • • cuda-oxideには、固定されたnightlyツールチェーン、Linux、およびcompute capability 8.0以上のNVIDIA GPUが必要です。
  • • cutile-rsは、タイルベースのカーネル開発のために、引き続き安定版Rust 1.89+およびCUDA 13.3をサポートします。
  • • 両トラックともアルファ版であり、現時点では本番環境での使用は推奨されません。

このイニシアチブはNVIDIAのRustサポートを統合し、開発者にメモリ安全なGPUカーネル開発を実現するためのSIMTとTileという2つの明確なパスを提供します。

SOURCES

8. Infercatが暗号化P2Pトンネルを介したローカルAIモデルの共有を実現

Infercatは、ローカルハードウェアをプライベートなミニクラウドへと効果的に変貌させます。公開ポートや複雑なネットワーク構成を必要としないため、開発者が異なるデバイス間でローカルモデルを共同作業したりテストしたりするための、非常に安全で摩擦のない方法を提供します。

  • • Infercatはtailcatを利用して、ホストマシンとクライアント間で安全なエンドツーエンド暗号化P2Pトンネルを確立します。
  • • llama.cpp、vLLM、Ollama、LM Studioなど、一般的なローカル推論エンジンをサポートしています。
  • • OpenAI互換のAPIを提供し、Cursor、Claude Code、Open WebUIとのシームレスな統合を可能にします。
  • • ユーザーは簡単な招待コードを生成することで、外部アカウントやシステムレベルのVPN構成を必要とせずにアクセス権を付与できます。
  • • ホストマシンは基本的な使用統計を記録しますが、プライベートな会話のトランスクリプトは保存しません。

複雑なVPNやクラウドホスティングを設定することなく、ローカルのGPU環境を外部クライアント、共同作業者、またはコーディングツールに公開できます。

SOURCES

9. I-Have-ADHDプラグインがClaude Codeから会話のフィラーを除去

現代のLLMに典型的な、丁寧だが時間を浪費する会話のフィラーを取り除くことで、i-have-adhdプラグインはターミナルベースのコーディングアシスタントを純粋な速度と実用性のために最適化します。これは、最大限の集中力を発揮するためにローカルの開発環境をカスタマイズする非常に実用的な方法です。

  • • このプラグインは、次のアクションから始めることやリストを5項目までに制限することなど、LLMの回答に対して10の厳格なルールを適用します。
  • • 導入部、要約、結びの言葉などの会話要素を厳格に禁止します。
  • • このツールはオープンソースであり、MITライセンスの下でGitHubでホストされており、ADHDの対処戦略を緩やかにベースにしています。
  • • Claude Codeへのインストールには、リポジトリのクローンとCLIコマンドを使用してローカルマーケットプレイスにプラグインを追加する必要があります。

反復的な会話のフィラーを排除し、モデルにアクション可能なコードを直接提示させることで、Claude Codeとのやり取りを高速化できます。

SOURCES

10. Hip-Agent:200行のPythonで構成された軽量エージェントハーネス

プロンプト内に直接収まるように設計されたhip-agentは、大規模なエージェントフレームワークの複雑さを回避します。アクションをシェルコマンドとして、サブエージェントを子プロセスとして扱うことで、LLM駆動の自動化を構築およびオーケストレーションするための、クリーンでUnixライクなアプローチを提供します。

  • • hip-agentのコアループは、約200行のPythonコードで実装されています。
  • • このハーネスは構成に標準の環境変数を使用し、シェルコマンドを介してアクションを実行します。
  • • ハーネス内のサブエージェントは、標準的な子プロセスとして実装されています。
  • • このツールには、Codex APIと統合するための専用モジュールが含まれています。
  • • 残りのエージェント機能については、既存のプロトコルとフォーマットに依存しています。

肥大化したエージェントフレームワークに代わる、シンプルで透明性の高い代替手段を開発者に提供し、エージェント実行ループの検査、カスタマイズ、デバッグを容易にします。

SOURCES

11. DeltafinがSSDストリーミングを介して2.8TのKimi K3モデルをローカル実行

Deltafinは、Moonshot AIとは無関係の独立したオープンソースプロジェクトとして運営されています。プルーニングを回避し、2.8兆パラメータのモデル全体を高速SSDからストリーミングすることで、アクセス可能なハードウェア上で巨大な混合エキスパートモデルをローカル実行するための新しい道を提供します。

  • • Deltafinは、128GBのRAMを搭載したM1 Max MacBook Pro上で、512トークンの回答に対して毎秒1.0トークンの安定したデコード速度を達成しました。
  • • このツールはモデルのエキスパートをSSDからストリーミングし、パフォーマンスはシングルドライブの52%から4ドライブ構成の90%までスケーリングします。
  • • 現在のプリフィル制限により、エキスパートの読み取りが繰り返されるため、512トークンのプロンプトで最初のトークンを生成するのに6.3分かかります。
  • • 開発者はQwenモデルを統合して推論デコーディングを介して生のテキスト補完を加速できます。ここでは、より小さなモデルがKimi K3が検証するためのトークンを提案します。
  • • Deltafinには、MITライセンスの下で標準的なチャットおよび補完エンドポイントをサポートするOpenAI互換サーバーが含まれています。

エンタープライズグレードのGPUクラスターを必要とせずに、標準的なワークステーション上で巨大なフロンティアクラスのモデルをローカルで実行できます。

SOURCES

12. Edge Browser Agentがレガシーモバイルハードウェアで1B未満のモデルを実行

この実験は、エッジエージェントの入力表現を最適化することによる劇的なパフォーマンス向上を強調しています。小さなモデルはトピックのデコイを識別するような判断ベースのタスクには苦戦しますが、構造化された知覚レイヤーにより、基本的なWebスクレイピングやデータ抽出は10年前のハードウェアでも十分に実行可能です。

  • • 研究者は、Termux内のllama.cppを使用して、2017年製のSamsung Galaxy Note 8上でQwen3-0.6Bのようなモデルを実行することに成功しました。
  • • システムは、生のHTMLや重いスクリーンショットではなく、約200トークンの構造化されたWebページ表現をモデルに供給します。
  • • Qwen3-0.6BやLlama-3.2-3Bを含む1Bおよび2B未満のモデルは、サンドボックスの書籍スクレイピングタスクで10/10の成功率を達成しました。
  • • 構造化された知覚の代わりに生のHTMLを使用すると、タスク実行時間が80秒から22分に増加し、タスクの失敗を引き起こしました。
  • • このプロジェクトはオープンソースであり、GitHub(github.com/e2llm/edge-browser-agent)で公開されています。

高価なクラウドAPIやハイエンドのモバイルGPUを必要とせず、デバイス上で完全に動作する、効率的で低レイテンシなブラウザエージェントを構築できることを証明しています。

SOURCES

13. Qwen3.8-Flash-Nextの262Kコンテキストにおける推論エンジンのベンチマーク

ベンチマークは、NVIDIA RTX PRO 6000 Blackwell GPUとAMD Ryzen 9 9950X CPUを搭載したワークステーションで実施されました。GSM8KやMATH-500などの標準ベンチマークでの精度はすべてのエンジンで統計的に同一でしたが、プリフィル時間とエネルギー消費の劇的な違いは、本番レベルのローカル展開においてエンジン選択がいかに重要であるかを浮き彫りにしています。

  • • 262Kのコンテキストウィンドウにおいて、SGLangの最初のトークンまでの時間は35.4秒でしたが、FreeTokenは80.4秒、ベースラインのllama.cppは258.4秒でした。
  • • FreeTokenはコンテキストスイープ全体で毎秒100.1〜94.8トークンのフラットなデコード速度を維持しましたが、ベースラインのllama.cppは毎秒101.9から20.2トークンまで低下しました。
  • • llama.cppのMulti-Token Predictionフォークは、すべてのモデルエキスパートがGPU上に留まっている場合に限り、コーディングテストでデコード速度を最大1.69倍向上させました。
  • • SGLangはフルウィンドウリクエストに対して約13 kJのGPUエネルギーを消費しましたが、ベースラインのllama.cppはリクエスト時間が長いため116 kJを消費しました。
  • • 最初の回答に到達するまでの起動時間は、llama.cppが16秒で最も速く、SGLangは108秒、FreeTokenは126秒でした。

ハードウェアに最適な推論エンジンを選択することで、長コンテキストのローカルモデルにおけるレイテンシとエネルギーコストを大幅に削減できます。

SOURCES

14. Qwen3.8 27Bが従来の量子化による劣化問題を克服

Q4_K_M量子化を使用した27Bモデルで数学や推論の著しい劣化が確認された以前の報告を基に、Qwen3.8 27Bモデルの新しい評価では、このバージョンがGPQA DiamondやTerminal-Bench 2.1などの主要なベンチマークでフル精度のパフォーマンスを維持していることが確認されました。これは、最新のモデルアーキテクチャが、前世代よりも標準的な4ビット圧縮に対して耐性があることを示しています。

  • • Qwen3.8 27BのQ4_K_M量子化は、GPQA DiamondおよびTerminal-Bench 2.1においてフル精度のBF16パフォーマンスと一致します。
  • • これは、同じQ4_K_M量子化の下で数学の精度が9%低下したことを示した以前の27Bモデルの評価とは対照的です。
  • • このモデルは、約64kトークンのコンテキストを維持しながら、単一の24GB GPUに収まります。
  • • 極端な1ビット量子化は依然として使用不可能であり、これは以前のモデル世代の調査結果と一致しています。

開発者は、以前の27Bモデルで見られた精度のトレードオフなしに、コンシューマーハードウェア上で4ビット量子化を使用してQwen3.8 27Bモデルを展開できるようになりました。

SOURCES

15. デュアルRTX 4090 GPUにおけるローカルエージェントの同時実行ベンチマーク

ベンチマークは、同時実行エージェントのスロット数に関係なく、プリフィルの総スループットが毎秒約1,500トークンで一定であることを示しています。これらのローカルモデルをアクティブなワークフローに統合しようとしている開発者にとって、このセットアップはMCPサーバーとして公開し、Claude Code内のサブエージェントとして機能させることができます。

  • • 128GB RAMを搭載したデュアルRTX 4090システムは、64kコンテキストで5つの同時実行エージェントでソフトキャップに達し、それ以上はスループットの向上なしにレイテンシが増加しました。
  • • システムのハードキャップは、VRAMの可用性に厳密に制限され、64kコンテキストで9つの同時実行エージェントでした。
  • • Qwen 27Bモデルはツール呼び出しあたり3.40秒を達成し、11.91秒かかった122B MoEモデルを大幅に上回りました。
  • • 最大251,557トークンまでの長距離検索において、Q4_K_M、Q6_K_XL、Q8_K_XL量子化の間で測定可能な精度の違いは見つかりませんでした。
  • • KVキャッシュにq8_0を使用すると、f16と比較して品質や速度の低下なしに、スロットあたり1.4 GiBのVRAMを節約できました。

モデルサイズと量子化レベルを特定のVRAMおよび同時実行制限に合わせることで、ローカルエージェントのアーキテクチャを最適化できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。