Inference Brew

Anthropicの安価なOpus 5が企業向けモデル支出でFable 5を追い抜く

00:00 / --:--

← ホームへ戻る

Anthropicの安価なOpus 5が企業向けモデル支出でFable 5を追い抜く

1. Anthropicの安価なOpus 5が企業向けモデル支出でFable 5を追い抜く

AnthropicのOpus 5は、リリースから1か月以内に、50%低い価格設定を背景に企業向け支出でFable 5を追い抜きました。Fable 5は、多段階の整合性を必要とする長期的な自律プロジェクト向けに設計されていますが、企業は低い切り替えコストを活用し、より多くの試行や人間のレビューが必要になる可能性がある場合でも、日常的なタスクをより経済的なOpus 5にルーティングしています。

  • • Opus 5はリリースから1か月で、企業向けモデル支出においてFable 5を上回った。
  • • Opus 5の価格はFable 5の半分である。
  • • 低い切り替えコストにより、企業は日常業務をより安価なモデルに動的にルーティングできる。
  • • Fable 5は、接続されたステップ全体で整合性を必要とする長期的な自律プロジェクト向けの立ち位置を維持している。
  • • Opus 5は、Fable 5と比較して、より多くの試行、長いプロンプト、またはより多くの人間のレビューを必要とする場合がある。

開発者は、日常的なタスクに安価なOpus 5を使用し、複雑な自律プロジェクトにはプレミアムモデルを予約することで、運用コストを最適化できます。

SOURCES

2. MetaがオンデバイスMixture-of-Expertsモデル「MobileMoE」をリリース

Metaは、モバイルハードウェア向けに最適化されたオンデバイスMixture-of-Experts言語モデルファミリー「MobileMoE」を発表しました。3つのスケール(0.3B、0.5B、0.9Bのアクティブパラメータ)で利用可能で、コンシューマーデバイスでのメモリ枯渇を防ぐため、INT4量子化後のフットプリントを3GB未満に抑えるよう設計されています。最大のバリアントであるMobileMoE-L-Baseは、60個のルーティングされたエキスパートと、トークンあたり4個のアクティブエキスパート、および共有エキスパートを活用し、8,192トークンのコンテキストウィンドウをサポートします。

  • • MobileMoEは、0.3B、0.5B、0.9Bのアクティブパラメータを持つオンデバイスMoEモデルファミリーである。
  • • 各モデルスケールは、モバイルDRAMに収まるよう、INT4精度で3GB未満のウェイトフットプリントで設計されている。
  • • MobileMoE-L-Baseモデルは、9億2,200万のアクティブパラメータと53億の総パラメータを特徴とする。
  • • アーキテクチャには、60個のルーティングされたエキスパート、トークンあたり4個のアクティブエキスパート、および1個の共有エキスパートが含まれる。
  • • モデルは8,192トークンのコンテキスト長をサポートし、FAIR NCライセンスの下でリリースされた。

開発者は、メモリ使用量を最小限に抑えるために、非常に効率的なオープンウェイトのMoEモデルをモバイルデバイスに直接デプロイできます。

SOURCES

3. Fastinoが境界予測による情報抽出モデル「GLiNER2.5」をリリース

Fastinoは、従来のスパン列挙から境界予測アーキテクチャに移行した新しい情報抽出モデル「GLiNER2.5」を立ち上げました。この変更により、最大エンティティ幅の制限が撤廃され、共同エンティティ・関係デコードやスパンごとの属性といった高度な機能が可能になりました。Apache 2.0ライセンスの下でリリースされたこのモデルは、CPU、CUDA、またはMPSでのローカルセルフホスティング向けに最適化された3つの軽量チェックポイント(74M、194M、287Mパラメータ)で利用可能です。

  • • FastinoはGLiNER2.5をリリースし、スパン列挙を境界予測に置き換えることでエンティティ幅の制限を撤廃した。
  • • モデルは4,096ワードのコンテキスト、共同エンティティ・関係デコード、およびタスク横断的なラベル制約をサポートしている。
  • • 3つのチェックポイント(74M、194M、287Mパラメータ)がHugging FaceでApache 2.0ライセンスの下で利用可能である。
  • • 多言語チェックポイントは、16のゼロショットベンチマーク全体で56.17の全体的なマクロF1スコアを達成した。
  • • モデルはセルフホスティング向けに設計されており、Python 3.10+を使用したCPU、CUDA、またはMPS推論をサポートしている。

開発者は、4,096ワードのコンテキストをサポートし、エンティティ幅の制限を撤廃した、非常に効率的な情報抽出モデルをセルフホストできます。

SOURCES

4. 超軽量ローカル言語モデル「SHADOW-250M」がリリース

SHADOW-250Mは、ローカル推論のための超軽量な選択肢を提供し、2ビット未満の量子化を通じて2億5,000万パラメータを60MBのフットプリントに詰め込んでいます。MITライセンスのコンパイル済みランタイムで動作し、標準的なノートPCのCPU上で毎秒400トークンを達成します。その独自のアーキテクチャは、2,048トークンのfp16 KVキャッシュを維持しながら、古い履歴をディスク上で1ビットに圧縮し、開発者が最大1億トークンの履歴データからコンテキストを取得できるようにします。

  • • SHADOW-250Mは、Finewebデータの300億トークンでゼロから学習された2億5,000万パラメータのモデルである。
  • • モデルは2ビット未満に量子化されており、60MBのデプロイサイズと80MBのRAMを必要とする。
  • • GPUなしの標準的なノートPCのCPU上で、毎秒約400トークンで動作する。
  • • アーキテクチャは最新の2,048トークンをfp16 KVキャッシュに保存し、古いトークンをディスク上で1ビットに圧縮することで、最大1億トークンの履歴からの取得を可能にする。
  • • モデルはWindowsとLinuxをサポートするMITライセンスのコンパイル済みランタイムを使用しており、GitHubとHugging Faceで利用可能である。

開発者は、GPUアクセラレーションを必要とせずに、標準的なノートPCのCPU上で非常に高速で低メモリの言語モデルをローカルにデプロイできます。

SOURCES

5. 高性能ローカルコーディングモデル「TielCoder 35B MoE」がリリース

TielCoderは、現実世界のコードベースの問題を解決するために特別に設計された新しい35B-A3B Mixture of Expertsモデルです。Ornith-1.5のファインチューンをベースにしており、動的量子化のためのコード加重imatrixと、エージェント実行中のトークン効率を最大化するための最適化されたチャットテンプレートを使用しています。GGUFおよびMLXバージョンがHugging Faceで利用可能になり、独自のAPIに代わる高速で一貫性のあるローカルな選択肢を提供します。

  • • TielCoderは、Ornith-1.5のファインチューンをベースにした35B-A3B Mixture of Expertsコーダーモデルである。
  • • このモデルは、22GBの4ビット量子化フォーマットで、最近の現実のコーディング問題においてOpus 4.6 mediumに匹敵する。
  • • 動的量子化のためのコード加重imatrixと、トークン効率の高いエージェントコーディング向けに最適化されたチャットテンプレートを利用している。
  • • モデルのGGUFおよびMLXバージョンは、ユーザー「peculiar-ragdoll」の下でHugging Faceで利用可能である。

開発者は、現実世界のコードベースの問題においてOpus 4.6 mediumのパフォーマンスに匹敵する、非常に効率的な4ビット量子化ローカルコーディングモデルを実行できます。

SOURCES

6. NvidiaのGroq 3 LPUラックシステムが毎秒3,400トークンを達成

Artificial Analysisによる独立したベンチマークにより、Groq 3 LPUを統合したNvidiaのLPXラックシステムが、GoogleのGemma 4 31Bモデルを実行して毎秒3,400トークンを達成したことが明らかになりました。この異種アーキテクチャはワークロードを分割し、計算負荷の高いプリフィルフェーズをGPUに、メモリ帯域幅を大量に消費するデコードフェーズをGroq 3 LPUにルーティングします。LPUは500MBのオンボードSRAMを活用して150TB/sのメモリ帯域幅を提供し、ベンチマークではCerebrasの最も近い代替品を4倍上回りました。

  • • Groq 3 LPUを搭載したNvidiaのLPXラックシステムは、独立したベンチマークでGemma 4 31Bを実行し、毎秒3,400トークンを達成した。
  • • ベンチマークされたシステムは、毎秒882トークンを記録したCerebrasのプラットフォームより4倍高速であると報告されている。
  • • Groq 3 LPUは、150TB/sのメモリ帯域幅を提供するSRAM重視のアーキテクチャを利用している。
  • • Nvidiaの異種アーキテクチャは、計算負荷の高いプリフィルフェーズをGPUに、デコードフェーズをGroq 3 LPUにオフロードする。
  • • 各Groq 3 LPUには500MBのSRAMが含まれており、ラックあたり最大256個のLPUにわたるイーサネット分散が必要である。

高スループットの推論を実行する開発者は、新しい異種ハードウェア構成を活用して超低レイテンシを達成できます。

SOURCES

7. vLLMの重大な脆弱性CVE-2025-9141により任意のコード実行が可能に

セキュリティ研究者は、悪意のあるLLMがvLLMやSGLangのような最新の推論エンジンの脆弱性を悪用してホストマシンを制御できる可能性があると警告しています。その代表例が、安全でないeval()呼び出しを通じてコード実行を可能にした、Qwen3 Coder向けのvLLMのXMLベースのツールパーサーにおける任意のコード実行の脆弱性であるCVE-2025-9141です。複雑なチャットパーサーやマルチモーダルデコーダーは攻撃対象領域を拡大するため、開発者はGPUホストをトークンパーサーから分離し、ホストの権限を制限することを推奨します。

  • • CVE-2025-9141は、Qwen3 Coder向けのvLLMのXMLベースのツールパーサーにおける任意のコード実行のバグであった。
  • • この脆弱性により、安全でないeval()呼び出しを通じて任意のコードを実行できた。
  • • Geminiからの重大なセキュリティフラグにもかかわらず、vLLMのリードメンテナーは変更を強制マージした。
  • • マルチモーダルアーキテクチャと複雑なチャットフォーマットパーサーは、最新の推論エンジンの攻撃対象領域を拡大する。
  • • 提案されている緩和策には、GPUホストをトークンパーサーから分離し、GPUホストの権限を制限することが含まれる。

セルフホスト型のvLLMまたはSGLangインスタンスを実行している開発者は、悪意のあるトークンシーケンスがパーサーの脆弱性を悪用してホストの制御権を奪う可能性があるため、環境を保護する必要があります。

SOURCES

8. Microsoftが新しい最適化スキルでAgent Lightningを拡張

8月20日にリリースされたAgent Lightning v1.0強化学習フレームワークを基盤として、MicrosoftはAgent Lightning v1.0.1を導入しました。この新しいコマンドラインスキルにより、開発者はClaude Code、Codex、GitHub Copilotを含むコーディングエージェントのプロンプト、ツール、ワークフローを体系的に最適化できます。開発者は、Agent Lightningエコシステムの最適化機能をエージェントパイプラインに直接統合し、精度、コスト、レイテンシのバランスを取ることができるようになりました。

  • • Agent Lightning v1.0.1は、Agent Lightningエコシステムを拡張するコマンドラインスキルである。
  • • コーディングエージェントのプロンプト、ツール、推論設定の最適化を自動化する。
  • • Claude Code、Codex、GitHub Copilotと互換性がある。
  • • インストールはGitHub CLI経由で利用可能:gh skill install microsoft/agent-lightning agent-lightning --agent <agent>。
  • • 精度、コスト、信頼性の向上を追跡するための自動ベンチマークレポートが含まれている。

このリリースは、開発者がAgent Lightningフレームワークの最適化ロジックをアクティブなコーディングエージェントに適用し、プロンプトと推論設定の改善を自動化するための実用的なインターフェースを提供します。

SOURCES

9. AnthropicがClaude Tag Slackエージェントを強化し、完全な会話コンテキストに対応

Claude Tagエージェントの初期リリースを基盤として、Anthropicはツールを更新し、個々のメッセージではなく完全な会話コンテキストを評価するようにしました。この強化により、チームの議論にプロアクティブに介入するエージェントの能力が30%向上しました。この更新では、Model Context Protocol (MCP)を活用して安全なデータアクセスを維持し、エージェントの可視性が個々のユーザー権限と一致していることを保証します。

  • • Claude Tagは、個別のメッセージではなく完全な会話履歴を評価するようになった。
  • • この更新により、エージェントのプロンプトなしの介入精度が30%向上した。
  • • エージェントは、安全で権限を認識したデータアクセスのためにModel Context Protocol (MCP)を引き続き使用している。
  • • 現在、拡張されたチャネルコンテキスト機能に対する追加料金はない。

この更新により、プロアクティブなチームメンバーとしてのClaude Tagの信頼性が向上し、開発者はSlack内でよりコンテキストを認識したエージェントをデプロイできるようになります。

SOURCES

10. Liquid AIとArtificial AnalysisがLFM2.5モデルのモバイル推論ベンチマークを標準化

Liquid AIとArtificial Analysisは、オープンソースのPipetteアプリを搭載したモバイルデバイス推論ベンチマークハーネスを導入しました。この取り組みは、今月初めにリリースされた2.6Bモデルを含むLFM2.5モデルファミリーの標準化されたパフォーマンスとメモリ指標を提供します。iPhone 17 ProとGalaxy S26 Ultraでのテストでは、Nanbeige4.2-3BとLFM2.5-2.6Bが63のスコアでインテリジェンスランキングをリードし、標準的な12GBデバイスにおけるより大きな9Bモデルのメモリ制約が浮き彫りになりました。

  • • ベンチマークパートナーシップは、iOSおよびAndroid上のLiquid AIの無料オープンソース「Pipette」アプリを使用している。
  • • 評価は、16Kのコンテキスト制限の下でiPhone 17 ProとGalaxy S26 Ultraで実施される。
  • • Nanbeige4.2-3BとLFM2.5-2.6Bが、63という最高の平均評価スコアで同点となった。
  • • LFM2.5-2.6Bは、iPhone 17 Pro上で2.3GBのメモリを使用して1,024トークンのプロンプトを8.0秒で処理し、より高い効率を示した。
  • • 4Kコンテキストでのピークメモリ使用量は、LFM2.5-230Mの0.4GBから、12GB RAMデバイスを大きく制約するQwen3.5 9Bの6.9GBまで及ぶ。

開発者は、標準化されたベンチマークを使用してモバイルハードウェア上でのLiquid AIモデルの効率とメモリフットプリントを評価し、オンデバイスアプリケーション向けのモデル選択を容易にできるようになりました。

SOURCES

11. OpenAIがGPT-5.6 Sol APIの20%一時値下げを導入

8月17日と8月21日のGPT-5.6 Solモデルの価格更新に続き、OpenAIはAPIの20%を超える一時的な値下げを発表しました。これは少なくとも2026年11月21日まで有効です。この更新では、2026年3月5日以降にリリースされたモデルの地域処理エンドポイントに対する10%の価格プレミアムも導入され、同社のファインチューニングプラットフォームの終了が確認されました。

  • • OpenAIは、2026年11月21日までGPT-5.6 Sol API利用料の20%一時値下げを提供している。
  • • 2026年3月5日以降にリリースされたモデルの地域処理エンドポイントには、10%の価格プレミアムが適用される。
  • • OpenAIはファインチューニングプラットフォームを終了しており、新規登録をブロックしつつ既存モデルは維持している。
  • • APIは引き続き優先サービスおよび高速サービスティアをサポートしている。

開発者は、この3か月間のプロモーション期間中、GPT-5.6 SolワークロードのAPIコストをさらに削減できます。

SOURCES

12. GPUネオクラウドの料金表でB200とB300の価格が明らかに

専門的なGPUネオクラウドの市場分析により、AIインフラをスケーリングする開発者にとって重要な価格設定とハードウェアの差別化要因が明らかになりました。Lambdaは現在、NVIDIA B200のオンデマンド手頃な価格でGPU時間あたり6.69ドルとリードしており、Nebiusは新しいB300のオンデマンド料金を公開している唯一のプロバイダーとして際立っています。AMDの代替品を探している開発者向けには、Crusoeが標準料金表にMI300XとMI355Xを記載している唯一のプロバイダーです。

  • • Lambdaは、NVIDIA B200のオンデマンド料金としてGPU時間あたり6.69ドルという最低価格を公開している。
  • • Nebiusは、グループ内でNVIDIA B300のオンデマンド価格を公開している唯一のプロバイダーである。
  • • Crusoeは、上位5社の中でAMD MI300XとMI355Xを料金表に記載している唯一のプロバイダーである。
  • • CoreWeaveは、2026年第2四半期に業界初のNVIDIA Vera Rubin NVL72システムの立ち上げと検証を完了した。
  • • CoreWeaveは、SemiAnalysis ClusterMAX 2.0評価でプラチナと評価された唯一のプロバイダーである。

開発者は、専門的なクラウドプロバイダー全体でオンデマンド料金とハードウェアの可用性を比較することで、トレーニングと推論の予算を最適化できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。