Inference Brew

謎のモデル「Ox Alpha」が登場、1日100兆トークンを無料で提供

00:00 / --:--

← ホームへ戻る

謎のモデル「Ox Alpha」が登場、1日100兆トークンを無料で提供

1. 謎のモデル「Ox Alpha」が登場、1日100兆トークンを無料で提供

このモデルの1日あたり100兆トークンという膨大な処理能力は、Zhipu AIの1万基のGPUクラスターのような、強力な計算リソースを持つプロバイダーの支援を示唆しています。トークナイザーの計算やビデオエンコーディングなどのアーキテクチャ上の手がかりは、ZhipuのGLM系列であることを強く示唆していますが、MicrosoftやDeepSeekのモデルではないかと推測する声もあります。

  • • Ox Alphaは、100万トークンのマルチモーダルコンテキストウィンドウと、131,072トークンの出力制限を備えています。
  • • 8月20日時点で、OpenRouterおよびOpenCodeにて無料で利用可能です。
  • • Kingbenchリーダーボードで87.5%のスコアを記録しました。
  • • このモデルは、Zhipu AIの未発表モデルGLM-5、DeepSeekのV4-Flash、あるいはMicrosoftのMAI 2に関連しているのではないかと推測されています。
  • • コーディング、継続的なエージェント作業、テキストと視覚的コンテキストを組み合わせた本番ワークロード向けに最適化されています。

開発者は、コーディングやエージェントワークロード向けに、非常に高性能で長大なコンテキストを扱えるマルチモーダルモデルを完全に無料で利用できるようになります。

SOURCES

2. Model Context Protocolがエージェント向けプリミティブとセキュリティのロードマップを公開

コアメンテナーとコミュニティのワーキンググループによって策定されたこのロードマップは、これらの重点分野に沿った仕様強化提案(SEP)を優先しています。開発者は、SEPを提案したり、アクティブなワーキンググループに参加したりすることで直接貢献できます。

  • • ロードマップでは、エージェントメッセージングプリミティブやHTTPネイティブトランスポートの統合など、5つの優先分野を特定しています。
  • • HTTPネイティブトランスポートの統合は、リモートのMCPサーバーを標準的なHTTPワークロードとして扱い、開発を簡素化することを目的としています。
  • • セキュリティの優先事項には、DPoP(Demonstrating Proof of Possession)の最終決定と、ワークロードIDフェデレーションの標準定義が含まれます。
  • • エージェントメッセージングの取り組みには、サーバー主導イベントの実装や、Tasks拡張(SEP-2663)の成熟が含まれます。
  • • 改良されたプリミティブにより、ツール呼び出し結果の処理が標準化され、大規模なツールカタログ向けの段階的な探索機能が導入されます。

このロードマップは、エージェントとツール間の通信に関する今後の標準を示しており、安全で相互運用性が高く、本番環境に対応したAIエージェントの構築を容易にします。

SOURCES

3. オープンソースの「Decode」エージェント、エージェントワークフローの3つの実行モードを実証

このプロジェクトは、エージェントアーキテクチャにおける経済性とパフォーマンスのトレードオフに焦点を当てています。高スループットのワークロードでは、ピーク時の需要と平均需要の比率が予約割引を上回る場合、サーバーレスGPUの使用が予約済み容量よりも費用対効果が高いことが示されています。

  • • Decodeエージェントは、異なる実行環境に対応するため、インタラクティブ、リモート、非同期の実行モードを備えています。
  • • インタラクティブモードでは、ツール実行中のユーザー入力を管理するために、優先順位ゲート付きのステアリングキューを使用します。
  • • リモートモードはKitaruのようなエージェントランタイム上で動作し、Modalのようなプラットフォーム上でタスクを並列実行します。
  • • 非同期モードは作業をジョブキューにオフロードし、開始したクライアントが終了した後もバックグラウンドワークフローを継続させます。
  • • LangChainのTerminal-Benchでは、モデルを固定したままエージェントのハーネスを変更することで、パフォーマンスが30位からトップ5に向上しました。
  • • 1,000件のドキュメント処理コストは、フロンティアAPIを使用した場合に約97ドルかかるのに対し、バッチ処理されたGPU時間では13ドルで済みます。

開発者はこれらのアーキテクチャパターンを採用することで、ユーザーのレイテンシ、サーバーレスのスループット、または長時間実行されるバックグラウンドタスクに合わせてエージェントを最適化できます。

SOURCES

4. NeMo Guardrailsを用いた階層型安全パイプラインの実装

このガイドでは、OpenAIモデルの設定、YAML構成の定義、およびステートフルなマルチターン対話中のレール起動のトレース方法を網羅しています。また、開発者が本番環境へのデプロイ前にガードレールの有効性を監査できるように、レッドチームスタイルのカバレッジレポートも含まれています。

  • • このチュートリアルでは、LLMベースの金融アシスタント向けの階層型パイプラインの構築を実証しています。
  • • パイプラインには、決定論的なPII検出、口座番号のマスキング、ポリシーベースのツールゲーティングが組み込まれています。
  • • 決定論的な制御にはColangフローを、ActionResultコンテキストの更新にはPythonアクションを利用しています。
  • • モデルに到達する前に内部ドキュメントをフィルタリングするための、キーワードベースのナレッジリトリーバーが実装されています。
  • • フレームワークは、合格率、ハードストップ、トークン消費量を測定するカバレッジスイートを使用して検証されます。

開発者は、堅牢で決定論的な安全制御とレッドチームによる検証を実装し、プロンプトインジェクションやデータ漏洩からエンタープライズLLMアプリケーションを保護できます。

SOURCES

5. Qwen3.6-27Bのツール呼び出し失敗の原因を特定

Qwen3.6-27BにおけるJSONフォーマットエラーの報告に基づき、新しい技術分析が行われました。その結果、低ビットのKVキャッシュおよび重みの量子化(特にInt4およびNVFP4)が、再現性のあるツール呼び出しの失敗とトークンの乖離を引き起こしていることが特定されました。この研究は、これらのエラーがモデルのアーキテクチャ固有のものではなく、過度な圧縮によるアーティファクトであることを確認しており、信頼性の高いエージェントワークフローにはINT8またはFP8形式を優先すべきであることを示唆しています。

  • • Int4 KVキャッシュ量子化は、BF16やint8では発生しない再現性のあるツール呼び出しエラーを引き起こします。
  • • NVIDIAのNVFP4量子化は最も高いトークン乖離を示し、88kコンテキストまでに50%の反転に達しました。
  • • NVFP4およびAWQ W4A16モデルはどちらも、Ciscoコマンドラインツール呼び出しを正しく実行できませんでした。
  • • INT8 W8A16は、ツール呼び出しの忠実度を維持するための最も信頼性の高い量子化手法であり続けています。
  • • トークン生成の乖離はクラスター内で発生するため、以前のマルチエージェント評価で観測されたフォーマットエラーの間欠的な性質を説明しています。

開発者は、ツールオーケストレーションにおいて問題があると特定された特定の高圧縮量子化手法を避けることで、エージェントのサイレントな失敗を回避できるようになります。

SOURCES

6. Qwen3.8-27Bが単一のRTX 5090で262Kコンテキストを実行

ローカルデプロイメントは、KDEデスクトップ環境を実行するArch Linuxシステム上で構成されました。モデルに組み込まれたマルチトークン予測(MTP)ヘッドがパフォーマンスを低下させ、VRAM消費量を増加させたため、実行中は推論デコーディングを明示的に無効にしました。

  • • このセットアップでは、短いコンテキストで毎秒77.2トークン、128Kの常駐コンテキストで毎秒64.7トークンの速度を達成しました。
  • • 構成には、モデルのNVFP4 ModelOptエクスポート、FP8 KVキャッシュ、vLLM 0.27.1上のFlashInferカーネルを利用しています。
  • • 262,000トークンの完全なプリフィル操作が166秒で完了しました。
  • • プレフィックスキャッシュにより22.3倍の高速化が実現し、最初のトークンまでの時間が6.437秒から0.288秒に短縮されました。
  • • システムはRTX 5090の32GB VRAMのうち約30.5GBを使用しました。

このデモンストレーションは、開発者が単一のコンシューマー向けGPU上で、長大なコンテキストを持つ中規模モデルを高いスループットでローカルホストできることを示しています。

SOURCES

7. Llama.cppがバージョン0.2.0をリリース

このリリースは、広く使用されているローカルLLM推論フレームワークの重要なバージョンアップとなります。開発者は、公式リポジトリから直接、更新されたソースコードとプリビルドされたバイナリにアクセスできます。

  • • Llama.cppバージョン0.2.0が正式にリリースされました。
  • • リリースのプリビルド版は、GitHubタグb10566で利用可能です。
  • • 完全な変更履歴とソースコードは、プロジェクトのGitHubリポジトリでホストされています。

ローカル推論にllama.cppを使用している開発者は、最新の安定版リリースに更新することで、新機能や最適化を活用できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。