Inference Brew

Tencentが100万トークンのコンテキストウィンドウを持つ「Hy4」プレビュー版を公開

00:00 / --:--

← ホームへ戻る

Tencentが100万トークンのコンテキストウィンドウを持つ「Hy4」プレビュー版を公開

1. Tencentが100万トークンのコンテキストウィンドウを持つ「Hy4」プレビュー版を公開

Hy4プレビュー版は、ソフトウェアエンジニアリング、ゲーム開発、科学研究などの生産性タスク向けに設計されています。エンジニアリングタスクの内部評価では、GLM-5.3やKimi K3を上回る4.00点中2.99点を記録しました。さらに、モデル自身が推論システムを自律的に最適化することで、エンドツーエンドのスループットを31.8%向上させるなど、モデル開発プロセスにも貢献しています。

  • • Hy4プレビュー版は、総パラメータ数7,700億、アクティブパラメータ数490億、100万トークンを超えるコンテキストウィンドウを備えています。
  • • API料金は、入力100万トークンあたり0.834ドル、出力100万トークンあたり2.501ドル、キャッシュヒット時は100万トークンあたり0.042ドルに設定されています。
  • • 本モデルは、Tencent Cloud TokenHub、OpenRouter、WorkBuddy、CodeBuddyを通じて世界中で利用可能です。
  • • Tencentは、モデルを1.5TBからGGUF形式で約200GBまで圧縮しつつ、元の性能の約98%を維持することに成功しました。

開発者は、OpenRouterやTencent Cloudを通じて、非常に競争力のあるAPI価格で、高性能かつ長大なコンテキストを扱えるMixture-of-Experts(MoE)モデルを世界中から利用可能です。

2. vLLM v0.28.0がDeepSeek V4をサポート、バッチトークン処理能力が倍増

今回のメジャーリリースには、270人の貢献者による584件のコミットが含まれています。モデルやハードウェアのサポート拡大に加え、Transformersライブラリの依存関係がバージョン5.15.0に更新され、bitsandbytesのサポートがアウトオブツリープラグインへと移行されました。CUDA 12.9および13.0向けのビルド済みホイールに加え、macOSを含むCPUのみの環境にも対応しています。

  • • vLLM v0.28.0はDeepSeek V4をサポートし、Sparse MLA、AMD Quark NVFP4サポート、ROCm対応を実現しました。
  • • デフォルトのmax_num_batched_tokensが8,192から16,384に倍増し、スループットが向上しました。
  • • Kimi-K3のパフォーマンス最適化として、Decode Context Parallelサポート、FlashKDAカーネルの統合、適応型推論トークン予算などが追加されました。
  • • Muse Glimmer、Ling 3.0 Flash、Dots3 NOTE、Interns2mobiusなどの新しいモデルのサポートが追加されました。

オープンウェイトモデルをホストする開発者は、最適化されたDeepSeek V4のサービングを活用し、デフォルトのバッチトークン容量を倍増させることで、より高いスループットを実現できます。

SOURCES

3. コーディングエージェントの評価コストを削減する「TerminalBench 4.0」が登場

Terminal-Benchスイートのこれまでのバージョンを基盤とするTerminalBench 4.0は、過去の反復における高コストや膨大なトークン要件という課題に対処するために設計された軽量フレームワークです。これにより、開発者は以前のベンチマークで必要とされていた膨大なトークン数を消費することなく、エージェントのハーネスやツール統合を迅速に反復開発できます。

  • • TerminalBench 4.0は、Terminal-Benchシリーズの以前のバージョンを継承しています。
  • • 新バージョンでは、50億〜100億トークン規模のベンチマークから脱却し、必要なトークン要件を削減しました。
  • • カスタムコーディングエージェントのハーネスを迅速に反復開発するために最適化されています。
  • • ツール修正やプロンプトエンジニアリングを評価するための、よりアクセスしやすい手段を提供します。

このアップデートにより、開発者はエージェントの修正がパフォーマンスやトークン効率に与える影響をより手頃な価格で測定できるようになり、開発サイクルの高速化が促進されます。

SOURCES

4. StemDeckがオープンソースのローカルAIオーディオステム分離ツールをリリース

StemDeckは、DAWスタイルのマルチトラックミキサー、波形エディタ、BPM・キー・スケール・ラウドネス(LUFS)の統合分析ツールを備えた、完全なローカルオーディオ操作環境を提供します。すべてデバイス上で動作するため、サブスクリプションやアカウント登録、クラウドへのアップロードが不要であり、ローカルでのオーディオ前処理において安全かつ費用対効果の高い選択肢となります。

  • • StemDeckは、オーディオファイルやYouTube URLをボーカル、ドラム、ベース、ギター、ピアノ、その他の6つのトラックに分離します。
  • • Python 3.12、FastAPIバックエンド、Tauri v2デスクトップシェルで構築されており、完全にローカルで動作します。
  • • 高品質なオーディオ分離のために、Demucsのhtdemucs_6sニューラルネットワークを利用しています。
  • • macOS、Windows、Linuxに対応し、NVIDIAハードウェアでのCUDAやApple SiliconでのMPSによるGPUアクセラレーションをサポートしています。

オーディオ処理やマルチモーダルアプリケーションを構築する開発者は、クラウドに依存することなく、GPUアクセラレーションを活用した完全ローカルなパイプラインでボーカルや楽器を分離できます。

SOURCES

5. Claude Code、一時的な制限緩和を経て週次利用制限を恒久的に引き上げ

Claude Codeの制限緩和の実績に基づき、ClaudeDevsは新しい恒久的なポリシーを発表しました。9月14日より、Pro、Max、Team、Enterpriseプランのユーザーは、標準の週次制限が恒久的に25%増加します。これは現在実施されている一時的な50%増からは17%の減少となりますが、開発者のワークフローに対してより高い長期的なベースラインを確立するものです。

  • • 9月14日より、Pro、Max、Team、Enterpriseプランにおいて、週次制限が恒久的に25%引き上げられます。
  • • 今回の変更により、現在実施されている一時的な50%の制限緩和から移行します。
  • • 新しい恒久的な制限は、一時的な50%増のレベルと比較すると17%の減少となります。
  • • これは、2026年5月および6月に報告されたClaude Codeの制限緩和に続くものです。

このアップデートは、Claude Codeユーザーの長期的な利用容量を正式に定めるものであり、以前の制限緩和で設定されたベースラインから恒久的な引き上げを実現します。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。