Inference Brew

蒸留版LivePortraitモデルがWebGPU経由でブラウザ上で25 FPSを実現

00:00 / --:--

← ホームへ戻る

蒸留版LivePortraitモデルがWebGPU経由でブラウザ上で25 FPSを実現

1. 蒸留版LivePortraitモデルがWebGPU経由でブラウザ上で25 FPSを実現

ある開発者が、WebGPUを使用してブラウザ内で完全に動作するLivePortraitモデルの蒸留版を公開しました。オリジナルのONNXモデルでは1フレームあたり30秒を要していましたが、この蒸留版はリアルタイム性能である25 FPS(Nvidia 5090上で1フレームあたり30ms未満)を達成しています。小規模なデータセットでの短時間の学習のため出力品質には制限がありますが、クライアントサイドでのハードウェアアクセラレーションによるポートレートアニメーションの実現可能性を示しています。

  • 開発者がWebGPU経由でChrome向けに最適化されたLivePortraitモデルの蒸留版を作成。
  • オリジナルのONNX版LivePortraitでは、ブラウザ上で1フレーム生成するのに30秒かかっていた。
  • 蒸留版モデルはNvidia 5090 GPU上で1フレームあたり30ms未満で生成し、ブラウザ内で完全に動作する。
  • モデルは数時間の小規模データセット学習のみであるため、現時点では出力品質に制限がある。

高価なサーバーサイドのGPUレンダリングを必要とせず、Webアプリケーション内で高性能かつ低遅延なローカルビデオおよびポートレートアニメーション機能を実現します。

SOURCES

2. SupraLabs、エージェントの思考トレースを要約する800Mモデルをリリース

SupraLabsは、エージェントの生の推論やツール呼び出しを解析し、構造化されたJSON要約に変換するために特別に学習された800Mパラメータのモデルを立ち上げました。これにより、開発者は生のモデルログではなく、クリーンで読みやすい進捗状況をエンドユーザーに表示できるようになります。モデルと併せて、SupraLabsはエージェントのトレース要約の開発を支援するため、6万1000件のエントリを含むデータセットをHugging Faceでオープンソース化しました。

  • SupraLabsがエージェントの思考トレースを要約するモデル「SupraLabs/reasoning-summarizer-800m-pre-gguf」をリリース。
  • モデルは生の推論とツール呼び出しを処理し、タイトル、サブタイトル、要約、現在のタスクを含む構造化されたJSONオブジェクトを出力する。
  • モデルと併せて、6万1000件の推論要約を含むオープンソースデータセット「reasoning-summaries-61k」がHugging Faceで公開された。
  • モデルは現在、要約を開始するための語彙が限られており、エージェント型コーディングに特化したバージョンが開発中である。

開発者がエージェントの生の複雑な思考トレースをそのまま表示するのではなく、クリーンで構造化されたユーザーフレンドリーな推論要約を提供できるようになります。

SOURCES

3. SupraLabs、51Mパラメータのプロンプトルーティングモデルをリリース

SupraLabsは、動的なプロンプトルーティング用に設計された、非常にコンパクトな5100万パラメータのモデル「Supra-Router-51M」をオープンソース化しました。このモデルは入力されたユーザープロンプトを評価し、リクエストを高速な小型モデルに送るか、より高性能な大型モデルに送るかを判断します。この低遅延オーケストレーターは、学習データセットとともにHugging Faceで利用可能です。

  • SupraLabsが5100万パラメータのプロンプトルーティングモデル「Supra-Router-51M」をリリース。
  • このモデルは低遅延環境向けに最適化されており、ユーザーリクエストを小型または大型モデルへ動的にルーティングする。
  • モデルの重みと学習データセットの両方がHugging Face Hubで公開されている。

単純なクエリを小型モデルへ、複雑なクエリを大型モデルへ動的にルーティングすることで、開発者が推論コストと遅延を削減するのに役立ちます。

SOURCES

4. shadcn/ui、デフォルトのコンポーネントライブラリをRadixからBase UIへ変更

アーキテクチャの大きな転換として、shadcn/uiはRadixから離れ、Base UIをデフォルトの基盤コンポーネントライブラリとしました。Radixは引き続き完全にサポートされ、CLIフラグ経由で利用可能ですが、この移行は開発者の強い選好を反映しており、新規プロジェクトではBase UIがRadixの2倍の割合で選択されています。移行を容易にするため、shadcnはCursorやClaude CodeなどのAIコーディングアシスタントと互換性のある移行スキルを導入し、コンポーネントごとのリファクタリングを自動化しました。

  • 2026年7月現在、Base UIがshadcn/uiのデフォルトコンポーネントライブラリとなり、ローンチ以来デフォルトだったRadixに代わった。
  • Base UIは現在バージョン1.6.0で、週間のダウンロード数は600万回を超えている。
  • shadcn/create経由で作成される新規プロジェクトでは、RadixよりもBase UIが2対1の比率で選択されている。
  • Radixは非推奨ではなく、今後もサポートと新しいコンポーネントのリリースが継続される。
  • 開発者はshadcn initプロセス中に「-b radix」フラグを使用することで、引き続きRadixで新規プロジェクトを初期化できる。
  • Claude CodeおよびCursorと互換性のある新しい移行スキルが利用可能で、RadixからBase UIへのコンポーネント移行を支援する。

shadcn/uiの新規プロジェクトを開始する開発者はデフォルトでBase UIを使用することになりますが、既存コンポーネントの移行には自動化ツールを使用したり、Radixを選択し続けることも可能です。

SOURCES

5. Qualcomm、WindowsノートPCでのローカルLLM実行用SDK「GenieX」を発表

Qualcommは、WindowsノートPC上でLLMをローカル実行するために設計されたソフトウェア開発キット「GenieX」を立ち上げました。このSDKはllama.cppと統合されており、開発者はあらゆるQ4_0 GGUFモデルをQualcommのCPU、GPU、NPUハードウェア上で実行できます。初期のユーザーベンチマークでは、Gemma 4 26Bモデルを使用してハードウェアアクセラレーションを活用し、毎秒20トークンという有望なパフォーマンスを示しています。

  • QualcommがWindowsノートPCでのローカルLLM実行を実現する「GenieX」を立ち上げた。
  • このSDKにより、llama.cppを使用してQualcommハードウェア(CPU、GPU、NPU)上で任意のQ4_0 GGUFモデルを実行できる。
  • あるユーザーは、QualcommのGPUまたはNPU上でGemma 4 26B A4Bモデルを実行し、毎秒20トークンを達成したと報告している。
  • 同じユーザーは、Qualcomm GPU上でQwen 3.6 27B MTPモデルを実行し、毎秒10トークンを達成した。

開発者がSnapdragon搭載のWindowsノートPC上で、ハードウェアアクセラレーションを活用したローカルAIアプリケーションを構築・実行できるようになります。

SOURCES

6. AI特有の凡庸なデザインを防ぐ「Claude Design」システムプロンプトが公開

Claude Designは、LLMの設計出力を向上させることを目的とした、MITライセンスのオープンソースシステムプロンプトおよびスキルライブラリをリリースしました。このシステムは、20章のデザイン哲学と14のプロシージャルスキルを提供し、モデルがクリーンでアクセシブル、かつプロフェッショナルなインターフェースを生成するのを支援します。過度な絵文字や重いグラデーションといったAIデザインの典型的なクリシェを明示的に禁止することで、開発者が本番環境ですぐに使えるUIコードを生成できるようにします。

  • Claude Designは、UIデザインコラボレーションのためのMITライセンスのオープンソースシステムプロンプトおよびスキルライブラリ。
  • システムには20章のデザイン哲学と、生成、抽出、レビューのための14の呼び出し可能なプロシージャルスキルが含まれている。
  • プロンプトは、過度なグラデーション、絵文字の装飾、一般的なSaaSテンプレートといったAIデザインの典型的な悪癖を拒否するようLLMに明示的に指示する。
  • Claude、GPT、Gemini、およびローカルモデルと互換性があり、OpenAIのCodex向けに特定のバリアントも用意されている。
  • プロンプトは、Fable 5やOpus 4.7/4.8系統を含むAnthropicのフロンティアモデル向けに調整されている。

開発者がLLMを一般的なSaaSテンプレートや過度なグラデーションから遠ざけ、よりクリーンでアクセシブルなUIコードを生成できるようにします。

SOURCES

7. 長文脈ベンチマークがローカルエージェントワークロードの主要なボトルネックを特定

llama.cppで動作する13種類のローカルLLMの包括的なベンチマークにより、長文脈エージェントワークロードにおける重要なアーキテクチャ要因が明らかになりました。この調査では、プリフィル速度が壁時計時間に支配的であり、標準的なトークン生成メトリクスは二次的なものになることが示されています。ローカルエージェントを構築する開発者は、4 KVヘッドアーキテクチャの優れたスケーリングや、量子化されたKVキャッシュによるパフォーマンス低下といったこれらの知見を活用して、ハードウェア構成を最適化できます。

  • ベンチマークは、RX 7900 XT 20GB GPUとllama.cppビルド9860を使用して、65K〜128Kのコンテキスト長で13種類のローカルLLMを評価した。
  • 65Kコンテキストでの短いエージェント出力において、プリフィル速度が壁時計時間の94%〜99%を占めており、トークン生成速度はほとんど無関係である。
  • 4 KVヘッドを持つモデルは、8 KVヘッドを持つモデルよりも長文脈のプリフィル速度において大幅に優れたスケーリングを示した。
  • Granite-4.0-H-SmallのようなMamba2ハイブリッドモデルは、131Kコンテキストまでほぼフラットなプリフィルスケーリングを維持し、4Kコンテキスト時の速度の69%を保持した。
  • F16 KVキャッシュの使用は、デ量子化オーバーヘッドのため、MoEや小型の密なモデルにおいて量子化されたQ8またはQ4 KVキャッシュよりも20%〜53%高速になる可能性がある。
  • GLM-4.7-FlashのようなMulti-head Latent Attention (MLA)アーキテクチャは、Vulkan上でプリフィルスケーリングが不十分で、16Kで速度の80%を失い、65Kでクラッシュした。

開発者がVRAMや計算リソースを無駄にすることなく、長文脈エージェントタスク向けにローカルモデルの選択と構成を最適化できるようになります。

SOURCES

8. oMLXの最適化により、Apple SiliconでのDeepSeek V4推論が大幅に高速化

SSDストリーミングやベースラインベンチマークを介したApple Silicon上でのDeepSeek V4実行に関する以前の報告に続き、パフォーマンスを大幅に向上させるoMLX最適化がリリースされました。ネイティブのDeepSeekアフィンMoEカーネルと8ビットアフィンMetalカーネルインスタンス化を実装することで、パッチはMac Studio M3 Ultra上でプリフィル(533 tok/s)の1.6倍の高速化と、デコード(最大22 tok/s)の3倍の高速化を達成しました。

  • 新しいoMLXパッチにより、ネイティブのDeepSeekアフィンMoEカーネルと8ビットアフィンMetalカーネルインスタンス化が可能になった。
  • Mac Studio M3 Ultraでのパフォーマンスは、プリフィルで533 tok/s、デコードで最大22 tok/sに向上した。
  • これらの最適化は、SSDストリーミングなど、Apple Silicon上でDeepSeek V4を実行するための既存の手法に基づいている。
  • 著者は現在、精度とのトレードオフの可能性についてコミュニティからのフィードバックを求めている。

これらの最適化は、巨大なMoEモデルをローカルで実行する開発者にとって、以前報告されたベースライン能力を超える大きなパフォーマンス向上をもたらします。

SOURCES

9. ByteDanceとAlibaba、中国での新しい規制遵守のためカスタムAIエージェントを無効化

ByteDanceとAlibabaは、中国国内のそれぞれのプラットフォーム「豆包(Doubao)」と「通義千問(Qwen)」において、カスタムAIエージェント機能を無効化しています。この動きは、7月15日に施行される「人工知能擬人化インタラクションサービス管理暫定措置」への直接的な対応です。この規制は、人間の人格をシミュレートしたり、持続的な感情的交流を促進したりするAIシステムを対象としていますが、職場のアシスタントやカスタマーサービスボットは免除されています。

  • ByteDanceの「豆包」とAlibabaの「通義千問」が、今後の規制に対応してカスタムAIエージェント機能を無効化している。
  • 「人工知能擬人化インタラクションサービス管理暫定措置」が7月15日に施行される。
  • 規制は、持続的な感情的交流のために人間の人格、思考パターン、コミュニケーションスタイルをシミュレートするAIサービスを対象としている。
  • この規則は、過激な思想、プライバシー漏洩、メンタルヘルスへの悪影響、AI依存症などのリスクを軽減することを目的としている。
  • カスタマーサービスボット、職場のアシスタント、科学研究ツールは、持続的な感情的交流を避ける限り、規則の対象外となる。

中国で会話型または感情的なAIエージェントを展開する開発者は、厳格な新しいコンプライアンス規則に適応しなければ、サービス停止のリスクに直面します。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。