Inference Brew

PrismMLがQwen3.8ベースのTernary Bonsai 2でBonsai 27Bラインを更新

00:00 / --:--

← ホームへ戻る

PrismMLがQwen3.8ベースのTernary Bonsai 2でBonsai 27Bラインを更新

1. PrismMLがQwen3.8ベースのTernary Bonsai 2でBonsai 27Bラインを更新

PrismMLは、オリジナルのBonsai 27Bのリリースを基盤として、Ternary Bonsai 2 27Bを立ち上げました。このイテレーションでは、基盤となるアーキテクチャをQwen3.8にアップグレードしつつ、5.9GBという非常に圧縮されたフットプリントを維持しています。このモデルは262Kトークンのコンテキストウィンドウをサポートし、CUDA、MLX、WebGPUを介したローカル実行を可能にします。これは、高性能かつ低フットプリントなローカル推論という同社の注力分野を継続するものです。

  • • Ternary Bonsai 2 27Bは、以前のQwen3.6ベースのリリースからアップグレードされたQwen3.8 27Bアーキテクチャに基づいています。
  • • このモデルは、三値重み(ternary weights)とFP16のグループ単位スケーリングを使用することで、5.9GBのフットプリントを維持しています。
  • • フル精度モデルのベンチマーク性能の98.2%を維持しています。
  • • 262Kトークンのコンテキストウィンドウをサポートし、Apache 2.0ライセンスでリリースされています。
  • • NVIDIA GeForce RTX 5090で143トークン/秒、Apple M5 Maxで46.8トークン/秒の性能に達します。

開発者は、オリジナルのBonsai 27Bのローカルファーストかつ低フットプリントという利点を維持しつつ、アーキテクチャが改善された最新の27Bクラスモデルを利用できるようになりました。

2. IFMが拡散モデルで拡張されたLLM「K2-Horizon-7B」をリリース

K2-Horizon-7Bは、従来の因果的自己回帰重みと拡散アダプターを組み合わせることで、標準的な生成のボトルネックを回避します。このハイブリッドアーキテクチャは、リアルタイムのテキスト生成を必要とする高スループットかつ低レイテンシなアプリケーションにとって、有望な道筋を提供します。

  • • K2-Horizon-7Bは、IFMによってリリースされた拡散モデルで拡張された大規模言語モデルです。
  • • 損失のない速度向上を謳い、最大5,200トークン/秒の速度を実現します。
  • • 自己回帰重みと併用するプラグアンドプレイの拡散アダプターと、因果的LLMアーキテクチャを組み合わせています。
  • • 基盤となる研究は、新しく公開されたarXiv論文に文書化されています。

開発者は、標準的な自己回帰重みとプラグアンドプレイの拡散アダプターを併用することで、品質を損なうことなく大幅な推論速度の向上を実現できます。

SOURCES

3. World Labsが3D生成モデル「Atlas」を一般公開

今月初めに発表された早期アクセスプログラムを基盤として、World LabsはAtlasモデルのフルリリースに移行しました。1枚の写真からナビゲート可能な3D環境に変換するこのモデルは、シミュレーション、ゲーム、ロボット工学のトレーニングなど、より幅広い用途で利用可能となり、初期の限定的なパートナーグループを超えてアクセスが拡大されました。

  • • World LabsはAtlasを早期アクセスから一般公開へと移行しました。
  • • このモデルは、1枚の写真からナビゲート可能な3D世界への変換を可能にします。
  • • 今回のリリースにより、シミュレーション、ゲーム、ロボット工学のトレーニングアプリケーションでの幅広い採用をサポートします。

開発者は、限定的なテストフェーズから一般公開へと移行したAtlasを、2D画像からインタラクティブな3D空間を生成するための本番パイプラインに統合できるようになりました。

SOURCES

4. Cactusが「Needle 3」をリリース、エッジ自動化機能を拡張

オリジナルのCactus Needleとエージェントに焦点を当てたNeedle 2のリリースに続き、CactusはNeedle 3を導入しました。この121Mパラメータモデルは、密な層をMonarch Hadamard MLPに置き換え、「インテリジェンスラダー」アーキテクチャを導入することでシリーズを進化させており、開発者はリソースの制約に応じて2層から20層の間でデプロイ可能です。ローカル実行への注力を維持しつつ、プレーンなCPUや、最小8MBというフットプリントのエッジデバイス向けに最適化されています。

  • • Needle 3は、Monarch Hadamard MLPを使用した121Mパラメータのアーキテクチャを特徴としています。
  • • 2層から20層まで独立してデプロイ可能な「インテリジェンスラダー」をサポートしています。
  • • 重みは2.125ビットに量子化されており、8MBから29MBのフットプリントを実現しています。
  • • macOS、Linux、Windows、Android、iOS、WebAssemblyのCPU上でのローカル実行に最適化されています。
  • • Hugging Face、GitHub、PyPIで「cactus-needle」パッケージとして現在利用可能です。

Needle 3は、制約のあるハードウェア上で自動化タスクを柔軟にデプロイできる、よりスケーラブルでスライス可能なアーキテクチャを提供することで、Cactus Needleラインを拡張します。

SOURCES

5. AnthropicがClaude Codeプロジェクトをアップグレード、永続的な並列クラウドセッションに対応

Anthropicは、プロジェクトを再設計して並列かつ永続的なクラウドベースの実行を可能にすることで、Claude Codeプラットフォームを進化させました。ローカルターミナルセッションに依存していた以前のセッション間メッセージングとは異なり、このベータアップデートでは、Claudeがクラウド内で永続するバックグラウンドスレッド全体で複雑なワークフローを調整できるようになります。Claudeは現在、中央調整役として機能し、これらのスレッドにタスクを委任します。スレッドはプロジェクト全体のコンテキストを継承し、ユーザーのローカルマシンがオフラインのときでも実行を継続します。

  • • Claude Codeプロジェクトは、並列かつ永続的なクラウドセッションをサポートするようになりました。
  • • Claudeは調整役として機能し、クラウド内で独立して動作するスレッドにタスクを委任します。
  • • 以前のローカルのみのセッション間メッセージングとは異なり、ユーザーがノートPCを閉じてもスレッドは永続します。
  • • 各スレッドは、リポジトリや指示を含むプロジェクト全体のコンテキストを継承します。
  • • この機能は現在、一部のClaude ProおよびMaxサブスクライバー向けにベータ版として提供されています。

このアップデートにより、Claude Codeはローカルファーストの調整からクラウドネイティブな永続的実行へと移行し、開発者はローカルマシンの稼働時間を維持することなく、マルチパートのタスクをバックグラウンドスレッドに委任できるようになります。

SOURCES

6. Cloudflareがコーディングエージェント向けセキュリティ監査スキルをオープンソース化

Cloudflareの内部脆弱性発見ハーネスから生まれたこのスキルは、architecture.mdやfindings.jsonのような構造化ファイルを使用して監査を管理します。テスト実行の結果、1回の実行で脆弱性の約半分が特定されますが、複数回実行することで補完され、堅牢な自動防御を提供することが示されています。

  • • セキュリティ監査スキルは、偵察から報告まで6つのフェーズを通じて分離されたエージェントを調整します。
  • • MITライセンスでリリースされており、Skills CLIを介してインストールされます。
  • • このスキルには、ツール使用機能、Node.js、OSで強制されるサンドボックスを備えたコーディングエージェントが必要です。
  • • 必要なサンドボックスは、外部ネットワークを無効にし、サニタイズされた環境を使用し、リソース制限を強制する必要があります。
  • • このシステムは敵対的検証を採用しており、発見エージェントと検証エージェントが異なることを保証します。

開発者は、サンドボックス化された敵対的AIエージェントを使用して、自動化された多段階のセキュリティ監査を開発パイプラインに統合できます。

SOURCES

7. Agent SubstrateがGKEに高密度サンドボックスランタイムをもたらす

Agent Substrateは、LLMが生成したコードを大規模に実行する際のインフラストラクチャの課題に対処します。ネイティブなゼロトラスト分離を備えた高密度サンドボックスを提供することで、開発者はパフォーマンスを犠牲にしたり、高いインフラストラクチャオーバーヘッドを発生させたりすることなく、エージェントワークフロー内で信頼できないコードを安全に実行できます。

  • • Agent Substrateは、GKE向けに最適化された、デフォルトで安全なオープンソースのエージェント実行ランタイムです。
  • • このランタイムは、標準的なコンテナランタイムの10倍の密度で数百万のサンドボックスをサポートします。
  • • 1秒あたり500回以上のサスペンド/レジュームアクティベーションのレートで、500ms未満の再開操作を提供します。
  • • ネイティブなゼロトラストカーネルとネットワーク分離を特徴としています。
  • • あらゆるKubernetesインフラストラクチャと互換性があります。

開発者は、標準的なコンテナランタイムの10倍の密度と500ms未満の再開時間で、数百万の分離されたエージェントサンドボックスを実行できます。

SOURCES

8. 研究がAIの電子透かしによるサンプリングドリフトと安全性のリスクを警告

この調査結果は、規制遵守の予期せぬ副作用を浮き彫りにしています。電子透かしプロセスはトークンの確率分布を変化させるため、意図せず安全ガードレールを弱め、ツール呼び出しの動作を混乱させる可能性があり、開発者はプロンプト防御を再評価する必要があります。

  • • Anthropicは、EU法を遵守するために、将来のClaudeモデルでGoogleのSynthID-Text電子透かしを実装すると発表しました。
  • • SynthID-Textは秘密鍵を使用して次の単語の選択に影響を与え、AI生成コンテンツを識別します。
  • • 研究によると、電子透かしは「サンプリングドリフト」を引き起こし、モデルが安全ガードレールやツール呼び出しを処理する方法を変化させることが示されています。
  • • この研究では、特にプロンプトインジェクションと組み合わせた場合、電子透かしがモデル有害なリクエストを満たす可能性を高める可能性があることがわかりました。
  • • この研究は、SynthID-TextのHugging Face実装を使用して、6つのオープンウェイトモデルで実施されました。

将来のClaudeモデルを統合する開発者は、アクティブな電子透かしによって導入される動作の変化と安全性のリスクを考慮し、厳格なレッドチームテストを実施する必要があります。

SOURCES

9. Histerプライベート検索エンジンがMCPと統合

Histerは完全にローカルで実行され、バイナリダウンロード、Homebrew、Docker、またはNixを介してインストールできます。MCPサーバーを通じてフルテキストインデックスを公開することで、ローカルのコーディングアシスタントやエージェントにとって強力でプライバシーを保護するコンテキストプロバイダーとして機能します。

  • • Histerは、訪問したWebページやローカルファイルをインデックス化するように設計されたプライベート検索エンジンです。
  • • ユーザーは、Webインターフェース、ターミナル、またはMCPを通じて接続されたAIアシスタントを介してインデックス化された情報にアクセスできます。
  • • このソフトウェアはAGPLv3ライセンスであり、デフォルトでテレメトリや必須のクラウドサービスはありません。
  • • FirefoxまたはChrome拡張機能を介した自動ブラウザインデックス化をサポートしています。
  • • オプションのセマンティック検索は、ユーザーが構成した埋め込みエンドポイントを通じてサポートされます。

開発者は、標準化されたModel Context Protocol接続を使用して、ローカルAIエージェントにブラウジング履歴やローカルファイルへの安全でプライベートなアクセスを提供できます。

SOURCES

10. Jevがインデックス付きアクションスペースを備えた超高速ブラウザエージェントをオープンソース化

特定の操作セット(CLICK、TYPE_TEXT、SCROLLなど)と推論的なファンアウトアーキテクチャを利用することで、Jevはネットワークのラウンドトリップを最小限に抑えます。現在、シャドウルート、フレーム、キャンバス、ファイルアップロードはサポートしていませんが、一般的なHTMLおよびARIAコントロールの相互作用に対して非常に効率的なベースラインを提供します。

  • • JevはGitHubで利用可能なオープンソースのブラウザエージェントです。
  • • このエージェントは、スクリーンショットに頼るのではなく、ブラウザから構造化された状態を消費することで動作します。
  • • 操作ヘッドとターゲットヘッドが同じ観測状態を共有する推論的なファンアウトアプローチを採用しています。
  • • OpenRouter、Gemini、GLM、DeepSeekからのOpenAI互換テキストモデルをサポートしています。
  • • 内部テストでは、Google Flightsの検索タスクが中央値7.092秒で完了しました。

開発者は、高価な視覚的入力の代わりに構造化されたHTML/ARIA状態を消費する、より高速で低レイテンシなWeb自動化エージェントを構築できます。

SOURCES

11. ケーススタディ:Gemini APIを置き換えるためのGLiNERの9ドルでのファインチューニング

この実践的なケーススタディは、非常に再現性の高いコスト削減パターンを示しています。高価なAPIからのバルク推論を、高度に専門化されたローカルのGLiNERモデルにオフロードすることで、開発者はRedditの議論を追跡するプロジェクト「New Knife Day」を強化するための費用対効果の高いパイプラインを構築しました。

  • • Gemini 3.1 Proを使用して、4,290件のRedditコメントを9ドルのコストで固有表現抽出用にラベル付けしました。
  • • GLiNER large v2.5モデルを、Modal上のTesla T4 GPUを使用してラベル付きデータでファインチューニングしました。
  • • GPUのトレーニングコストは、10回の実行で合計約2.50ドルでした。
  • • ファインチューニングされたモデルは、検証セットにおいてGeminiのラベルに対して0.83のF1スコアを達成しました。
  • • グローバルなカットオフの代わりにクラスごとのしきい値を実装することで、マテリアルの再現率が0.911に向上しました。

開発者は、フロンティアLLMを使用してトレーニングデータをラベル付けし、タスク固有の小さなローカルモデルをファインチューニングすることで、運用コストを劇的に削減できます。

SOURCES

12. パターン:LLM分類を特徴量エンジニアリングとして扱う

直接的なLLM分類には、動作しきい値を調整する必要がある本番システムに必要な柔軟性が欠けています。LLMの出力を他の決定論的な共変量と並ぶ特徴量として扱うことで、開発者は従来の機械学習アルゴリズムを活用して優れたキャリブレーションを達成し、精度と再現率のトレードオフを簡単に調整できます。

  • • 分類器として直接使用されるLLMは、キャリブレーションとしきい値制御に苦労することがよくあります。
  • • 提案されたフレームワークは、LLMの判定を入力特徴量としてロジスティック回帰モデルに扱います。
  • • このアプローチにより、より優れたキャリブレーションと追加の共変量の組み込みが可能になります。
  • • SemEval 2018データセットでテストしたところ、初期のワンショットLLM分類器は0.747のスコアを達成し、コンペティションの勝者を上回りました。
  • • 基盤となる分類器アーキテクチャは、XGBoostやニューラルネットワークなどのアルゴリズムに置き換えることができます。

開発者は、LLMの出力と従来の機械学習を組み合わせることで、精度と再現率のしきい値を正確に制御できる、高度にキャリブレーションされた分類器を構築できます。

SOURCES

13. MicrosoftがKubernetes GPUワークロード向けにTauGridをオープンソース化

TauGridは、高価なGPUリソースを管理するための統合されたセルフホスト型コントロールプレーンを提供します。Azure Data Explorerのような一部の可観測性統合は現在Azure固有ですが、コアプラットフォームは標準的なKubernetesインフラストラクチャ上で実行され、開発者に独自のオーケストレーションツールに代わる堅牢な選択肢を提供します。

  • • MicrosoftはTauGridをMITライセンスでオープンソース化しました。
  • • TauGridは、Tau CLI、キューイング用のKueue、オーケストレーション用のKubeRay、GPUヘルス監視、可観測性をバンドルしています。
  • • このプラットフォームには、GPUノードを備えたKubernetes 1.30+クラスターとHelm 3.0以降が必要です。
  • • 再現性のために構成、ログ、メトリック、チェックポイントをキャプチャするEvidenceレコードを利用します。
  • • このソフトウェアは、デフォルトでMicrosoftにテレメトリを送信しません。

開発者は、デフォルトのテレメトリなしで、独自のKubernetesクラスター上にセルフホスト型の再現可能なAIトレーニングおよび推論スタックをデプロイできます。

SOURCES

14. Grok Buildがコンテキスト保持のための永続メモリを追加

2026年6月のGrok Build APIのベータ版リリースに続き、xAIは永続メモリを備えたプラットフォームを更新しました。この機能により、AIはプロジェクトの事実、コーディングの慣習、決定事項をセッション間で保持できるようになり、繰り返しプロンプトを入力する必要性が減り、一貫した出力を保証します。

  • • Grok Buildは、既存のAPIプラットフォームに永続メモリを追加しました。
  • • この機能は、プロジェクトの事実、慣習、決定事項を保存します。
  • • 初期ベータ版と比較して、一貫性が向上し、繰り返しプロンプトを入力する必要が減ります。

開発者は、初期ベータ版で確立されたエージェント的コーディングワークフローの効率を向上させ、複数のセッションにわたってプロジェクトのコンテキストとコーディング基準を維持できるようになりました。

SOURCES

15. GoogleがGeminiプラットフォームでのエージェント異常検知をプレビュー

AIエージェントがより自律的になるにつれて、その実行を監視することが重要になります。Googleの新しいツールは、エンタープライズ開発者にエージェントのトレースとログを分析するための組み込みメカニズムを提供し、プロンプトインジェクション、無限ループ、または不正なアクションが害を及ぼす前に特定するのに役立ちます。

  • • エージェント異常検知は、Gemini Enterprise Agent Platformのプライベートプレビューで利用可能になりました。
  • • このツールは、AIエージェントの動作を監視して異常を検出します。
  • • ログとトレースを利用して、エージェントプラットフォーム内の疑わしいアクティビティにフラグを立てます。

開発者は、ログとトレースをリアルタイムで監視することで、予期しない、または悪意のあるAIエージェントのアクションを自動的に検出し、軽減できます。

SOURCES

16. Nunchux AIがビデオDiT向けにVC-Attentionカーネルをリリース

Nunchux AIの新しいカーネルは、スパースアテンション、蒸留、マルチGPU実行と互換性があります。値の量子化とソフトマックスステージを最適化することで、VC-Attentionはモデルの再トレーニングを必要とせずに、ビデオ生成パイプラインにドロップインの速度向上を提供します。

  • • VC-Attentionは、ビデオDiffusion Transformer(DiT)向けに設計された、トレーニング不要の低ビットアテンションカーネルです。
  • • このカーネルは、ビデオ生成における値の量子化エラーと遅いソフトマックスステージに対処します。
  • • V-Smoothコンポーネントは値トークンをクラスター化し、ブロック平均を減算した後の残差のみを量子化します。
  • • ExpCast-FP8は、標準のFP32指数およびキャスト操作を単一の積和演算に置き換えます。
  • • NVIDIA B200上で、VC-AttentionはSageAttention2よりも6.02倍高速に動作します。

ビデオ生成機能を構築する開発者は、推論レイテンシを大幅に削減し、最新のGPU上のソフトマックスのボトルネックを回避できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。