Inference Brew

AnthropicがSlack用AIエージェント「Claude Tag」を発表

00:00 / --:--

← ホームへ戻る

AnthropicがSlack用AIエージェント「Claude Tag」を発表

1. AnthropicがSlack用AIエージェント「Claude Tag」を発表

Anthropicは、Claude EnterpriseおよびTeam顧客向けに「Claude Tag」のベータ版を導入し、既存の「Claude in Slack」アプリを置き換えます。Claude Opus 4.8モデルを搭載したこのエージェントは、チャンネルの文脈を読み取り、スレッドに参加し、非同期でタスクを実行する自律的なチームメイトとして機能するように設計されています。管理者は、Claude Tagのアクセス範囲を特定のチャンネルに限定したり、トークン使用制限を設定したり、実行されたすべてのアクションの詳細なログを確認したりできます。Anthropicによると、同社の製品チームはすでに内部バージョンのツールを使用してコードの65%を生成しているとのことです。対象となる組織には、サービスをテストするための導入用クレジットが提供されています。

  • AnthropicはClaude EnterpriseおよびTeam顧客向けにClaude Tagのベータ版をリリースし、既存のClaude in Slackアプリを置き換えます。
  • このエージェントはClaude Opus 4.8モデルを搭載し、Slackチャンネル内で常駐するチームメイトとして機能します。
  • 主な機能には、マルチプレイヤー対話、長期記憶、プロアクティブな環境監視、非同期タスク実行が含まれます。
  • 管理者はClaudeのアクセス範囲を特定のチャンネルに制限し、トークン使用制限を設定し、詳細なアクティビティログを確認できます。
  • Anthropicは、自社の製品チームのコードの65%が現在、内部バージョンのClaude Tagによって生成されていると報告しています。

開発者は、Slackチャンネルに直接、自律的なAIチームメイトを常駐させ、タスクの実行、文脈の学習、コードの記述を行わせることができます。

2. 推論モデル「VibeThinker-3B」が主要なフロンティアモデルに匹敵する性能を達成

VibeThinker-3Bは、小規模言語モデルにおける検証可能な推論を調査するために開発された、30億パラメータの密なモデルです。「Spectrum-to-Signal」ポストトレーニングパラダイム(カリキュラムベースのSFT、マルチドメインRL、オフライン自己蒸留で構成)を使用して学習されたこのモデルは、AIME26で94.3のスコアを達成し、クレームレベルのテスト時スケーリングにより97.1まで向上しました。また、LiveCodeBench v6で80.2のPass@1スコアを記録し、最近の未公開LeetCodeコンテストでは96.1%の合格率を達成しました。VibeThinker-3Bは、高い指示追従性を維持しながら、推論タスクにおいてDeepSeek V3.2、GLM-5、Gemini 3 Proといった大型のフラッグシップモデルと同等以上の性能を発揮します。

  • VibeThinker-3Bは、新しいSpectrum-to-Signalポストトレーニングパラダイム(SFT + GRPO)を使用して学習された30億パラメータの密なモデルです。
  • このモデルはAIME26で94.3のスコアを達成し(テスト時スケーリングで97.1に向上)、LiveCodeBench v6で80.2のPass@1を記録しました。
  • 推論タスクにおいて、DeepSeek V3.2、GLM-5、Gemini 3 Proなどの大型フラッグシップモデルと同等以上の性能を発揮します。
  • このモデルは高い指示追従性を維持しており、IFEvalベンチマークで93.4をスコアしました。

開発者は、コーディングや数学のベンチマークで高い推論性能を発揮する、コンパクトな30億パラメータのモデルを活用できます。

SOURCES

3. Mistral AIが多言語ドキュメントモデル「Mistral OCR 4」をリリース

Mistral AIは、テキスト、バウンディングボックス、ブロック分類、インライン信頼度スコアを抽出するドキュメント理解モデル「Mistral OCR 4」を立ち上げました。10の言語グループにわたる170言語をサポートしており、エンタープライズ検索、RAG、ドメイン固有の検索パイプラインに最適化されています。厳格なデータコンプライアンス要件を満たすため、セルフホスト環境向けに単一コンテナでデプロイ可能です。Mistral OCR 4はMistral Search Toolkitに統合されており、Mistral Studio、Amazon SageMaker、Microsoft Foundryを通じて利用可能で、Snowflakeのサポートも近日予定されています。

  • Mistral AIは、10の言語グループにわたる170言語をサポートするドキュメント理解モデル「Mistral OCR 4」をリリースしました。
  • このモデルは、抽出されたテキスト、バウンディングボックス、ブロック分類、インライン信頼度スコアを提供します。
  • API料金は1,000ページあたり4ドルに設定されており、Batch-API利用の場合は1,000ページあたり2ドルの割引料金が適用されます。
  • データコンプライアンス要件を満たすため、セルフホスト環境向けに単一コンテナでデプロイ可能です。
  • Mistral Studio、Amazon SageMaker、Microsoft Foundryを通じて利用可能で、Snowflake Parse Documentのサポートも近日予定されています。

開発者は、APIまたはセルフホストコンテナを通じて、高度な多言語ドキュメント理解モデルをRAGや検索パイプラインに統合できます。

SOURCES

4. Kreaがオープンウェイト画像モデル「Krea 2 Raw」および「Turbo」をリリース

Kreaは、Krea 2 AI画像モデルファミリーをHugging Faceで公開し、「Krea 2 Raw」と「Krea 2 Turbo」の2つのバージョンを提供しています。120億パラメータのDiffusion Transformerアーキテクチャに基づいて構築されたKrea 2 Rawは、構造的な学習やファインチューニング用に設計された蒸留されていないベースモデルであり、Krea 2 Turboは高速生成用に最適化された蒸留バリアントで、2秒という生成速度を実現しています。Krea 2コミュニティライセンスにより、個人および最大50席までの小規模企業は無料で商用利用が可能です。すべてのユーザーは、違法または有害な素材の生成を防ぐための技術的保護措置を実装することが契約上義務付けられています。

  • Kreaは、Hugging Faceからダウンロード可能なオープンウェイトモデルとしてKrea 2 RawおよびKrea 2 Turboをリリースしました。
  • Krea 2 Turboは2秒の生成速度を特徴としており、利用可能な画像生成モデルの中で最も高速なものの一つです。
  • これらのモデルは120億パラメータのDiffusion Transformerアーキテクチャに基づいて構築されています。
  • Krea 2コミュニティライセンスにより、個人および最大50席までの企業は無料で商用利用が可能です。
  • ユーザーは、違法または有害な素材の生成を防ぐための技術的保護措置を実装することが契約上義務付けられています。

開発者は、小規模チーム向けの無料商用利用を許可するライセンスの下で、高速な120億パラメータの画像生成モデルをセルフホストできます。

SOURCES

5. マルチタスクコンピュータビジョンモデルファミリー「YOLO26」がリリース

エンドツーエンドのマルチタスクコンピュータビジョンモデルファミリー「YOLO26」がリリースされました。物体検出、インスタンスセグメンテーション、姿勢推定、指向性物体検出、画像分類をサポートし、NanoからExtra Largeまでの5つのサイズバリエーションを展開しています。YOLO26は、レイテンシを低減するために非最大値抑制(NMS)を削除し、エッジや低電力ハードウェアとの互換性を向上させるためにDistribution Focal Loss(DFL)モジュールを削除しました。YOLO26-Nバリアントは、YOLO11-Nと比較して最大43%高速なCPU推論を実現し、TFLite、CoreML、OpenVINO、TensorRT、ONNXを含む複数のエクスポート形式をサポートしています。

  • YOLO26は、物体検出、セグメンテーション、姿勢推定、分類をサポートするエンドツーエンドのマルチタスクコンピュータビジョンモデルファミリーです。
  • アーキテクチャから非最大値抑制(NMS)とDistribution Focal Loss(DFL)を削除し、レイテンシの低減とエッジハードウェアとの互換性向上を図っています。
  • YOLO26-Nバリアントは、YOLO11-Nモデルと比較して最大43%高速なCPU推論を実現します。
  • TFLite、CoreML、OpenVINO、TensorRT、ONNXを含む複数のエクスポート形式をサポートしています。
  • パフォーマンスベンチマークでは、COCOデータセットで40.9〜57.5 mAP、T4レイテンシで1.7〜11.8 msを報告しています。

開発者は、レイテンシを大幅に低減した、高度に最適化されたマルチタスクコンピュータビジョンモデルをエッジや低電力ハードウェアにデプロイできます。

SOURCES

6. Alibabaが動画生成モデル「HappyHorse 1.1」をリリース

Alibabaは、エンタープライズソフトウェア統合向けに設計されたAI動画生成モデル「HappyHorse 1.1」を立ち上げました。Alibaba Cloud Model Studioで利用可能なこのモデルは、テキストから動画、画像から動画、被写体から動画への生成、および動画編集をサポートしています。アイデア出しからポストプロダクションまでの商用動画制作ワークフローをサポートすることを目的としています。リリースを記念して、Alibabaは提供開始から最初の2週間、サイト全体で40%のローンチ割引を提供しています。

  • Alibabaは、API経由でのエンタープライズソフトウェア統合向けに設計されたAI動画生成モデル「HappyHorse 1.1」をリリースしました。
  • このモデルはAlibaba Cloud Model Studioで利用可能で、テキストから動画、画像から動画、被写体から動画への生成、および動画編集をサポートしています。
  • Alibabaは、提供開始から最初の2週間、サイト全体で40%のローンチ割引を提供しています。
  • このモデルは、アイデア出しからポストプロダクションまでの商用動画制作ワークフローをサポートするように最適化されています。

開発者は、期間限定の40%割引を利用して、新しいエンタープライズグレードの動画生成モデルをAPI経由でアプリケーションに統合できます。

SOURCES

7. マルチモーダルストリーム調整用モデル「DataClaw0 9B」がリリース

生のマルチモーダルデータストリームのエージェント的な調整用に設計された9Bモデル「DataClaw0」がリリースされました。このモデルは5つの異なるドメインで動作するように構築されており、ビデオ、GUI、具現化されたデータソースからノイズをフィルタリングします。事実に基づくアンカーと意味論的合成を使用して、生の信号を密な監視データへと再構成します。DataClaw0の学習プロセスでは、教師ありファインチューニング(SFT)とグループ相対ポリシー最適化(GRPO)が利用されました。リリースには、パフォーマンスを評価するための付随するベンチマークも含まれています。

  • DataClaw0は、5つのドメインにわたる生のマルチモーダルデータストリームのエージェント的な調整用に設計された新しい9Bモデルです。
  • このモデルはビデオ、GUI、具現化されたデータソースからノイズをフィルタリングし、事実に基づくアンカーと意味論的合成を使用して信号を再構成します。
  • 学習プロセスでは、教師ありファインチューニング(SFT)とグループ相対ポリシー最適化(GRPO)が利用されました。
  • リリースには、パフォーマンスを評価するための付随するベンチマークが含まれています。

ビデオ、GUI、または具現化されたデータストリームを処理する開発者は、専門化された9Bモデルを使用してノイズをフィルタリングし、信号を構造化データに再構成できます。

SOURCES

8. 長期間ドキュメント解析用「Unlimited-OCR」がリリース

Unlimited-OCRは、Deepseek-OCRのオープンソースの進歩としてリリースされ、付随する研究論文がarXivで公開されました。このモデルはModelScopeおよびHugging Faceで利用可能で、NVIDIA GPU上のHugging Face transformersを使用したローカル推論、およびSGLangサーバー経由での推論をサポートしています。Unlimited-OCRは、640画像サイズの「gundam」と1024画像サイズの「base」という2つの画像構成を提供します。開発者は、Deepseek-OCR、Deepseek-OCR-2、およびPaddleOCRのアーキテクチャの影響を認めています。

  • Unlimited-OCRはDeepseek-OCRのオープンソースの進歩としてリリースされ、研究論文がarXivで公開されました。
  • このモデルはModelScopeおよびHugging Faceで利用可能で、transformersおよびSGLangサーバー経由での推論をサポートしています。
  • 640画像サイズの「gundam」と1024画像サイズの「base」という2つの画像構成を提供します。
  • このプロジェクトは、Deepseek-OCR、Deepseek-OCR-2、およびPaddleOCRの影響を基盤としており、それを認めています。

開発者は、新しいオープンソースの長期間ドキュメント解析モデルを、NVIDIA GPU上でローカルに、またはSGLang経由で実行できます。

SOURCES

9. Ai2が推論デコードを備えたターミナルエージェントLLM「Tmax」をリリース

Ai2は、Qwen3.6をベースにDPPO強化学習で学習されたターミナルエージェントLLMファミリー「Tmax」をリリースしました。Tmax-27Bモデルは、Terminal Bench 2.0で約43%、TB Liteで69%を達成しています。27Bモデルには、2〜5ビット/重みの重要度行列でキャリブレーションされたGGUF量子化が利用可能です。重要な点として、各量子化には、組み込みの推論デコードをサポートするためにQ8_0でグラフトされたMTPドラフトヘッドが含まれています。10個の保持されたSWE-rebenchインスタンスでのエージェントテストでは、異なる量子化レベルで50%〜70%の合格率が示され、モデルはOllamaまたはllama.cpp経由でアクセス可能です。

  • Ai2は、Qwen3.6をベースにDPPO強化学習で学習されたターミナルエージェントLLMファミリー「Tmax」をリリースしました。
  • Tmax-27Bモデルは、Terminal Bench 2.0で43%、TB Liteで69%を達成しています。
  • 2〜5ビット/重みのGGUF量子化が利用可能で、それぞれが推論デコード用にQ8_0でグラフトされたMTPドラフトヘッドを備えています。
  • SWE-rebenchインスタンスでのエージェントテストでは、異なる量子化レベルで50%〜70%の合格率が示されました。
  • モデルはOllamaまたはllama.cpp経由でローカルにアクセス可能です。

開発者は、専門化されたターミナルエージェントモデルを小型GPU上でローカルに実行し、組み込みの推論デコードを利用して実行速度を向上させることができます。

SOURCES

10. Pioneerがコーディングタスク用モデルルーターをリリース

Pioneerは、コーディングタスク専用に設計されたモデルルーターをリリースしました。このツールは推論リクエストを監視し、タスクの複雑さをリアルタイムで分析して開発者のワークフローを最適化します。適切な場合に、より軽量なモデルオプションを自動的に提案することで、開発者が実行速度を向上させ、APIコストを削減し、タスクの精度を維持するのを支援します。

  • Pioneerは、コーディングワークフローを最適化するために特別に設計されたモデルルーターをリリースしました。
  • このツールは推論リクエストを監視し、タスクの複雑さをリアルタイムで分析します。
  • 実行速度を向上させ、コストを削減し、精度を維持するために、より軽量なモデルオプションを自動的に提案します。

開発者は、タスクの複雑さに基づいて、最も費用対効果が高く高速なモデルにコーディングタスクを自動的にルーティングできます。

SOURCES

11. Claude Codeが「Extended Thinking」の推論出力を暗号化

Anthropicは、Claude Codeにおける「Extended Thinking」推論プロセスの暗号化を実装しました。暗号化キーはAnthropicが保持するため、生の推論データがユーザーのローカルマシンに送信されることはありません。代わりに、標準のClaude Code APIが推論の要約を提供します。暗号化されていない完全な思考出力へのアクセスは、有効なエンタープライズ契約を持つユーザーに制限されています。

  • Claude Codeの「Extended Thinking」推論プロセスは暗号化されており、キーはAnthropicが保持しています。
  • 推論データはユーザーのローカルマシンに送信されず、Claude Code APIが推論の要約を提供します。
  • 暗号化されていない完全な思考出力へのアクセスは、有効なエンタープライズ契約を持つユーザーに制限されています。

Claude Codeを使用する開発者は、完全な「Extended Thinking」の推論ステップが暗号化され、エンタープライズ契約に制限されていること、および標準API経由では要約のみが利用可能であることを知っておく必要があります。

SOURCES

12. Hugging Faceストレージが大規模ロボティクスおよびビデオAIデータに活用

Hugging Faceは、ロボティクスおよびビデオAIアプリケーションにおける大規模な追記型データセットのストレージバックエンドとしてますます利用されています。Hugging Faceでホストされている公開ロボティクスデータセットの数は、2025年初頭の1,000から現在は60,000に増加しており、プラットフォーム上にはその2倍のプライベートデータセットがホストされています。140 MB/sで記録する単一のロボットのような高帯域幅要件をサポートするため、事前ウォームアップされたキャッシュを使用してHugging Face Hubから直接ストリーミングすることで、GPUは約1,326 MB/sのデータ転送速度を達成できます。LeRobotは、これらのストリーミングワークフローを促進するためにHugging Faceストレージバケットと統合されています。

  • Hugging Faceは、ロボティクスおよびビデオAI用の大規模な追記型データセットをホストするためにますます使用されており、プライベートデータセットは公開データセットの2倍の数に上ります。
  • プラットフォーム上の公開ロボティクスデータセットの数は、2025年初頭の1,000から現在は60,000に増加しました。
  • 事前ウォームアップされたキャッシュを使用してHugging Face Hubから直接ストリーミングすることで、GPUは約1,326 MB/sの転送速度を達成できます。
  • LeRobotは、これらの高速ストリーミングワークフローを促進するためにHugging Faceストレージバケットと直接統合されています。

ビデオやロボティクスのための大規模な追記型データセットを扱う開発者は、高速GPUデータストリーミングのためにHugging Faceストレージバケットを活用できます。

SOURCES

13. Artificial Analysisが「Speech to Speech Index」を立ち上げ

Artificial Analysisは、ネイティブの音声対音声モデルを評価するために設計された新しい合成メトリック「Speech to Speech Index」を導入しました。このインデックスは、音声推論用のBig Bench Audio、会話ダイナミクス用のFull Duplex Bench、エージェントパフォーマンス用の𝜏-Voiceという3つの等しく重み付けされたデータセットに基づいてモデルをスコアリングします。OpenAIのGPT-Realtime-2 (High) が現在77.2%のパフォーマンススコアでインデックスをリードしており、Deepslate Opalが0.44秒のTime to First Audio (TTFA) で最速の速度を記録しました。GoogleのGemini 3.1 Flash Live Preview (Minimal) は、入力音声1時間あたり1.50ドルで、インデックス内で最も低コストのモデルとして特定されました。

  • Artificial Analysisは、3つのデータセットにわたってネイティブ音声対音声モデルの品質を測定するためのSpeech to Speech Indexを立ち上げました。
  • OpenAI GPT-Realtime-2 (High) が77.2%のパフォーマンススコアでインデックスをリードし、xAI Grok Voice Think Fast 1.0が75.7%で続いています。
  • Deepslate Opalは、0.44秒のTime to First Audio (TTFA) でインデックス内の最速速度を記録しました。
  • Google Gemini 3.1 Flash Live Preview (Minimal) は、入力音声1時間あたり1.50ドルで、インデックス内で最も低コストのモデルです。
  • インデックスは、音声推論(Big Bench Audio)、会話ダイナミクス(Full Duplex Bench)、エージェントパフォーマンス(𝜏-Voice)に基づいてモデルを評価します。

リアルタイム音声アプリケーションを構築する開発者は、標準化されたインデックスを使用して、ネイティブ音声対音声モデルの品質、レイテンシ、コストを比較できます。

SOURCES

14. 新しい「Will It Mythos?」ベンチマークスイートがセキュリティバグ検出を評価

ある開発者が、AIモデルが脆弱性を効果的に特定できるかどうかをテストするために設計された、9つの確認されたセキュリティバグを含むベンチマークスイート「Will It Mythos?」を作成しました。ベンチマーク環境は、モデルが過去のコミットデータにアクセスするのを防ぐために、サニタイズされたソースチェックアウトと.gitディレクトリが削除されたコンテナ化されたセットアップを使用しています。テストでは、Qwen 3.6 27Bが高いパフォーマンスを示し、いくつかの大型商用モデルよりも少ない誤検知でより多くのバグを特定しました。MiMoとDeepSeekも、大幅に低価格でOpus 4.8やGPT 5.5のようなフロンティアモデルと競合しましたが、Gemma 4 MoEは頻繁にループ障害を経験しました。

  • AIモデルにおける脆弱性特定をテストするために、9つの確認されたセキュリティバグを含む新しいベンチマークスイートが作成されました。
  • ベンチマーク環境は、過去のコミット漏洩を防ぐために、サニタイズされたソースチェックアウトと.gitディレクトリが削除されたコンテナ化されたセットアップを使用しています。
  • Qwen 3.6 27Bが高いパフォーマンスを示し、いくつかの大型商用モデルよりも少ない誤検知でより多くのバグを特定しました。
  • MiMoとDeepSeekは、大幅に低価格でOpus 4.8やGPT 5.5のようなフロンティアモデルと競合しました。
  • Gemma 4 MoEモデルは4/9の検出率を達成しましたが、テスト中に頻繁にループ障害に悩まされました。

開発者は、新しいコンテナ化されたベンチマークスイートを使用して、さまざまなLLMがコード内のセキュリティ脆弱性をどれだけ効果的に特定できるかを評価できます。

SOURCES

15. ナレッジエージェントが小型LLMを使用してフロンティアモデルの性能に匹敵

AnthropicによるMythosモデルの削除を受けて、より大型のフロンティアAIモデルの性能に匹敵する「ナレッジエージェント」を構築するための新しい手法が開発されました。Qwen 3.6 27Bのような小型モデルに特定の関連知識を注入することで、開発者は高品質な結果を達成できます。この手法には、データ構造化、埋め込み、および専門的なクエリや独自のデータに対してLLMを拡張するための複数の検索パスの実行が含まれます。

  • 新しい手法は、「ナレッジエージェント」がより大型のフロンティアAIモデルの性能に匹敵できることを示しています。
  • このアプローチは、Qwen 3.6 27Bのような小型モデルを、構造化データ、埋め込み、複数の検索パスと組み合わせます。
  • この手法は、より大きく高価なモデルを必要とせずに、専門的なクエリや独自のデータに対してLLMを最適化します。
  • このリリースは、AnthropicがMythosモデルを削除したことに伴うものです。

開発者は、構造化データ、埋め込み、マルチパス検索を使用して、小型モデルがフロンティアモデルの性能に匹敵できるようにする「ナレッジエージェント」を構築できます。

SOURCES

16. CPUのみのTTSベンチマークがオープンウェイトモデルを評価

AIコーディングエージェントNeoによって実行されたエンドツーエンドのベンチマークでは、4コアと15.6GBのRAMを搭載したIntel Xeon CPU上で、3つのオープンウェイトテキスト読み上げ(TTS)モデルを評価しました。テストは5つの構成と6つのテキスト長にわたる150回のタイミング実行で構成され、UTMOSメトリックを使用して音声品質をスコアリングしました。Inflect-Nano-v1は7.3xリアルタイム(RTF 0.1376)で最速の速度を達成しましたが、金属的な音声を生成し、15秒の切り捨てキャップによって制限されました。Supertonic-3 5-stepはRTF 0.3164と4.37の高いMOSを記録しました。Kokoro-82Mはテストされた中で最も遅いモデルでしたが、最も人間らしい音声品質を提供し、そのONNXバージョンはPyTorchよりも高速に動作しました。

  • ベンチマークでは、4コアのIntel Xeon CPU上で3つのオープンウェイトTTSモデル(Kokoro 82M、Supertonic 3、Inflect-Nano-v1)を評価しました。
  • Inflect-Nano-v1は7.3xリアルタイム(RTF 0.1376)で最速でしたが、15秒の切り捨てキャップと金属的な音声によって制限されています。
  • Supertonic-3 5-stepはRTF 0.3164と4.37 MOSの高い音声品質スコアを達成しました。
  • Kokoro-82Mはテストされた中で最も遅いモデルでしたが、最も人間らしい音声品質を提供し、そのONNXバージョンはPyTorchを上回りました。

音声機能を構築する開発者は、速度と音声品質に基づいて、低コストのCPUのみの環境に最適なオープンウェイトTTSモデルを選択できます。

SOURCES

17. Mimo 2.5が高コンテキストローカル推論で競合他社を上回る

Mimo 2.5は、5対1のローカル/グローバルスライディングウィンドウアテンションメカニズムを利用することで、デュアルRTX Pro 6000 GPU上で高コンテキストパフォーマンスを実証しました。対照的に、MiniMax M3とDeepSeek V4は、カスタムカーネルがデータセンターのBlackwellハードウェア用に設計されているため、コンシューマーグレードのGPUでは高コンテキストで大幅なパフォーマンス低下を経験します。DeepSeek V4のパフォーマンスは、操作がCPUにフォールバックすると14トークン/秒に低下しますが、Step 3.7 Flashは178kコンテキストで約40トークン/秒を達成します。プライベートコーディングベンチマークでは、Mimo 2.5はタスクを約4分で完了しましたが、MiniMax M3は40分かかり、Claude 3.5 Sonnetに匹敵する品質レベルで実行されました。

  • Mimo 2.5は、5対1のローカル/グローバルスライディングウィンドウアテンションメカニズムを使用して、デュアルRTX Pro 6000 GPU上で高コンテキストパフォーマンスを維持します。
  • 対照的に、MiniMax M3とDeepSeek V4は、カーネルがデータセンターのBlackwellハードウェア用に最適化されているため、コンシューマーGPUで深刻なパフォーマンス低下を経験します。
  • DeepSeek V4はCPUにフォールバックすると14トークン/秒に低下しますが、Step 3.7 Flashは178kコンテキストで40トークン/秒を達成します。
  • プライベートコーディングベンチマークでは、Mimo 2.5、MiniMax 2.7、MiniMax M3、Step 3.7 FlashはClaude 3.5 Sonnetに匹敵する品質レベルで実行されます。
  • Mimo 2.5はベンチマークを4分で完了しましたが、MiniMax M3は40分かかりました。

ローカルワークステーションGPUに高コンテキストモデルをデプロイする開発者は、スライディングウィンドウアテンションで最適化されたモデルを選択することで、より高速な推論を達成できます。

SOURCES

18. 16GB VRAM向けに最適化されたQwen3.6-27B GGUF量子化がリリース

ユーザーcHunter789は、16GBのVRAMを搭載したNvidia GPU向けに特別に最適化された2つの新しいQwen3.6-27B GGUF量子化をリリースしました。Qwen3.6-27B.i1-IQ4_KS-attn_qkv-IQ4_KS.ggufモデルは、一般的な知識よりもコーディングタスクのロジックを優先するように調整されており、n_ctx=65536で12チャンクにわたって7.4131のパープレキシティを達成しています。Qwen3.6-27B.i1-IQ4_KS_KT-attn_qkv-IQ4_KS.ggufモデルは、ガウス分布に近いテンソルに適用される実験的なTrellisアルゴリズム量子化を使用しており、7.4091のパープレキシティを達成しています。推論デコードをサポートするために、マルチトークン予測(MTP)バージョンも作成されています。

  • 16GB VRAMとNvidia GPU向けに最適化された2つの新しいQwen3.6-27B GGUF量子化がユーザーcHunter789によってリリースされました。
  • IQ4_KSバリアントは、一般的な知識よりもコーディングタスクのロジックを優先するように調整されており、n_ctx=65536で7.4131のパープレキシティを達成しています。
  • IQ4_KS_KTバリアントは、ガウス分布に近いテンソルに実験的なTrellisアルゴリズム量子化を使用しており、7.4091のパープレキシティを達成しています。
  • 推論デコードをサポートするために、マルチトークン予測(MTP)バージョンも作成されました。

16GB VRAMのNvidia GPUでローカルモデルを実行する開発者は、コーディングロジックに合わせて調整された最適化済みのQwen3.6-27B量子化をデプロイできます。

SOURCES

19. Anthropicがプライバシーポリシーとデータ規約を更新

Anthropicは、2026年7月8日に発効する新しいプライバシーポリシーを公開し、同社のウェブサイト、Claude.ai、およびその他のサービス全体での個人データの収集、使用、処理を規定しました。このポリシーは、ID、連絡先、支払い、技術データ、およびユーザーの入力と出力の収集の概要を示しています。ユーザーは、安全審査のためにフラグが立てられた場合や明示的に報告された場合を除き、入力と出力がモデル学習に使用されることをオプトアウトすることが許可されています。このポリシーはまた、欧州地域のデータ管理者としてAnthropic Ireland, Limitedを、その地域外のユーザーに対してはAnthropic PBCを確立しています。

  • Anthropicは、Claude.aiおよびその他のサービスのデータ収集を規定する新しいプライバシーポリシーを2026年7月8日付で公開しました。
  • ユーザーは、安全審査のためにフラグが立てられた場合を除き、入力と出力がモデル学習に使用されることをオプトアウトできます。
  • Anthropicは個人データを販売せず、国際的なデータ転送のために標準的な契約条項を利用しています。
  • Anthropic Ireland, Limitedは欧州地域のデータ管理者として機能し、Anthropic PBCは他の地域の管理者として機能します。

Anthropicのサービスを使用する開発者は、2026年7月8日から開始される更新されたプライバシー規約と潜在的な本人確認要件に備える必要があります。

SOURCES

20. Anthropicがフラグ付きClaudeアカウントに対してID確認を要求へ

7月8日より、Anthropicは、アカウントがフラグ付けされているが禁止されていないユーザーの少数のサブセットに対して、本人確認を要求する場合があります。同社は、ユーザーが政府発行の書類の提供を求められる正確な状況やトリガーを指定していません。Anthropicは、この確認プロセスの本人確認プロバイダーとしてPersonaと提携しています。

  • 7月8日より、Anthropicはフラグ付けされているが禁止されていないアカウントの少数のサブセットに対して本人確認を要求する場合があります。
  • Anthropicは、サードパーティの本人確認プロバイダーとしてPersonaを使用します。
  • 同社は、政府発行の書類の提出を求める正確なトリガーを指定していません。

Claudeの開発者およびユーザーは、7月8日よりAnthropicがフラグ付きアカウントに対して政府発行のID確認を要求する場合があることを認識しておく必要があります。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。