Inference Brew

AnthropicがClaude Sonnet 5をリリース

00:00 / --:--

← ホームへ戻る

AnthropicがClaude Sonnet 5をリリース

1. AnthropicがClaude Sonnet 5をリリース

Claude Sonnet 5は、エージェントワークフローにおける大きな前進であり、ミッドティアの価格でフラッグシップに近いパフォーマンスを提供します。このモデルはブラウザやターミナルを自律的に操作できるように設計されており、複雑なソフトウェアエンジニアリングや計画タスクに最適です。更新されたトークナイザーを使用しているため、トークン数が1.0〜1.35倍に増加する可能性がありますが、導入時の割引とレート制限の拡大により、即時の導入が非常に容易になっています。

  • AnthropicはClaude Sonnet 5をリリースし、従来のSonnet 4.6モデルを置き換えました。
  • このモデルは、長時間のセッションにわたる計画立案、ツール使用、自律的な操作を目的として設計されています。
  • 導入時の価格は、2026年8月31日まで、入力100万トークンあたり2ドル、出力100万トークンあたり10ドルです。
  • プロモーション期間終了後の標準価格は、入力100万トークンあたり3ドル、出力100万トークンあたり15ドルに引き上げられます。
  • Sonnet 5は、SWE-bench Proで63.2%、OSWorld-Verifiedで81.2%のスコアを記録しました。
  • このモデルは100万トークンのコンテキストウィンドウを備え、更新されたトークナイザーを使用しています。
  • Anthropicは、Chat、Cowork、Claude Code、Claude Platform全体でレート制限を拡大しました。

開発者は、以前のフロンティアモデルよりも低コストで、計画立案やツールの操作が可能な、より自律的なエージェントを構築できるようになります。

2. Google、Gemini 3.1 Flash-Lite ImageとGemini Omni Flashを公開

Googleは同じ発表の流れで、2つのマルチモーダルモデルを投入した。Gemini 3.1 Flash-Lite ImageはNano Banana 2 Liteとして高速かつ低コストな画像生成を狙い、Gemini Omni Flashは会話型の動画生成・編集を開発者ワークフローに組み込む。

  • Gemini 3.1 Flash-Lite ImageはNano Banana 2 Liteの正式なモデル名だ。
  • 画像モデルは低コストで高速な生成を重視している。
  • Gemini Omni Flashは会話型の動画生成と編集を支援する。
  • Gemini Omni Flashの価格は生成動画1秒あたり0.10ドルと報じられている。
  • 両モデルはローカルのオープンウェイトではなく、Googleの管理型マルチモーダルスタックに属する。

開発者は今回の更新を別々の画像・動画ニュースではなく、Googleのマルチモーダル基盤のまとまったリリースとして評価できる。

3. GLM-5.2がIntelligence Indexでオープンウェイトモデルのトップにランクイン

最近のオープンウェイトリリースに基づき、GLM-5.2はArtificial Analysis Intelligence Indexによって評価され、オープンウェイトモデルの中でトップの座を獲得しました。このモデルはクローズドソースの代替品に匹敵する推論能力を示していますが、評価では出力トークンの95%が推論に費やされるという高い冗長性が指摘されており、開発者は推論コストの計画においてこれを考慮する必要があります。

  • GLM-5.2は、Artificial Analysis Intelligence Indexにおいて、現在最もパフォーマンスの高いオープンウェイトモデルです。
  • このモデルは51のスコアを達成し、Claude Opus 4.8やGPT-5.5のようなクローズドソースモデルに次ぐ結果となりました。
  • 評価により、平均出力トークンの1.8倍を使用するという高い冗長性が確認されました。
  • 推論プロセスがモデルの総出力トークン使用量の95%を占めています。
  • このモデルは、GDPval-AA v2ベンチマークでGPT-5.5を上回りました。

この独立したランキングは、最近リリースされたGLM-5.2をローカルのエージェントワークフローに統合するかどうかを決定する開発者にとって、標準化されたパフォーマンスベンチマークを提供します。

SOURCES

4. Microsoftが4B GUIエージェントモデルをアップデートし、タスク成功率を向上

5月のPhi-Ground-Any 4Bモデルの初期リリースに続き、MicrosoftはGUIエージェントのアップデート版をリリースしました。このイテレーションでは、Sico-Evolutionタスク成功率が39.8%から82.9%に向上するという大幅なパフォーマンス向上が見られ、特定のタスクベンチマークにおいてGPT-5.4やClaude Opus 4.7といったより大規模なフロンティアモデルを上回りました。

  • Microsoftは、Hugging Faceでアップデートされた4BパラメータのGUIエージェントをリリースしました。
  • このモデルは、Sico-Evolutionタスク成功率を39.8%から82.9%に向上させました。
  • アップデートされたエージェントは、タスク成功率においてGPT-5.4およびClaude Opus 4.7を上回ると報告されています。

開発者は、より信頼性の高い画面上の自動化のために、Microsoftの軽量なオープンウェイトGUIエージェントのより高性能なバージョンを利用できるようになりました。

SOURCES

5. Google ResearchがTabFM基盤モデルを発表

TabFMは、開発者が表形式データを扱う方法に変化をもたらし、従来の分類および回帰タスクに基盤モデルの技術を適用します。ゼロショットのインコンテキスト学習を活用することで、TabFMは面倒な特徴量エンジニアリングやモデルトレーニングの必要性を排除します。また、BigQueryへの統合が予定されており、開発者はSQLを使用して直接予測を実行できるようになります。

  • Google Researchは、表形式データの分類および回帰のためのTabFMを発表しました。
  • このモデルは、ゼロショットのインコンテキスト学習を利用して予測を行います。
  • TabFMは、構造的因果モデルを使用して生成された合成データセットでトレーニングされました。
  • このモデルは、2026年6月30日時点でHugging FaceおよびGitHubで利用可能です。
  • Googleは、AI.PREDICT SQLコマンドを通じてTabFMをBigQueryに統合する予定です。

開発者は、手動でのモデルトレーニング、ハイパーパラメータの調整、特徴量エンジニアリングなしで、表形式の予測を実行できます。

SOURCES

6. HuaweiがOpenPangu-2.0-Flashをオープンソース化

HuaweiによるOpenPangu-2.0-Flashのリリースは、開発者に非常に効率的なMixture-of-Experts (MoE) モデルを提供します。合計920億パラメータのうちアクティブパラメータはわずか60億であり、このモデルは高速な推論のために設計されています。また、オープンソースのウェイトと推論コードを備え、広大な512Kのコンテキストウィンドウをサポートしています。

  • HuaweiはOpenPangu-2.0-Flashモデルをオープンソース化しました。
  • Flashモデルは、合計92Bパラメータ、アクティブパラメータ6Bを備えています。
  • このモデルは512Kのコンテキストウィンドウをサポートしています。
  • Huaweiは、Flashモデルのウェイト、推論コード、トレーニングオペレーションをリリースしました。
  • 505Bパラメータを備えたより大規模なフラッグシップProモデルが7月にリリース予定です。

開発者は、セルフホスト可能な、長文コンテキストタスクに最適化された新しいオープンウェイトモデルにアクセスできます。

SOURCES

7. NVIDIAがQwen3.6-27B-NVFP4量子化版をリリース

NVIDIAによるHugging FaceでのFP4量子化Qwen 3.6 27Bモデルのリリースにより、開発者はコンシューマーグレードのハードウェア上で大規模言語モデルをより簡単にデプロイできるようになります。FP4フォーマットは、モデルの基礎となる能力を維持しながら、メモリ帯域幅とストレージ要件を大幅に削減します。

  • NVIDIAは、Qwen3.6-27B-NVFP4モデルをHugging Faceでホストしました。
  • このモデルは、NVIDIAのFP4量子化フォーマットを利用しています。
  • Qwen 3.6 27Bアーキテクチャに基づいています。

開発者は、FP4量子化を使用してVRAM要件を削減し、高性能な27Bパラメータモデルをローカルで実行できます。

SOURCES

8. DeepSeek-V4-Flashがローカルデプロイ用のGGUFフォーマットで利用可能に

DeepSeek-V4-Flashの最近のリリースと、それに続くllama.cppでの推論的デコードサポートの統合に基づき、モデルがGGUFフォーマットで利用可能になりました。このリリースによりローカルデプロイが簡素化され、開発者はGGUF互換ランタイムを使用して、CPUおよびGPUハードウェア上で最適化されたモデルを直接実行できるようになります。

  • DeepSeek-V4-FlashがHugging FaceでGGUFフォーマットで利用可能になりました。
  • GGUFフォーマットにより、生のチェックポイントと比較してローカルデプロイが容易になります。
  • このリリースは、DeepSeek-V4の推論的デコードに対する既存のllama.cppサポートを補完します。

このGGUFリリースは、以前にリリースされたDSparkチェックポイントとシームレスなローカル実行の間のギャップを埋め、開発者がDeepSeek-V4-Flashをローカル推論パイプラインに統合するための標準化されたフォーマットを提供します。

SOURCES

9. Claude CodeがAPIリクエストを密かにマーキングしていることが判明

Claude Codeバージョン2.1.196の分析により、ツールに埋め込まれたステガノグラフィー(隠蔽)追跡メカニズムが明らかになりました。システムタイムゾーン、ホスト名、プロキシキーワードに基づいてシステムプロンプトの日付文字列を微妙に変更することで、ツールは分類信号をAnthropicに送信します。この密かな動作は、ツールの広範なファイルシステムおよびシェルアクセスに依存する開発者の間でプライバシー上の懸念を引き起こしています。

  • Claude Codeバージョン2.1.196は、Unicodeマーカーを使用してシステムプロンプトの日付文字列を密かに変更します。
  • 変更は、環境変数やAPIホスト名に基づいて、アポストロフィやハイフンなどの文字を改変します。
  • バイナリは、base64エンコードおよびXORデコードされたリストを使用して、プロキシ、リセラー、または不正なゲートウェイを識別します。
  • 変更された日付文字列はシステムコンテキストとして送信され、Anthropicが特定のAPI使用パターンを検出できるようにします。
  • 追跡メカニズムは、システムホスト名またはタイムゾーンを変更することで回避できます。

Claude Codeを使用する開発者は、環境やプロキシの詳細をAnthropicに送信する隠れた追跡メカニズムがあることに注意する必要があります。

SOURCES

10. CognitionがDevin Fusionマルチモデルハーネスを発表

Devin Fusionは、LLMの支出を最適化しようとする開発者のために、効率的なオーケストレーションパターンを導入します。メインエージェントとサイドキックエージェントを併用することで、システムはタスクを処理可能な最も費用対効果の高いモデルに動的にルーティングし、高コストなキャッシュミスを軽減します。

  • Cognitionは、フロンティアモデルと費用対効果の高いモデルを組み合わせるためにDevin Fusionを導入しました。
  • このシステムは、FrontierCodeベンチマークで費用を35%削減します。
  • Devin Fusionは、メインエージェントとサイドキックを備えたデュアルエージェントアーキテクチャを利用しています。
  • アーキテクチャは動的なモデルルーティングを実行してタスク処理を最適化し、キャッシュミスを防ぎます。
  • Fable 5との統合により、Devin Fusionは41%のコスト削減を達成します。

開発者は、複雑なコーディングタスクのパフォーマンスを犠牲にすることなく、動的なモデルルーティングを実装してAPI費用を大幅に削減できます。

SOURCES

11. Couchbaseがエージェントメモリ用のAIデータプレーンをリリース

CouchbaseのAIデータプレーンは、エージェント開発における重要な課題である、さまざまなネットワーク条件下での一貫した低レイテンシのコンテキスト維持に対処します。高速なインメモリキャッシングとCouchbase Liteによるローカルベクトル検索を組み合わせることで、このプラットフォームにより、開発者はクラウドから完全に切断された場合でもメモリとツールアクセスを保持するエージェントをデプロイできます。

  • Couchbaseは、永続的なエージェントメモリとコンテキスト取得のためのAIデータプレーンを発表しました。
  • プラットフォームには、エンタープライズサポートされたModel Context Protocol (MCP) サーバーが含まれています。
  • クラウド、オンプレミス、切断されたエッジ環境全体で同一に動作します。
  • Couchbase Liteは、デバイス上でのローカルSQL、全文検索、ベクトル検索を可能にします。
  • キャッシングをルートとするアーキテクチャは、ディスクよりも最大10倍高速なメモリ書き込みをサポートします。

開発者は、クラウド環境とエッジ環境全体でメモリを統合した、オフライン対応で低レイテンシのエージェントアプリケーションを構築できます。

SOURCES

12. Xがホスト型MCPサーバーをリリース

XによるModel Context Protocol (MCP) の採用は、AIエージェントがWebプラットフォームと対話する方法を標準化するための重要な一歩です。MCPサーバーをホストすることで、Xは開発者がエージェントにプラットフォームのデータや機能への安全で構造化されたアクセスを許可することを容易にします。

  • Xは、ホスト型のModel Context Protocol (MCP) サーバーをリリースしました。
  • サーバーは、AIアプリケーションとXのAPIの統合を簡素化します。
  • AIツールがプラットフォームと対話するための標準化された方法を提供します。

開発者は、標準化されたMCPプロトコルを使用して、AIエージェントやLLMアプリケーションをXのプラットフォームに簡単に接続できます。

SOURCES

13. Mistralがワークフローオーケストレーションプラットフォームをリリース

Mistral Workflowsは、マルチエージェントパイプラインを管理するための専用プラットフォームを提供することで、信頼性の高いエージェントオーケストレーションのニーズに対処します。耐久性とフォールトトレランスに重点を置いたこのシステムにより、長時間実行されるドキュメント処理や推論タスクを大規模に確実に実行できます。

  • Mistral Workflowsは、マルチエージェントAIパイプラインを実行するためのオーケストレーションプラットフォームです。
  • プラットフォームは、耐久性とフォールトトレランスを備えるように設計されています。
  • 複雑なドキュメント処理やエージェントワークフローを監視するためのツールを提供します。

開発者は、組み込みのフォールトトレランスを備えた複雑なマルチエージェントワークフローを構築、監視、スケーリングできます。

SOURCES

14. Lullabeast自律開発パイプラインがリリース

Lullabeastは、LLM主導の計画と厳格な非LLM検証ステップを組み合わせた、エージェントによるソフトウェア開発のための構造化されたフレームワークを提供します。ファイルマニフェストとテスト結果をチェックするための決定論的なゲートを強制することで、パイプラインはエージェントが生成したコードが次のフェーズに進む前に徹底的に検証されることを保証します。

  • Lullabeastは、プランナー、エグゼキューター、レビュアーエージェントを使用するオープンソースの自律開発パイプラインです。
  • パイプラインはOpenClaw上で実行され、git diffとテスト結果を検証するために非LLMの決定論的ゲートを使用します。
  • テストでは、ローカルのRTX 4090ビルドがAPIコストゼロで3.5時間かかり、クラウドLLMでは2時間かかることが示されました。
  • このツールは初期ベータ版であり、小規模で焦点を絞ったWebアプリケーションに推奨されます。
  • エージェントが書いたコードを直接実行するため、仮想マシンでツールを実行することをお勧めします。

開発者は、決定論的な検証ゲートを備えたパイプラインを使用して、マルチフェーズのソフトウェア開発タスクを自動化できます。

SOURCES

15. Ornith-1.0-35Bがhf-claude統合に追加

6月27日のhf-claude統合ツールのリリースと6月25日のOrnith-1.0モデルファミリーのリリースに続き、開発者はOrnith-1.0-35BモデルをClaude Code内で直接利用できるようになりました。このアップデートにより、自動化されたhf-claudeインターフェースを通じて利用可能なサポート対象オープンウェイトモデルのリストが拡大され、モデルのパフォーマンスとコストプロファイルの実験が容易になります。

  • Ornith-1.0-35Bがhf-claude統合ツールと互換性を持つようになりました。
  • この開発により、手動設定なしでClaude Code内でモデルを直接使用できるようになります。
  • 統合は、以前にリリースされたhf-claudeユーティリティとOrnith-1.0モデルファミリーに基づいています。

開発者は、Ornith-1.0-35BモデルをClaude Codeの代替バックエンドとして活用でき、この特定のモデルのセットアッププロセスが簡素化されます。

SOURCES

16. Open-FusionがClaude Code用hf-claudeツールに追加

Claude Codeのマルチモデルサポートを簡素化した6月27日のhf-claudeユーティリティのリリースに基づき、開発者はOpen-Fusionをワークフローに直接統合できるようになりました。このアップデートにより、hf-claudeパッケージを通じて利用可能な互換ツールライブラリが拡大され、より柔軟なAI支援コーディング構成が可能になります。

  • Open-Fusionがhf-claudeツールでサポートされるようになりました。
  • このアップデートは、6月27日のリリースで導入された自動統合フレームワークに基づいています。
  • 開発者は、hf-claudeパッケージを使用してClaude Code内でOpen-Fusionを設定できるようになりました。

この統合によりhf-claudeツールの有用性がさらに広がり、開発者はOpen-Fusionの機能を既存のClaude Codeターミナル環境に組み込むことができます。

SOURCES

17. Hugging Face BucketsがS3 APIサポートを追加

Hugging Face BucketsへのS3 APIサポートの追加により、AI開発者のデータ管理が大幅に簡素化されます。標準のS3互換インターフェースを提供することで、Hugging Faceは開発者が統合コードを書き直すことなく、既存のストレージユーティリティ、バックアップスクリプト、データパイプラインを再利用できるようにします。

  • Hugging Face BucketsがS3 APIをサポートしました。
  • 統合により、何百もの標準ストレージツールとの互換性が可能になります。
  • 開発者は、コードを1〜2行変更するだけでツールを接続できます。

開発者は、最小限のコード変更で、既存のデータパイプラインやツールをHugging Face Bucketsに接続できます。

SOURCES

18. TurboOCR v3ローカルOCRサーバーがリリース

TurboOCR v3は、クラウドベースのドキュメント処理APIに代わる強力なローカル代替手段を提供します。C++とTensorRTで構築されたこのサーバーは、大幅なスループットの向上に加え、複雑なレイアウト、表、数式を直接クリーンなHTML、LaTeX、またはMarkdownに変換する新しい構造化解析機能を提供します。

  • TurboOCR v3は、完全にローカルで動作するセルフホスト型の高速ドキュメントOCRサーバーです。
  • アップデートによりパイプラインがPP-OCRv6にアップグレードされ、RTX 5090で約520 img/sへとパフォーマンスが倍増しました。
  • レイアウトからHTMLテーブルへの変換や、数式からLaTeXへの変換を含む構造化解析が導入されました。
  • ソフトウェアスタックは、C++、TensorRT FP16、マルチストリーム処理を利用しています。
  • 構造化解析機能は、コストを管理するためにリクエストごとの厳格なオプトインとして利用可能です。

開発者は、高度な構造化解析機能を備えた、高速なセルフホスト型ドキュメント処理サーバーをデプロイできます。

SOURCES

19. 非NVIDIA CUDA実行用のZLUDA 6がリリース

ZLUDA 6は、NVIDIAハードウェアのロックインから脱却しようとする開発者にとって重要な互換レイヤーを提供します。プロジェクトは個人の週末の取り組みに移行し、更新頻度は低下すると予想されますが、このリリースではWindowsの安定性が向上し、代替GPUでCUDAアプリケーションを実行するためのワークロードサポートが拡大されました。

  • ZLUDAバージョン6がリリースされ、6-preview.79ビルドと一致しました。
  • このツールにより、未修正のCUDAアプリケーションを非NVIDIA GPUで実行できます。
  • 新しいワークロードには、プレアルファ版のPhysXサポートとBlenderのテクスチャサポートが含まれます。
  • Windowsサポートが強化され、より堅牢なローダーが搭載されました。
  • 開発は、商業的に資金提供されたプロジェクトから個人の週末プロジェクトに移行しました。

開発者は、コードを書き直すことなく、AMDやその他の非NVIDIAハードウェア上でCUDA依存のAIワークロードを実行できます。

SOURCES

20. 米国がAnthropicのFable 5に対する残りの輸出制限を解除

米国政府は、6月26日のMythos 5の承認から始まった規制の逆転を完了し、AnthropicのFable 5モデルに対する輸出制限を正式に解除しました。Mythos 5は先週、承認された機関による使用が許可されましたが、Fable 5はさらなる安全性交渉が保留されるまでブロックされたままでした。この新しい展開により、Anthropicは、脱獄に対するより堅牢な保護策を実装し、安全性プロトコルについて政府と緊密に協力するというコミットメントに従い、一般ユーザー向けに両モデルへのアクセスを復元することが許可されました。

  • 米国政府は、AnthropicのFable 5モデルに対する輸出制限を解除しました。
  • この措置は、6月26日のMythos 5の承認に続くものであり、Fable 5は唯一の制限付きモデルとして残っていました。
  • Anthropicは、政府の安全要件を満たすために、モデルの脱獄に対するより堅牢な保護策を構築することを約束しました。
  • これらの管理の解除により、Fable 5とMythos 5の両方への一般的なアクセスを復元できます。

開発者と一般ユーザーは、6月13日の世界的な停止後も輸出制限下に残っていたシリーズ最後のモデルであるAnthropicのFable 5への完全なアクセスを回復できるようになりました。

21. Moondream HQがPhotonデコード技術を発表

Photonは、高性能ハードウェアがトークン選択などのCPUハウスキーピングタスクを待機してアイドル状態になる「GPUバブル」という一般的なボトルネックをターゲットにしています。デコードプロセスをパイプライン化し、フォワードパスをサンプリングから切り離すことで、Photonはフリーテキストと制約付きデコードの両方のワークロードに対してハードウェアの利用率を最大化します。

  • Moondream HQは、AIモデル推論におけるGPUバブルを排除するためにPhotonを開発しました。
  • Photonは、2つのバッファセットを交互に使用するピンポン・スロットを備えたパイプライン化されたデコードを使用します。
  • 「今すぐフォワード、後でサンプリング」メカニズムにより、サンプリングが完了する前に次のフォワードパスを開始できます。
  • パフォーマンスの向上は、NVIDIA 3090での12%から、32ストリームのB200での35%まで及びます。
  • この技術は、同じパイプライン内でプリフィルタスクとデコードタスクの両方を処理します。

ローカル推論を実行する開発者は、CPUとGPUの連携を最適化することで、最大35%のパフォーマンス向上を達成できます。

SOURCES

22. Qwen3.6-35Bにノルム保存アブリテレーションを適用

従来のモデルの消去は、拒否ベクトルを投影して取り除くとウェイトノルムが縮小するため、一般的なパフォーマンスが低下することがよくあります。ハイブリッドMoE Qwen3.6-35B-A3Bモデルにノルム保存バイプロジェクション技術を適用することで、開発者は複雑な数学やコーディングタスクにおける元の能力を保持した、完全に検閲されていないモデルにアクセスできるようになりました。

  • Qwen3.6-35B-A3Bの拒否方向を消去するために、ノルム保存バイプロジェクション技術が使用されました。
  • この技術は、ウェイト行を拒否方向に対して直交化し、元のL2ノルムに再スケーリングします。
  • 結果として得られたモデルは、数学とコードのベンチマークスコアを維持しながら、テストセットで0%の拒否を達成しました。
  • 偏りのない拒否方向を抽出するために、7,356のプロンプトからなる強化された有害データセットが作成されました。
  • モデル、GGUF量子化、およびデータセットがHugging Faceでリリースされました。

開発者は、ウェイトの変更による劣化なしに、完全な推論能力とコーディング能力を維持する検閲されていないモデルを利用できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。