Inference Brew

AnthropicがClaude 5モデル向けのコンテキストエンジニアリングガイドラインを更新

00:00 / --:--

← ホームへ戻る

AnthropicがClaude 5モデル向けのコンテキストエンジニアリングガイドラインを更新

1. AnthropicがClaude 5モデル向けのコンテキストエンジニアリングガイドラインを更新

更新されたガイドラインは、厳格なガードレールではなく、モデル本来の判断力に依存する方向へのシフトを反映しています。開発者はCLAUDE.mdファイルを軽量に保ち、単純なマークダウンファイルではなく、コードベース固有の「落とし穴」やHTMLアーティファクト、テストスイートといったリッチなリファレンスに焦点を当てることが推奨されています。

  • Anthropicは、パフォーマンスを損なうことなく、Claude Opus 5およびClaude Fable 5向けのClaude Codeのシステムプロンプトを80%以上削減しました。
  • 新しい「claude doctor」コマンドにより、CLAUDE.mdファイルやスキルを含むユーザーのコンテキストエンジニアリングを自動的に簡素化できます。
  • Anthropicは現在、例を提供するのではなく表現力豊かなツールインターフェースを設計し、必要な時にのみコンテキストを読み込むプログレッシブ・ディスクロージャーを使用することを推奨しています。
  • Claude Codeは現在、自動メモリ機能を使用して関連情報を保存するようになり、CLAUDE.mdファイルへの手動保存に取って代わりました。

開発者がClaude 5向けにプロンプトとコンテキスト構造を最適化し、トークン使用量を削減してエージェントのパフォーマンスを向上させるのに役立ちます。

SOURCES

2. Kimi K3およびGLM-5.2のリリースによりオープンウェイトエコシステムが拡大

オープンウェイトモデルの急速な成熟は、高度に最適化されたサービングスタックによって支えられています。トランプ政権が中国のオープンウェイトモデルに対する制限を検討していると報じられていますが、現在のエコシステムは、MITのような寛容なライセンスの下で、開発者に最先端レベルの機能への前例のないアクセスを提供しています。

  • Moonshotは、長期間のコーディングタスクにおいてクローズドな最先端モデルに迫る性能を持つKimi K3モデルのウェイトを7月27日に公開すると確約しました。
  • Z.aiはMITライセンスの下でGLM-5.2モデルをリリースし、SWE-bench ProでGPT-5.5の58.6%に対し62.1%を達成したと報告されています。
  • vLLM、SGLang、llama.cpp、Ollama、MLXなど、オープンウェイトモデルを中心に堅牢なサービングエコシステムが成熟しています。
  • 米政権による制限の可能性が取り沙汰される中、過去1年間のHugging Faceにおける全モデルダウンロードのうち、中国製モデルが41%を占めました。

複雑なコーディングや推論タスクに対して、セルフホスト可能な非常に高性能なオープンウェイトの代替手段を開発者に提供します。

SOURCES

3. Inflect v2が10Mパラメータ未満の超小型ローカルTTSモデルをリリース

これらの超小型モデルは、既存のオープンソースTTSソリューションに代わる非常にコンパクトな選択肢を提供します。Inflect-Nano-v2はKokoroより約21倍、Fish Audio S2 Proより1000倍以上小さく、ローカルでの音声生成が必要なリソース制約のある環境に適しています。

  • Inflect v2には、Inflect-Nano-v2(3.96Mパラメータ、15.97 MB)とInflect-Micro-v2(9.36Mパラメータ、37.53 MB)が含まれます。
  • 両モデルとも、外部のボコーダーを使用せず、CPUまたはCUDA上でローカルにテキスト処理、タイミング予測、音声生成、波形デコードを行います。
  • Inflect-Micro-v2はUTMOS22スコア4.395と意味論的単語誤り率3.99%を達成し、Inflect-Nano-v2はUTMOS22スコア4.386と誤り率4.21%を記録しました。
  • これらのモデルは現在、英語のみ、固定の男性音声1種類に限定されており、音声クローンには対応していません。

外部APIに依存することなく、超軽量で低遅延なローカルTTS機能をコンシューマーハードウェア上で直接展開できるようになります。

SOURCES

4. Llama.cppがModel Context Protocolの完全サポートを追加

この統合により、ローカル推論スタックにネイティブなエージェント機能がもたらされます。外部依存関係なしでMCPサーバーへの直接接続が可能になるため、開発者はローカルモデルを複雑なツール使用ワークフローに簡単に組み込むことができます。

  • Llama.cppは現在、すべてのプロトコルにおいてModel Context Protocol(MCP)の完全なサポートを提供しています。
  • プルリクエスト#26062のマージにより、llama.cpp WebUIをエージェント型のチャットインターフェースとして使用できるようになりました。
  • この統合により、llama-cliターミナルクライアントがサーバーを直接使用するように変更され、ネイティブツールサーバーにMCPサポートが追加されました。
  • ユーザーはSerenaのような専用のコーディングMCPサーバーに接続し、ローカルモデルによるエージェント型のコーディングを実現できます。
  • MCPサーバーの設定は、標準JSON設定ファイルで定義するか、コマンドラインからインラインで提供できます。

外部APIや依存関係に頼ることなく、llama.cppを使用して完全にローカルなエージェント型のコーディングおよびチャットインターフェースを構築できます。

SOURCES

5. C#推論エンジン「TensorSharp」がllama.cppと同等のパフォーマンスを実現

TensorSharpは、カスタムC# CPU実装に加えてCUDA、MLX、GGML用のネイティブバックエンドを提供することで、C++ラッパーに伴う統合の摩擦を解消します。ベンチマーク結果はllama.cppと競合するパフォーマンスを示しており、クロスプラットフォームの.NETアプリケーションにとって有力な選択肢となります。

  • TensorSharpは、CPUバックエンド向けにC#でゼロから実装されたオープンソースのローカルLLM推論エンジンです。
  • Gemma4、DiffusionGemma、Qwen3.6などのモデルをサポートし、OpenAIおよびOllama APIと互換性があります。
  • Windows、MacOS、Linux上で動作し、Vulkan、CUDA、Metalを介してNvidia、Apple、AMD、IntelのGPUを活用します。
  • 最適化には、ページングされたKVキャッシュ、連続バッチ処理、MoEモデル用のSSDベースのキャッシュ、GGUF量子化などが含まれます。

.NETおよびC#開発者は、外部のC++バインディングに依存することなく、ネイティブで高性能なローカル推論エンジンを利用できるようになります。

SOURCES

6. CloudflareがAIクローラー分離を強制するための詳細な制御機能をリリース

Cloudflareは詳細なAIトラフィック管理オプションを導入し、顧客が検索ボット、エージェントボット、トレーニングボットを区別できるようにしました。このリリースは、以前発表された9月15日のクローラー分離期限をサポートするための技術インフラを提供します。新機能には、エンタープライズ顧客向けの検索可能なBotBaseや、robots.txtでコンテンツの使用を管理するための提案された「use」シグナルが含まれます。9月15日以降、新しいドメインはデフォルトで広告付きページ上のトレーニングボットとエージェントボットをブロックし、検索クローラーは許可する設定になります。

  • Cloudflareはボットを検索、エージェント、トレーニングに分類する詳細な制御機能をリリースし、9月15日の期限を運用可能にしました。
  • 9月15日以降、新しいドメインはデフォルトで広告付きページ上のトレーニングボットとエージェントボットをブロックします。
  • エンタープライズ顧客は、特定のボット分類を識別および管理するためのBotBaseにアクセスできるようになります。
  • Cloudflareは、コンテンツの使用許可を指定するためのrobots.txt用の新しい「use」シグナルをテストしています。

これらのツールは、サイト所有者が7月に発表されたクローラー分離ポリシーを強制するための実用的な手段を提供し、検索の可視性を維持しながら不正なトレーニングからコンテンツを保護します。

SOURCES

7. Intelコンシューマー向けプラットフォームでAI推論時のマルチGPU P2Pに制限

Asus Z890 Apexマザーボードを搭載したIntel Core Ultra 7 270K Plusでのハードウェアテストにより、P2Pの失敗が確認されました。Nvidiaのドライバーはこれらのコンシューマー向けIntelプラットフォーム上でP2Pを積極的にブロックしているため、この制限を回避しようとする開発者は、並列モデル実行中にアプリケーションの不安定化や出力の破損を招くリスクがあります。

  • Z890のようなIntelコンシューマー向けプラットフォームのArrow Lake CPUルートコンプレックス下では、PCIeピア・ツー・ピア(P2P)通信が正しく機能しません。
  • Nvidiaドライバーはコンシューマー向けIntelプラットフォームでのPCIe P2Pをブロックしており、パッチを適用したオープンソースカーネルドライバーで強制するとvLLMでデータ破損を引き起こす可能性があります。
  • AM5やEpyc SP3を含むAMDプラットフォームは、マルチGPU構成に対してより優れたPCIeコントローラーの実装を示しています。
  • AMD Epyc SP3システムは、Intel Ice Lake Xeon構成と比較して、GPU間P2P通信において優れた帯域幅とレイテンシを提供します。

LLM推論やトレーニングのためにローカルのマルチGPU環境を構築する開発者は、データ破損やパフォーマンスのボトルネックを防ぐため、Intelのコンシューマー向けプラットフォームを避けるべきです。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。