1. AnthropicがClaude Opus 5をリリース、思考の調整機能とソースコード安全制限の緩和を導入
Anthropicは、Claude Opus 4.8の後継となる新しいフラッグシップモデル「Claude Opus 5」をリリースしました。このモデルは、限定的かつ複雑なタスク向けに設計されており、Claude Maxコンシューマーティアの新しいデフォルトモデルとなります。多くの領域でClaude Fable 5の能力に迫りつつ、複雑なコーディングタスクではより優れたパフォーマンスを発揮します。安全性への対応として、Anthropicはソースコード内の脆弱性検出を許可するために安全制限を緩和しましたが、バイナリベースのスキャンやエクスプロイト生成に対する制限は維持しています。また、このモデルは欺瞞的な行動の発生率が低く、間接的なプロンプトインジェクションの成功率も低下しています。さらに、Anthropicは政府パートナーと協力し、モデルの独立したテストを実施しています。
- • Claude Opus 5の価格は、前モデルのOpus 4.8と同様に、入力100万トークンあたり5ドル、出力100万トークンあたり25ドルです。
- • このモデルは100万トークンのコンテキストウィンドウを備え、同期Messages APIで最大128kの出力トークンをサポートします。
- • 「Thinking(思考)」機能がデフォルトで有効になっており、推論の深さを制御する調整可能な負荷パラメータが用意されています。effortを4096以上に設定してmax_tokensを指定すると400エラーが返されます。
- • Anthropicは、ソースコードの脆弱性スキャンを許可するために安全制限を緩和しましたが、エクスプロイト生成に対する制限は維持しています。
- • 新しいAPI機能には、2倍の価格で利用できるFastモード、自動フォールバックルーティング、会話中のツール変更サポートが含まれます。
開発者は、ネイティブな推論制御を備え、ソースコードのセキュリティ分析に対する制限が少ない、高性能でコスト効率の高いフラッグシップモデルを利用できるようになります。
2. MicrosoftがMAI-Image-2.5-ProとMAI-Voice-2-Flashをパブリックプレビューで公開
PowerPointやBingなどの主要製品へのMAI-Image-2.5-ProおよびMAI-Voice-2-Flashの統合に続き、Microsoftはこれらのモデルを開発者向けパブリックプレビューとして公開しました。今回のリリースにより、これまで社内製品向けに限定されていた高忠実度の画像生成機能と低遅延の音声機能へのアクセスが拡大されます。
- • MAI-Image-2.5-ProとMAI-Voice-2-Flashが、開発者向けパブリックプレビューとして利用可能になりました。
- • これは、BingやPowerPointといったMicrosoftのコンシューマー製品への最近の導入に続くものです。
- • これらのモデルは、外部利用向けのMicrosoftのプロダクションモデルラインナップの一部となりました。
開発者は、Microsoftの主要なコンシューマーアプリケーションを支える高性能モデルを、自身のソフトウェアに統合できるようになります。
3. CachyLLamaフォークが永続的なKVキャッシュによりローカルエージェントセッションを最適化
CachyLLamaは、低速なハードウェアでの繰り返しプロンプト処理を最適化するために設計されたllama.cppのフォークです。このプロジェクトは、SSDベースの永続的なKVチェックポイントと、以前に処理されたコンテキストを復元するためのシステムプロンプトキャッシュを特徴としています。CachyLLamaのチェックポイントはサーバーの再起動後も保持されます。このソフトウェアは生成速度を向上させるものではありませんが、冗長な作業を回避することでプロンプト評価時間を短縮します。
- • CachyLLamaは、サーバー再起動後も保持されるSSDベースの永続的なKVチェックポイントとシステムプロンプトキャッシュを備えたllama.cppのフォークです。
- • このソフトウェアはプロンプト評価時間を短縮し、7840Uシステム上で15,700トークンのウォーム処理時間を0.99秒で達成しました。
- • Qwen 3.5/3.6、Gemma 4、GLM-4.7を含むハイブリッドアーキテクチャをサポートしています。
ローカルエージェントを実行する開発者は、冗長なプロンプト処理のオーバーヘッドを排除し、サーバーの再起動をまたいでコンテキストを維持できるようになります。
4. Baiduの3B Unlimited-OCRモデルで高解像度OCRパイプラインを構築
Baiduの3BパラメータUnlimited-OCRビジョン言語モデルを使用して、エンドツーエンドのOCRパイプラインを構築する方法を示す新しいチュートリアルが公開されました。このワークフローは、CUDA対応GPUを搭載したGoogle Colabで実行するように設計されており、ハードウェアのサポートに応じてbfloat16またはfloat16の精度を自動的に選択します。パイプラインには、長文コンテキスト生成の設定、繰り返し制御、およびテキスト、Markdown、MMD、JSONアーティファクトを生成するための構造化出力処理が含まれています。
- • このパイプラインは、Baiduの3BパラメータUnlimited-OCRビジョン言語モデルを使用し、CUDA対応GPU上でbfloat16/float16を自動選択して実行します。
- • 高密度レイアウトのタイル画像クロップ用の「Gundamモード」と、単一の1024ピクセルビュー用の「Baseモード」の2つの推論モードをサポートしています。
- • 複数ページのPDFは、PyMuPDFを使用してページをPNGにラスタライズし、infer_multi()関数で処理することで解析されます。
- • パイプラインは、長文コンテキスト生成と繰り返し制御を備えた構造化テキスト、Markdown、MMD、JSONアーティファクトを出力します。
開発者は、軽量な3Bモデルを使用して、構造化されたMarkdownおよびJSON出力を行う高解像度かつ複数ページ対応のOCRパイプラインを、ローカルまたはColab上で実装できます。
5. SupraLabsが小規模モデルのファインチューニング向けに500万サンプルの推論コーパスをリリース
SupraLabsは、500万サンプルを含む推論コーパスデータセットをHugging Faceで公開しました。このデータセットは、教師ありファインチューニング(SFT)および超小型言語モデル(SLM)のトレーニングを促進するために設計されています。すべてのサンプルは、リソースの少ないトレーニング環境との互換性を確保するため、シーケンス長が5,000トークンに制限されています。
- • このデータセットは500万サンプルを含み、Hugging Face上で「SupraLabs/reasoning-corpus-4K-5M-v1」としてホストされています。
- • 各サンプルには、ChatML形式でのユーザープロンプト、モデルの思考トレース、アシスタントの回答、リポジトリID、および合計トークン長が含まれています。
- • すべてのサンプルは、超小型モデルの教師ありファインチューニング(SFT)を容易にするため、シーケンス長が5,000トークンに制限されています。
開発者は、この構造化された推論コーパスを使用して、明示的な思考トレースと5,000トークンのシーケンス制限を備えた、タスク特化型の小規模モデルをファインチューニングできます。
6. Noema OverfitによりGemma 4 26BがSSDモデルページングを介してiPhoneで動作可能に
Noemaは、Noemaアプリ内で「Noema Overfit」と呼ばれる機能をリリースしました。Noema Overfitは、ページング技術を使用することで、Gemma 4 26B A4B (Q4_K_Mバージョン) のような大規模モデルをiPhone 17 Proなどのデバイスで実行可能にします。このページング技術は、非専門家(non-expert)の重みをRAMに保持しつつ、モデルの専門家(expert)の重みをSSDから読み取る仕組みです。このシステムは、速度よりも回答の正確性が優先されるシナリオ向けに設計されており、低RAMのMacBookにも適しています。
- • NoemaアプリのNoema Overfit機能により、Gemma 4 26B A4BモデルをiPhone 17 Proなどのデバイスで実行できます。
- • このページング技術は、非専門家の重みをRAMに保持し、モデルの専門家の重みをSSDから動的に読み取ります。
- • iPhone 17 Proでのテストでは、プリフィル速度が毎秒34.4トークン、デコード速度が毎秒3.5トークンという結果が得られました。
- • このシステムは速度よりも正確性が重視されるシナリオ向けに設計されており、低RAMのMacBookとも互換性があります。
開発者は、SSDベースの重みページングを活用することで、より大規模で高性能なオープンウェイトモデルを、モバイルや低スペックのコンシューマーハードウェアに直接デプロイできるようになります。
7. HetznerがQwen MoEモデル向けの実験的な無料LLM推論APIを立ち上げ
Hetznerは、現在無料で提供されており、SLAや本番環境での保証がない実験的なLLM推論サービスを開始しました。このサービスは、Qwen/Qwen3.6-35B-A3B-FP8モデル向けのOpenAI互換APIを提供します。これは、350億パラメータのMixture-of-Expertsモデルで、30億のアクティブパラメータ、262Kのコンテキストウィンドウ、FP8量子化重みを備えています。Hetznerの公開専用GPUサーバー製品は、現在NVIDIA RTX 4000 SFF Ada GenerationおよびNVIDIA RTX PRO 6000 Blackwell Max-Q GPUで構成されています。
- • Hetznerの実験的なLLM推論サービスは現在無料で、SLAなしのOpenAI互換APIを提供しています。
- • このサービスは、3Bアクティブパラメータと262Kコンテキストウィンドウを備えた35B MoEモデル「Qwen/Qwen3.6-35B-A3B-FP8」をホストしています。
- • ベンチマークテストでは、最初のトークンまでの時間の中央値が153ms、出力速度が毎秒224トークンを記録しました。
- • APIには、モデルの推論予算を切り替えるための文書化されていない「enable_thinking」パラメータが含まれています。
- • Hetznerの公開専用GPUサーバーオプションは、現在NVIDIA RTX 4000 SFF AdaおよびRTX PRO 6000 Blackwell Max-Q GPUを搭載しています。
開発者は、専用GPUハードウェアにデプロイする前に、OpenAI互換エンドポイントを使用して、応答性の高い量子化済み35B MoEモデルを無料でテストできます。