1. Shanghai AI Labがマルチモーダルモデル「Intern-S2-397B」を公開
Shanghai AI Labは、科学的インテリジェンスと長期的なエージェントタスク向けに調整された、新しいオープンウェイトのマルチモーダル基盤モデル「Intern-S2-397B」を公開しました。このモデルは、科学文献の生のページから直接学習し、複雑な視覚的関係と記号的意味論を捉える独自の視覚言語事前学習パラダイムを採用しています。20以上の科学分野で学習され、サンドボックス環境でのブラックボックス型エージェント強化学習を用いて最適化されたIntern-S2-397Bは、生体分子相互作用の設計や材料構造の生成といった専門的なタスクで優れた性能を発揮するように設計されています。
- • Intern-S2-397Bは、科学的インテリジェンスと長期的なエージェントタスクのために設計された新しいマルチモーダル基盤モデルです。
- • このモデルは、科学文献の生のページから直接学習して記号的意味論をモデル化する、視覚言語事前学習パラダイムを活用しています。
- • 生体分子設計を含む20以上の分野にわたる多様な科学的強化学習タスクで学習されました。
- • 汎化性能を向上させるため、サンドボックス環境でのブラックボックス型エージェント強化学習を採用しています。
- • 事前学習、強化学習タスクの網羅性、対話型エージェント環境という3つの次元でスケーリングします。
複雑な科学的推論やサンドボックス化されたエージェント環境を処理できる、大規模なオープンウェイトモデルを開発者に提供します。
2. AWSがバックグラウンドAIエージェント用オープンソース受信トレイ「Pizza Bot」を公開
AWSは、バックグラウンドで動作するAIエージェントを管理するために設計されたオープンソースのセルフホスト型アプリケーション「Pizza Bot」を立ち上げました。Apache 2.0ライセンスで提供されるPizza Botは、タスクの結果、スレッド履歴、保留中の決定を整理するためのメール形式の受信トレイインターフェースを提供します。DeepAgentsとLangGraph上に構築されたこのシステムは、MCPサーバーを介した外部ツールに対する人間による承認をサポートし、Bedrock、Anthropic、Gemini、OpenAI、OpenRouter、Ollamaを含む主要なモデルプロバイダーと統合されています。
- • Pizza BotはApache 2.0ライセンスのオープンソース・セルフホスト型アプリケーションであり、macOS、Windows、Linux向けのデスクトップビルドが用意されています。
- • AIタスクの結果や保留中の決定を、スレッド履歴や完了した作業のカテゴリを備えたメール形式の受信トレイに整理します。
- • DeepAgentsとLangGraphを使用してステートフルな実行を行い、チェックポイントを使用してスレッドの状態と承認待ちの停止状態を維持します。
- • Amazon Bedrock、Anthropic、Google Gemini、OpenAI、OpenRouter、Ollamaなど、複数のモデルプロバイダーと互換性があります。
- • ユーザーはMCPサーバーを介して外部ツールを管理し、提案されたアクションを承認、編集、または拒否するポリシーを設定できます。
- • デスクトップクライアントを閉じてもタスクを継続して実行するには、常時稼働するバックエンドが必要です。
バックグラウンドエージェントの監視、保留中のアクションの確認、ツール実行ポリシーの管理を行うための、すぐに使えるセルフホスト型ダッシュボードを開発者に提供します。
3. 長期AIエージェントのための新しいコンテキストエンジニアリングパターン
自律型エージェントが長期的なタスクにおいてパフォーマンスの低下に直面する中、業界は単純なブレッドクラムワークフローを超え、より堅牢なコンテキストエンジニアリングへと移行しています。新たな進展として、OpenAIのサーバーサイド・コンテキストキャッシング、AWS AgentCoreの並列MicroVMサブエージェントアーキテクチャ、Deep Agentsにおける特殊なファイルシステムオフロードなどが挙げられ、開発者がエージェントの焦点を維持しコストを制御するためのより効果的なツールが提供されています。
- • OpenAIのResponses APIに、「context_caching」によるサーバーサイドのコンテキスト圧縮機能が追加されました。
- • AWS AgentCoreは、並列MicroVMサブエージェントを活用してタスクの実行時間を最大3倍短縮します。
- • Deep Agentsは、20,000トークンを超えるツール応答に対してファイルシステムオフロードを実装しています。
- • Claude Codeは、アーキテクチャ上の決定を保持するために選択的な圧縮の改良を続けています。
これらの進歩は、以前特定された実験的な「ブレッドクラム」アプローチを超えて、コンテキストウィンドウの制限を緩和するための標準化されたスケーラブルなアーキテクチャパターンを開発者に提供します。
4. Llama.cppのフォーク版にホットスワップ可能な推論デコーディングと適応型KVストリーミングが追加
Raymond氏のllama.cpp KVキャッシュストリーミングプロジェクトの新しいフォーク版がリリースされ、適応型KVストリーミングとホットスワップ可能な推論デコーディングが導入されました。限られたハードウェアでパフォーマンスを最大化するように設計されたこのシステムは、VRAM容量を超えた場合にホストRAMからコンテキストをストリーミングするVRAMメモリプールを利用します。重要な点として、コンテキストが多いときに推論モデル(MTPやDFlash2など)を動的に排出し、コンテキストが少ないときに再ロードできるため、16GB GPU上でQwen 3.8 27Bのようなモデルをより高速にローカル実行することが可能です。
- • このフォーク版は、Raymond氏のllama.cpp KVキャッシュストリーミングプロジェクトにホットスワップ可能な推論デコーディングを追加しました。
- • VRAM容量を超えた場合にホストRAMからコンテキストをストリーミングするVRAMメモリプールを使用しており、標準的なオフロードよりも優れたパフォーマンスを発揮します。
- • コンテキストが多いときに推論モデル(MTPやDFlash2など)を排出し、コンテキストが少ないときに再ロードできるシステムです。
- • 実装は、16GBの5060Ti GPU上でQwen 3.8 27B UD-IQ4_XSモデルを使用してテストされました。
- • プロジェクトのリポジトリは https://github.com/troed/llama.cpp-adaptive-kv-streaming で公開されています。
メモリ制約のあるハードウェア上で、より大きなモデルをより高いパフォーマンスでローカル実行できるようになります。
5. vLLM設定によりRTX 3090でQwen3.8 27Bの高速推論が可能に
ある開発者のベンチマークにより、vLLM 0.27.1上でQwen3.8-27B-int4-AutoRoundモデルを実行することで、単一のRTX 3090 GPUで高速なローカル推論を実現できることが実証されました。FP8 E4M3 KVキャッシュを設定することで、この構成は147,456トークンという巨大なコンテキストウィンドウをサポートし、平均プリフィル速度は毎秒871.93トークン、デコード速度は毎秒38.39トークンを実現しました。このモデルは、ツール呼び出しと指示追従に関するBenchLocal-CLIベンチマークで94.7%のスコアを記録し、プレフィックスキャッシングやbfloat16精度といった最適化されたvLLMフラグを活用しています。
- • ベンチマークは、RTX 3090 GPUを搭載したWSL2上で、vLLM 0.27.1を使用してQwen3.8-27B-int4-AutoRoundを実行しました。
- • この構成は、FP8 E4M3 KVキャッシュを使用して147,456トークンのコンテキストウィンドウをサポートしました。
- • プリフィル性能は平均毎秒871.93トークン、デコード性能は平均毎秒38.39トークンでした。
- • ツール呼び出し、指示追従、推論をテストするBenchLocal-CLIベンチマークで、71/75(94.7%)のスコアを達成しました。
- • 使用された主なvLLM設定には、--dtype bfloat16、--gpu-memory-utilization 0.9475、--enable-prefix-cachingが含まれます。
一般的なコンシューマー向けハードウェア上で、144Kのコンテキストウィンドウを持つ27Bモデルを実行するための、具体的で高度に最適化された構成を開発者に提供します。