Inference Brew

Moonshot AIが2.8兆パラメータのMoEモデル「Kimi K3」を発表

00:00 / --:--

このブリーフィングのオーディオはありません。

← ホームへ戻る

Moonshot AIが2.8兆パラメータのMoEモデル「Kimi K3」を発表

1. Moonshot AIが2.8兆パラメータのMoEモデル「Kimi K3」を発表

Moonshot AIは、2.8兆パラメータのスパースMixture-of-Expertsモデル「Kimi K3」を発表しました。Kimi Delta AttentionおよびAttention Residualsアーキテクチャに基づいて構築されたこのモデルは、896個の専門家(エキスパート)のうち16個をアクティブ化することで、デコード速度とスケーリング効率を向上させています。Kimi K3は現在Kimi API経由で利用可能であり、モデルの全ウェイトは2026年7月27日に公開予定です。

  • Moonshot AIは、2.8兆パラメータのスパースMixture-of-Expertsモデル「Kimi K3」を発表。ウェイトは2026年7月27日に公開予定。
  • ネイティブな視覚理解、常時稼働の「思考モード」推論機能、100万トークンのコンテキストウィンドウを搭載。
  • Kimi Delta AttentionとAttention Residualsを活用し、デコード速度とスケーリング効率を向上。
  • API料金は入力100万トークンあたり3.00ドル(キャッシュヒット時は0.30ドル)、出力100万トークンあたり15.00ドルに設定。
  • 48時間のデモンストレーションにおいて、Kimi K3はオープンソースの電子設計自動化ツールを使用して、機能する4平方ミリメートルのチップを自律的に設計。

開発者は、ネイティブなマルチモーダルサポートと長文脈推論を備えた、巨大なフロンティアクラスのオープンウェイトモデルを活用して開発を行うことができます。

2. 「GPT-5.6 Sol」がWeb Design Arenaベンチマークで首位を獲得

GPT-5.6モデルファミリーのグローバルプレビューに基づき、OpenAIのフラッグシップモデルである「Sol」が、Design Arenaの「Web Design Arena」で1位を獲得しました。このパフォーマンスの達成は、AI設計におけるアンチパターンを認識・圧縮するモデルの能力を強調しており、現在18位低い順位にいるGPT-5.5モデルからの大幅な改善を示しています。

  • GPT-5.6 SolがWeb Design Arenaベンチマークでランキング1位に到達。
  • 現在18位低い順位のGPT-5.5と比較して、大幅なパフォーマンスの優位性を示している。
  • ベンチマーク結果は、一般的なAI設計のアンチパターンを効果的に特定・圧縮するモデルの能力を裏付けている。

現在のグローバルプレビューでGPT-5.6 Solモデルをテストしている開発者は、パーソナライズされた高品質なWebデザイン生成において、その実証済みのトップクラスのパフォーマンスを活用できるようになります。

SOURCES

3. OpenLLM-Franceが「Luciole-23B-Instruct-1.1」をリリース

LINAGORAとOpenLLM-Franceコンソーシアムは、オープンソースの多言語モデル「Luciole-23B-Base」を微調整および調整した「Luciole-23B-Instruct-1.1」をリリースしました。トレーニングはスーパーコンピュータ「Jean Zay」上で3段階にわたって実施され、思考トレースの有無による教師あり微調整と、その後のDirect Preference Optimization(DPO)が含まれています。このコレクションはApache 2.0ライセンスで提供され、8Bおよび1Bパラメータのバージョンも含まれています。

  • Luciole-23B-Instruct-1.1は、オープンソースの多言語モデル「Luciole-23B-Base」を微調整・調整したバージョン。
  • LINAGORAとOpenLLM-Franceコンソーシアムが開発し、BPI Franceから資金提供を受けている。
  • スーパーコンピュータ「Jean Zay」を使用し、思考トレースの有無による教師あり微調整とDPOによる調整を実施。
  • Apache 2.0ライセンスでリリースされ、23B、8B、1Bのパラメータバージョンが含まれる。

開発者は、数学、科学、コーディング、RAGタスクで微調整された、新しいApache 2.0ライセンスの多言語モデルを利用できます。

SOURCES

4. OpenAI、GPT-5.6のファイル削除バグの原因と対策を詳述

GPT-5.6におけるファイル削除問題の報告を受け、OpenAIは根本原因が環境変数のエラーであることを特定しました。モデルが一時パスを定義しようとする際に、誤って$HOMEディレクトリを上書きしてしまうというものです。リスクを軽減するため、OpenAIは開発者へのメッセージを更新し、より安全な権限モードに関するガイダンスを提供するとともに、詳細な事後分析の準備を進めています。

  • ファイル削除は、モデルが$HOME環境変数を誤って上書きしたことが原因。
  • OpenAIは開発者向けメッセージの更新と、より安全な権限モードの推奨により問題を軽減中。
  • 数日中に詳細な事後分析レポートが公開される予定。

具体的な技術的障害を理解することで、開発者は環境設定を改善し、恒久的な修正が展開されるまでデータ損失を防ぐために必要なサンドボックス化を適用できるようになります。

SOURCES

5. LM Studioがオープンモデル向けAIエージェント「Bionic」を公開

LM Studioは、オープンモデル向けに設計された新しいAIエージェントアプリケーション「Bionic」を立ち上げました。このプラットフォームは、ローカルでのモデル実行と、「LM Studio Secure Cloud」を介したクラウド実行の両方をサポートし、データ保持ゼロ(Zero Data Retention)を約束しています。コーディングタスクにおいて、Bionicはローカルのコードベースを検査、デバッグ、インライン差分表示が可能で、GLM 5.2やKimi K2.7 Codeなどのモデルをサポートしています。

  • LM Studioは、ローカル実行とLM Studio Secure Cloud経由のクラウド実行をサポートするAIエージェント「Bionic」を公開。
  • Bionicはデータ保持ゼロを特徴とし、ユーザーデータでの学習は行わない。
  • コーディングでは、GLM 5.2やKimi K2.7 Codeなどのモデルを使用して、ローカルコードベースの検査、デバッグ、インライン差分表示が可能。
  • Mistral AIの「Voxtral」モデルを利用した音声キーボードを搭載し、ローカルでのリアルタイム文字起こしに対応。
  • ドキュメントタスク用のサンドボックス環境を提供し、バージョン管理のための自動チェックポイント機能を備える。

開発者は、専用のエージェント環境を使用して、データ保持ゼロでコーディング、デバッグ、ドキュメントタスクのためにオープンモデルをローカルまたは安全なクラウド経由で実行できます。

SOURCES

6. Modalがサンドボックスプラットフォームを刷新、100万の同時環境をサポート

Modalは、数百万の同時サンドボックスと毎秒数万のサンドボックス作成をサポートするために、サンドボックスプラットフォームを再構築しました。新しいアーキテクチャでは、グローバルな調整をRedisストリームを使用した水平方向にスケーラブルな非同期設計に置き換えることで、中央のボトルネックを排除しています。サンドボックスの平均起動時間は0.5秒未満となり、必要なのは2回のネットワークホップと1回のCPU操作のみです。

  • Modalは、数百万の同時サンドボックスと毎秒数万の作成をサポートするようプラットフォームを再構築。
  • 新しいアーキテクチャは、グローバル調整をRedisストリームによる水平スケーラブルな非同期設計に置き換え。
  • 平均サンドボックス起動時間は0.5秒未満で、2回のネットワークホップと1回のCPU操作で完了。
  • 1分以内に100万個のサンドボックスを作成するベンチマークを達成。
  • 新しいプラットフォームは現在ベータ版として利用可能。

エージェントワークロードを実行する開発者は、1秒未満の起動時間で、膨大な数の分離された同時実行環境にスケールアップできます。

SOURCES

7. Perplexityがエージェント向けエフェメラルサンドボックス「SPACE」を公開

Perplexity AIは、機密タスクを実行するAIエージェントを保護するために設計されたサンドボックスプラットフォーム「SPACE」を立ち上げました。このプラットフォームは、タスク完了後に自動的に破棄されるエフェメラルなサンドボックスを利用します。SPACEは、コントロールプレーンとノードレベルのサービスを通じて認証情報へのアクセスを管理・保護し、認証情報の分離、ローリングスナップショット、暗号化ストレージなどのセキュリティ機能を提供します。

  • Perplexity AIは、安全で効率的なAIエージェント実行のためのサンドボックスプラットフォーム「SPACE」を公開。
  • タスク完了時に自動的に破棄されるエフェメラルなサンドボックスを使用。
  • コントロールプレーンとノードレベルのサービスを使用して認証情報を分離・保護。
  • 認証情報の分離、ローリングスナップショット、暗号化ストレージなどのセキュリティ機能を提供。
  • オンプレミスおよびオフライン運用をサポート。

開発者は、認証情報の漏洩やデータ流出を防ぐため、安全で分離された、自動的に破棄される環境で機密性の高いエージェントタスクを実行できます。

SOURCES

8. 1PasswordがClaudeと統合、安全な認証情報の自動入力が可能に

1Passwordは、AnthropicのClaudeチャットボットが保存されたセキュリティ認証情報を使用してタスクを完了できるようにするブラウザ統合を公開しました。この統合は、安全なチャネルを通じて認証情報を注入する「ゼロ露出(Zero-Exposure)」セキュリティフレームワークを利用しており、AIモデルが実際のパスワードやMFAコードを閲覧することを防ぎます。ユーザーは生体認証プロンプトを介して各リクエストを承認する必要があり、1Passwordは許可された特定の認証情報のみにアクセスを制限します。

  • 1Passwordは、Claudeチャットボットが保存された認証情報を使用してタスクを完了できるブラウザ統合を公開。
  • ゼロ露出セキュリティフレームワークが安全なチャネルで認証情報を注入し、AIモデルによるパスワードやMFAコードの閲覧を防止。
  • ユーザーは生体認証で各リクエストを承認し、1Passwordは許可された認証情報のみにアクセスを制限。
  • Macユーザー向けのビジネス、ファミリー、個人プランで利用可能(デスクトップアプリとブラウザ拡張機能が必要)。
  • 今後のアップデートで支払いカードや身分証明情報のサポートを予定。

開発者は、基盤となるLLMに生のパスワードやMFAコードをさらすことなく、Claudeエージェントに安全な認証情報へのアクセスを許可できます。

SOURCES

9. ReasonGateが説明可能なプロンプトインジェクションガードをオープンソース化

ReasonGateは、ユーザープロンプト、取得したコンテキスト、モデル出力を検査することでLLMアプリケーションを保護するために設計された、説明可能でモデル非依存のセキュリティゲートとしてリリースされました。純粋なPythonで記述され、依存関係はゼロです。このコアツールは任意のプロンプトから文字列への関数をラップし、正規化、インジェクション、間接インジェクション、マルチターンリスク、出力漏洩の検出器を備えています。

  • ReasonGateは、Apache-2.0ライセンスで提供される説明可能でモデル非依存のセキュリティゲート。
  • 純粋なPythonで記述され、依存関係ゼロ。任意のプロンプトから文字列への関数をラップ可能。
  • 正規化、インジェクション、間接インジェクション、マルチターンリスク、出力漏洩の検出器を搭載。
  • ポリシーエンジンが信号を統合してリクエストの許可・フラグ立て・ブロックを判断し、機械可読な監査記録を生成。
  • オプションのエンタープライズアドオンで埋め込みベースのML検出を提供し、コアはルールベースのみを維持。

開発者は、軽量で自己完結型のセキュリティ層で任意のLLMやRAGパイプラインをラップし、プロンプトを検査して構造化された監査記録を生成できます。

SOURCES

10. Granolaが会議メモ用のMCP統合を公開

Granolaは、会議メモをClaudeやChatGPTなどのAIツールに直接公開するModel Context Protocol(MCP)統合を立ち上げました。この統合により、開発者はCRMシステムの更新やLinearでのタスク整理などのワークフローを非同期で自動化できます。MCPを使用することで、AIボットをライブ通話に参加させることなく、会議データを処理できます。

  • Granolaは、会議メモをClaudeやChatGPTなどのAIツールに公開するMCP統合を公開。
  • CRMシステムの更新やLinearでのタスク整理などの自動化ワークフローを実現。
  • メモを非同期で処理するため、AIボットをライブ通話に参加させる必要がない。
  • コード「TLDR1MO」で最初の1ヶ月のサービスを無料で提供。

開発者は会議メモをAIワークフローに直接接続し、ボットをライブ通話に招待することなく、CRMの更新やLinearのタスク管理などの自動化タスクを実行できます。

SOURCES

11. Libretto PR agentsがPlaywrightスクリプトの失敗を自動修正

Saffron Healthは、Playwrightブラウザ自動化を維持するために設計された無料のオープンソースTypeScriptライブラリ「Libretto PR agents」をリリースしました。このツールを使用すると、Playwrightスクリプトが失敗した際に、エージェントが自動的にGitHubプルリクエストを開いて修正できます。CDPを介して失敗したブラウザセッションに接続し、実行ツールを使用してPlaywrightとJavaScriptをページに注入し、失敗の原因を検査します。

  • Saffron Healthは、Playwrightブラウザ自動化を維持するための無料オープンソースTypeScriptライブラリ「Libretto PR agents」をリリース。
  • スクリプト失敗時にGitHubプルリクエストを自動的に開いて修正。
  • 1行のコードで既存スクリプトに統合し、CDP経由で失敗したブラウザセッションに接続。
  • ユーザー提供のLLM APIキーをサポートし、セルフホストを含むあらゆるブラウザプロバイダーで動作。

開発者はこのライブラリを1行のコードで統合し、AIエージェントに壊れたエンドツーエンドテストを自律的にデバッグおよび修復させることができます。

SOURCES

12. AtlassianがAIエージェントをJiraに直接統合

Atlassianは、ユーザーがClaude、Cursor、GitHub CopilotなどのAIエージェントにタスクを直接割り当てられる新しい機能をJiraに導入しました。この統合により、関連するタスクのコンテキストがJiraインターフェースからエージェントに直接渡されます。Atlassianは、これらの新機能によりエージェントの出力が44%向上すると主張しています。

  • Atlassianは、Claude、Cursor、GitHub CopilotなどのAIエージェントにタスクを直接割り当てる機能をJiraに追加。
  • Jiraインターフェースからエージェントへ関連するタスクコンテキストを直接渡す。
  • 新機能によりエージェントの出力が44%向上すると主張。

開発者は、完全なコンテキストを備えたAIネイティブなコーディング環境内で、Jiraタスクを受け取り実行できます。

SOURCES

13. 開発者がClaude Codeでバックログ管理を自動化

ある開発者が、Claude Codeを使用して自己改善ループを構築し、バックログ管理プロセスを自動化しました。この自動化システムは、タスクのトリアージ、大きなタスクの分解、コードの実装、テストの実行、プルリクエストの作成が可能です。パイプライン全体は月額約110ドルのコストで実行されました。

  • 開発者がClaude Codeを使用してバックログ管理プロセスを自動化。
  • システムはタスクのトリアージ、分解、実装、テスト実行、プルリクエスト作成を行う。
  • 自己改善パイプライン全体の実行コストは月額110ドル。

開発者は同様の自動化ループを実装し、タスクのトリアージ、コード作成、テスト実行、プルリクエスト作成を自律的に行うことができます。

SOURCES

14. Patter SDKが音声エージェントのローカルプロトタイピングを実現

新しいチュートリアルでは、レストラン予約のユースケース向けに、Patter SDKを使用して音声エージェントワークフローを構築する方法を実演しています。このSDKにより、開発者は自己完結型の環境で音声エージェントをプロトタイプおよびテストし、動的な発信者変数の定義、呼び出し可能なツールの登録、出力ガードレールの適用を行うことができます。また、テスト済みのロジックをTwilioとOpenAI Realtimeを使用してライブ電話環境にデプロイするためのテンプレートも提供しています。

  • Patter SDKのチュートリアルでは、レストラン予約のユースケース向け音声エージェントワークフローの構築を解説。
  • 動的な発信者変数、呼び出し可能なツール、出力ガードレール、シミュレートされた音声認識/音声合成をサポート。
  • レイテンシとコストのメトリクスを追跡し、回帰テスト用の決定論的評価ハーネスを含む。
  • プロトタイプしたロジックは、TwilioとOpenAI Realtimeを使用してライブ電話環境にデプロイ可能。

開発者は、TwilioやOpenAI Realtimeなどのライブ電話インフラにデプロイする前に、自己完結型の環境で音声エージェントをプロトタイプおよびテストできます。

SOURCES

15. コーディングエージェントを評価する「ReactBench v1」がリリース

ReactBench v1は、コーディングエージェントのパフォーマンスをテストするために設計された評価フレームワークとしてリリースされました。このフレームワークは、コーディングエージェントが現実的なReact開発タスクをどの程度処理できるかを具体的に評価し、フロントエンドエージェントの能力に対する標準化されたベンチマークを開発者に提供します。

  • ReactBench v1は、コーディングエージェント専用に設計された評価フレームワーク。
  • 現実的なReact開発タスクにおけるエージェントのパフォーマンスをテスト。

開発者はこのフレームワークを使用して、フロントエンドのReactタスクにおけるさまざまなコーディングエージェントのパフォーマンスをベンチマークし、比較できます。

SOURCES

16. Open Interpreterがコーディングエージェントをローカルで実行

Open Interpreterは、コーディングエージェントをローカルで実行するためのオープンソース環境を提供します。このソフトウェアは、Webおよびネイティブアプリケーションの両方のインターフェースをテストするように設計されており、開発者はローカルマシン上で直接UIインタラクションを自動化および評価できます。

  • Open Interpreterは、ユーザーのローカルマシン上でコーディングエージェントを実行。
  • Webおよびネイティブアプリケーションのインターフェースをテストするように設計。

開発者はローカルのコーディングエージェントを実行し、クラウドホスト環境に依存することなくユーザーインターフェースを自動化およびテストできます。

SOURCES

17. llama.cppのDFlash推論デコードで6倍の高速化を実現

llama.cppにおけるDFlash推論デコードサポートの最近の統合に基づき、NVIDIA RTX PRO 6000 GPU上のQwen 3.6 27Bモデルを使用した新しいベンチマークで、大幅なパフォーマンス向上が示されました。DFlashとn-gramルックアップドラフターを組み合わせることで、反復的なコーディングタスクで6.01倍の高速化を達成し、コードメンテナンス中には7.5倍に達しました。これらの結果は、以前発表されたDFlashサポートの実際的な利点を定量化するものであり、ホストRAMに保存されたn-gramルックアップテーブルはVRAMコストを一切増加させないことに留意してください。

  • llama.cppでDFlashとn-gramルックアップドラフターを組み合わせたベンチマークにより、18ターンの反復コーディングタスクで6.01倍(321.5 tok/s)の高速化を達成。
  • 既存コードの編集を含むメンテナンスターンでは7.5倍(385 tok/s)の高速化に到達。
  • n-gramドラフターはルックアップテーブルをホストRAMに保存するため、VRAMコストはゼロ。
  • ターゲットモデルがすべてのドラフトトークンを検証するため、貪欲温度(greedy temperature)で出力ロスレスを維持。
  • DFlashは構造化されたコーディングタスクに推奨され、MTPはチャットやクリエイティブライティングに推奨される。

これらのベンチマークはDFlash推論デコード統合のパフォーマンスの可能性を裏付けており、開発者はVRAM使用量を増やすことなくコーディングタスクで大幅な高速化を実現できることを示しています。

SOURCES

18. llama.cppのアップデートによりDeepSeek V4 Flashのパフォーマンスが300%向上

DeepSeek V4サポートと量子化KVキャッシュ機能の統合に基づき、llama.cppのバージョンb9986からb10034の間の最近のアップデートにより、推論パフォーマンスが大幅に向上しました。コンシューマーハードウェア(AMD Ryzen 5 9600XとNVIDIA RTX 4060 Ti)で98GBの「DeepSeek-V4-Flash-UD-Q2_K_XL」モデルを実行しているユーザーは、生成速度が毎秒2トークンから7トークンに増加しています。これらの向上は、131,072のコンテキストサイズとレイヤーベースの分割モードを使用して達成されました。

  • 98GBのDeepSeek-V4-Flash-UD-Q2_K_XLモデルの生成速度が毎秒2トークンから7トークンに向上。
  • パフォーマンス向上はllama.cppのバージョンb9986からb10034のアップデートによるもの。
  • AMD Ryzen 5 9600X、138GB RAM、NVIDIA RTX 4060 Ti(16GB VRAM)というコンシューマーハードウェアでテスト。
  • 131,072のコンテキストウィンドウとレイヤーベースの分割モードを使用。

これらのパフォーマンス向上により、巨大で高パラメータのモデルを予算に優しいコンシューマーハードウェア上でローカル実行することが、開発者にとって大幅に現実的になります。

SOURCES

19. EUがGoogleに対し、Androidと検索を競合AIアシスタントに開放するよう命令

欧州委員会は、デジタル市場法(DMA)に基づき、Googleに対してAndroidとGoogle検索を競合するAIプラットフォームに開放することを義務付ける法的拘束力のある措置を発令しました。この裁定により、Googleは2027年7月までに、競合するAIアシスタントがAndroid上のシステム機能、デバイスハードウェア、アプリのインタラクションにアクセスできるようにしなければなりません。さらに、2027年1月からは、検索データを競合する検索エンジンやAIチャットボットと共有する必要があります。

  • EUはGoogleに対し、2027年1月までに検索データを共有し、2027年7月までにAndroidの相互運用性を変更するよう命令。
  • Androidの裁定では、競合するAIアシスタントがシステム機能、デバイスハードウェア、アプリのインタラクションにアクセスできるようにすることを義務付け。
  • 検索の裁定では、検索データを競合する検索エンジンやAIチャットボットと共有することを要求。
  • 不遵守の場合、欧州委員会はGoogleの全世界年間売上高の最大10%の罰金を科す可能性がある。

ChatGPTやClaudeなどの代替AIアシスタントの開発者は、欧州のAndroidデバイスで深いシステムレベルの統合を獲得し、Geminiの独占的なアクセス権を終わらせることになります。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。