1. OpenAIがGPT-5.5 Instantをアップグレード、意図認識機能を強化
2026年5月5日に公開されたGPT-5.5 Instantの初期リリースに続き、OpenAIはこのモデルのアップグレード版を公開しました。今回のアップデートでは、より優れた意図認識と複雑な制約に対する堅牢な処理を通じて、自然な対話の向上に焦点を当てています。更新されたモデルは、すべてのChatGPTユーザーが利用可能であり、chat-latest APIエイリアスもこの新しいバージョンを指すように更新されました。
- • OpenAIは、5月5日の初期リリースに続き、2026年6月24日にGPT-5.5 Instantモデルを更新しました。
- • chat-latest APIエイリアスは、更新されたバージョンのGPT-5.5 Instantを指すようになりました。
- • 新しい機能には、意図認識の向上と複雑な制約の処理能力の改善が含まれます。
- • モデルは40万トークンのコンテキストウィンドウと12万8000トークンの最大出力制限を維持しています。
- • chat-latestの価格は、入力100万トークンあたり5.00ドル、出力100万トークンあたり30.00ドルで、キャッシュされた入力には90%の割引が適用されます。
現在chat-latest APIエイリアスを使用している開発者は、コードを変更することなく、400Kのコンテキストウィンドウを備えた、より高性能で制約を認識できるモデルに即座にアクセスできます。
2. Liquid AIがオンデバイスのエージェントワークフロー向けにLFM2.5-230Mをリリース
Liquid AIのLFM2.5-230Mは、スマートフォン、ノートPC、ロボットなどのリソースが制限されたハードウェア上でローカルに実行できるように設計された、高度に最適化された基盤モデルです。メモリフットプリントが小さいことに加え、コミュニティによるデモンストレーションでは、M4 Maxプロセッサ上でカスタムWebGPUカーネルを使用し、ブラウザ内で毎秒1,400トークンの速度でローカル実行される様子が示されました。
- • Liquid AIは、オンデバイスのエージェントワークフローとデータ抽出に最適化された2億3000万パラメータのモデル「LFM2.5-230M」をリリースしました。
- • このモデルはLFM2アーキテクチャを採用しており、ゲート付き短距離畳み込みとグループクエリ注意を組み合わせることで、400MB未満のメモリフットプリントを実現しています。
- • 32Kのコンテキストウィンドウをサポートし、ローカルで実行可能。Samsung Galaxy S25 Ultraで毎秒213トークン、Raspberry Pi 5で毎秒42トークンの速度を達成しています。
- • ツール使用ベンチマーク「BFCLv3」で43.26を記録し、10億パラメータのGoogle Gemma 3 1Bを上回りました。
- • LFM Open License v1.0の下でリリースされ、個人および年間収益1,000万ドル未満の企業は無料で使用可能です。
- • Hugging Faceで公開されており、llama.cpp、MLX、vLLM、SGLang、ONNXをネイティブサポートしています。
開発者は、400MB未満の非常に高性能なモデルをエッジデバイス上でローカルに実行し、高いトークン処理能力を実現しながら、ツール使用ベンチマークでより大きなモデルを上回るパフォーマンスを得ることができます。
3. DeepReinforceがオープンソースのコーディングモデル「Ornith-1.0」をリリース
DeepReinforceは、エージェントによるコーディングタスク向けに特別に設計されたオープンソースモデルファミリー「Ornith-1.0」をリリースしました。Gemma 4およびQwen 3.5アーキテクチャをベースに構築されたこれらのモデルは、Hugging Faceでホストされており、一般的なサービングフレームワークと完全に互換性があります。9Bの密なモデルは、Gradioサーバーアプリケーションによってサポートされ、Hugging Face Spacesでテスト可能です。
- • DeepReinforceは、Gemma 4およびQwen 3.5アーキテクチャをベースに事後学習させた「Ornith-1.0」モデルファミリーをMITライセンスでリリースしました。
- • 9B(密)、31B(密)、35B(MoE)、397B(MoE)の4つのサイズが用意されています。
- • 手作業で設計されたハーネスに頼るのではなく、強化学習中にモデル自身が独自のオーケストレーション・スキャフォールドを学習します。
- • 報酬ハッキングを防ぐため、固定された信頼境界、決定論的モニター、凍結されたLLMジャッジという3つの防御層を実装しています。
- • フラッグシップモデルである397B MoEは、Terminal-Bench 2.1で77.5、SWE-Bench Verifiedで82.4のスコアを達成しました。
- • すべてのモデルがOpenAI互換のエンドポイントを提供し、vLLM、SGLang、Transformersをサポートしています。
開発者は、vLLMやSGLangなどの一般的なサービングフレームワークをネイティブにサポートする、高性能でMITライセンスのオープンソース・コーディングモデルを利用できるようになります。
4. Microsoft、Foundry APIを通じてMAI-Image-2.5モデルを提供開始
Microsoftは、Build 2026で発表したMAI-Image-2.5モデルファミリーをFoundry APIで一般公開しました。このリリースには、標準のMAI-Image-2.5モデルと、より効率的なMAI-Image-2.5-Flashバリアントが含まれており、テキストから画像への生成や画像編集のための新しいツールを開発者に提供します。
- • MAI-Image-2.5およびMAI-Image-2.5-FlashがMicrosoft Foundry APIを通じて利用可能になりました。
- • MAI-Image-2.5は、Artificial Analysis Image Arenaのテキストから画像生成部門で2位、画像編集部門で3位にランクインしています。
- • MAI-Image-2.5-Flashは低コストで高速なバリアントであり、テキストから画像生成で8位、画像編集で6位にランクインしています。
- • 価格は標準モデルが画像1,000枚あたり48ドル、Flashバリアントが画像1,000枚あたり20ドルに設定されています。
- • モデルは32Kのコンテキストと約1MPの出力解像度で、テキストから画像生成および画像編集をサポートしています。
開発者はこれらの高性能な画像モデルをアプリケーションに統合できるようになり、新しいFlashバリアントによって画像生成タスクのコストを抑えることが可能になります。
5. NVIDIAが拡散モデルベースの言語モデル「Nemotron-TwoTower-30B」をリリース
NVIDIAの新しい「Nemotron-TwoTower-30B-A3B-Base-BF16」は、拡散アーキテクチャと自己回帰アーキテクチャを組み合わせた、言語モデリングに対する異例のアプローチを採用しています。凍結された自己回帰コンテキストタワーと拡散デノイザータワーを利用することで、モデルはトークンのブロックを並列に生成でき、ローカル展開において大幅な高速化を実現します。
- • NVIDIAは、Nemotron 3 Nano 30B-A3Bバックボーン上に構築された「Nemotron-TwoTower-30B-A3B-Base-BF16」をリリースしました。
- • このモデルは、凍結された自己回帰コンテキストタワーと拡散デノイザータワーを使用して、トークンのブロックを並列に生成します。
- • 自己回帰ベースラインと比較して、壁時計時間での生成スループットが2.42倍に向上しています。
- • デフォルトのマスク拡散設定は、自己回帰ベースラインの集計ベンチマーク品質の98.7%を維持しています。
このリリースは、ベースラインのベンチマーク品質の98.7%を維持しながら、スループットを劇的に向上させる、非常に効率的な並列トークン生成アーキテクチャを導入するものです。
6. BatonBotがKanbanボードでローカルAIコーディングワークフローを自動化
BatonBotは、開発者が複数のAIコーディングタスクを非同期で管理できるようにするローカルファーストのKanbanワークフローを導入します。Aider、Cline、Claude Codeなどの一般的なツールと統合することで、開発者はタスクをキューに入れ、常に手動で監視することなくエージェントに作業させることができます。
- • BatonBotは、AIコーディングワークフローを自動化し、手動の監視を減らすために設計されたローカルファーストのオープンソースアプリケーションです。
- • ユーザーはコーディングタスクを設定し、エージェントに委任し、Kanbanスタイルのボードを通じて進捗を監視できます。
- • Aider、Cline、Roo、Codex CLI、Claude Code、ローカルLLMなど、ローカルまたはセミローカルのAIコーディングツールユーザー向けに設計されています。
- • プロジェクトはGitHub(https://github.com/mdoty4/batonbot)でホストされています。
開発者は、すべてのステップを手動で監視することなく、ローカルコーディングエージェント(Aider、Cline、Claude Codeなど)を実行および監視できます。
7. NVIDIAがMoEファインチューニングを加速する「NeMo AutoModel」を立ち上げ
NVIDIAのNeMo AutoModelは、Mixture-of-Experts(MoE)モデルのファインチューニングにおけるリソース集約的な課題に対処します。高度な通信カーネルとエキスパート並列処理を活用することで、開発者が標準的なGPUクラスターを使用して、巨大なオープンウェイトモデルを自身のデータセットに適応させることが大幅に容易かつ安価になります。
- • NVIDIAは、MoEアーキテクチャのファインチューニングパイプラインを最適化するため、Hugging FaceでNeMo AutoModelを立ち上げました。
- • このフレームワークは、Qwen3やDeepSeek V3を含むMoEモデルをサポートしています。
- • エキスパート並列処理とDeepEP融合通信カーネルを利用して、専門化されたエキスパートウェイトをGPUクラスター全体に動的に分散させます。
- • NeMo AutoModelは、ネイティブのTransformers v5ライブラリと比較して、トレーニングスループットを最大3.7倍向上させます。
- • ネイティブのTransformers v5ライブラリと比較して、ピーク時のGPUメモリ使用量を32%削減します。
大規模なMoEモデルをファインチューニングする開発者は、トレーニングスループットを最大3.7倍向上させ、ピーク時のGPUメモリ使用量を32%削減できます。
8. MCPサポートを備えた無料の医療RAG APIが公開
検証済みの医療事実にローカルLLMが迅速にアクセスできるように、新しい軽量の医療RAG APIが公開されました。医療用Wikipedia記事に基づいて構築され、低リソースのARM VPSでホストされているこのAPIは、Model Context Protocol(MCP)をネイティブにサポートしており、事実誤認を防ぐためにエージェントワークフローへ簡単に組み込むことができます。
- • 医療用Wikipedia記事に基づいた無料のRAG APIが https://hyfl.uk でアクセス可能です。
- • このAPIは、ハルシネーションを修正するためにローカルLLMへ医療的事実を提供することを目的としています。
- • 単一のARM VPSでホストされ、約2GBのRAMを使用し、サブ秒の応答時間を目標としています。
- • AIエージェントとの統合を容易にするModel Context Protocol(MCP)をサポートしています。
- • デモンストレーションでは、qwen3.5-0.8Bモデルにおけるレルミット徴候に関するハルシネーションをこのAPIが修正する様子が示されました。
開発者は、Model Context Protocolを使用してローカルLLMやエージェントを検証済みの医療知識ベースに簡単に接続し、ハルシネーションを低減できます。
9. Audio.cppが12種類のオーディオモデルを単一のC++/GGMLランタイムに統合
Audio.cppは、オーディオモデルをローカルで実行するための統合された軽量C++ランタイムを提供します。ggmlを活用することで、複雑なPython環境の必要性を排除し、Qwen3-ASRとQwen3-TTSを単一のCLIコマンドで組み合わせる同言語吹き替えパイプラインなど、大幅なパフォーマンス向上を実現します。
- • Audio.cppは、ggml上に構築されたオーディオモデル用のネイティブC++推論フレームワークです。
- • 現在25のモデルファミリーが含まれており、Qwen3-TTS、PocketTTS、VeVo2など、12種類がオフラインで使用可能です。
- • リリースされたモデルは、TTS、音声クローン、ASR、アライメント、VAD、音声変換、コーデックタスクをカバーしています。
- • ランタイム、セッション管理、CLI、サーバーロジックを統合することで、個別のPython環境の必要性を排除しています。
- • ベンチマークでは、PocketTTSがPythonと比較してCUDA上で3.68倍の高速化を達成し、リアルタイム生成速度は最大48.40倍に達します。
- • モデルに応じてCPU、CUDA、Vulkan、Metalバックエンドをサポートしています。
開発者は、重いPython環境なしでテキスト読み上げ(TTS)、音声クローン、ASRモデルをローカルに展開でき、大幅な高速化と統合されたセッション管理を実現できます。
10. JetSpecが最大9.64倍のロスレスLLM高速化を達成
JetSpecの研究では、従来のブロック拡散や自己回帰ドラフトヘッドの制限を回避するために、因果並列ツリードラフトを使用する投機的デコード手法を導入しています。単一パスで因果関係を保持するツリーをドラフトすることで、システムは標準的なベンチマークで大幅かつロスレスな高速化を実現します。
- • JetSpecは、因果並列ツリードラフトを利用して、LLM生成のドラフトコストと品質を共同最適化します。
- • このシステムは、MATH-500で最大9.64倍、オープンエンドのチャットで4.58倍のエンドツーエンドの高速化を達成しつつ、ロスレスな生成を維持します。
- • CUDAグラフとカーネル最適化を使用した場合、単一のB200 GPUで毎秒約1,000トークンに達します。
- • この手法は、従来の投機的デコードアプローチの制限を克服するために、単一パスで因果関係を保持するツリーをドラフトします。
開発者は、並列ツリードラフトを採用することで、生成品質を損なうことなく、ローカルLLMの推論速度を劇的に加速できます。
11. Backtrack Samplerが小型モデルのコーディング性能を劇的に向上
新しいバックトラック・サンプラーおよび検証手法は、重みを変更することなく、小型モデルのコーディング能力を劇的に向上させる方法を提供します。デコード速度の低下や推論時のVRAMおよび計算要件の増加という代償はありますが、この手法はハルシネーションを大幅に削減し、将来的にはllama.cppのようなランタイムに直接統合される可能性があります。
- • 新しいバックトラック・サンプラー手法により、0.5Bモデルがコーディングタスクで2B-4Bモデルと同等の性能を発揮できる可能性があります。
- • この手法は、大規模モデルのハルシネーションを30〜50%削減すると推定されますが、5〜30%のデコード速度低下を伴います。
- • この手法の実装には同程度のサイズの検証モデルのトレーニングが必要であり、VRAM要件が倍増し、計算ニーズが1.5〜3倍に増加します。
- • 検証モデルのトレーニングには、元の事前トレーニングトークンサイズの約0.01%が必要です。
- • 検証モデルは、同じデータ分布を共有する同等以下のウェイトクラスの他のモデルにも汎用可能です。
ローカルモデルを実行している開発者は、5〜30%のデコード速度低下と引き換えに、コーディング性能を大幅に向上させ、ハルシネーションを30〜50%削減できます。