Inference Brew

OpenAIがGPT-5.6モデルとChatGPT Workエージェントを一般公開

00:00 / --:--

← ホームへ戻る

OpenAIがGPT-5.6モデルとChatGPT Workエージェントを一般公開

1. OpenAIがGPT-5.6モデルとChatGPT Workエージェントを一般公開

OpenAIは、GPT-5.6モデルファミリー(Sol、Terra、Luna)のプレビューを終了し、一般公開しました。これと同時に、SlackやGoogle Driveなどの業務ツールと連携し、多段階のプロジェクトを自動化するエージェント「ChatGPT Work」も発表されました。この移行に伴い、OpenAIはスタンドアロンのAtlasブラウザを8月9日に廃止し、そのエージェント機能をメインのデスクトップアプリケーションと新しいChrome拡張機能に統合します。

  • GPT-5.6モデル(Sol、Terra、Luna)が一般公開されました。
  • 多段階の業務ワークフローを自動化するChatGPT Workが導入されました。
  • Responses APIがプログラムによるツール呼び出しをサポートしました。
  • 複雑なタスクのために4つのエージェントを並列で調整する新しい「ウルトラ」設定が追加されました。
  • ChatGPT Atlasブラウザは8月9日に廃止されます。

開発者は、プログラムによるツール呼び出しや「ウルトラ」マルチエージェント加速モードを備えたGPT-5.6フロンティアモデルと、新しいChatGPT Workエージェントをフル活用できるようになりました。

2. Metaがコーディングモデル「Muse Spark 1.1」のAPIプレビューを開始

Metaは、Muse Spark 1.1のリリースによりAIコーディング分野に参入し、米国の開発者向けにパブリックAPIプレビューを提供開始しました。大規模なエージェントワークロードを処理するように設計されており、バグ修正やエンドツーエンドのコード移行などのタスクに適しています。また、コードに加えて画像、動画、ドキュメントを処理するためのネイティブなマルチモーダル認識機能を備えています。普及を促進するため、Metaは新しいMeta Model APIアカウントに対して20ドル分の無料クレジットを提供しています。

  • Muse Spark 1.1は、本日より米国の開発者向けにパブリックAPIプレビューとして提供されます。
  • Metaは、すべての新しいMeta Model APIアカウントに20ドルの無料クレジットを提供しています。
  • バグ検出の向上、エンドツーエンドのエージェントワークフローのサポート、画像・動画・ドキュメントのネイティブなマルチモーダル認識機能を備えています。
  • Meta AIアプリおよびウェブサイト経由で「Thinking mode」として利用可能です。
  • Metaは、バグ修正やコード移行といった大規模なタスクを企業が支援できるよう、Sparkエージェントを位置づけています。

開発者は、ネイティブなマルチモーダル認識とエージェントワークフローのサポートを備えた新しい競争力のあるコーディングモデルを、20ドルの無料APIクレジット付きで利用できます。

3. シングルパス音声処理モデル「MOSS-Transcribe-Diarize 0.9B」がリリース

オープンウェイトの「MOSS-Transcribe-Diarize 0.9B」モデルがリリースされ、長時間の音声処理に対するエンドツーエンドのソリューションを提供します。文字起こしと話者分離を分離する従来のパイプラインとは異なり、このモデルは両方をシングルパスで実行し、匿名化された話者ラベル付きのタイムアライメントされたテキストを生成します。Qwen3-0.6Bスタイルの因果デコーダーとWhisper-Mediumエンコーダーをベースにしており、カスタムの文字起こし指示、ホットワード、音響イベントの注釈をサポートしています。GGUFウェイトはHugging Faceで入手可能です。

  • MOSS-Transcribe-Diarize 0.9Bは、長時間の複数話者文字起こしと話者分離のためのエンドツーエンド音声理解モデルです。
  • 文字起こしと話者分離をシングルパスで実行し、匿名化された話者ラベル(例:[S01])付きのタイムアライメントされたテキストを出力します。
  • アーキテクチャは、Qwen3-0.6Bスタイルの因果デコーダー、Whisper-Mediumエンコーダー、およびMLPアダプターを備えた4倍テンポラルマージを組み合わせています。
  • カスタム文字起こし指示、ホットワード、音響イベント注釈などのプロンプト可能な生成をサポートしています。
  • ローカルデプロイ用に、モデルのGGUFバージョンがHugging Faceで入手可能です。

開発者は、複雑なマルチモデルパイプラインを回避し、匿名化された話者ラベル付きのタイムアライメントされたテキストを出力する軽量なローカル音声モデルを実行できます。

SOURCES

4. ByteDanceがマルチモーダルデザインモデル「Seedream 5.0 Pro」をリリース

ByteDanceは、プロダクションデザインのワークフロー向けに構築されたマルチモーダル画像生成モデル「Seedream 5.0 Pro」をリリースしました。単純なワンショット生成から脱却し、精密な編集機能と高度なデザインツールに焦点を当てています。また、10以上の言語に対する強力な多言語サポートを備えており、右から左へ記述するレイアウトやアクセントの特殊な処理にも対応しているため、グローバルな製品デザインに非常に適しています。

  • Seedream 5.0 Proは、ワンショットの画像生成ではなく、プロダクションデザインのワークフロー向けに設計されています。
  • 精密な編集機能と高度なプロダクションデザインツールを備えています。
  • 10以上の言語をサポートしており、右から左へ記述するレイアウトやアクセントの特定のサポートが含まれています。
  • クリエイター、デザイナー、開発者、製品チームをターゲットにしています。

開発者やデザイナーは、精密な編集機能と多言語レイアウトサポートを備えたプロダクションレベルの画像モデルを利用できます。

SOURCES

5. NetSuiteがModel Context Protocol (MCP)のサポートを追加

NetSuiteは、Model Context Protocol (MCP)へのネイティブサポートと、新しいAI Connector Serviceを発表しました。この統合により、開発者は外部AIモデルをNetSuiteの運用データや組み込みワークフローに直接接続できます。重要な点として、システムは既存のNetSuiteの権限とガバナンスポリシーを維持するため、収益レポートや顧客データの取得といったエンタープライズタスクを自動化する際に、AIエージェントが許可されていない情報にアクセスすることを防ぎます。

  • NetSuiteはModel Context Protocol (MCP)をサポートし、AI Connector Serviceを提供します。
  • この統合により、外部AIモデルを組み込みワークフローや運用データに接続できます。
  • ガバナンスやセキュリティポリシーなどの既存のNetSuite権限が維持され、不正なデータアクセスを防ぎます。
  • エンタープライズの事例では、顧客のバックオーダー検索時間を数分から数秒に短縮するなど、大幅な効率向上が示されています。

開発者は、外部LLMをNetSuiteの運用データや権限に直接接続する標準化されたMCPサーバーや統合を構築できるようになりました。

SOURCES

6. PostHog FOSSがLLM可観測性機能を備えてリリース

PostHogは、MITライセンスの下で、クラウドプラットフォームのセルフホスト可能な代替手段を提供する専用の完全オープンソースリポジトリ(posthog-foss)をリリースしました。標準的な製品分析、セッションリプレイ、機能フラグに加え、このリリースにはLLMアプリケーションのトレース、生成、レイテンシ、コストをキャプチャするように設計されたAI可観測性機能が含まれています。このプラットフォームは、最低4GBのメモリを搭載したLinux上のDocker経由でセルフホスト可能で、主要なバックエンドおよびフロントエンド向けのSDKが含まれています。

  • PostHogは、100%無料かつオープンソースのソフトウェアとして、MIT Expatライセンスの下で個別のposthog-fossリポジトリを立ち上げました。
  • このプラットフォームには、LLMアプリケーションのトレース、生成、レイテンシ、コストをキャプチャするためのAI可観測性機能が含まれています。
  • 分析、セッションリプレイ、機能フラグ、実験、エラー追跡、アンケートをオールインワンのプラットフォームで提供します。
  • ユーザーはLinux上のDockerを使用してPostHogをセルフホストでき、ホビーインスタンスには4GBのメモリが推奨されます。
  • PostHogは、Go、Django、.NET/C#、Angularなど、複数の言語やフレームワーク向けのSDKを提供しています。

開発者は、クラウドベンダーのロックインなしで、完全な製品分析およびAI可観測性スタックをローカルまたは独自のサーバーでセルフホストできます。

SOURCES

7. FableCutがエージェント駆動型のブラウザ動画エディタをリリース

FableCutは、人間とAIの共同ワークフロー向けに特別に設計された、オープンソースのブラウザベースの非線形動画エディタをリリースしました。タイムライン全体をJSONドキュメントとして公開することで、FableCutはAIエージェントがMCP、REST、または直接的なJSON操作を使用して、人間とリアルタイムで動画トラック、オーディオトラック、トランジションを編集できるようにします。システムはリビジョンカウンターを使用して同時編集をシームレスに処理し、AIによる背景削除や動画リファレンス分析のための組み込みツールが含まれています。

  • FableCutは、依存関係のないブラウザベースの非線形動画エディタで、タイムラインをJSONドキュメントとして公開します。
  • AIエージェントと人間は、MCP、REST、または直接的なJSON変更を使用して、同じタイムラインを同時に編集できます。
  • エディタは、4つのビデオトラック、3つのオーディオトラック、キーフレームアニメーション、トランジション、AI背景削除機能を備えています。
  • リビジョンカウンターが同時編集を管理し、人間とAIの変更間の競合を防ぎます。
  • 既存の動画からショットの境界、BPM、音楽を抽出するリファレンス分析ツールが含まれています。
  • このツールにはNode 18以降とChromiumベースのブラウザが必要で、オプションでffmpegサポートが利用可能です。

開発者は、人間の編集者とリアルタイムで並行して、タイムライン、トランジション、エフェクトをプログラムで操作する動画編集エージェントを構築できます。

SOURCES

8. OpenMed 1.8がモバイルおよびWeb向けのローカル臨床データ匿名化機能を追加

OpenMedは、Apache-2.0ライセンスの臨床NLPツールキットのバージョン1.8をリリースし、完全にローカルなクライアントサイドでの匿名化に焦点を当てました。このアップデートでは、Android、iOS/Swift、React Nativeブリッジ向けのOpenMedKitと、Transformers.jsおよびONNX Runtime Webを搭載したブラウザランタイムが導入されました。一般的なセキュリティ上の欠陥に対処するため、このリリースには、黒塗りの下に隠すだけでなく、編集されたテキストレイヤーが完全に削除されることを保証するverify-pdfツールが含まれており、新しいDICOMサポートと臨床NERドメインも追加されています。

  • OpenMed 1.8は、コンシューマーハードウェア上で完全にローカルに動作する臨床NLP向けのApache-2.0ライセンスツールキットです。
  • このリリースでは、Android(ONNX Runtime MobileおよびML Kit OCRを使用)、iOS/Swift、React Nativeブリッジ向けのOpenMedKitが導入されました。
  • 新しいブラウザランタイムは、クライアントサイドの匿名化のためにTransformers.jsとONNX Runtime Webを使用します。
  • 新しいverify-pdfツールは、黒塗りの下にテキストレイヤーが残るという編集の脆弱性を防ぎます。
  • このアップデートでは、DICOMの匿名化、5つの新しい言語IDパック、5つの新しい臨床NERドメインが追加されました。

機密性の高い医療データやPIIデータを扱う開発者は、外部APIにデータを送信することなく、モバイルやWeb上で安全なクライアントサイドの編集を実行できるようになりました。

SOURCES

9. Context.devが構造化Webデータ抽出用APIをリリース

Context.devは、LLMやAIエージェント向けのWebデータ抽出を簡素化するように設計されたAPIをリリースしました。このサービスは、あらゆるURLをクリーンなMarkdown、レンダリングされたHTML、スクリーンショット、またはユーザーが提供するスキーマに基づいた構造化JSONに変換します。また、ロゴ、色、フォント、説明を抽出する自動ブランドコンテキスト抽出機能も備えており、キャッシュレイヤーを組み込み、ウェブサイトのオプトアウト要求を尊重します。

  • Context.devは、URLからクリーンなMarkdown、レンダリングされたHTML、スクリーンショット、画像を抽出するAPIを提供します。
  • ユーザーはURLとターゲットのJSONスキーマを提供することで、ウェブサイトから構造化データを抽出できます。
  • このサービスは、会社名、説明、ロゴ、色、フォント、ソーシャルリンクなどのブランドコンテキストを抽出します。
  • プラットフォームにはリクエスト頻度を管理するためのキャッシュレイヤーが含まれており、ウェブサイトのオプトアウト要求を尊重します。
  • ブランドデータの使用はソフトウェア内の顧客識別に制限されており、外部マーケティングには使用できません。

ウェブサイトのオプトアウトを尊重し、キャッシュを自動的に処理する、LLM対応のクリーンなWebスクレイピングおよびブランド抽出APIを提供します。

SOURCES

10. レポート:企業の69%がAIエージェント間でAPIキーを共有

VentureBeatの第2四半期エージェントセキュリティレポートは、エンタープライズAIデプロイにおける深刻なセキュリティギャップを浮き彫りにし、組織の69%が複数のAIエージェント間でAPI認証情報を共有していることを明らかにしました。この広範な認証情報の共有により、調査対象企業の54%がAIエージェントのセキュリティインシデントまたはニアミスを経験しています。さらに、現在最もリスクの高いエージェントをサンドボックス化している企業はわずか30%で、残りはプロバイダーネイティブの制御に依存しています。このレポートは、過去1年間に220億ドル以上のセキュリティ買収が行われたことに象徴される、エージェントのアイデンティティを保護するための業界の巨大な動きを強調しています。

  • VentureBeatの第2四半期エージェントセキュリティレポートによると、調査対象企業の69%がAIエージェント間で認証情報を共有しています。
  • 調査によると、企業の54%がAIエージェントのセキュリティインシデントまたはニアミスを経験しています。
  • 現在、最もリスクの高いAIエージェントをサンドボックス化している企業はわずか30%です。
  • 主要なセキュリティベンダーは、CrowdStrikeのAIエージェント向けContinuous Identityなど、エージェントのセキュリティギャップに対処するために過去1年間で220億ドル以上を買収に費やしました。
  • 企業の82%が主要なセキュリティレイヤーとしてプロバイダーネイティブまたはハイパースケーラーの制御に依存しており、OpenAIが51%でトップです。

開発者がエージェントをデプロイする方法における重大なセキュリティの脆弱性を浮き彫りにし、サンドボックス化と分離された認証情報管理の緊急の必要性を強調しています。

SOURCES

11. Colibrìエンジンが32GB RAMで744B GLM 5.2 MoEモデルを実行

Colibrìという新しいオープンソースプロジェクトは、巨大な7440億パラメータのGLM 5.2 Mixture-of-Experts (MoE)モデルを標準的なコンシューマーハードウェア上で実行する方法を実証しました。モデルをint4に量子化することで、Colibrìは密な170億パラメータのコアをRAMに保持し(約9.9GBを使用)、残りの370GBの専門家を必要に応じてディスクからストリーミングします。PythonやGPUなどの外部依存関係を一切持たない1,300行の単一のCファイルで記述されたこのエンジンは、12コアのラップトップで毎秒0.1トークンを達成し、超大規模モデルをローカルで実行する実現可能性を証明しました。

  • Colibrìエンジンは、32GBのRAMを搭載した標準的なコンピューター上で744BパラメータのGLM 5.2 MoEモデルを実行します。
  • Colibrìはモデルをint4に変換し、密な17Bパラメータ部分を約9.9GBのRAMに常駐させます。
  • 残りの21,504のルーティングされた専門家(370GB)はディスクに保存され、レイヤーごとのLRUキャッシュとOSページキャッシュを使用してオンデマンドでストリーミングされます。
  • エンジンは約1,300行の単一のCファイルで実装されており、BLAS、Python、GPUは不要です。
  • 25GBのRAMを搭載した12コアのラップトップでのテストでは、毎秒0.1トークンのローカル推論パフォーマンスが得られました。

高価なGPUクラスターなしで、標準的なラップトップ上で大規模なフロンティアクラスのオープンモデルを実行できる新しいローカル推論技術を実証しています。

SOURCES

12. 研究:量子化が数学的精度に不釣り合いな影響を与えることを明らかに

FP16モデルとさまざまなGGUF量子化レベルを比較する体系的な評価により、量子化がすべての能力を均等に低下させるわけではないことが明らかになりました。27Bモデルでのテストでは、Q4_K_M量子化は会話や知識想起タスクでは2%未満のパフォーマンス低下しか生じませんでしたが、多段階の数学的精度では約9%の低下を引き起こしました。Q5_K_M量子化へのアップグレードはこの数学的精度のギャップを効果的に解消したため、推論や数学を多用するアプリケーションを構築する開発者は、標準の4ビット量子化を避け、5ビットバリアントを選択すべきであることが示唆されます。

  • 数学、コード、推論、想起にわたって、27BモデルでFP16とさまざまなGGUF量子化レベルを比較する体系的なテストが行われました。
  • Q4_K_M量子化は、会話や知識タスクにおいてFP16と比較して2%未満の劣化でした。
  • 同じQ4_K_M量子化により、多段階の数学的精度が約9%低下しました。
  • Q5_K_M量子化へのアップグレードにより、FP16と比較した数学的精度のギャップが効果的に解消されました。
  • この研究は、コンテキストウィンドウが埋まるにつれて量子化モデルのコンテキスト検索精度がより速く失われるかどうかについての厳密なテストが不足していることを指摘しています。

ローカルモデルを微調整またはデプロイする開発者は、標準のQ4量子化が会話テストでは問題ないように見えても、推論や数学的能力を密かに低下させる可能性があるため、量子化レベルを慎重に選択する必要があります。

SOURCES

13. 研究:マルチモデルLLMルーティングにおける「共失敗上限」を特定

67のフロンティアモデルを評価する研究により、マルチモデルオーケストレーションにおける「共失敗上限(co-failure ceiling)」、つまりルーティングプール内のすべてのモデルが同じプロンプトで同時に失敗する割合という数学的制限が特定されました。研究者は、標準的なペアワイズ誤差相関指標が実際の共失敗率を2.25倍過小評価していることを発見しました。さらに、この研究は、能力が不均等なモデル間での単純な多数決は、弱いモデルが最強のモデルを上回ってしまうため、パフォーマンスを低下させることが多いと警告しています。これを軽減するために、開発者は一致する品質帯内のモデルのみを組み合わせ、デプロイ前にClopper-Pearson境界を使用して絶対的なパフォーマンス上限を計算することを推奨しています。

  • 67のフロンティアモデルの評価により、プール内のすべてのモデルが同時に失敗するプロンプトの割合である「共失敗上限」が特定されました。
  • 標準的なペアワイズ誤差相関指標は、実際の共失敗率を2.25倍過小評価しています(例:MATH-500で2.3%の失敗率を予測したが、実際の率は5.2%だった)。
  • 能力が不均等なモデル間での単純な多数決は、弱いモデルが最も有能なモデルを上回ってしまうため、全体的なパフォーマンスを低下させる可能性があります。
  • 研究者は、一致する品質帯内のモデルのみを組み合わせるか、タスクに対して単一の最良モデルに頼ることを推奨しています。
  • 開発者は、マルチモデルシステムの絶対的なパフォーマンス上限を計算するために、コストのかからないデプロイ前のテストとしてClopper-Pearson境界を使用できます。

LLMルーティングやアンサンブルシステムを構築する開発者は、共失敗上限を考慮し、不均等なモデル間での単純な多数決を避ける必要があります。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。