Inference Brew

SpaceXAIがフロンティアモデルをGrok 4.6にアップグレード

00:00 / --:--

← ホームへ戻る

SpaceXAIがフロンティアモデルをGrok 4.6にアップグレード

1. SpaceXAIがフロンティアモデルをGrok 4.6にアップグレード

SpaceXAIは、Grok 4.5の後継モデルとなるGrok 4.6をリリースしました。長時間実行エージェント、コーディング、ナレッジワーク向けに設計されたこの新しいモデルは、セーフガードが強化され、再生成されたSFT軌道でトレーニングされています。現在、Grok Buildプラットフォーム、Cursor、OpenRouter、Vercel、Cloudflareを通じて利用可能です。

  • • Grok 4.6はGrok 4.5の後継であり、Artificial Analysis Intelligence Indexで61を記録。
  • • 価格は前バージョンと同様、入力トークン100万あたり2ドル、出力トークン100万あたり6ドル。
  • • 50万トークンのコンテキストウィンドウ、関数呼び出し、構造化出力を備えている。
  • • Grok Build、Cursor、OpenRouter、Vercel、Cloudflareを通じて即時利用可能。

開発者は、GPT-5.6 Solのパフォーマンスに匹敵し、前回のGrok 4.5リリースの機能を基盤とした、エージェント最適化済みの最新フロンティアモデルを利用できるようになります。

2. AlibabaがオープンウェイトのQwen3.8-2.4T-A95B-FP8 MoEモデルをリリース

AlibabaはQwen3.8-Maxモデルのオープンウェイトをリリースするという約束を果たし、Qwen3.8-2.4T-A95B-FP8として利用可能になりました。この巨大なMixture-of-Experts(MoE)モデルは、950億のアクティブパラメータ、262Kのネイティブコンテキストウィンドウ、推論のための必須の思考モードを備えています。主要な推論フレームワークを通じてセルフホストが可能です。

  • • Qwen3.8-2.4T-A95B-FP8は、合計2.4兆パラメータを持ち、512の専門家(エキスパート)全体で950億パラメータがアクティブ化される。
  • • ネイティブコンテキスト長は262,144トークンで、最大1,010,000トークンまで拡張可能。
  • • 出力前に推論がタグ内に生成される必須の思考モードが必要。
  • • reasoning_effortパラメータ(xhigh、medium、low)を使用して推論の深さを調整可能。
  • • Transformers、vLLM、SGLang推論フレームワークと互換性がある。

これまでQwenCloudでのAPIアクセスに限定されていたフロンティアクラスのQwen3.8-Maxモデルを、開発者がセルフホストできるようになりました。

3. DeepSeek、NVIDIA、Mistralの新しいオープンウェイトモデルがエコシステムに参入

オープンウェイトモデルの状況は急速に拡大しています。MetaのMuse Glimmerの最近のリリースに続き、今週はDeepSeek-V4-Flash-0731、NVIDIAのNemotron-3.5-Lightning-30B-A3BおよびVoiceChat-11B、Liquid AIのLFM2.5-2.6B、MistralのShieldstral-1.0-3Bが追加され、開発者にローカルデプロイのための多様な新しいツールが提供されました。

  • • DeepSeek-V4-Flash-0731は、MITライセンス下の304B MoEモデル。
  • • NVIDIAはNemotron-3.5-Lightning-30B-A3Bと全二重のVoiceChat-11Bをリリース。
  • • Liquid AIは131kコンテキストをサポートするLFM2.5-2.6Bをリリース。
  • • MistralはマルチモーダルガードレールモデルであるShieldstral-1.0-3Bをリリース。

開発者は、最近リリースされたMuse Glimmer以外にも、ローカルデプロイ、低遅延推論、エージェントワークフロー向けの専門的で寛容なライセンスを持つモデルをさらに幅広く選択できるようになりました。

SOURCES

4. Upstageが推論モデル「Solar Pro 4」をローンチ

Upstageは、エージェントタスクや長文コンテキストタスクにおいて大幅なパフォーマンス向上を示す独自のフラッグシップ推論モデル「Solar Pro 4」を立ち上げました。このモデルは巨大なコンテキストウィンドウと高い最大出力制限を備えており、複雑な多段階推論ワークフローに適しています。

  • • UpstageがSolar Pro 4をリリース。Artificial Analysis Intelligence IndexでSolar Pro 3の14から42にスコアが向上。
  • • 価格はUpstageのファーストパーティAPI経由で入力トークン100万あたり0.30ドル、出力トークン100万あたり1.20ドル。
  • • 512Kトークンのコンテキストウィンドウと128Kトークンの最大出力制限を備える。
  • • UpstageのファーストパーティAPI、OpenRouter、TimelyRouterを通じて利用可能。
  • • Solar Pro 4はハルシネーション率を24%に低減し、Terminal-Bench v2.1スコアを57に向上させた。

開発者は、巨大なコンテキストウィンドウとエージェントパフォーマンスの向上を備えた低コストの推論モデルを、大量のタスクに活用できます。

SOURCES

5. Liquid AIがオンデバイスビジョンモデル「LFM2.5-VL-3B」をリリース

Liquid AIは、LFM2.5ハイブリッドモデルファミリーのマルチモーダルバリアントであるLFM2.5-VL-3Bをリリースしました。LFM2.5-2.6B言語バックボーンとSigLIP2 NaFlex 400Mビジョンエンコーダーを組み合わせたこのモデルは、ローカルのオンデバイスデプロイメントに最適化されており、小さなメモリフットプリント内で高スループットの推論を提供します。

  • • Liquid AIが32Kコンテキストウィンドウを持つ3.1Bパラメータのビジョン言語モデル「LFM2.5-VL-3B」をリリース。
  • • モデルはローカルで動作し、Apple M5 Maxで228トークン/秒、Galaxy S26 Ultraで20トークン/秒を3GBのメモリ内で達成。
  • • SigLIP2 NaFlex 400Mビジョンエンコーダーを搭載し、16言語をサポート。
  • • ほぼリアルタイムの物体検出、レイアウト注釈付きOCR、オンデバイス翻訳に最適化。
  • • Hugging Faceで利用可能であり、atomic.chatモバイルアプリケーションを使用してテスト可能。

開発者は、リアルタイムの物体検出、OCR、翻訳のために、コンシューマーハードウェア上で高速かつ軽量なビジョンモデルをローカルにデプロイできます。

SOURCES

6. GitHubがCopilotを「MAI-Code-1.1-Flash」にアップグレード

2026年6月のMAI-Code-1-Flashモデルの初期リリースを基盤として、GitHubはMAI-Code-1.1-Flashをリリースしました。この更新されたモデルは、トークン効率が25%向上し、元のモデルの4分の1の価格でありながら、コーディングタスクにおけるパフォーマンスが向上しています。

  • • MAI-Code-1.1-Flashは、2026年6月にリリースされたオリジナルのMAI-Code-1-Flashモデルの後継。
  • • 新しいモデルはトークン効率が25%向上し、前モデルよりコストが75%削減された。
  • • パフォーマンスの向上には、Terminal-Bench 2.1で22%のゲイン、.NETタスクで15%の改善が含まれる。
  • • このモデルは現在、GitHub Copilot内で利用可能。

GitHub Copilotを使用する開発者は、以前のバージョンよりも大幅に低いコストで、より高速で高品質なコード生成とCLIパフォーマンスの向上を享受できます。

SOURCES

7. Cohereが「North-Micro-Vision-Instruct」モデルをリリース

CohereLabsは、研究開発タスク向けに設計されたオープンウェイトビジョン言語モデル「North-Micro-Vision-Instruct」をリリースしました。このモデルは、2Bパラメータの言語バックボーンと400Mパラメータのビジョンエンコーダーを備えており、ネイティブ解像度の画像処理とマルチ画像入力をサポートしています。

  • • North Micro Vision Instructは、2Bの言語バックボーンと400MのSigLIP 2ビジョンエンコーダーを組み合わせた2.4Bパラメータモデル。
  • • Apache 2.0ライセンスでリリースされ、Hugging Faceで利用可能。
  • • ネイティブ解像度の画像処理、マルチ画像入力、128Kトークンの言語コンテキストウィンドウをサポート。
  • • 研究、プロトタイピング、ファインチューニング、文書理解向けに設計。
  • • ツール呼び出しやエージェントワークフローはサポートしておらず、数学やコード生成能力は限定的。

開発者は、プロトタイピング、文書理解、視覚的QAのために、軽量で寛容なライセンスを持つビジョンモデルをセルフホストできます。

SOURCES

8. Mistralがリージョンエンドポイントと優先ティアをローンチ

Mistralは、企業にAIモデルとインフラストラクチャに対するより大きな制御を提供することで、AI主権を推進しています。同社はリージョンエンドポイントを一般公開し、顧客が推論処理のためにヨーロッパまたは米国を選択できるようにしました。また、コミットされたサービスレベルとカスタムレート制限を提供する優先ティアを導入しました。

  • • Mistralリージョンエンドポイントが一般公開され、顧客は推論処理のためにヨーロッパまたは米国を選択可能。
  • • Mistral優先ティアがパブリックプレビューとなり、コミットされたサービスレベル、カスタムレート制限、稼働率SLAを提供。
  • • Mistralは、Z.aiのGLM-5.2を皮切りに、サードパーティのオープンモデルをサポートするためにプラットフォームを拡大中。
  • • 同社は、複数年のコミットメントをインフラストラクチャアクセスに変換するためのEuropean Compute Units (ECUs)を導入。

開発者は、ヨーロッパまたは米国でのリージョン内推論処理を保証し、ミッションクリティカルなワークロードに対してコミットされたサービスレベルを確保できるようになりました。

SOURCES

9. LiteLLMのサプライチェーン攻撃により2,500以上の組織の認証情報が流出

オープンソースツール「LiteLLM」に対する大規模なサプライチェーン攻撃により、Microsoft、Amazon、Cisco、Samsung、Salesforceを含む2,500以上の組織の認証情報が流出しました。この侵害は、被害者がTrivy脆弱性スキャナーに対する以前のサプライチェーン攻撃に起因する、侵害されたバージョンのLiteLLMをPython Package Index (PyPI)からダウンロードしたために発生しました。

  • • LiteLLMへのサプライチェーン攻撃により、2,500以上の組織のクラウドキー、リポジトリトークン、AIプロバイダーキーを含む認証情報が流出。
  • • 侵害は、ユーザーがPython Package Index (PyPI)から侵害されたバージョンのLiteLLMをダウンロードしたために発生。
  • • 侵害は、KICSやTelnyx Python SDKにも影響を与えたTrivy脆弱性スキャナーへの以前のサプライチェーン攻撃に起因。
  • • 盗まれた認証情報は3月の40分間に流出し、データの正当性はセキュリティ研究者によって確認されている。

LiteLLMを使用する開発者は、直ちに環境を監査し、流出したAPIキーをローテーションし、侵害されたバージョンのパッケージを実行していないことを確認する必要があります。

SOURCES

10. Cursorが自動PRパイプラインのために「Origin」を「Cursor Review」にリブランド

2026年6月のGit互換フォージ「Origin」の初期リリースに続き、Cursorは現在、新しい名称「Cursor Review」の下でプラットフォームをクローズドベータから移行させています。更新されたプラットフォームには、リポジトリ管理用の「Codebase」タブと、人間とAIエージェント間の自動プルリクエストワークフローを促進するための「Review」タブが搭載されます。

  • • Cursorは「Origin」プラットフォームを「Cursor Review」にリブランド。
  • • プラットフォームはクローズドパートナーベータから移行中。
  • • 新機能には、リポジトリ管理用の「Codebase」タブと、自動PRパイプライン用の「Review」タブが含まれる。
  • • パブリックロールアウトは早ければ今週中にも予想される。

この移行は、CursorのエージェントネイティブなGitフォージが、クローズドベータから、共同コードレビューのためのより広範で機能重視のプラットフォームへと進化したことを示しています。

SOURCES

11. 推論デコーディングがApple Silicon上でのMuse Glimmer 30Bを高速化

ある開発者が、Apple Silicon上のmlx-dsparkプロジェクトにおいて、MetaのMuse Glimmer 30Bモデルの推論デコーディングを実装しました。この実装は、数学、コード、チャットタスク全体で大幅な高速化を実現しつつ、出力が通常のデコーディングとバイト単位で同一であることを保証し、モデルの品質を維持しています。

  • • mlx-dsparkプロジェクトでの推論デコーディングにより、M4 Pro上でのMuse Glimmer 30Bの速度が8.2から最大26トークン/秒に向上。
  • • 8ビットモデルの高速化係数は、数学で3.27倍、コードで2.5倍、チャットで2.22倍。
  • • 出力は通常のデコーディングとバイト単位で同一であり、モデル品質の低下がないことを保証。
  • • 8ビット実行はメモリ使用量が40GBでピークに達し、4ビットビルドは18GBのメモリを必要としつつ1.7倍の高速化を提供。
  • • プロジェクトはオープンソースであり、GitHubで利用可能。

Apple Silicon上でローカルモデルを実行する開発者は、出力品質を損なうことなく、遅延を劇的に削減できます。

SOURCES

12. 新しい研究により、トークン削減ツールがLLMコストを増加させる可能性があることが判明

rtkやheadroomのようなトークン圧縮ツールが「分母効果」のためにわずかな実質的節約しか提供しないという以前の報告に続き、PointFiveによる新しい研究では、その影響が以前の理解よりも深刻である可能性が示唆されています。103のタスクにわたる2,908のClaude Codeセッションを評価した結果、コスト削減策として販売されることが多いこれらのツールが、モデルやタスク構成によっては、実際にはLLMの総コストを最大46.4%増加させる可能性があることがわかりました。

  • • PointFiveは、2,908のClaude Codeセッションと103のタスクを評価し、トークン削減ツールの実質的なコスト影響を測定。
  • • 研究では、これらのツールが最大90%の節約というマーケティング上の主張に反し、LLMコストを最大46.4%増加させる可能性があることが判明。
  • • この発見は、これらのツールに関連する3.7%のわずかな節約と運用リスクを特定した2026年6月の以前のベンチマークを拡張するもの。

開発者は、宣伝されている節約効果に対する懐疑的な姿勢を超えて、トークン削減戦略を積極的にベンチマークする必要があります。これらのツールは、コスト最適化ソリューションではなく、API支出増加の原因として特定される可能性があるためです。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。