Inference Brew

MiniMax lanza el modelo M3 con contexto de 1M de tokens y control de escritorio

00:00 / --:--

← Volver al inicio

MiniMax lanza el modelo M3 con contexto de 1M de tokens y control de escritorio

1. MiniMax lanza el modelo M3 con contexto de 1M de tokens y control de escritorio

MiniMax lanzó oficialmente el modelo M3 el 1 de junio de 2026, introduciendo la arquitectura MiniMax Sparse Attention (MSA). Esta arquitectura utiliza un enfoque de "KV outer gather Q" para reducir significativamente las demandas de cómputo en comparación con generaciones anteriores. Además de su ventana de contexto de 1 millón de tokens, M3 admite entrada nativa de imagen y video, y puede operar una computadora de escritorio. El modelo es accesible a través de MiniMax Code, el Token Plan y los servicios de API de MiniMax, con planes de suscripción desde $20 al mes.

  • MiniMax M3 cuenta con una ventana de contexto de 1M de tokens impulsada por la nueva arquitectura MiniMax Sparse Attention (MSA).
  • La arquitectura MSA reduce el cómputo por token a 1/20 de los modelos anteriores, logrando una aceleración de 9x en prellenado y 15x en decodificación a 1M de tokens.
  • El modelo obtuvo un 59.0% en SWE-Bench Pro y un 70.06% en OSWorld-Verified, y puede procesar nativamente entradas de imagen/video y operar un escritorio.
  • Los pesos se lanzarán bajo una licencia de pesos abiertos en un plazo de 10 días, y el precio de la API tiene un descuento temporal a $0.30/M de tokens de entrada y $1.20/M de salida.

Proporciona a los desarrolladores un modelo de contexto largo altamente eficiente que logra un fuerte rendimiento agente a un precio de API introductorio con un gran descuento.

2. NVIDIA lanza los modelos de IA física de pesos abiertos Cosmos 3

Cosmos 3 de NVIDIA integra razonamiento físico, generación de mundos y generación de acciones. La arquitectura consta de una torre de razonamiento (Reasoner) para la interpretación de observaciones multimodales y una torre de generación (Generator) para la salida de video y acciones conscientes de la física. El lanzamiento incluye puntos de control de modelos de código abierto en Hugging Face, scripts de entrenamiento en GitHub y seis conjuntos de datos de generación sintética. Los modelos están disponibles como microservicios NVIDIA NIM, con el NIM de razonamiento ya disponible y el NIM de generación próximo a lanzarse.

  • NVIDIA lanzó Cosmos 3 en variantes de 16B (Nano) y 64B (Super) parámetros bajo la licencia OpenMDW 1.1.
  • Los modelos utilizan una arquitectura Mixture-of-Transformers que combina un razonador autorregresivo con un generador de difusión.
  • Las variantes Cosmos 3 Super alcanzaron el puesto #1 en el ranking de pesos abiertos para Text-to-Image y Image-to-Video en los Artificial Analysis Leaderboards.
  • Los pesos del modelo, scripts de entrenamiento y conjuntos de datos están disponibles en Hugging Face y GitHub, con microservicios NIM que soportan cuantización NVFP4 para una aceleración de 2x.

Los desarrolladores pueden autoalojar estos modelos para observación multimodal y generación de video utilizando la licencia OpenMDW 1.1 y los puntos de control de Hugging Face.

3. NVIDIA anuncia el modelo de pesos abiertos Nemotron 3 Ultra de 550B

Anunciado durante la conferencia de Jensen Huang en Computex, Nemotron 3 Ultra se posiciona como el modelo de pesos abiertos de EE. UU. más inteligente disponible actualmente. El modelo utiliza un 90% de dispersión para mantener 55 mil millones de parámetros activos de sus 550 mil millones totales. Aunque obtuvo una puntuación inferior al modelo Kimi K2.6 (54) en el Artificial Analysis Intelligence Index, superó a varios otros modelos de pesos abiertos.

  • Nemotron 3 Ultra cuenta con 550B de parámetros totales con 55B de parámetros activos mediante un 90% de dispersión.
  • El modelo obtuvo 48 en el Artificial Analysis Intelligence Index, superando a Gemma 4 31B (39) y Nemotron 3 Super (36).
  • Logró velocidades superiores a 300 tokens por segundo en un endpoint de pre-lanzamiento de DeepInfra.
  • El modelo se lanza en pesos BF16, con cuantización NVFP4 planificada para un lanzamiento futuro.

Proporciona a los desarrolladores una opción de modelo de pesos abiertos de EE. UU. altamente capaz que funciona a más de 300 tokens por segundo en endpoints optimizados.

SOURCES

4. Modelos frontera de OpenAI y Codex se lanzan en Amazon Bedrock

La disponibilidad general de los modelos frontera de OpenAI y Codex en AWS permite a los clientes empresariales utilizar estas capacidades dentro de su infraestructura en la nube existente. Esta integración admite controles de seguridad y gobernanza nativos de AWS. Además, la próxima suite Daybreak de OpenAI en AWS está diseñada para ayudar a los defensores cibernéticos con revisiones de código seguras, modelado de amenazas, validación de parches, análisis de riesgos de dependencias y orientación para la remediación.

  • Los modelos frontera de OpenAI y Codex ya están disponibles de forma general en Amazon Bedrock tanto en regiones comerciales como en GovCloud.
  • La integración permite a los clientes de AWS ejecutar modelos de OpenAI dentro de sus flujos de trabajo de cumplimiento, adquisiciones y seguridad existentes.
  • Codex en Bedrock está disponible para ayudar a los equipos de desarrollo con la revisión de código, depuración y modernización.
  • OpenAI planea llevar su suite de ciberseguridad Daybreak, incluyendo Codex Security, a AWS en un futuro lanzamiento.

Los desarrolladores que despliegan en AWS ahora pueden integrar los modelos de OpenAI directamente a través de Amazon Bedrock, aprovechando los controles de gobernanza nativos de AWS y la facturación unificada.

SOURCES

5. Paquetes npm de Red Hat comprometidos atacan a Claude Code y VS Code

El 1 de junio de 2026, StepSecurity descubrió malware dentro del ámbito npm @redhat-cloud-services. La carga útil maliciosa está contenida en un archivo index.js de 4.2 MB activado por un script preinstall en el archivo package.json, utilizando cuatro capas de ofuscación. El tráfico de exfiltración se enruta a través de api.github.com para imitar la actividad legítima de la API de GitHub. StepSecurity ha presentado problemas de divulgación para tres repositorios afectados, incluido RedHatInsights/platform-frontend-ai-toolkit.

  • StepSecurity identificó malware en el ámbito npm @redhat-cloud-services que se ejecuta automáticamente durante npm install mediante un script preinstall.
  • El malware apunta a credenciales para AWS, GCP, Azure, Kubernetes, HashiCorp Vault, GitHub Actions y CircleCI.
  • Establece persistencia inyectando un gancho SessionStart en la configuración de Claude Code y una tarea folderOpen en las configuraciones del espacio de trabajo de VS Code.
  • El gusano autopropagable utiliza tokens npm robados y el parámetro bypass_2fa para volver a publicar versiones con puertas traseras de 32 paquetes afectados.

Los desarrolladores que utilizan estos paquetes deben auditar inmediatamente sus entornos, ya que el malware inyecta ganchos maliciosos directamente en la configuración de Claude Code y las configuraciones del espacio de trabajo de VS Code.

SOURCES

6. xAI lanza la API Grok Build 0.1 para codificación agente

El modelo grok-build-0.1 ya está disponible en beta pública, proporcionando una opción de alta velocidad para los desarrolladores que construyen flujos de trabajo de codificación agente. El modelo está diseñado para procesar datos a velocidades superiores a 100 tokens por segundo, lo que lo hace altamente receptivo para tareas de depuración y desarrollo web en tiempo real.

  • xAI lanzó el modelo grok-build-0.1 en beta pública a través de su API.
  • El modelo está optimizado para codificación agente, específicamente desarrollo web y depuración, procesando más de 100 tokens por segundo.
  • El precio de la API se establece en $1 por millón de tokens de entrada y $2 por millón de tokens de salida.
  • Se integra directamente con plataformas de desarrollo incluyendo Cursor, Grok Build y OpenClaw.

Los desarrolladores pueden integrar inmediatamente este modelo en sus flujos de trabajo diarios a través de Cursor u OpenClaw para una codificación agente rápida a $1 por millón de tokens de entrada.

SOURCES

7. Microsoft presentará el modelo de razonamiento MAI-Thinking-1 en Build

La conferencia Build de Microsoft en San Francisco se centrará en gran medida en la IA y las mejoras de Windows centradas en el desarrollador. Se espera que el jefe de IA de Microsoft, Mustafa Suleyman, lidere los anuncios, que incluyen nuevos modelos de IA locales y una experiencia de usuario de Windows 11 reescrita. Las demostraciones también incluirán Microsoft Scout, un agente de IA basado en el trabajo de OpenClaw de la compañía.

  • Se espera que Microsoft presente MAI-Thinking-1, su primer modelo de razonamiento nativo y no destilado, en su conferencia Build.
  • La compañía introducirá los modelos MAI-Image-2.5 y MAI-Image-2.5-Flash, junto con una vista previa de una "super app" de Copilot a finales del verano.
  • Microsoft enfatizará la ejecución de modelos de IA locales en Windows para aprovechar el cómputo local en lugar de las API en la nube.
  • Una nueva experiencia de Windows 11 optimizada para desarrolladores proporcionará un entorno libre de distracciones con herramientas y scripts de desarrollo preinstalados.

Los desarrolladores obtendrán acceso a nuevos modelos nativos de razonamiento e imagen, además de un entorno de Windows 11 optimizado para desarrolladores diseñado para la ejecución local de IA.

SOURCES

8. Memory OS lanza una pila de memoria de código abierto de 6 capas para agentes Hermes

Lanzado el 31 de mayo de 2026, Memory OS ofrece un enfoque estructurado para gestionar la memoria de los agentes. El sistema utiliza una cascada de respaldo de cuatro niveles para la recuperación y un escáner de decaimiento semanal para gestionar la hinchazón de la memoria. Aunque el proyecto se encuentra en sus etapas iniciales de desarrollo y requiere una configuración compleja de múltiples servicios, proporciona una pila de memoria altamente personalizable para los desarrolladores que construyen con Hermes.

  • Memory OS es una arquitectura de memoria con licencia MIT diseñada para ejecutarse localmente utilizando Docker, Qdrant, Redis y Python.
  • El sistema implementa seis capas de memoria, incluyendo archivos de espacio de trabajo, historial de sesiones, hechos estructurados y una wiki de LLM auto-curada.
  • Cuenta con un proceso de recuperación cerrado y deduplicado durante pre_llm_call y captura nueva información durante post_llm_call y on_session_end.
  • La arquitectura es compatible con cualquier proveedor de LLM compatible con el agente Hermes, aunque actualmente carece de puntos de referencia publicados.

Proporciona a los desarrolladores una pila de memoria local lista para producción con curación automática, almacenamiento vectorial y escaneo de decaimiento para evitar la hinchazón del contexto.

SOURCES

9. Los asistentes Pi obtienen flujos de trabajo multi-agente a través de pi-dynamic-workflows

La extensión pi-dynamic-workflows permite a los asistentes Pi orquestar tareas complejas distribuyendo el trabajo a subagentes. Estos subagentes operan de forma aislada para realizar acciones específicas, como leer archivos o ejecutar comandos de shell, antes de que el asistente principal sintetice los resultados finales.

  • La extensión pi-dynamic-workflows introduce una herramienta de flujo de trabajo para los asistentes Pi.
  • Los asistentes pueden ejecutar scripts de JavaScript para distribuir tareas entre múltiples subagentes aislados.
  • Los subagentes son capaces de leer archivos, ejecutar comandos de shell y generar resultados estructurados.
  • La herramienta está diseñada para auditorías de bases de código, revisiones desde múltiples perspectivas, refactorizaciones grandes y búsqueda distribuida.

Proporciona un marco estructurado para que los desarrolladores automaticen tareas complejas de varios pasos, como auditorías de bases de código y refactorizaciones a gran escala.

SOURCES

10. AgentControl lanza monitoreo y dirección de producción para agentes de IA

AgentControl aborda los desafíos de gestionar agentes autónomos en entornos en vivo. Al proporcionar visibilidad en tiempo real y capacidades de dirección, la plataforma permite a los desarrolladores bloquear comportamientos indeseables y experimentar con variaciones del comportamiento del agente de forma dinámica.

  • AgentControl es una herramienta de monitoreo y gestión de producción para agentes de IA.
  • La plataforma permite a los desarrolladores ver las actividades de los agentes, bloquear comportamientos no deseados y dirigir las respuestas en tiempo real.
  • Los usuarios pueden experimentar e iterar sobre los comportamientos de los agentes sin pasar por un ciclo de despliegue completo.
  • La herramienta está actualmente disponible para una prueba gratuita.

Brinda a los desarrolladores visibilidad inmediata y control en tiempo de ejecución sobre agentes autónomos sin necesidad de volver a desplegar código.

SOURCES

11. JetBrains lanza modelos MoE enfocados en codificación Mellum-2 de código abierto

La serie Mellum-2 está diseñada como una opción de modelo rápido para flujos de trabajo de IA. Alojados en Hugging Face y documentados en un informe técnico de arXiv, los modelos están optimizados para tareas de codificación, aunque JetBrains señala que funcionan peor que Qwen 3.5 4B en dominios no relacionados con la codificación.

  • JetBrains lanzó la serie de modelos pequeños Mixture-of-Experts (MoE) Mellum-2 como código abierto en Hugging Face.
  • El modelo de razonamiento de la serie ofrece un rendimiento de codificación comparable a Qwen 3.5 9B.
  • Mellum-2 está optimizado para la velocidad en flujos de trabajo de IA, pero funciona peor que Qwen 3.5 4B en tareas no relacionadas con la codificación.

Ofrece a los desarrolladores una alternativa local y ligera para la generación de código que funciona de manera comparable a modelos más grandes como Qwen 3.5 9B.

SOURCES

12. llama.cpp b9455 corrige error de caché KV cuantizada multi-GPU

El lanzamiento b9455 de llama.cpp aborda un problema crítico multi-GPU en la rama principal. Al extender la especificación ggml_backend_meta_split_state, la corrección permite que el backend meta restaure el diseño de datos correcto después de cambiar la forma, resolviendo la pérdida de información de forma causada por el aplanamiento de tensores.

  • El lanzamiento b9455 de llama.cpp corrige un error que ocurría al usar --sm tensor con una caché KV cuantizada en configuraciones multi-GPU.
  • El error era causado por el aplanamiento de tensores durante la rotación de la caché KV, lo que eliminaba la información de forma necesaria para el backend meta.
  • La corrección extiende la especificación ggml_backend_meta_split_state para rastrear la frecuencia de repetición de segmentos, restaurando el diseño correcto.
  • La implementación es totalmente compatible con versiones anteriores y no requiere cambios en los grafos de cómputo existentes de llama.cpp.

Los desarrolladores que ejecutan inferencia multi-GPU local ahora pueden usar de forma segura cachés KV cuantizadas con división de tensores sin modificar sus grafos de cómputo existentes.

SOURCES

13. ByteDance lanza el modelo de generación de video Bernini en Hugging Face

ByteDance ha lanzado Bernini en la plataforma Hugging Face. El modelo está diseñado para generar o editar videos utilizando texto, imágenes o referencias como entrada, y se afirma que rivaliza con el rendimiento de los principales modelos de generación de video de código cerrado.

  • ByteDance lanzó el modelo de generación y edición de video Bernini en Hugging Face.
  • El modelo acepta texto, imágenes o videos de referencia como entradas para generar o editar contenido de video.
  • Bernini está posicionado para rivalizar con el rendimiento de los principales modelos de generación de video de código cerrado.

Los desarrolladores pueden acceder y alojar un modelo de generación de video altamente capaz localmente o a través de Hugging Face para construir flujos de trabajo de edición de video personalizados.

SOURCES

14. El CSTO de Snowflake aboga por permisos basados en intención y puertas de enlace MCP para agentes de IA

Mayank Upadhyay, Director de Seguridad y Confianza en Snowflake, argumenta que la adopción de la seguridad falla cuando el camino seguro es más difícil de usar que el inseguro. Señala que los agentes de IA a menudo poseen permisos excesivos, lo que aumenta la superficie de ataque. Para abordar esto, aboga por credenciales específicas para cada tarea y sugiere las puertas de enlace MCP como un método práctico para codificar centralmente las reglas de gobernanza.

  • El CSTO de Snowflake recomienda otorgar a los agentes credenciales de corta duración específicas para cada tarea basadas en la intención, en lugar de permisos estáticos y excesivos.
  • Las puertas de enlace MCP se destacan como una herramienta práctica para codificar centralmente las reglas de gobernanza en múltiples conexiones de agente a herramienta.
  • El autor aconseja utilizar la identidad de carga de trabajo en la nube para eliminar claves estáticas y cerrar las brechas de visibilidad del 20% que los agentes de IA pueden explotar.

Los desarrolladores que construyen flujos de trabajo agente pueden usar puertas de enlace MCP para gestionar y gobernar centralmente múltiples conexiones de agente a herramienta, reduciendo la superficie de ataque de agentes con privilegios excesivos.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.