Inference Brew

SpaceXAI gradúa su modelo de codificación a Grok 4.5

00:00 / --:--

← Volver al inicio

SpaceXAI gradúa su modelo de codificación a Grok 4.5

1. SpaceXAI gradúa su modelo de codificación a Grok 4.5

SpaceXAI ha lanzado oficialmente Grok 4.5, el sucesor de la beta grok-build-0.1. Mientras que la beta se centraba en el desarrollo web y la depuración, Grok 4.5 es un modelo más robusto entrenado en asociación con Cursor, optimizado específicamente para ingeniería de software compleja y tareas de agentes autónomos. Ya está disponible en Grok Build, Cursor y la consola de SpaceXAI.

  • Grok 4.5 sucede a la beta grok-build-0.1, ofreciendo un rendimiento mejorado para la ingeniería de software.
  • Tiene un precio de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida.
  • Entrenado en asociación con Cursor utilizando datos de interacción y el superordenador Colossus de SpaceX.
  • Alcanzó un 64,7% en SWE Bench Pro, superando a las iteraciones anteriores.
  • Disponible en Grok Build, Cursor y la consola de SpaceXAI.

Los desarrolladores ahora tienen acceso a un modelo de nivel de producción centrado en la ingeniería de software que mejora las capacidades y la eficiencia de la versión beta anterior.

2. OpenAI lanza oficialmente los modelos de voz full-duplex GPT-Live

OpenAI ha hecho la transición de su investigación de audio bidireccional, previamente identificada como GPT-Bidi-1, a un producto listo para producción llamado GPT-Live. Los nuevos modelos GPT-Live-1 y GPT-Live-1 mini permiten una interacción de voz full-duplex, lo que permite escuchar y hablar simultáneamente. Los modelos se están desplegando globalmente para los suscriptores de ChatGPT, con la versión 'mini' más pequeña sirviendo como predeterminada para los usuarios gratuitos.

  • OpenAI ha lanzado oficialmente GPT-Live-1 y GPT-Live-1 mini, la versión de producción del modelo GPT-Bidi-1 previamente anunciado.
  • Los modelos cuentan con una arquitectura full-duplex que permite hablar y escuchar simultáneamente.
  • El sistema se está desplegando globalmente en iOS, Android y la web para los usuarios de ChatGPT.
  • GPT-Live desacopla la capa de interacción de voz de la capa de razonamiento, delegando tareas complejas a GPT-5.5.
  • El acceso a la API aún no está disponible, pero se ha abierto un formulario de registro para acceso futuro.

Este lanzamiento marca la transición de la tecnología de audio bidireccional anunciada anteriormente a un producto orientado al consumidor, permitiendo conversaciones de voz naturales e interrumpibles en ChatGPT.

3. OpenAI expande la vista previa de GPT-5.6 a desarrolladores globales

Tras la vista previa inicial restringida al gobierno de la serie GPT-5.6 anunciada el 26 de junio, OpenAI ahora está ampliando el acceso a una audiencia global. Esta expansión permite a un conjunto más amplio de desarrolladores probar el modelo insignia Sol, el equilibrado Terra y el rentable Luna antes de que los modelos alcancen la disponibilidad general.

  • OpenAI está expandiendo la vista previa de GPT-5.6 de solo gobierno a una audiencia global de desarrolladores.
  • La línea incluye los modelos insignia Sol, el equilibrado Terra y el modelo de bajo coste Luna.
  • Esta expansión sirve como la fase de prueba final antes de que los modelos alcancen la disponibilidad general.
  • Los desarrolladores ahora pueden evaluar el rendimiento y la rentabilidad de los modelos para sus casos de uso específicos.

Los desarrolladores que anteriormente estaban excluidos de la vista previa limitada solo para el gobierno ahora pueden comenzar a integrar y probar la nueva línea GPT-5.6, incluidas las variantes insignia y optimizadas en costes, antes del lanzamiento público completo.

SOURCES

4. Google expande la familia Gemma 4 con una gama completa de modelos multimodales

Google ha expandido su línea multimodal de pesos abiertos Gemma 4, yendo más allá del modelo de 12B lanzado anteriormente para ofrecer un conjunto completo de tamaños desde 2,3B hasta 31B de parámetros. Estos modelos cuentan con una arquitectura unificada sin codificador, modo de pensamiento nativo y soporte de contexto largo, todo lanzado bajo la licencia permisiva Apache 2.0 para facilitar despliegues locales con recursos limitados.

  • La familia Gemma 4 ahora incluye modelos que van desde 2,3 mil millones hasta 31 mil millones de parámetros.
  • La línea completa mantiene la arquitectura unificada sin codificador y el modo de pensamiento nativo introducido en la versión de 12B.
  • Todos los modelos están disponibles bajo la licencia Apache 2.0.
  • La expansión ofrece más opciones para equilibrar el rendimiento y los requisitos de hardware en despliegues locales.

Los desarrolladores ahora tienen acceso a una gama más amplia de tamaños de modelo, lo que permite un mejor escalado entre modelos ligeros de 2,3B y variantes más capaces de 31B para aplicaciones multimodales locales.

SOURCES

5. NVIDIA lanza el modelo de mezcla de expertos audio-texto Audex 30B

NVIDIA ha lanzado Audex, un modelo de mezcla de expertos (MoE) audio-texto de 30 mil millones de parámetros que activa 3B de parámetros por token. Para evitar el problema común de la degradación del rendimiento del texto al añadir capacidades multimodales, Audex fue entrenado utilizando un plan de estudios SFT de múltiples etapas y Cascade RL solo de texto. El modelo admite una longitud de contexto de 1M de tokens, se integra con marcos de servicio estándar como vLLM y logró una tasa de error de palabra promedio de 6,82 en la tabla de clasificación OpenASR. Sin embargo, los desarrolladores deben tener en cuenta que se lanza bajo una licencia no comercial.

  • NVIDIA lanzó Audex (Nemotron-Labs-Audex-30B-A3B), un modelo unificado de mezcla de expertos audio-texto.
  • El modelo activa 3 mil millones de parámetros por token de su total de 30 mil millones.
  • Está construido sobre la base de texto Nemotron-Cascade-2-30B-A3B, un híbrido Mamba-Transformer.
  • Audex admite una longitud de contexto de 1 millón de tokens y es compatible con Megatron-LM y vLLM.
  • El modelo utiliza AF-Whisper para la codificación de audio y se lanza bajo una licencia no comercial.

Los desarrolladores pueden crear aplicaciones avanzadas de audio-texto utilizando un modelo abierto que mantiene un razonamiento de texto de alta calidad y es compatible con la infraestructura LLM estándar como vLLM.

SOURCES

6. La vulnerabilidad HalluSquatting amenaza a los asistentes de codificación de IA populares

Los investigadores de seguridad han descubierto un nuevo vector de ataque llamado HalluSquatting que se dirige a asistentes de codificación de IA y agentes de desarrollo populares, incluidos Cursor, GitHub Copilot, Windsurf y Cline. A diferencia de las inyecciones de prompts tradicionales basadas en push, HalluSquatting es un ataque basado en pull que predice identificadores de recursos (como nombres de paquetes o repositorios) que es probable que un LLM alucine. Luego, los atacantes registran estos identificadores y los siembran con instrucciones maliciosas, lo que podría conducir a infecciones de dispositivos locales y al ensamblaje de botnets cuando los desarrolladores ejecutan sin saberlo los recursos alucinados.

  • Los investigadores desarrollaron HalluSquatting, un ataque basado en pull que explota la tendencia de un LLM a alucinar identificadores de recursos.
  • El ataque funciona prediciendo identificadores que es probable que un LLM alucine, luego registrándolos y sembrándolos con instrucciones maliciosas.
  • Los asistentes y agentes de codificación de IA susceptibles incluyen Cursor, Cursor CLI, Gemini CLI, Windsurf, GitHub Copilot, Cline, OpenClaw, ZeroClaw y NanoClaw.
  • HalluSquatting permite ataques a gran escala, incluido el ensamblaje de botnets, ataques DDoS e infecciones de dispositivos.
  • Las mitigaciones de seguridad de IA actuales se basan en barandillas en lugar de abordar la causa raíz de separar las fuentes confiables de las no confiables.

Los desarrolladores que utilizan asistentes de codificación de IA deben ser conscientes de cómo los identificadores de recursos alucinados pueden ser registrados por atacantes para ejecutar código malicioso en sus máquinas locales.

SOURCES

7. Google añade MCP remoto y ejecución en segundo plano a los agentes gestionados de Gemini

Basándose en el marco de agentes gestionados introducido en mayo, Google ha lanzado una actualización importante para la API de Gemini. Los desarrolladores ahora pueden integrar servidores remotos del Protocolo de Contexto de Modelo (MCP) y ejecutar tareas en segundo plano. Al consolidar el razonamiento, la instalación de paquetes y la gestión de archivos en un único punto final ejecutado dentro de un entorno aislado en la nube, esta actualización simplifica aún más el despliegue de flujos de trabajo de agentes autónomos y seguros.

  • Google añadió la integración de servidores MCP remotos y la ejecución en segundo plano al marco de agentes gestionados de la API de Gemini.
  • Los agentes gestionados ahora pueden operar como trabajadores asíncronos en entornos de desarrollo reales sin bloquear las aplicaciones.
  • La actualización mantiene la arquitectura de entorno aislado en la nube existente para la ejecución segura de código y la instalación de paquetes.
  • Las nuevas características incluyen llamadas a funciones personalizadas y actualización de credenciales a través de las interacciones de los agentes.

Estas adiciones permiten a los desarrolladores desplegar agentes más complejos, asíncronos y de larga duración que se conectan de forma segura a herramientas externas compatibles con MCP sin gestionar infraestructura adicional.

SOURCES

8. Salesforce integra Slackbot con la plataforma Salesforce a través de MCP

Salesforce ha lanzado una integración importante que conecta Slackbot a toda la plataforma Salesforce utilizando el Protocolo de Contexto de Modelo (MCP). Esta integración permite a los equipos consultar datos de CRM, acceder a análisis de Tableau y activar flujos de trabajo externos como aprobaciones de DocuSign directamente desde canales compartidos de Slack. Fundamentalmente, el sistema respeta automáticamente los permisos existentes de Salesforce y la seguridad a nivel de campo, lo que demuestra una implementación robusta y de nivel de producción de MCP que cuenta con el respaldo de un ecosistema creciente de socios, incluidos Atlassian, Box y Zoom.

  • Salesforce conectó Slackbot a la plataforma Salesforce utilizando el Protocolo de Contexto de Modelo (MCP).
  • La integración permite a los usuarios acceder a datos de CRM, análisis de Tableau y perfiles de Data 360, y activar acciones como aprobaciones de DocuSign directamente desde Slack.
  • Slackbot respeta automáticamente los permisos existentes de Salesforce, las reglas de validación y la configuración de seguridad a nivel de campo.
  • El nuevo ecosistema de socios nativos de MCP incluye Atlassian, Box, DocuSign, Canva, Lucid y Zoom.

Este importante despliegue empresarial del Protocolo de Contexto de Modelo (MCP) valida la preparación del protocolo para la producción y destaca cómo los desarrolladores pueden crear integraciones seguras de múltiples herramientas.

SOURCES

9. Google AI Studio añade 'Importar desde GitHub' al modo de construcción

Google AI Studio ha actualizado su interfaz de 'vibe coding' basada en prompts, el modo de construcción, con una nueva función de 'importar desde GitHub'. Esta adición permite a los desarrolladores extraer un repositorio de GitHub existente y convertirlo en una aplicación full-stack editable y desplegable. Para garantizar la seguridad durante la creación rápida de prototipos, AI Studio configura automáticamente las claves de API de Gemini como secretos del lado del servidor, evitando que se expongan en el código del lado del cliente.

  • Google AI Studio introdujo una función de 'importar desde GitHub' dentro de su modo de construcción.
  • El modo de construcción es una interfaz de 'vibe coding' que genera aplicaciones full-stack a partir de las indicaciones del usuario.
  • La función permite a los usuarios importar un repositorio y convertirlo en un formato compatible con el tiempo de ejecución para su despliegue.
  • Al utilizar la API de Gemini, AI Studio configura automáticamente las claves de API como secretos del lado del servidor para evitar la exposición del lado del cliente.
  • La actualización fue anunciada por el líder de producto de Google AI Studio, Logan Kilpatrick.

Los desarrolladores pueden importar rápidamente bases de código, scripts o proyectos de hackathon existentes para iterar sobre ellos y desplegarlos como aplicaciones full-stack con claves de API aseguradas automáticamente.

SOURCES

10. CopilotKit extiende el protocolo AG-UI para habilitar agentes de autoaprendizaje

CopilotKit ha ampliado su protocolo AG-UI, lanzado originalmente para manejar la transmisión de UI y la sincronización de estado, para admitir arquitecturas de agentes de autoaprendizaje. Al capturar rastros de ejecución de agentes y correcciones de usuarios en el navegador, el sistema convierte estas interacciones en memoria procedimental y episódica. Este desarrollo cumple con el objetivo de la hoja de ruta anterior de la compañía de permitir el aprendizaje continuo a partir de la retroalimentación humana, permitiendo a los agentes adaptarse al comportamiento del usuario mientras mantienen alcances de aprendizaje restringidos para aplicaciones o equipos específicos.

  • Extiende el protocolo AG-UI para admitir arquitecturas de agentes de autoaprendizaje.
  • Captura rastros de agentes y correcciones de usuarios para construir memoria procedimental y episódica.
  • Cumple con el objetivo de la hoja de ruta anunciado anteriormente de aprendizaje continuo a partir de la retroalimentación humana.
  • Mantiene la seguridad restringiendo los alcances de aprendizaje a usuarios, equipos o aplicaciones específicos.

Los desarrolladores ahora pueden implementar bucles de agentes que mejoran por sí mismos utilizando la infraestructura AG-UI existente, pasando del manejo básico de interacciones a agentes que aprenden activamente de los fallos y correcciones del mundo real.

SOURCES

11. NVIDIA añade un tutorial de cosmos-framework para modelos de mundo en miniatura

Tras el lanzamiento el 1 de junio de los modelos de pesos abiertos Cosmos 3, NVIDIA ha publicado un tutorial para su cosmos-framework. Este recurso guía a los desarrolladores a través de la creación de una versión en miniatura de la arquitectura del modelo, que está diseñada para ejecutarse en Google Colab. Si bien la inferencia completa de Cosmos 3 requiere más de 16B de parámetros y hardware de clase H100, esta implementación educativa utiliza una arquitectura de mezcla de transformadores omnimodal para ayudar a los desarrolladores a aprender el marco antes de escalar a despliegues de tamaño completo.

  • El tutorial proporciona una implementación en miniatura y compatible con Colab de la arquitectura del modelo de mundo Cosmos 3.
  • Este recurso sirve como un trampolín educativo para los desarrolladores que no pueden ejecutar la inferencia de Cosmos 3 a gran escala, que requiere más de 16B de parámetros y hardware H100.
  • El modelo en miniatura demuestra la arquitectura de mezcla de transformadores omnimodal, incluidos RMSNorm, incrustaciones rotativas y expertos SwiGLU.
  • El tutorial incluye especificaciones de entrada correctas según el esquema y comandos de inicio para los usuarios listos para hacer la transición a la inferencia a gran escala en hardware de clase H100.

Los desarrolladores ahora pueden aprender a implementar y entrenar modelos de mundo utilizando atención transmodal compartida y enrutamiento de expertos en hardware accesible antes de escalar a modelos Cosmos 3 de nivel de producción.

SOURCES

12. Google actualiza Android Bench con métricas de costes y nuevos modelos

Google ha actualizado Android Bench, su benchmark diseñado para ayudar a los desarrolladores a evaluar y seleccionar los mejores agentes de IA para tareas de desarrollo de Android. La última actualización introduce métricas críticas para el coste y la eficiencia, admite modelos de pesos abiertos y añade ocho nuevos modelos a la tabla de clasificación. Claude Fable 5 lidera actualmente el benchmark con un 84,5% de precisión, seguido de Claude Sonnet 5, mientras que Gemini 3.1 Pro de Google ocupa el quinto lugar.

  • Google actualizó su benchmark Android Bench, que evalúa el rendimiento de LLM en 100 tareas de desarrollo de Android.
  • La actualización añade métricas para el coste y la eficiencia e introduce soporte para modelos de pesos abiertos.
  • Se añadieron ocho nuevos modelos a la tabla de clasificación, incluidos Claude Fable 5, Claude Sonnet 5, GLM 5.2 y MiniMax M3.
  • Claude Fable 5 lidera la tabla de clasificación actual con un 84,5% de precisión, mientras que Gemini 3.1 Pro de Google ocupa el quinto lugar.

Los desarrolladores pueden utilizar este benchmark actualizado para comparar el coste, la eficiencia y la precisión de los modelos líderes al crear agentes de codificación centrados en Android.

SOURCES

13. La startup francesa ZML lanza ZML/LLMD para reducir los costes de inferencia

La startup francesa de IA ZML, respaldada por un respaldo de Yann LeCun, ha lanzado una herramienta de software gratuita llamada ZML/LLMD. El producto está diseñado para acelerar la inferencia de modelos en una variedad de chips de IA, ayudando a los desarrolladores a optimizar su utilización de hardware. Al mejorar las velocidades de ejecución, el software tiene como objetivo reducir los costes operativos asociados con la ejecución de modelos de IA autohospedados.

  • La startup francesa de IA ZML ha lanzado un producto de software gratuito llamado ZML/LLMD.
  • El software está diseñado para acelerar la inferencia de modelos en múltiples chips de IA.
  • ZML/LLMD tiene como objetivo reducir potencialmente los costes generales asociados con la ejecución de modelos de IA.
  • La startup ha recibido el respaldo del ganador del Premio Turing, Yann LeCun.

Los desarrolladores que buscan optimizar los despliegues de modelos autohospedados pueden aprovechar esta herramienta gratuita para reducir potencialmente sus costes de hardware e inferencia.

SOURCES

14. Anthropic extiende el acceso a Claude Fable 5 con un periodo promocional gratuito

Basándose en el cambio del 7 de julio de Claude Fable 5 a un modelo de uso basado en créditos, Anthropic ha lanzado una ventana promocional que permite a los suscriptores Pro, Max, Team y Enterprise premium acceder al modelo sin coste adicional. Hasta el 12 de julio, los usuarios pueden aplicar hasta el 50% de sus límites de suscripción semanales a Fable 5, después de lo cual pueden continuar usando el modelo a través de créditos de uso estándar o cambiar a otros modelos.

  • Anthropic ofrece acceso promocional gratuito a Claude Fable 5 hasta el 12 de julio.
  • La oferta sigue a la transición del modelo el 7 de julio a un sistema de uso basado en créditos.
  • Los usuarios elegibles incluyen suscriptores de planes Pro, Max, Team y Enterprise premium.
  • Los usuarios pueden asignar hasta el 50% de sus límites de suscripción semanales al modelo durante la promoción.

Esta promoción proporciona una extensión temporal de la disponibilidad del modelo para que los desarrolladores prueben y evalúen sus aplicaciones frente a Claude Fable 5 sin impacto inmediato en sus saldos de crédito.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.