Inference Brew

Z AI lanza el modelo de pesos abiertos GLM-5.2 con 1M de contexto

00:00 / --:--

← Volver al inicio

Z AI lanza el modelo de pesos abiertos GLM-5.2 con 1M de contexto

1. Z AI lanza el modelo de pesos abiertos GLM-5.2 con 1M de contexto

El último lanzamiento de Z AI aporta capacidades de razonamiento de clase frontera al ecosistema de pesos abiertos. Con una velocidad de 112 tokens por segundo, el modelo demuestra mejoras significativas en el razonamiento científico, incluyendo una mejora de 16 puntos en el benchmark de física CritPt, donde empata con Claude Opus 4.8. Versiones cuantizadas del modelo ya están disponibles en Hugging Face, con opciones de 4 y 2 bits que permiten la ejecución local en clústeres Mac Studio o configuraciones de GPU empresariales.

  • GLM-5.2 es un modelo de mezcla de expertos de pesos abiertos con 744B de parámetros totales y 40B activos.
  • El modelo cuenta con una ventana de contexto ampliada de 1 millón de tokens, frente a los 200K de GLM-5.1.
  • Se lanza bajo licencia MIT, lo que permite su uso comercial y alojamiento propio.
  • GLM-5.2 obtuvo una puntuación de 51 en el Artificial Analysis Intelligence Index v4.1, liderando todos los modelos de pesos abiertos.
  • El precio de la API propia se ha fijado en 1,40 $ por cada millón de tokens de entrada y 4,40 $ por cada millón de tokens de salida.

Los desarrolladores pueden alojar por cuenta propia un modelo de razonamiento altamente capaz, con licencia MIT, que iguala el rendimiento de modelos propietarios en tareas científicas complejas.

2. OpenAI prepara el modelo de audio bidireccional GPT-Bidi-1 para ChatGPT

El desarrollo de GPT-Bidi-1 por parte de OpenAI apunta a un cambio importante en la forma en que los agentes de voz manejan el flujo conversacional. Al procesar el audio de forma bidireccional, el modelo elimina los incómodos retrasos de turno de palabra de las tuberías de voz tradicionales, allanando el camino para interfaces conversacionales altamente naturales.

  • GPT-Bidi-1 es un modelo de audio bidireccional diseñado para el modo de voz de ChatGPT.
  • El modelo puede escuchar y hablar simultáneamente, absorbiendo interrupciones en tiempo real.
  • Puede ajustar su discurso a mitad de frase basándose en la entrada del usuario.

Los desarrolladores pueden esperar próximas capacidades de API que soporten interacciones de voz naturales, interrumpibles y en tiempo real.

SOURCES

3. Soniox lanza una API de voz a texto en streaming de baja latencia

El nuevo modelo en tiempo real de Soniox se sitúa en la frontera de Pareto en cuanto a precisión y latencia. Al ofrecer transcripciones casi instantáneas con bajas tasas de error de palabra, la API está altamente optimizada para aplicaciones de voz interactivas y servicios de traducción en tiempo real.

  • Soniox v5 Real-Time tiene un precio de 2 $ por cada 1.000 minutos de audio a través de la consola de Soniox.
  • El modelo alcanza una tasa de error de palabra (WER) del 4,5% a los 0,05 segundos tras finalizar el habla para las transcripciones finales.
  • Soporta más de 60 idiomas y proporciona traducción e identificación de idioma en tiempo real.
  • El lanzamiento complementa al modelo no streaming existente, Soniox v5 Async.

Los desarrolladores pueden integrar transcripción y traducción en tiempo real de alta precisión en agentes de voz a una fracción del coste de otras APIs propietarias.

SOURCES

4. El modelo de código LoopCoder-v2 7B alcanza 64.4 en SWE-bench Verified

LoopCoder-v2 aprovecha el escalado de computación en tiempo de prueba para ofrecer un rendimiento superior para su tamaño de parámetros. Los investigadores determinaron que una configuración de dos bucles proporciona el equilibrio óptimo para el refinamiento latente, mientras que añadir un tercer bucle resulta en rendimientos decrecientes o regresión del rendimiento.

  • LoopCoder-v2 es un modelo de código ajustado por instrucciones de 7B construido sobre la arquitectura Parallel Loop Transformer.
  • El modelo alcanzó una puntuación de 64.4 en el benchmark SWE-bench Verified utilizando una configuración de dos bucles.
  • Fue entrenado desde cero con 18 billones de tokens que cubren más de 100 lenguajes de programación.
  • La arquitectura utiliza desplazamientos de posición entre bucles y atención de ventana deslizante con puertas KV compartidas para mantener una huella de caché constante.
  • El modelo y su código asociado están disponibles públicamente en Hugging Face.

Los desarrolladores obtienen acceso a un modelo de codificación de pesos abiertos altamente eficiente que supera a modelos muchas veces más grandes en tareas complejas de ingeniería de software.

5. OpenAI Codex añade soporte para el protocolo Chrome DevTools para agentes de navegador

La integración del soporte CDP en Codex por parte de OpenAI marca un paso significativo hacia agentes de uso web más capaces. Aunque la función se encuentra en sus primeras etapas y está restringida geográficamente, proporciona la infraestructura subyacente necesaria para que los agentes interactúen dinámicamente con entornos web en vivo.

  • OpenAI Codex ahora soporta el protocolo Chrome DevTools (CDP) a través de ajustes opcionales.
  • La función permite a los agentes perfilar el rendimiento de JavaScript y modificar sitios web en tiempo real.
  • El acceso está actualmente excluido para usuarios en el EEE, Reino Unido y Suiza.
  • La función en etapa temprana requiere un prompting cuidadoso y actualmente enfrenta problemas de rendimiento.

Los desarrolladores que crean agentes de automatización web ahora pueden aprovechar la depuración nativa del navegador y las capacidades de modificación de sitios web en tiempo real.

SOURCES

6. Vercel lanza el framework de agentes de IA de código abierto 'Eve'

El nuevo framework de Vercel simplifica el desarrollo de agentes al mapear archivos en un directorio directamente a las capacidades del agente. Con soporte integrado para conexiones seguras, comunicación multicanal y seguimiento de evaluación, eve proporciona una base robusta y de grado de producción para los desarrolladores que despliegan agentes en la nube.

  • eve es un framework de código abierto bajo licencia Apache-2.0 para construir y escalar agentes de IA.
  • El framework utiliza una arquitectura centrada en el sistema de archivos donde un agente se define como un directorio en el disco.
  • Las capacidades integradas incluyen ejecución duradera, computación en sandbox y aprobaciones con intervención humana.
  • Los desarrolladores pueden crear nuevos agentes usando `npx create-eve@latest` y desplegarlos directamente en Vercel.
  • Vercel actualmente ejecuta más de 100 agentes en producción utilizando el framework eve.

Los desarrolladores pueden construir agentes listos para producción utilizando una arquitectura simple basada en directorios con ejecución duradera y computación en sandbox integradas.

SOURCES

7. Claude Design renovado con sincronización bidireccional de Claude Code

Dos meses después de su vista previa inicial, Anthropic ha abordado los principales puntos de dolor de los desarrolladores con respecto al alto consumo de tokens de Claude Design. Al introducir un editor visual y límites de uso compartidos, la actualización minimiza los turnos de modelo innecesarios mientras proporciona características de cumplimiento de grado empresarial como el bloqueo de componentes.

  • Claude Design ahora cuenta con integración bidireccional con Claude Code, permitiendo la sincronización de sistemas de diseño basada en terminal.
  • La actualización permite a las organizaciones importar componentes desde GitHub, archivos de diseño o subidas directas.
  • Anthropic abordó los problemas de consumo de tokens compartiendo límites de uso entre Claude Design, chat, Cowork y Claude Code.
  • Un nuevo editor con capacidades de arrastrar y redimensionar reduce el número de turnos de modelo necesarios para ajustes de diseño.
  • La plataforma añadió soporte de exportación para Vercel, Replit, Lovable, Canva y Adobe.

Los desarrolladores ahora pueden sincronizar sistemas de diseño sin problemas y ejecutar tareas de interfaz de usuario directamente desde su terminal, reduciendo el consumo de tokens y las transferencias manuales.

SOURCES

8. AWS lanza Context Intelligence Stack con soporte nativo para MCP

AWS está entrando en la carrera del contexto de agentes con una pila diseñada para eliminar la curación manual de conocimiento. Al sintetizar definiciones de negocio desde S3 Annotations y activos de habilidades de Glue en un grafo consultable, AWS Context proporciona una capa de contexto de tiempo de ejecución segura y auditable a la que los agentes pueden acceder de forma nativa a través de MCP.

  • AWS Context es un nuevo servicio de grafo de conocimiento que infiere automáticamente relaciones entre conjuntos de datos y reglas de negocio.
  • Los agentes consultan el sistema a través de APIs de búsqueda agentica y herramientas MCP en Bedrock AgentCore o EKS.
  • La pila incluye S3 Annotations y una vista previa de activos de habilidades en AWS Glue Data Catalog.
  • Las consultas heredan los permisos de IAM y Lake Formation del usuario que realiza la llamada para un acceso seguro a los datos.
  • Los metadatos se publican en formato Apache Iceberg en Amazon S3 Tables.

Los desarrolladores que despliegan agentes en AWS pueden aprovechar una capa de contexto gestionada que se integra con Bedrock y expone herramientas a través de MCP.

SOURCES

9. Cursor Origin Launches as Agent-Native Git Forge

Building on the initial announcement of the Origin platform, Cursor has now officially launched Cursor Origin. This forge is designed to handle the specific demands of AI agents, including automated branching, committing, and code reviews, providing a dedicated environment for agent-scale development.

  • Cursor Origin is now live as a Git-compatible forge for AI agents.
  • The platform supports parallel agent tasks like cloning, branching, and rebasing.
  • It serves as an AI software factory designed to optimize agent-scale development pipelines.

Developers can now utilize the platform to deploy coding agents into a repository hosting environment specifically optimized for automated, parallel workflows.

SOURCES

10. Android 17 introduce MCP nativo y AppFunctions para agentes de IA

La adición de soporte nativo para el Protocolo de Contexto de Modelo (MCP) en Android 17 representa un gran paso adelante para las arquitecturas de agentes móviles. Al estandarizar cómo los modelos en el dispositivo descubren y ejecutan funciones de aplicaciones, Google está facilitando significativamente a los desarrolladores la creación de aplicaciones móviles compatibles con agentes.

  • Android 17 introduce soporte para AppFunctions y Android MCP (Model Context Protocol).
  • Las funciones permiten a las aplicaciones exponer herramientas orquestables para agentes en el dispositivo.
  • Google está posicionando el lanzamiento como un cambio hacia un sistema de inteligencia profundamente integrado en toda la plataforma.

Los desarrolladores móviles pueden exponer las capacidades de sus aplicaciones como herramientas orquestables que los agentes de IA a nivel de sistema pueden invocar de forma nativa.

SOURCES

11. Lemonade v10.8 añade gestión dinámica de VRAM y pasarela MCP

El rápido ciclo de desarrollo de Lemonade continúa ofreciendo características altamente prácticas para la ejecución de modelos locales. Al combinar la gestión automática de memoria con una pasarela nativa del Protocolo de Contexto de Modelo, la actualización hace que sea increíblemente fácil integrar modelos locales en flujos de trabajo agenticos modernos.

  • Lemonade v10.8 introduce una gestión dinámica de VRAM que descarga automáticamente modelos inactivos y reduce el tamaño de la caché KV.
  • Una nueva pasarela MCP en `POST /mcp` expone herramientas para listar modelos, chat, transcripción y generación de imágenes.
  • La actualización añade un backend de descarga agnóstico al proveedor para servir completaciones desde proveedores compatibles con OpenAI.
  • El soporte de plataforma se ha ampliado para incluir NVIDIA Blackwell arm64 CUDA y AMD ROCm en Windows.

Los desarrolladores pueden exponer sus modelos locales como herramientas MCP a cualquier host compatible con MCP mientras gestionan automáticamente la memoria de la GPU.

SOURCES

12. La Casa Blanca exige protecciones contra jailbreak antes del relanzamiento de Claude Fable 5

La disputa en curso destaca la creciente presión sobre los laboratorios de IA de frontera para asegurar sus modelos contra el prompting adversarial. Expertos independientes en ciberseguridad señalan que las barandillas actuales suelen ser solo soluciones temporales, ya que los usuarios expertos encuentran constantemente formas de evitarlas. El regreso del modelo sigue estancado mientras Anthropic trabaja para cumplir con las demandas de pruebas proactivas de la administración.

  • El gobierno de EE. UU. exige a Anthropic que resuelva las vulnerabilidades de jailbreak en Claude Fable 5 antes de su relanzamiento.
  • La Agencia de Seguridad Nacional confirmó que los jailbreaks podrían permitir a los usuarios eludir las barandillas para acceder a capacidades cibernéticas, químicas y biológicas.
  • La administración espera que Anthropic pruebe proactivamente todos los modelos de frontera para detectar jailbreaks en lugar de depender de la detección gubernamental.
  • Anthropic sostiene que las preocupaciones de la administración con respecto a los jailbreaks son exageradas y tienen un efecto mínimo en el mundo real.

Los desarrolladores que utilizan los modelos de frontera de Anthropic deben esperar a que la empresa implemente barandillas más robustas y proactivas contra consultas de ciberseguridad y biológicas.

SOURCES

13. Llama.cpp Expands Model API to Include Full Lifecycle Management

Following the introduction of the model hotswap API earlier this month, Llama.cpp has merged a new pull request that extends its API capabilities to include full model lifecycle management. Developers can now programmatically load, unload, and download models on demand, moving beyond simple swapping to comprehensive model management without server restarts.

  • Expands the existing hotswap API to include loading, unloading, and downloading functionality.
  • Pull request #23976 enables complete programmatic model lifecycle management.
  • Allows for dynamic model management without requiring server restarts.
  • No user interface is currently available for these new features.

This update enables developers to build more dynamic, multi-model local applications by providing full control over the model lifecycle via API calls.

SOURCES

14. Claw-SWE-Bench estandariza la evaluación de arneses de agentes de codificación

Claw-SWE-Bench aborda una brecha crítica en la evaluación de agentes al aislar el rendimiento del "arnés" (la capa envolvente que impulsa el modelo) del modelo en sí. Los hallazgos del benchmark muestran que las tasas de éxito y los costes varían enormemente según el diseño del arnés, proporcionando a los desarrolladores una forma estandarizada de optimizar sus arquitecturas de agentes.

  • Claw-SWE-Bench utiliza 350 problemas reales de GitHub en 8 lenguajes y 43 repositorios.
  • Todos los arneses se evalúan bajo condiciones fijas, incluyendo un límite de tiempo de una hora e intentos únicos.
  • La calificación se basa únicamente en los cambios de archivos del repositorio, ignorando el formato de salida del agente.
  • Está disponible una versión Lite con 80 tareas, que reproduce las clasificaciones al 23% del coste de la ejecución completa.
  • El benchmark incluye medidas contra trampas para evitar el acceso a respuestas futuras.

Los desarrolladores que crean agentes de codificación pueden utilizar este benchmark para medir cómo las diferentes capas envolventes y métodos de interacción afectan al éxito de la tarea y a los costes de la API.

SOURCES

15. Los bucles de captura de pantalla sin cabeza permiten la depuración visual para agentes de codificación locales

Aunque tanto Claude Code como los modelos locales inicialmente tuvieron dificultades para escribir una demo de FPS con trazado de rayos en un solo intento, la introducción de retroalimentación visual cambió el resultado. Al permitir que el agente active capturas de pantalla e inspeccione la salida visual de su código, los desarrolladores pueden aumentar significativamente las capacidades de resolución de problemas de los modelos locales, aunque a costa de un mayor consumo de tokens.

  • Añadir un modo sin cabeza con disparadores de captura de pantalla permitió un bucle de depuración visual recursivo para agentes de codificación.
  • El patrón permitió a un agente local Qwen3.6 27B (codehamr) y a Claude Code escribir una demo de FPS con trazado de rayos en C.
  • Los agentes utilizaron capturas de pantalla para inspeccionar los resultados de renderizado, identificar errores e iterar en las correcciones.
  • El bucle de retroalimentación visual aumenta el uso de tokens, el tiempo de ejecución y el tiempo de reloj.

Los desarrolladores pueden implementar este patrón de bucle de retroalimentación visual para ayudar a modelos locales más pequeños a resolver tareas complejas de interfaz de usuario y renderizado que de otro modo fallarían.

SOURCES

16. Los núcleos WebGPU optimizados de Gemma 4 alcanzan 255 tokens/seg en M4 Max

Este lanzamiento demuestra la viabilidad de la ejecución de LLM de alto rendimiento en el lado del cliente. Al aprovechar los núcleos WebGPU, los desarrolladores pueden ejecutar Gemma 4 localmente en el navegador a velocidades que rivalizan o superan a las APIs en la nube, abriendo nuevas posibilidades para aplicaciones web de latencia cero y que preservan la privacidad.

  • Los núcleos WebGPU optimizados de Gemma 4 alcanzaron aproximadamente 255 tokens por segundo en un procesador M4 Max.
  • La demo y los núcleos han sido lanzados en Hugging Face.
  • La implementación utiliza el modelo google/gemma-4-E2B-it-qat-mobile-transformers.
  • El trabajo de optimización se completó utilizando Fable 5 antes de su cierre.

Los desarrolladores pueden desplegar funciones de LLM locales de alta velocidad en el navegador en el hardware del cliente sin incurrir en costes de inferencia del lado del servidor.

SOURCES

17. Anthropic pausa la facturación separada basada en tokens para el SDK de agentes de Claude

La decisión de pausar la facturación separada del SDK proporciona alivio a los desarrolladores que enfrentaban posibles aumentos de costes para los flujos de trabajo agenticos. Anthropic está reevaluando su estructura de precios para garantizar una mejor alineación con los desarrolladores que utilizan tarifas de API estándar y modelos de suscripción.

  • Anthropic pausó los cambios de facturación basados en tokens separados anunciados el mes pasado para el SDK de agentes de Claude.
  • El uso del SDK de agentes seguirá facturándose a las tarifas de API vigentes de Anthropic.
  • La empresa está actualizando sus planes para apoyar mejor a los desarrolladores que construyen con suscripciones de Claude.

Los desarrolladores que construyan con el SDK de agentes de Claude seguirán siendo facturados a las tarifas de API estándar vigentes, evitando aumentos de costes inesperados.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.