Inference Brew

OpenAI lanza la API de Agentes en versión beta pública con Managed Codex Harness

00:00 / --:--

← Volver al inicio

OpenAI lanza la API de Agentes en versión beta pública con Managed Codex Harness

1. OpenAI lanza la API de Agentes en versión beta pública con Managed Codex Harness

La nueva API de Agentes de OpenAI se encarga del trabajo pesado de la orquestación de agentes, incluyendo la compactación automática de contexto para sesiones largas, el uso eficiente de herramientas y la delegación a subagentes. Al proporcionar una interfaz unificada para ejecutar código, editar archivos y conectarse a servidores MCP, la API reduce el código repetitivo necesario para construir agentes fiables. Los precios están vinculados directamente a las tarifas de la API del modelo subyacente, junto con costos adicionales por entornos de pruebas y herramientas alojadas.

  • • La API de Agentes proporciona a los desarrolladores el mismo Codex harness e infraestructura utilizados internamente por OpenAI.
  • • Los desarrolladores pueden ejecutar el cómputo de los agentes en un entorno de pruebas gestionado por OpenAI, en su propia infraestructura o en nueve entornos de pruebas de socios.
  • • Los entornos de pruebas de socios incluyen Vercel, E2B, Modal, Cloudflare, Daytona, DigitalOcean, Blaxel, Runloop y Oracle.
  • • La API está estructurada en torno a cuatro conceptos principales: Agente, Entorno, Sesión y Eventos/elementos.
  • • La residencia de datos está actualmente restringida a EE. UU. y no se admite la Retención Cero de Datos (ZDR).

Permite a los desarrolladores construir y desplegar agentes en la nube duraderos utilizando la infraestructura gestionada de OpenAI y los entornos de pruebas de sus socios.

SOURCES

2. DeepSeek lanza el modelo actualizado DeepSeek-V4.1-Flash

Basándose en el modelo original DeepSeek-V4 Flash lanzado en mayo de 2026, la nueva iteración V4.1-Flash introduce un diseño de codificador-decodificador causal y una atención dispersa comprimida avanzada 2 (CSA2) para optimizar aún más la eficiencia de la memoria. Esta actualización mejora la arquitectura original utilizando cuantización FP4 para reducir la huella de la caché KV a 890 bytes por token, permitiendo un rendimiento superior en tareas de agentes y codificación en comparación con la serie V4 Pro anterior.

  • • DeepSeek-V4.1-Flash es un modelo multimodal de mezcla de expertos (MoE) de 552B de parámetros.
  • • Cuenta con una ventana de contexto de 1M de tokens con 8B de parámetros activos durante el prellenado y 16B durante la decodificación.
  • • Implementa atención dispersa comprimida 2 (CSA2) y cuantización FP4 para mejorar la eficiencia de la caché KV.
  • • Supera al anterior DeepSeek V4 Pro 0813 en puntos de referencia de agentes, codificación y ciberseguridad.
  • • Disponible bajo licencia MIT a través de vLLM, SGLang, Transformers y API pública.

Este lanzamiento proporciona un modelo multimodal actualizado y más eficiente que reduce significativamente la sobrecarga de memoria para aplicaciones de contexto largo en comparación con el lanzamiento inicial de V4 Flash.

3. Cognition lanza el modelo de codificación SWE-2 con una puntuación del 50% en FrontierCode

El SWE-2 de Cognition está construido sobre la base Kimi K3 y ha sido sometido a un extenso aprendizaje por refuerzo para la codificación de agentes. Al entrenar todos los niveles de esfuerzo de razonamiento en una sola ejecución, el modelo optimiza la frontera costo-rendimiento, permitiendo que SWE-2 medium supere a SWE-1.7 utilizando un 58% menos de turnos y costando un 81% menos en promedio. Aunque no hay pesos públicos ni puntos finales de API independientes, los desarrolladores pueden acceder al modelo inmediatamente a través de la suite Devin.

  • • SWE-2 es un modelo de mezcla de expertos de 2.8T de parámetros con 104B de parámetros activos por token, post-entrenado a partir de Kimi K3.
  • • El modelo alcanza una puntuación de 50.0 en el benchmark FrontierCode 1.1, igualando a Claude Fable 5.1 a un costo un 64% menor.
  • • Está disponible desde hoy en Devin Desktop, CLI, Devin Web y Fusion, sin pesos públicos ni precios de API por token.
  • • SWE-2 utiliza kernels NVFP4 y FP8 para la inferencia, junto con un retardador de prellenado que mejora el rendimiento entre un 10% y un 20%.
  • • El modelo fue entrenado utilizando un algoritmo de aprendizaje por refuerzo que optimiza todos los niveles de esfuerzo de razonamiento en una sola ejecución.

Los desarrolladores que utilizan Devin obtienen acceso a un modelo de codificación de agentes significativamente más barato y eficiente que optimiza la frontera costo-rendimiento.

4. AI Sage lanza GigaChat-3.5-Reasoning con Gated DeltaNet

GigaChat-3.5-Reasoning aprovecha Gated DeltaNet para lograr una alta eficiencia en escenarios de contexto largo. Desarrollado utilizando CISPO para entrenar expertos específicos de dominio antes de destilarlos en un solo modelo, ofrece una potente alternativa de pesos abiertos para tareas de matemáticas, codificación y razonamiento. Los pesos con licencia MIT ya están disponibles en Hugging Face.

  • • GigaChat-3.5-Reasoning es un modelo de mezcla de expertos de 432B-A28B que cuenta con Gated DeltaNet.
  • • El modelo fue entrenado destilando expertos de dominio en código, matemáticas y conocimiento general mediante destilación en política.
  • • Tiene un rendimiento similar al de DeepSeek V4 Flash Preview mientras utiliza un 37% menos de tokens en sus trazas de razonamiento.
  • • Los pesos del modelo están disponibles en Hugging Face bajo una licencia MIT.
  • • El modelo también es accesible a través de una interfaz web en giga.chat.

Los desarrolladores pueden autoalojar un modelo de razonamiento altamente eficiente que iguala el rendimiento de vanguardia mientras utiliza significativamente menos tokens en sus trazas de razonamiento.

SOURCES

5. Lanzamiento de CyberTiel 35B-A3B para seguridad ofensiva y codificación de agentes

CyberTiel se dirige a problemas de ingeniería de software del mundo real, y su creador afirma que supera a Opus 4.6 medium en problemas de bases de código en una fracción del tiempo requerido por Qwen3.8-27b. Al sacrificar el conocimiento general del mundo, el modelo maximiza su utilidad para tareas especializadas de codificación y seguridad. Los desarrolladores pueden ejecutar el modelo localmente utilizando los formatos GGUF y MLX recién lanzados.

  • • CyberTiel es un modelo de codificación de 35B-A3B sin censura basado en la base TielCoder.
  • • El modelo está diseñado específicamente para la investigación de seguridad ofensiva y la ingeniería de software de agentes.
  • • Fue creado utilizando cuantización con una imatrix mejorada entrenada en un corpus curado de ciberseguridad e ingeniería de software.
  • • Las versiones GGUF y MLX del modelo están disponibles en Hugging Face para su despliegue local.
  • • El modelo prioriza la capacidad de codificación sobre el conocimiento general del mundo y es desarrollado por un investigador anónimo.

Proporciona a los desarrolladores centrados en la seguridad un modelo local altamente especializado y sin censura que supera a modelos más grandes en problemas de bases de código del mundo real.

SOURCES

6. Lanzamiento del modelo OUI-1 para generar elementos de interfaz de usuario a medida

OUI-1 introduce un método eficiente para generar elementos de interfaz de usuario mediante el entrenamiento en OpenUI-Lang en lugar de formatos web estándar detallados. Este enfoque centrado en DSL reduce significativamente la sobrecarga del prompt del sistema que normalmente se requiere para el formato de la interfaz de usuario. Sin embargo, los desarrolladores que busquen ejecutar el modelo localmente enfrentarán obstáculos, ya que la arquitectura subyacente DiffusionGemma carece de soporte para llama.cpp.

  • • OUI-1 es un modelo ajustado en DiffusionGemma y subido a Hugging Face.
  • • El modelo utiliza OpenUI-Lang, un lenguaje específico de dominio personalizado, en lugar de HTML, Markdown o React.
  • • El ajuste fino en un DSL está diseñado para reducir la sobrecarga de la ventana de contexto en comparación con los prompts del sistema.
  • • DiffusionGemma no es compatible actualmente con llama.cpp, lo que limita la ejecución local a través de herramientas como Ollama.

Ofrece un enfoque especializado para la generación de interfaces de usuario que reduce el uso de tokens, aunque el despliegue local está actualmente limitado por la compatibilidad con llama.cpp.

SOURCES

7. LandingAI lanza la extracción de documentos de agentes Gen2 con modelos DPT-3

ADE Gen2 de LandingAI representa un cambio importante en el procesamiento de documentos al alejarse de la fragmentación plana hacia estructuras jerárquicas de árbol. Esto permite una extracción de datos precisa con una conexión verificable. El lanzamiento está disponible de forma general y admite opciones de despliegue flexibles, incluyendo AWS, Azure, Google Cloud, Snowflake y locales, con ahorros de costos proyectados del 25% al 80% en cargas de trabajo mixtas.

  • • ADE Gen2 está construido sobre la nueva familia de modelos DPT-3, que incluye DPT-3 Pro y DPT-3 Verity.
  • • El sistema trata los documentos como estructuras de árbol y proporciona una conexión atómica para rastrear datos hasta palabras o líneas específicas.
  • • DPT-3 Verity ofrece transcripción determinista con confianza a nivel de palabra, mientras que DPT-3 Pro maneja diseños complejos y escritura a mano.
  • • Los precios han cambiado de un modelo fijo de 3 créditos por página a una tarifa por página más una tarifa por carácter de salida.
  • • El código de cliente de Gen1 es incompatible con los puntos finales de Gen2, lo que requiere una migración para los usuarios existentes.

Los desarrolladores obtienen un análisis de documentos altamente preciso con conexión a nivel de línea, aunque deben migrar el código de cliente existente a los nuevos puntos finales incompatibles.

SOURCES

8. Redis lanza el servicio de almacenamiento en caché semántico gestionado LangCache

Redis LangCache opera como un bucle de dos llamadas, buscando en la caché semántica antes de invocar al LLM y almacenando la respuesta después. Al hacer coincidir la intención de un prompt en lugar de su texto exacto, el servicio maximiza las tasas de aciertos de caché para las entradas dinámicas de los usuarios. Redis garantiza que los datos de los clientes permanezcan en sus propios servidores y nunca se utilicen para el entrenamiento de modelos.

  • • Redis LangCache es un servicio de almacenamiento en caché semántico gestionado disponible en vista previa pública en Redis Cloud.
  • • El servicio es accesible a través de una API REST con SDK dedicados para Python y JavaScript.
  • • Hace coincidir los prompts basándose en el significado semántico, devolviendo aciertos de caché hasta 15 veces más rápido que las consultas estándar de LLM.
  • • Las características incluyen umbrales de similitud configurables, TTL, políticas de desalojo y controles de precisión adaptativos.
  • • El cliente inicial Mangoes.ai informó una tasa de aciertos de caché del 70% y una reducción del 70% en el gasto en LLM.

Reduce los costos de la API de LLM y la latencia de respuesta a través del almacenamiento en caché semántico gestionado en Redis Cloud.

SOURCES

9. Sentry introduce una herramienta de rastreo de agentes para depurar flujos de trabajo de LLM

Las nuevas capacidades de rastreo de agentes de Sentry abordan los desafíos de observabilidad de los flujos de trabajo de IA no deterministas. Al mapear los pasos de ejecución del agente, los desarrolladores pueden rastrear fácilmente las salidas mal formadas hasta llamadas a herramientas específicas o fallos en los prompts. La herramienta se mostró en un taller en vivo que demostró la depuración en diversos entornos como Slack y GitHub Actions.

  • • La herramienta de rastreo de agentes de Sentry diagnostica problemas como llamadas a herramientas incorrectas, salidas mal formadas y gasto de tokens no contabilizado.
  • • La herramienta permite a los desarrolladores identificar exactamente dónde fallan los agentes y los costos operativos asociados.
  • • Sentry demostró la herramienta en agentes en vivo, incluyendo un agente de Slack, un chatbot de comercio electrónico y una GitHub Action.
  • • Los desarrolladores pueden integrar sus propios agentes personalizados en la plataforma Sentry para su monitoreo y análisis.

Brinda a los desarrolladores una visibilidad profunda de las rutas de ejecución de los agentes para identificar fallos y optimizar el gasto en tokens.

SOURCES

10. NVIDIA lanza la extensión SoL-Pi para optimizar el agente de codificación Pi

La extensión SoL-Pi de NVIDIA proporciona una forma no invasiva de optimizar el rendimiento del agente de codificación Pi. Al implementar características como el Reductor de Preservación de Evidencia para compactar registros de diagnóstico y el Compactador de Contexto en Línea para gestionar la presión de la ventana, la extensión minimiza el intercambio innecesario de tokens. Debido a que todos los mecanismos son opcionales y están deshabilitados por defecto, los desarrolladores pueden aplicar optimizaciones de forma selectiva para que coincidan con sus flujos de trabajo específicos.

  • • SoL-Pi es una extensión independiente diseñada para mejorar la eficiencia del agente de codificación Pi.
  • • La extensión se instala sobre una versión de Pi sin modificar utilizando API públicas sin parchear el código fuente.
  • • Incluye cuatro mecanismos opcionales: Fusión de Acciones, Paquete de Observación, Reductor de Preservación de Evidencia y Compactador de Contexto en Línea.
  • • La Fusión de Acciones ejecuta comandos de validación en la misma llamada a la herramienta que las operaciones de edición o escritura.
  • • El Paquete de Observación convierte grandes resultados de texto en identificadores estables con recuperación paginada para reducir el tráfico de tokens.

Permite a los desarrolladores que utilizan el agente Pi reducir significativamente los costos de inferencia y la latencia a través de mecanismos de optimización opcionales.

SOURCES

11. Lanzamiento de LangSmith Connections para la gestión gestionada de credenciales de agentes

La gestión de credenciales en los flujos de trabajo de agentes ha sido históricamente un cuello de botella de seguridad. LangSmith Connections aborda esto proporcionando una forma estructurada de manejar OAuth y claves de API compartidas. Esto permite a los agentes realizar tareas autenticadas, como presentar tickets o consultar bases de datos externas, manteniendo estrictos límites de seguridad y pistas de auditoría.

  • • LangSmith Connections es un sistema de gestión de credenciales gestionado diseñado para agentes de IA.
  • • El sistema admite credenciales propiedad del agente para tareas compartidas como búsquedas web.
  • • Admite configuraciones OAuth propiedad del usuario, lo que permite a los agentes actuar de forma segura en nombre de usuarios individuales.
  • • El sistema tiene como objetivo mejorar tanto la seguridad como las capacidades funcionales de los agentes desplegados.

Resuelve el desafío de seguridad de gestionar claves de API y tokens OAuth para agentes autónomos que realizan búsquedas web o presentan tickets.

SOURCES

12. ZeroModels lanza modelos preentrenados de Keras 3 para inferencia multimodelo

ZeroModels proporciona una alternativa optimizada para los desarrolladores que integran características multimodales en sus aplicaciones. Al aprovechar Keras 3, la colección permite que los modelos se ejecuten sin problemas en JAX, PyTorch o TensorFlow dependiendo del entorno de despliegue. La falta de dependencias pesadas de tiempo de ejecución como los transformadores lo hace muy adecuado para tuberías de producción con recursos limitados o altamente optimizadas.

  • • ZeroModels es una colección de modelos preentrenados construidos completamente en Keras 3.
  • • Las tareas admitidas incluyen clasificación de imágenes, detección de objetos, segmentación, estimación de profundidad y reconocimiento de voz.
  • • La base de código es totalmente compatible con los backends de JAX, PyTorch y TensorFlow.
  • • La colección elimina la necesidad de bibliotecas de transformadores o torch en tiempo de ejecución.

Permite a los desarrolladores desplegar modelos ligeros de visión y voz en diferentes backends sin la sobrecarga de bibliotecas de tiempo de ejecución pesadas.

SOURCES

13. El motor de inferencia Cherenkov optimiza los modelos MoE locales en Apple Silicon

Cherenkov aborda las limitaciones de memoria de ejecutar modelos masivos de mezcla de expertos en hardware local. Al predecir qué expertos serán necesarios y transmitirlos desde el SSD sobre la marcha, el motor evita cargar todo el modelo en la RAM. Este enfoque de transmisión predictiva permite que los dispositivos con memoria restringida, como un MacBook Air de 32 GB, ejecuten modelos que de otro modo excederían sus límites de memoria física.

  • • Cherenkov es un motor de inferencia diseñado específicamente para Apple Silicon.
  • • El motor utiliza transmisión predictiva de expertos para mantener un conjunto de trabajo limitado de expertos en memoria unificada.
  • • Utiliza una mirada anticipada de una capa para predecir los expertos requeridos e iniciar las lecturas del SSD con antelación.
  • • El sistema puede recurrir a cuantizaciones Q3 o Q2 más pequeñas si los tiempos de lectura del SSD son insuficientes.
  • • Logró 8-22 tokens por segundo ejecutando Qwen3.8-Flash-Next en un MacBook Air M4 de 32 GB.

Permite a los desarrolladores ejecutar grandes modelos de mezcla de expertos localmente en Macs de grado de consumo mediante la transmisión de expertos desde el SSD bajo demanda.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.