Inference Brew

OpenAI actualiza la Realtime API con GPT-Realtime-2.1 y 2.1-mini

00:00 / --:--

← Volver al inicio

OpenAI actualiza la Realtime API con GPT-Realtime-2.1 y 2.1-mini

1. OpenAI actualiza la Realtime API con GPT-Realtime-2.1 y 2.1-mini

Basándose en el modelo GPT-Realtime-2 lanzado en mayo, OpenAI ha lanzado la iteración 2.1 de su Realtime API. La actualización incluye una nueva variante mini y mejoras de rendimiento significativas, específicamente una reducción del 25% en la latencia p95 lograda mediante un almacenamiento en caché de audio optimizado. El lanzamiento también introduce un esfuerzo de razonamiento configurable y precios competitivos para las entradas de audio en caché, refinando aún más las capacidades para aplicaciones de voz de baja latencia.

  • OpenAI lanzó gpt-realtime-2.1 y gpt-realtime-2.1-mini como una actualización de la serie GPT-Realtime-2.
  • Los nuevos modelos cuentan con una reducción del 25% en la latencia p95 mediante un almacenamiento en caché de audio mejorado.
  • El modelo mini admite el uso nativo de herramientas y llamadas a funciones con un esfuerzo de razonamiento configurable.
  • El nuevo precio para la entrada de audio en caché se establece en $0.30 por cada 1 millón de tokens, significativamente más bajo que el audio nuevo.

Los desarrolladores ahora pueden aprovechar una latencia mejorada y un nuevo modelo mini para crear agentes de voz más rentables y receptivos en comparación con el lanzamiento original de GPT-Realtime-2.

SOURCES

2. NVIDIA lanza Nemotron-Labs-3-Puzzle-75B-A9B

NVIDIA ha presentado Nemotron-Labs-3-Puzzle-75B-A9B, un modelo comprimido y optimizado para despliegue, diseñado para inferencia local de alto rendimiento. Al aplicar el marco Iterative Puzzle a su modelo original de 120B, NVIDIA redujo el recuento de parámetros activos a 9.3B manteniendo sólidas capacidades de razonamiento. La arquitectura híbrida del modelo combina capas de Mamba, MoE y Attention, lo que resulta en un aumento de 2x en el rendimiento en nodos B200 y permite que una sola GPU H100 maneje hasta ocho solicitudes concurrentes de 1M de tokens.

  • Nemotron-Labs-3-Puzzle-75B-A9B se deriva de Nemotron-3-Super-120B-A12B utilizando el marco de compresión Iterative Puzzle.
  • La arquitectura híbrida presenta capas intercaladas de Mamba, MoE y Attention con predicción de múltiples tokens.
  • El modelo reduce los parámetros activos a 9.3B (desde 12.8B) y los parámetros totales a 75.3B (desde 120.7B).
  • Ofrece aproximadamente 2 veces más rendimiento de servidor en un nodo 8xB200 en comparación con su modelo original.
  • La concurrencia de una sola H100 para cargas de trabajo de 1M de tokens aumenta de 1 a 8 solicitudes concurrentes.
  • El modelo está disponible para uso comercial y admite varios idiomas, incluidos inglés, español y chino.

Los desarrolladores pueden lograr una concurrencia y un rendimiento significativamente mayores en nodos de GPU estándar al ejecutar cargas de trabajo de razonamiento local.

SOURCES

3. Gepard 1.0: TTS de streaming de código abierto y nativo de vLLM

Gepard 1.0 ha sido lanzado como un modelo de texto a voz de streaming de código abierto optimizado para IA conversacional en tiempo real. Construido sobre una base Qwen3.5 y Nemo NanoCodec, el modelo de 555 millones de parámetros logra un tiempo hasta el primer audio excepcionalmente bajo de aproximadamente 50 ms y admite clonación de voz zero-shot. Debido a que es nativo de vLLM, los desarrolladores pueden desplegarlo fácilmente junto con la infraestructura de servicio de LLM existente, logrando una alta concurrencia de hasta 256 flujos paralelos en hardware empresarial.

  • Gepard 1.0 es un modelo de TTS de streaming de 555 millones de parámetros lanzado bajo la licencia Apache 2.0.
  • El modelo utiliza una base Qwen3.5 0.8B y Nemo NanoCodec, admitiendo clonación de voz zero-shot.
  • Logra un tiempo hasta el primer audio (TTFA) de 50 ms y un factor de tiempo real (RTF) de 20x en una NVIDIA RTX 5090 a través de vLLM.
  • Una sola GPU RTX Pro 6000 Blackwell puede manejar hasta 256 secuencias paralelas.
  • Gepard 1.0 admite inglés, español, portugués y holandés, y obtuvo una puntuación de 4.25 en el benchmark Seed-TTS-eval NISQA-MOS.

Los desarrolladores que crean agentes de voz pueden lograr una síntesis de voz de alta calidad y casi instantánea utilizando un modelo que se integra de forma nativa con vLLM.

SOURCES

4. Anthropic expande Claude Cowork a la web y dispositivos móviles con ejecución en la nube

Basándose en el agente Claude Cowork existente, Anthropic ha lanzado versiones web y móviles que admiten la ejecución continua de tareas basadas en la nube. Esta actualización permite a los usuarios ejecutar flujos de trabajo de agentes de varios pasos en segundo plano sin mantener una sesión de escritorio activa, al tiempo que proporciona notificaciones en tiempo real para aprobaciones humanas en todos los dispositivos.

  • Claude Cowork ya está disponible en versión beta en la web, iOS y Android para suscriptores del plan Max.
  • Las tareas ahora se ejecutan en la nube de forma predeterminada, lo que permite una ejecución autónoma mientras el dispositivo del usuario está desconectado.
  • El cliente de escritorio sigue estando disponible para tareas que requieren acceso a archivos locales.
  • Anthropic ofrece precios de introducción para el modelo Claude Sonnet 5 y cuotas de uso extendidas para los suscriptores de Cowork hasta agosto de 2026.

Esta expansión elimina el requisito de tiempo de actividad de la máquina local para tareas de agentes de larga duración, aumentando significativamente la utilidad de Claude Cowork para flujos de trabajo operativos y comerciales asincrónicos.

5. Estado de los agentes de codificación CLI a mediados de 2026

Una evaluación de mediados de 2026 de los agentes de codificación de línea de comandos destaca el panorama maduro de los asistentes de IA basados en terminal. El análisis compara Claude Code, Codex CLI, Omp y OpenCode en flujos de trabajo estándar de desarrolladores. Si bien Claude Code, Codex CLI y Omp ofrecen capacidades similares en la lectura de bases de código y la ejecución de ediciones, divergen en detalles operativos como las solicitudes de permisos y la limpieza del espacio de trabajo. OpenCode se queda atrás en la calidad de salida, pero sigue siendo una alternativa viable para los desarrolladores que buscan una amplia compatibilidad de modelos.

  • Claude Code, Codex CLI y Omp demuestran un rendimiento comparable en tareas principales como la lectura de repositorios, la edición de archivos y la ejecución de comprobaciones.
  • Las herramientas difieren significativamente en cómo gestionan la claridad de las tareas, la higiene del repositorio y los permisos de ejecución.
  • Se descubrió que OpenCode produce resultados de menor calidad en comparación con los otros tres agentes CLI líderes.
  • Se destaca a OpenCode por su flexibilidad para integrarse con una mayor variedad de modelos subyacentes.

Los desarrolladores pueden tomar decisiones informadas sobre qué asistente de codificación basado en terminal integrar en sus flujos de trabajo de desarrollo diarios.

SOURCES

6. docx-cli ayuda a los agentes de IA a editar documentos de Word de manera eficiente

Trabajar con documentos de Microsoft Word ha sido históricamente un punto de dolor importante para los agentes de IA debido a la complejidad del OOXML sin procesar. La herramienta de código abierto docx-cli resuelve esto convirtiendo archivos .docx en Markdown anotado y comandos simples que los agentes pueden analizar y editar fácilmente. Los benchmarks muestran que el uso de docx-cli no solo evita la corrupción de documentos, sino que también reduce el consumo de tokens en 2.5 veces, al tiempo que aumenta significativamente las tasas de éxito de las tareas. La herramienta se integra a la perfección con marcos de agentes populares como Claude Code y Codex.

  • docx-cli permite a los agentes de IA leer y editar archivos .docx utilizando comandos simples y Markdown anotado en lugar de OOXML sin procesar.
  • En los benchmarks, el nivel de modelo Sonnet logró una tasa de éxito del 100% (6/6 tareas) usando docx-cli mientras consumía 2.5 veces menos tokens.
  • Las 36 salidas de documentos generadas a través de docx-cli se abrieron correctamente en Microsoft Word, en comparación con 5 fallos usando habilidades predeterminadas.
  • La herramienta admite funciones avanzadas como control de cambios, manipulación de tablas, inserción de imágenes y renderizado de documentos.
  • Es compatible con arneses de agentes como Claude Code, Codex y Pi, y se puede instalar a través de npm o binarios independientes.

Los desarrolladores que crean agentes de procesamiento de documentos pueden reducir drásticamente los costos de API y eliminar la corrupción de formato reemplazando la manipulación de OOXML sin procesar con comandos Markdown limpios.

SOURCES

7. VisionBridge Proxy añade soporte de imágenes a LLMs solo de texto

VisionBridge es un ingenioso proxy de código abierto que cierra la brecha entre los LLM solo de texto y las tareas multimodales. Operando como un servidor compatible con OpenAI, VisionBridge intercepta las entradas de imagen y expone funciones de llamada a herramientas (como OCR, recorte y escaneo) al modelo de texto. Luego, el modelo de texto consulta a un modelo de visión dedicado y separado para recopilar los datos visuales necesarios. Esto permite a los desarrolladores añadir capacidades de procesamiento de imágenes a modelos de razonamiento solo de texto de alto rendimiento sin necesidad de ajuste fino o entrenamiento de modelos personalizados.

  • VisionBridge es un proxy compatible con OpenAI con licencia MIT.
  • Permite que los modelos solo de texto interpreten imágenes consultando un modelo de visión separado mediante funciones como look, OCR y crop.
  • La herramienta no requiere entrenamiento de modelos, ajustes de peso ni configuraciones de tuberías complejas.

Los desarrolladores pueden actualizar fácilmente los modelos de razonamiento solo de texto para manejar entradas visuales sin necesidad de ajuste fino o modificación de los pesos del modelo.

SOURCES

8. Rowboat: Una alternativa de código abierto y local-first a Claude Desktop

Rowboat se ha lanzado como una alternativa de código abierto y local-first a Claude Desktop. Con licencia Apache-2.0, Rowboat organiza las interacciones de IA en torno a superficies de trabajo dedicadas (como correo electrónico, notas de reuniones y codificación) en lugar de una única ventana de chat. Almacena todos los datos localmente en Markdown simple y utiliza el protocolo Agent Client Protocol para orquestar agentes de codificación como Claude Code o Codex. Los desarrolladores pueden conectar cualquier LLM local o basado en la nube y crear interfaces personalizadas basadas en la web que se conecten a la memoria local y a las integraciones de herramientas de Rowboat.

  • Rowboat es de código abierto bajo la licencia Apache-2.0 y almacena todos los datos localmente como archivos Markdown simples.
  • Cuenta con superficies de trabajo dedicadas para redacción de correos electrónicos, notas de reuniones, navegación por el navegador y codificación paralela.
  • El modo de codificación paralela utiliza el Agent Client Protocol para orquestar instancias de Claude Code o Codex.
  • La plataforma admite cualquier LLM, incluidos modelos locales a través de Ollama o LM Studio, y permite a los desarrolladores crear superficies de trabajo personalizadas basadas en la web.

Los desarrolladores pueden crear y ejecutar flujos de trabajo de IA personalizados y locales utilizando cualquier LLM con soporte integrado para Claude Code y Codex.

SOURCES

9. Liquid AI hace de código abierto Antidoom para detener bucles de razonamiento

Liquid AI ha hecho de código abierto Antidoom, una técnica de post-entrenamiento diseñada para resolver el modo de fallo de "bucle de fatalidad" (doom loop) donde los modelos de razonamiento generan repetidamente el mismo bloque de texto. En lugar de volver a entrenar todo el modelo, la Optimización de Preferencia de Token Final (FTPO) de Antidoom aísla y ajusta los pesos del primer token que activa el bucle, dirigiendo al modelo hacia rutas alternativas coherentes. La tubería ligera se puede ejecutar en solo unas pocas horas, ofreciendo una forma práctica para que los desarrolladores estabilicen los modelos de razonamiento locales antes del despliegue.

  • Antidoom utiliza la Optimización de Preferencia de Token Final (FTPO) para apuntar y volver a entrenar solo el token específico que inicia un bucle repetitivo.
  • La tubería es altamente eficiente, requiriendo aproximadamente una hora de generación de datos en 8 GPU MI325 y de una a dos horas de entrenamiento en una sola GPU.
  • La aplicación de Antidoom a un modelo Qwen 3.5 4B redujo su tasa de bucle de fatalidad de muestreo codicioso del 22.9% a solo el 1%.
  • Las pruebas en un punto de control temprano de LFM 2.5 2.6B redujeron la tasa de bucle del 10.2% al 1.4%.
  • El método actúa como una herramienta de reparación post-entrenamiento, restaurando la capacidad del modelo para generar respuestas correctas sin perder capacidades previas.

Los desarrolladores que ajustan o despliegan modelos de razonamiento locales pueden aplicar este método para evitar que los modelos se queden atrapados en bucles infinitos de generación de texto.

SOURCES

10. Jacobian Lens aplicado al enrutamiento de modelos de local a nube

La aplicación de la investigación de interpretabilidad Jacobian Lens de Anthropic a modelos de código abierto ha dado lugar a un mecanismo práctico de enrutamiento de local a nube. Al analizar la "trayectoria del espacio de trabajo" interna de modelos como Gemma 4 durante la inferencia, un investigador construyó un enrutador de regresión logística ligero que detecta estados internos "nebulosos", donde los candidatos a tokens en competencia persisten profundamente en las capas del modelo. Cuando el enrutador detecta estos estados, puede activar una alternativa automática a un modelo de nube más grande, evitando alucinaciones locales seguras mientras minimiza los costos de API.

  • La metodología se probó en modelos de código abierto, incluidas las variantes de Gemma 4 y Qwen 3.6 27B.
  • El análisis de las características de la trayectoria del espacio de trabajo interno reveló que los estados nebulosos (donde múltiples tokens candidatos compiten profundamente en las capas) se correlacionan con respuestas seguras pero incorrectas.
  • Un enrutador de regresión logística entrenado en estas características internas superó a las puntuaciones de confianza de salida simples en la predicción de errores para los modelos Gemma.
  • El enrutador no mejoró las predicciones para Qwen 27B, que ya cuenta con una confianza de salida bien calibrada.
  • El código, la demostración y los enrutadores preentrenados se han hecho de código abierto en GitHub y Hugging Face.

Los desarrolladores pueden construir arquitecturas híbridas altamente rentables que ejecutan consultas localmente de forma predeterminada y escalan automáticamente a las API de la nube solo cuando los estados internos indican una alta incertidumbre.

SOURCES

11. mistral.rs v0.9.0 supera a llama.cpp en decodificación de CPU

El motor de inferencia local mistral.rs se ha actualizado a la versión 0.9.0, centrándose en el rendimiento de la CPU. Al implementar optimizaciones específicas de hardware para los conjuntos de instrucciones AVX2, AVX512 y ARM NEON, el motor logra una aceleración de hasta 1.8x en la decodificación en comparación con llama.cpp. Además, la actualización introduce un sistema de cuantización in situ (ISQ), que permite a los desarrolladores cargar y ejecutar modelos no cuantizados directamente desde Hugging Face mientras los cuantizan sobre la marcha para ahorrar memoria.

  • mistral.rs v0.9.0 ofrece una decodificación de CPU hasta 1.8 veces más rápida que llama.cpp al ejecutar Qwen3 4B Q4_K.
  • El motor cuenta con optimizaciones granulares para CPU x86 (AVX2 y AVX512) y CPU ARM (NEON).
  • La ventaja de rendimiento se mantuvo en todas las profundidades de contexto medidas.
  • El lanzamiento incluye un sistema de cuantización in situ (ISQ) que permite ejecutar modelos directamente desde Hugging Face.

Los desarrolladores que despliegan modelos locales en entornos solo de CPU pueden lograr velocidades de decodificación hasta 1.8 veces más rápidas.

SOURCES

12. Kokoro TTS obtiene una API contenedorizada amigable con la CPU

Basándose en el lanzamiento anterior del modelo Kokoro TTS de 82 millones de parámetros optimizado para GPU NVIDIA, se ha lanzado un nuevo contenedor Kokoro-FastAPI para simplificar el despliegue local. Esta imagen de 5 GB proporciona una API de voz compatible con OpenAI, lo que permite a los desarrolladores integrar el modelo en pilas locales en CPU estándar sin necesidad de hardware de GPU dedicado.

  • Amplía las opciones de despliegue de Kokoro TTS de solo GPU a entornos contenedorizados amigables con la CPU.
  • Proporciona una API de voz compatible con OpenAI para una integración más fácil en aplicaciones existentes.
  • Incluye una interfaz web integrada para pruebas y despliegue.
  • Los benchmarks demuestran un rendimiento eficiente en CPU de consumo como AMD Ryzen 7 y Apple M2 Pro.

Este desarrollo amplía la accesibilidad del modelo Kokoro, permitiendo a los desarrolladores desplegar síntesis de voz de baja latencia y autohospedada en hardware de grado de consumo.

SOURCES

13. Hy3-1M ahora se puede ejecutar localmente a través de GGUF y llama.cpp

Basándose en el lanzamiento del 6 de julio del modelo MoE Hy3 de Tencent, la comunidad de código abierto ahora ha habilitado la inferencia local. Las cuantizaciones GGUF están disponibles en Hugging Face, y se ha añadido soporte a llama.cpp a través de la solicitud de extracción #25395. Los benchmarks en una NVIDIA RTX 5090 muestran que el modelo alcanza de 10 a 11 tokens por segundo.

  • Las cuantizaciones GGUF para Hy3-1M ya están disponibles en Hugging Face.
  • llama.cpp ahora admite el modelo a través de la solicitud de extracción #25395.
  • La inferencia local en una NVIDIA RTX 5090 con 96 GB de RAM alcanza de 10 a 11 tokens por segundo.

Los desarrolladores ahora pueden autohospedar el modelo Hy3 en hardware de consumo utilizando herramientas de inferencia local estándar.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.