Inference Brew

OpenAI abre GPT-Live-1 a desarrolladores de API

00:00 / --:--

← Volver al inicio

OpenAI abre GPT-Live-1 a desarrolladores de API

1. OpenAI abre GPT-Live-1 a desarrolladores de API

OpenAI ha ampliado el acceso a su modelo GPT-Live-1, pasando de ser una función exclusiva de ChatGPT a un producto de API para desarrolladores. Con un precio de 0,05 dólares por minuto, el modelo permite a los desarrolladores integrar capacidades de voz full-duplex (que permiten escuchar y hablar simultáneamente) en sus propias aplicaciones. Este lanzamiento sigue al despliegue inicial del modelo para consumidores en julio, proporcionando a los desarrolladores manejo nativo de interrupciones y capacidades de razonamiento en tiempo real para agentes de voz.

  • • GPT-Live-1 ya está disponible en la API de OpenAI a 0,05 dólares por minuto.
  • • El modelo admite voz full-duplex, lo que permite escuchar y hablar simultáneamente.
  • • Incluye 12 opciones de voz y manejo nativo de interrupciones.
  • • Permite razonamiento o acciones en segundo plano durante interacciones de voz en vivo.
  • • Las pruebas iniciales indican una reducción del 80% en las interrupciones en comparación con los sistemas anteriores basados en turnos.

Los desarrolladores ahora pueden crear interfaces de voz en tiempo real altamente naturales que manejan las interrupciones con elegancia y realizan razonamientos complejos durante la conversación utilizando la misma tecnología que antes estaba limitada a ChatGPT.

SOURCES

2. OpenAI lanza los modelos GPT Image 2.5 Flare y Sunburst

OpenAI ha actualizado su suite de generación de imágenes con el lanzamiento de GPT Image 2.5 Flare y Sunburst. Flare está diseñado para la generación de imágenes cotidiana de baja latencia, mientras que Sunburst está adaptado para el trabajo creativo detallado y un control de edición preciso. Ambos modelos tienen un precio de 30 dólares por millón de tokens de salida de imagen (igualando el precio de GPT Image 2) y son accesibles inmediatamente a través de la API de OpenAI. Sunburst ha alcanzado el primer puesto en la tabla de clasificación de edición de imágenes de Artificial Analysis, demostrando mejoras significativas en el manejo de diseños complejos, renderizado de texto y ediciones estructurales.

  • • OpenAI lanzó GPT Image 2.5 Flare y Sunburst, cinco meses después de GPT Image 2.
  • • Flare está optimizado para la generación cotidiana de baja latencia, mientras que Sunburst está diseñado para trabajo creativo de alta calidad y un control de edición estricto.
  • • Ambos modelos admiten conversión de texto a imagen y edición de imágenes, y tienen un precio de 30 dólares por millón de tokens de salida de imagen.
  • • Flare y Sunburst ocupan las dos primeras posiciones en las tablas de clasificación de imágenes de Artificial Analysis.
  • • Sunburst lidera en 8 de cada 10 casos de uso de edición de imágenes, mostrando grandes ganancias en composiciones complejas, diagramas y contenido de creadores.
  • • Los modelos están disponibles a través de la API de OpenAI e integrados en ChatGPT y Codex.

Los desarrolladores pueden integrar una generación de imágenes más rápida y de mayor calidad, así como una edición de composición precisa, en sus aplicaciones sin pagar un sobreprecio respecto a los modelos de la generación anterior.

SOURCES

3. Cohere lanza el modelo North Small Translate 218B MoE

Cohere ha lanzado North Small Translate, un modelo de mezcla de expertos (MoE) disperso de 218 mil millones de parámetros optimizado para traducción automática de alta calidad en 50 idiomas. Activando 25 mil millones de parámetros por token, el modelo cuenta con una arquitectura solo de decodificador con 128 expertos y admite una generosa ventana de contexto de entrada/salida de 16K. Los desarrolladores pueden acceder al modelo a través de la API de Cohere o alojar por cuenta propia la versión cuantizada de 4 bits en una configuración B200 única o H100 dual, lo que la convierte en una opción viable para tuberías de traducción locales de alto rendimiento.

  • • North Small Translate es un modelo de mezcla de expertos (MoE) disperso con 218B de parámetros totales y 25B activos.
  • • El modelo admite traducción en 50 idiomas con una ventana de contexto de 16K de entrada y 16K de salida.
  • • Está disponible a través de la API de Cohere, para alojamiento propio no comercial o bajo una licencia comercial.
  • • La versión cuantizada de 4 bits se puede ejecutar localmente en una sola B200 o dos GPU H100.
  • • Una variante agentica utiliza un flujo de trabajo de múltiples pasadas para corregir errores, obteniendo una puntuación de 84,36 en la evaluación WMT26 de Cohere.

Los desarrolladores pueden implementar un modelo de traducción de pesos abiertos altamente preciso localmente en hardware empresarial estándar o acceder a él a través de API para aplicaciones multilingües.

SOURCES

4. Lanzamiento del modelo de reconocimiento de voz Orukeet de 25 idiomas

Orukeet ha sido lanzado como un modelo de reconocimiento automático de voz (ASR) de alto rendimiento y 25 idiomas construido sobre la arquitectura NVIDIA Parakeet TDT 0.6B v3. Al reemplazar la mitad de los filtros temporales de profundidad del codificador con 12.288 núcleos Gabor ajustados y congelados, Orukeet logra una reducción relativa del 10,6% en la tasa de error de palabras (WER) en 25 idiomas FLEURS en comparación con el modelo Parakeet original. Este modelo de pesos abiertos ofrece a los desarrolladores una solución de voz a texto multilingüe y multiacento altamente precisa para su implementación local.

  • • Orukeet es un reconocedor de voz de 25 idiomas construido a partir del modelo NVIDIA Parakeet TDT 0.6B v3.
  • • El modelo reemplaza la mitad de los filtros temporales de profundidad del codificador con 12.288 núcleos Gabor ajustados y congelados.
  • • Orukeet logra una tasa de error de palabras (WER) del 1,46% en LibriSpeech test-clean, en comparación con el 1,53% de Parakeet.
  • • En 25 idiomas FLEURS, Orukeet logra un WER combinado del 9,85%, lo que representa una reducción relativa del 10,6% sobre Parakeet.
  • • El modelo está entrenado con datos multilingües y multiacento, utilizando LibriSpeech test-other para la adaptación final.

Los desarrolladores que crean funciones de voz y habla pueden adoptar un modelo de voz a texto de pesos abiertos altamente preciso que reduce las tasas de error de palabras en múltiples idiomas.

SOURCES

5. Lanzamiento del modelo Qwen3.8-27B-Humanlike-Chat

Para combatir el tono excesivamente verboso y pulido característico de los asistentes de IA estándar, un desarrollador ha lanzado Qwen3.8-27B-Humanlike-Chat. Ajustado mediante un LoRA de rango 256 sobre el modelo base Qwen3.8-27B abliterado, el entrenamiento aprovechó un conjunto de datos de más de 125.000 mensajes humanos ofuscados. El modelo resultante genera naturalmente respuestas conversacionales más cortas, menos formales y más realistas sin necesidad de complejos prompts del sistema. Actualmente está disponible como pesos abiertos en Hugging Face y a través de un endpoint de API compatible con OpenAI con límite de tasa.

  • • El modelo fue entrenado para abordar el tono excesivamente servicial, pulido y verboso típico de los asistentes de IA estándar.
  • • Fue entrenado utilizando un conjunto de datos de 125.217 mensajes humanos ofuscados en 1.396 conversaciones.
  • • El entrenamiento involucró un LoRA de rango 256 aplicado al modelo base huihui-ai/Huihui-Qwen3.8-27B-abliterated.
  • • El modelo produce respuestas más cortas y menos pulidas sin necesidad de prompts del sistema específicos.
  • • Está disponible a través de Hugging Face, un espacio de demostración y un endpoint de API compatible con OpenAI con límite de tasa.

Los desarrolladores que crean agentes conversacionales pueden evitar las plantillas de asistente robóticas y excesivamente verbosas, e implementar un modelo que imite naturalmente el diálogo humano realista.

SOURCES

6. Sakana AI expande la plataforma de orquestación Fugu con Fugu Max y Fugu Ultra v2

Basándose en la plataforma de orquestación Fugu, previamente expandida con el endpoint Fugu-Cyber, Sakana AI ha lanzado dos nuevos modelos: Fugu Max y Fugu Ultra v2. Estos modelos están disponibles a través de una única API compatible con OpenAI, lo que permite a los desarrolladores enrutar tareas a través de un grupo de modelos para mejorar la rentabilidad o el razonamiento complejo. Fugu Max está optimizado para reducir costes, mientras que Fugu Ultra v2 se centra en el razonamiento de varios pasos de alta capacidad. Tenga en cuenta que estos modelos no están disponibles para alojamiento propio y siguen estando excluidos de la UE/EEE.

  • • Fugu Max y Fugu Ultra v2 son nuevas incorporaciones a la plataforma de orquestación Fugu.
  • • Fugu Max tiene un precio de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida, con el objetivo de la rentabilidad.
  • • Fugu Ultra v2 está diseñado para razonamiento complejo, obteniendo una puntuación de 74,3 en el benchmark DeepSWE.
  • • Los modelos están disponibles a través de una API alojada compatible con OpenAI.
  • • Al igual que los endpoints Fugu anteriores, estos no están disponibles para alojamiento propio y están excluidos de la UE/EEE.

Esta actualización proporciona a los desarrolladores opciones de enrutamiento especializadas adicionales dentro del ecosistema Fugu, lo que permite un control más granular sobre el coste y el rendimiento del razonamiento.

SOURCES

7. Debuta Octen Search con latencia y coste ultrabajos

Octen Search ha entrado en el mercado de API de búsqueda con un fuerte enfoque en la velocidad y la rentabilidad para agentes de IA. Debutando en tercer lugar en el índice de búsqueda de Artificial Analysis, el servicio registra una latencia de consulta promedio de solo 0,2 segundos (cinco veces más rápido que las variantes de Perplexity Search) y completa tareas de búsqueda complejas en 16,9 segundos. Con un precio altamente competitivo de 1 dólar por cada 1.000 consultas, Octen Search ofrece a los desarrolladores una opción de alto rendimiento y bajo coste para fundamentar LLM y agentes en datos web en tiempo real.

  • • Octen Search debutó en tercer lugar en el índice de búsqueda de Artificial Analysis con una puntuación de 77.
  • • El servicio logró el tiempo por tarea más rápido con 16,9 segundos, superando la línea base de solo modelo de 22,6 segundos.
  • • Promedia 0,2 segundos por consulta, lo que es 5 veces más rápido que las variantes de Perplexity Search.
  • • Octen Search tiene un precio de 1 dólar por cada 1.000 consultas de búsqueda (0,058 dólares por tarea de índice de búsqueda).
  • • El benchmark se realizó utilizando el arnés de agentes de código abierto Stirrup con un modelo base fijo.

Los desarrolladores que crean agentes habilitados para búsqueda pueden reducir drásticamente la latencia y los costes de API cambiando a un proveedor de búsqueda optimizado para la velocidad.

SOURCES

8. Lanzamiento y evaluación del agente de codificación multimodelo Devin Fusion

Basándose en la reciente integración del modelo SWE-2, Cognition ha lanzado formalmente Devin Fusion. Esta arquitectura de agente multimodelo combina un modelo de frontera (como Claude Fable 5.1 o GPT-6 Astra) con un modelo auxiliar SWE-2 para equilibrar la capacidad y los costes de ejecución. El sistema ha debutado ahora en el índice de agentes de codificación de Artificial Analysis, proporcionando a los desarrolladores datos comparativos sobre velocidad y rentabilidad para flujos de trabajo agenticos.

  • • Devin Fusion es el primer agente de codificación multimodelo que aparece en el índice de agentes de codificación de Artificial Analysis.
  • • La configuración que combina Claude Fable 5.1 (xhigh) con SWE-2 (medium) obtuvo una puntuación de 62 en el índice de agentes de codificación v1.5.
  • • La configuración GPT-6 Astra (xhigh) y SWE-2 (medium) obtuvo una puntuación de 59, siendo un 43% más barata y un 31% más rápida que la configuración de Claude Fable.
  • • Cognition publicó una entrada de blog de lanzamiento detallando el desglose técnico del modelo Fusion.

Los desarrolladores ahora pueden evaluar las compensaciones de rendimiento y coste de las configuraciones multimodelo de Devin Fusion utilizando benchmarks estandarizados del índice de agentes de codificación de Artificial Analysis.

SOURCES

9. Anthropic introduce evaluaciones de plugins para Claude Code

Anthropic ha añadido un flujo de trabajo de evaluación de plugins nativo a Claude Code, comenzando en la versión 2.1.269. Esta nueva función permite a los desarrolladores medir el rendimiento de los plugins personalizados comparándolos con una línea base donde el plugin está deshabilitado, generando una puntuación delta clara. El marco admite seis tipos de evaluadores (cuatro de los cuales son gratuitos, mientras que dos utilizan llamadas LLM pagadas para actuar como jueces). Con el nuevo comando 'claude-code eval', los desarrolladores pueden generar automáticamente conjuntos de pruebas e integrarlos directamente en las tuberías de CI para evitar regresiones en las habilidades de los agentes.

  • • Anthropic ha introducido un nuevo flujo de trabajo de evaluación de plugins para Claude Code (v2.1.269 o posterior).
  • • El flujo de trabajo compara el rendimiento del plugin con una línea base sin plugin para calcular una puntuación delta.
  • • El sistema admite seis tipos de evaluadores, incluidos cuatro evaluadores gratuitos y dos evaluadores de juez LLM pagados.
  • • El comando 'claude-code eval' puede generar automáticamente conjuntos de pruebas iniciales y evaluadores para un plugin.
  • • Las evaluaciones se pueden integrar directamente en las tuberías de CI para actuar como una puerta de calidad para nuevas habilidades.

Los desarrolladores que crean plugins o habilidades personalizados para Claude Code ahora pueden probar, comparar y controlar sistemáticamente su código utilizando evaluaciones automatizadas de múltiples evaluadores.

SOURCES

10. Litelm: una alternativa ligera y de baja dependencia a LiteLLM

Los desarrolladores que buscan reducir las dependencias de sus aplicaciones ahora pueden usar litelm, una alternativa ligera a la popular biblioteca LiteLLM. Escrita en solo 2.900 líneas de código con solo dos dependencias ('openai' y 'httpx'), litelm se centra estrictamente en el enrutamiento central, la traducción de mensajes, el streaming, el uso de herramientas y las incrustaciones, omitiendo funciones pesadas como servidores proxy y almacenamiento en caché. La API está diseñada para reflejar directamente a LiteLLM, lo que permite un reemplazo directo, e incluye soporte asíncrono completo junto con una integración verificada con DSPy.

  • • litelm es una biblioteca de enrutamiento LLM mínima que consta de ~2.900 líneas de código y solo dos dependencias (openai y httpx).
  • • La API refleja a LiteLLM, lo que permite a los desarrolladores cambiar simplemente actualizando sus declaraciones de importación.
  • • Admite el enrutamiento a 19 proveedores utilizando una sintaxis estándar de proveedor/nombre-de-modelo e incluye variantes asíncronas como acompletion.
  • • La biblioteca asigna errores de proveedor a una jerarquía de excepciones personalizada (por ejemplo, ContextWindowExceededError).
  • • Actualmente en alfa, la biblioteca tiene soporte verificado para la integración de DSPy en siete rutas de ejecución.

Los desarrolladores pueden reemplazar bibliotecas de enrutamiento infladas con un envoltorio de dependencia mínima altamente optimizado que mantiene la compatibilidad con la API y el soporte asíncrono nativo.

SOURCES

11. CodeFinetuner simplifica el ajuste fino de modelos de autocompletado locales

CodeFinetuner se ha lanzado como una tubería de extremo a extremo diseñada para ayudar a los desarrolladores a ajustar modelos de autocompletado de código pequeños y locales (como Qwen2.5-Coder-3B) en sus propias bases de código privadas. Instalable a través de 'uv tool install codefinetuner', la herramienta admite el entrenamiento tanto en Mac (MPS) como en hardware NVIDIA (CUDA), utilizando Unsloth para minimizar el uso de VRAM. La tubería automatiza todo el proceso (desde el análisis de tree-sitter y el ajuste fino de LoRA hasta la evaluación y la conversión a GGUF), produciendo modelos que se pueden colocar directamente en extensiones de editor locales como llama.vim o llama.vscode.

  • • CodeFinetuner es una tubería de extremo a extremo para el ajuste fino de LoRA de modelos de autocompletado de código pequeños en bases de código específicas.
  • • La herramienta admite el entrenamiento tanto en Mac (MPS) como en hardware NVIDIA (CUDA), con integración opcional de Unsloth.
  • • El flujo de trabajo maneja el análisis de tree-sitter, el ajuste fino de LoRA, la evaluación (CodeBLEU/perplejidad) y la conversión a GGUF.
  • • Los modelos GGUF resultantes son compatibles con herramientas de editor locales como llama.vim y llama.vscode.
  • • La herramienta se puede instalar instantáneamente a través de 'uv tool install codefinetuner'.

Los desarrolladores pueden personalizar fácilmente los modelos de autocompletado locales para sus bases de código privadas, ejecutándolos de manera eficiente en hardware Mac o NVIDIA.

SOURCES

12. Google lanza el plugin para desarrolladores de Cloud basado en el estándar Agent Plugins 1.0.0

Tras el lanzamiento del estándar abierto Agent Plugins 1.0.0 en agosto, Google ha lanzado el Google Cloud Developer Plugin. Este nuevo conjunto de herramientas proporciona paquetes instalables que equipan a los agentes de codificación de IA con habilidades especializadas para interactuar, configurar y gestionar la infraestructura de Google Cloud, marcando una aplicación práctica de la especificación de plugin establecida recientemente.

  • • Google lanzó el Google Cloud Developer Plugin, implementando el estándar Agent Plugins 1.0.0.
  • • El plugin proporciona paquetes instalables de herramientas para gestionar recursos de Google Cloud.
  • • Permite a los agentes de IA realizar tareas de implementación, gestión y resolución de problemas dentro de los entornos de Google Cloud.

Este lanzamiento demuestra la adopción del estándar Agent Plugins 1.0.0, lo que permite a los desarrolladores integrar capacidades de gestión en la nube estandarizadas y portátiles directamente en sus flujos de trabajo de agentes de IA.

SOURCES

13. Google Research lanza el marco ToolGrad para la generación de datos de uso de herramientas

Investigadores de Google, la Universidad de Tokio, RIKEN y la Universidad de Tohoku han lanzado ToolGrad, un marco de código abierto diseñado para generar datos de entrenamiento de alta calidad para modelos de uso de herramientas y llamadas a funciones. Al invertir la tubería tradicional (construyendo primero una cadena de uso de herramientas verificada y luego generando la consulta de usuario correspondiente), ToolGrad logra una tasa de aprobación de generación de datos del 99,8% en ToolBench. Utilizando este método, los investigadores ajustaron un modelo Gemma-3 12B que obtuvo una puntuación de 83,1 en el Berkeley Function Calling Leaderboard, superando a su modelo profesor, Gemini 2.5 Flash-Lite. El marco está disponible como un paquete PyPI bajo una licencia Apache-2.0.

  • • ToolGrad invierte la generación de datos estándar construyendo primero una cadena de uso de herramientas verificada, luego generando la consulta de usuario coincidente.
  • • El marco mejoró la tasa de aprobación de generación de datos en ToolBench del 63,8% al 99,8% en comparación con la búsqueda en profundidad.
  • • Los investigadores utilizaron ToolGrad para ajustar modelos Gemma-3 (1B, 4B, 12B) utilizando Gemini 2.5 Flash-Lite.
  • • El modelo ToolGrad-12B resultante obtuvo una puntuación de 83,1 en el Berkeley Function Calling Leaderboard, superando a su modelo profesor.
  • • El código de ToolGrad se publica bajo una licencia Apache-2.0, con modelos, conjuntos de datos y un paquete PyPI disponibles.

Los desarrolladores pueden generar conjuntos de datos de llamadas a funciones de alta calidad y ajustar modelos locales pequeños y altamente eficientes que superan a las API de frontera en el uso de herramientas.

SOURCES

14. Llama-Manager permite la reconfiguración dinámica del modelo a mitad de la generación

Una nueva herramienta llamada llama-manager ofrece a los desarrolladores una forma de reconfigurar dinámicamente los modelos locales que se ejecutan en llama.cpp sin interrumpir la generación activa de tokens. Al preservar la caché KV durante las reconfiguraciones, llama-manager elimina la necesidad de volver a procesar los prompts al alternar la decodificación especulativa, mover componentes a la CPU o ajustar la cuantización de la caché KV. En pruebas beta en una sola GPU de 32 GB, la herramienta expandió con éxito la ventana de contexto de un modelo Qwen3.8-27B de 167.680 tokens a 262.144 tokens utilizando estrategias de memoria dinámica.

  • • llama-manager es un envoltorio para una bifurcación de llama.cpp que permite la configuración dinámica del modelo después de la carga.
  • • La herramienta admite la recarga en caliente de modelos a mitad de la generación de tokens, preservando la caché KV para evitar el reprocesamiento de prompts.
  • • Permite a los usuarios alternar dinámicamente la decodificación especulativa, mover componentes a la CPU y actualizar la cuantización de la caché KV.
  • • Al ejecutar Qwen3.8-27B-UD-Q4_K_XL en una GPU de 32 GB, expandió la ventana de contexto de 167.680 a 262.144 tokens.
  • • El proyecto se encuentra actualmente en fase beta y está restringido a la inferencia de una sola GPU.

Los desarrolladores que ejecutan modelos locales pueden ajustar dinámicamente las estrategias de cuantización, decodificación especulativa y descarga sobre la marcha, maximizando la longitud del contexto en una memoria GPU limitada.

SOURCES

15. El ajuste fino de Qwen 3 4B en 100 acertijos de lógica aumenta el benchmark de matemáticas en un 31%

Una sorprendente demostración de ajuste fino dirigido muestra que entrenar el modelo base Qwen 3 4B en un pequeño conjunto de datos de solo 100 acertijos de cebra produce un aumento del rendimiento del 31% en el benchmark MATH-500. Toda la ejecución de entrenamiento se completó en 6,5 minutos en una sola GPU H100 o H200. Esta receta, completa con un cuaderno de reproducción compartido, destaca cómo los desarrolladores pueden lograr ganancias masivas de razonamiento en modelos locales pequeños utilizando conjuntos de datos altamente curados y específicos del dominio en lugar de presupuestos de computación masivos.

  • • El ajuste fino de Qwen 3 4B Base en 100 acertijos de cebra resultó en una mejora del 31% en el benchmark MATH-500.
  • • El proceso de entrenamiento tomó solo 6,5 minutos en una sola GPU H100 o H200.
  • • Se ha puesto a disposición del público un cuaderno de reproducción completo para el proceso de ajuste fino.

Los desarrolladores pueden aplicar conjuntos de datos ultra pequeños y altamente específicos para mejorar drásticamente las capacidades de razonamiento de los modelos locales pequeños con costes de computación mínimos.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.