Inference Brew

OpenAI lanza GPT-6 Astra con 1.05M de contexto y capacidades de uso de computadora

00:00 / --:--

← Volver al inicio

OpenAI lanza GPT-6 Astra con 1.05M de contexto y capacidades de uso de computadora

1. OpenAI lanza GPT-6 Astra con 1.05M de contexto y capacidades de uso de computadora

OpenAI ha lanzado GPT-6 Astra, su modelo de próxima generación optimizado para tareas de uso de computadora e ingeniería de software. Astra introduce una ventana de contexto de 1.05 millones de tokens que gestiona el estado mediante un nuevo método de toma de notas entre ventanas en lugar de compactación. Construido sobre una arquitectura de transformador en bucle que reutiliza capas para ahorrar RAM de alojamiento, el modelo tiene un precio de $10 por millón de tokens de entrada y $50 por millón de salida. Se está implementando para los miembros de Daybreak Access, los niveles de pago de ChatGPT, la API de OpenAI y AWS.

  • • GPT-6 Astra cuenta con una ventana de contexto de 1,050,000 tokens y un límite máximo de salida de 128,000 tokens.
  • • El precio de la API se establece en $10.00 por millón de tokens de entrada y $50.00 por millón de tokens de salida, con un descuento del 90% para lecturas en caché.
  • • El modelo alcanza un 74.1% en el benchmark DeepSWE v1.1 y un 99.9% en ARC-AGI-3 utilizando el arnés Provider Adapter.
  • • Astra utiliza una arquitectura de transformador en bucle que reutiliza capas para aumentar la capacidad sin incrementar los requisitos de almacenamiento o RAM.
  • • El modelo ha sido designado como alcanzando el umbral crítico de ciberseguridad de OpenAI, restringiendo el descubrimiento de exploits avanzados para usuarios estándar.

Los desarrolladores obtienen acceso a un modelo de codificación y uso de computadora altamente avanzado que reduce drásticamente el uso de tokens por tarea, a pesar de un precio base de API más alto.

2. Meta detalla el rendimiento de Muse Spark 1.3 y los precios para colaboradores

Meta ha proporcionado más detalles sobre el modelo Muse Spark 1.3 lanzado ayer, destacando una ventana de contexto de 1 millón de tokens y una eficiencia mejorada. El modelo reduce las llamadas a herramientas en un 20% y el uso de tokens en un 25% en comparación con la versión 1.2. Meta también ofrece un descuento del 95% a los usuarios que opten por compartir sus prompts y resultados para ayudar a entrenar futuros modelos.

  • • Muse Spark 1.3 cuenta con una ventana de contexto de 1 millón de tokens.
  • • Las mejoras de eficiencia incluyen una reducción del 20% en las llamadas a herramientas y un 25% menos de uso de tokens.
  • • El modelo alcanzó una puntuación de 75.4 en el benchmark DeepSWE v1.1.
  • • Hay disponible un descuento del 95% para los usuarios que opten por compartir datos para el entrenamiento del modelo.
  • • El modo de razonamiento más alto permanece restringido para pruebas de seguridad.

Los desarrolladores ahora pueden evaluar las ganancias de eficiencia y las oportunidades de ahorro de costos del modelo a través del programa de colaboradores recién revelado.

3. IFM lanza la familia de modelos de pesos abiertos K2 Horizon con 512K de contexto

El Institute of Foundation Models (IFM) en MBZUAI ha lanzado K2 Horizon, una flota conectada de seis modelos de pesos abiertos. El lanzamiento es altamente transparente, proporcionando el ciclo de vida completo de entrenamiento, puntos de control intermedios, recetas de datos de entrenamiento y la infraestructura de entrenamiento xLLM. Los modelos van desde una variante ligera de 0.9B hasta un modelo masivo de Mezcla de Expertos (MoE) de 375B-A23B. El modelo 36B-A4B introduce un mecanismo de Mezcla de Atención de Valor (MoVA) para optimizar los parámetros activos, mientras que los modelos más grandes admiten una ventana de contexto nativa de 512K tokens.

  • • La familia K2 Horizon incluye seis modelos: variantes de 375B-A23B, 36B-A4B, 32B, 7B, 3.7B y 0.9B.
  • • Los modelos se lanzan bajo la licencia Apache 2.0, con puntos de control intermedios, recetas de datos de entrenamiento y código completamente de código abierto.
  • • Los modelos 36B-A4B y 375B-A23B utilizan arquitecturas de Mezcla de Expertos (MoE), con el modelo 36B presentando un nuevo mecanismo de Mezcla de Atención de Valor (MoVA).
  • • Los modelos admiten una ventana de contexto nativa de hasta 524,288 tokens.
  • • El soporte de despliegue desde el primer día está disponible para hardware NVIDIA, AMD y Cerebras a través de vLLM, SGLang y Ollama.

Los desarrolladores obtienen acceso a una familia de modelos de pesos abiertos altamente capaz con una ventana de contexto masiva de 512K y soporte desde el primer día en vLLM, SGLang y Ollama.

4. Microsoft lanza MAI-Transcribe-2 con un recorte de precio del 72%

Basándose en el modelo MAI-Transcribe-1.5 introducido en junio de 2026, Microsoft ha lanzado MAI-Transcribe-2. El nuevo modelo ofrece una reducción de precio del 72% a $0.10 por hora y aumenta la velocidad de procesamiento a 411x en tiempo real, mientras mejora la precisión a una tasa de error de palabra del 2.0%. Ya está disponible a través de Microsoft Foundry y MAI Playground.

  • • MAI-Transcribe-2 tiene un precio de $0.10 por hora, una reducción del 72% respecto al costo de $6 por 1,000 minutos de MAI-Transcribe-1.5.
  • • El modelo logra una tasa de error de palabra del 2.0%, mejorando la tasa del 2.4% de su predecesor.
  • • La velocidad de procesamiento ha aumentado a 411x en tiempo real, frente a 276x en la versión anterior.
  • • Las nuevas características incluyen soporte para 60 idiomas, diarización de hablantes y marcas de tiempo a nivel de palabra.
  • • Disponible ahora a través de Microsoft Foundry y MAI Playground.

La actualización reduce significativamente el costo y la latencia para los desarrolladores que utilizan los modelos de transcripción propietarios de Microsoft en comparación con la generación anterior.

5. Inworld mueve Realtime TTS-2 a disponibilidad general

Inworld ha hecho la transición de su modelo Realtime TTS-2 de una vista previa de investigación a un lanzamiento comercial completo. El modelo, que admite más de 100 idiomas e instrucciones de estilo de texto plano, ha asegurado ahora la posición #1 en el Artificial Analysis Controlled Voice Arena con una puntuación Elo de 1,123. Está disponible para desarrolladores a un precio de $20.83 por 1 millón de caracteres.

  • • Realtime TTS-2 ya está disponible de forma general tras su vista previa de investigación inicial.
  • • El modelo tiene un precio de $20.83 por 1 millón de caracteres.
  • • Ocupa el puesto #1 en el Artificial Analysis Controlled Voice Arena con una puntuación Elo de 1,123.
  • • Admite más de 100 idiomas con detección automática de idioma.
  • • Logra un rendimiento de generación de 106 caracteres por segundo.

Los desarrolladores ahora pueden acceder a la versión lista para producción del modelo, que ofrece generación de voz multilingüe de alta calidad a un rendimiento de 106 caracteres por segundo.

SOURCES

6. Alibaba lanza el modelo de generación y edición de video Wan 3.0

Alibaba ha lanzado Wan 3.0, una actualización importante de su familia de modelos de generación de video. El modelo es capaz de generar hasta 30 segundos de video en 1080p completo con audio nativo. Admite una amplia gama de entradas creativas, incluyendo texto, imágenes, audio y páginas web, y permite la edición guiada por instrucciones de visuales, trama, diálogo y sonido. Wan 3.0 se encuentra actualmente en vista previa pública en Alibaba Cloud Model Studio.

  • • Wan 3.0 genera hasta 30 segundos de video en 1080p con audio nativo.
  • • El modelo admite texto a video, imagen a video, generación basada en referencias y edición guiada por instrucciones.
  • • Ocupa el puesto #1 en Edición de Video con Audio y #2 en Texto a Video con Audio en el Artificial Analysis Video Arena.
  • • Los precios comienzan en $0.05/seg para 480p, $0.10/seg para 720p y $0.20/seg para 1080p.
  • • El modelo está disponible en vista previa pública a través de Alibaba Cloud Model Studio.

Los desarrolladores pueden integrar capacidades avanzadas de edición y generación de video, incluyendo transferencia de estilo y preservación de movimiento, directamente a través de Alibaba Cloud Model Studio.

SOURCES

7. sanoTTS lanza una pila de TTS neuronal ultraligera para microcontroladores

Un desarrollador ha lanzado sanoTTS, una pila de texto a voz neuronal ultraligera diseñada para hardware de bajos recursos. La familia de modelos varía de 294k a 2.2 millones de parámetros, con el modelo más pequeño ocupando solo 337kb cuando se cuantiza a int8. A pesar de su tamaño diminuto, el modelo de 1.5M puede ejecutarse en un microcontrolador ESP32 de $3 con un factor de tiempo real de 0.225, generando cuatro segundos de audio en menos de un segundo.

  • • sanoTTS admite 11 voces y 6 idiomas con tamaños de modelo que van desde 294k a 2.2M de parámetros.
  • • El modelo de 294k ocupa solo 337kb cuando se cuantiza a int8 y funciona en chips de $3 con 512kb de SRAM.
  • • El modelo de 1.5M logra un factor de tiempo real de 0.225 en un microcontrolador ESP32, generando 4 segundos de audio en 1 segundo.
  • • La familia de modelos está disponible para aplicaciones web a través del paquete npm `sanotts-web`.
  • • El desarrollador afirma que sanoTTS es el modelo de TTS neuronal más pequeño jamás creado.

Los desarrolladores pueden desplegar capacidades de texto a voz locales de alta calidad directamente en hardware de borde de bajo costo y microcontroladores sin una NPU.

SOURCES

8. Anthropic lanza el plano de referencia de agentes de comercio Claude

Anthropic ha lanzado `anthropics/commerce-agents`, un plano de referencia de código abierto para construir agentes de compras y comerciantes. El repositorio proporciona implementaciones ejecutables para cuatro verticales: minorista, viajes, telecomunicaciones y entretenimiento. Para optimizar el rendimiento, Anthropic recomienda una arquitectura de "habilidades de agente" sobre los enrutadores de intención tradicionales, lo que ayuda a minimizar la latencia y los costos de API. El sistema también utiliza una puerta de aprobación donde el modelo propone acciones y el arnés las aplica.

  • • El repositorio `anthropics/commerce-agents` se lanza bajo la licencia Apache 2.0.
  • • El plano incluye verticales ejecutables para minorista, viajes, telecomunicaciones y entretenimiento, ejecutándose en Python 3.11+ y Node 22.
  • • Admite despliegue a través de la API de Claude, Amazon Bedrock, Microsoft Foundry y Google Cloud Vertex AI.
  • • La arquitectura utiliza un diseño de "habilidades de agente" sobre enrutadores de intención para minimizar la latencia y los costos de tokens.
  • • El lanzamiento incluye un plugin de Claude Code para estructurar y revisar implementaciones de agentes.

Los desarrolladores pueden estructurar y desplegar rápidamente agentes de comercio listos para producción utilizando una arquitectura de habilidades preconstruida y optimizada que minimiza la latencia y los costos de tokens.

SOURCES

9. Los agentes en la nube de Cursor ahora admiten ejecución en redes privadas

Tras la introducción el 20 de agosto de los agentes en la nube basados en eventos, Cursor ha ampliado su soporte de infraestructura para permitir que estos agentes se ejecuten en redes privadas. Aunque los agentes estaban restringidos anteriormente al entorno de nube estándar de Cursor, ahora pueden programarse dinámicamente en grupos de máquinas gestionados directamente por los equipos de desarrollo, permitiendo un acceso seguro a servicios internos y control de fuente privado.

  • • Los agentes en la nube de Cursor ahora admiten la ejecución en grupos de máquinas privados gestionados por el usuario.
  • • Esto amplía las capacidades de agentes basados en eventos introducidas en agosto.
  • • Los agentes ahora pueden acceder directamente a servicios internos y sistemas de control de fuente privados.
  • • Los agentes continúan siendo iniciados y gestionados a través de la plataforma estándar de Cursor.

Esta actualización permite a los equipos integrar los flujos de trabajo agénticos de Cursor con bases de datos internas, tuberías de construcción personalizadas y sistemas de control de fuente privados que antes eran inaccesibles para los agentes alojados en la nube.

SOURCES

10. Lanzamiento de Restless para ayudar a los agentes de IA a crear y depurar interacciones de API

Restless ha lanzado una herramienta para desarrolladores diseñada para agilizar cómo los agentes de IA interactúan con las API. La plataforma genera automáticamente documentación de API a partir de puntos finales existentes, facilitando que los agentes entiendan cómo llamarlos. Crucialmente, Restless incluye un mecanismo de manejo de errores que intercepta llamadas a API fallidas, generando instrucciones correctivas que permiten al agente autocorregirse y reintentar la solicitud en tiempo real.

  • • Restless genera automáticamente documentación de API a partir de puntos finales existentes para ayudar en la integración de agentes.
  • • La herramienta cuenta con un bucle de manejo de errores que detecta llamadas a API fallidas y proporciona instrucciones a los agentes para reintentar.
  • • Los registros de API en tiempo real permiten a los desarrolladores monitorear la actividad del cliente llamada por llamada.
  • • Los desarrolladores pueden inicializar la herramienta localmente ejecutando `npx restless init`.

Los desarrolladores pueden construir integraciones de agentes más resistentes dejando que Restless detecte llamadas a API fallidas y devuelva instrucciones correctivas al agente.

SOURCES

11. Nvidia lanza PAIR para vincular computadoras inactivas para inferencia de IA local

Nvidia ha lanzado Personal AI Router (PAIR), una herramienta gratuita y de código abierto diseñada para conectar computadoras inactivas en un grupo de inferencia de IA local unificado. Compatible con Windows, Linux y macOS, PAIR admite GPUs Nvidia RTX, sistemas DGX Spark y chips Apple M4. El software utiliza TLS mutuo (mTLS) para asegurar las comunicaciones y escala dinámicamente a medida que los dispositivos se unen o abandonan la red, permitiendo a los desarrolladores ejecutar modelos locales en múltiples máquinas.

  • • PAIR es una herramienta gratuita y de código abierto que vincula computadoras domésticas inactivas para realizar inferencia de IA local en paralelo.
  • • El software es compatible con Nvidia GeForce RTX serie 20 o superior, RTX Pro, DGX Spark y chips Apple M4 o superior.
  • • PAIR se ajusta automáticamente a los dispositivos que se unen o abandonan la red para evitar interferir con las tareas activas.
  • • Las conexiones están aseguradas mediante un código de emparejamiento de seis dígitos y cifrado TLS mutuo (mTLS).
  • • Nvidia también anunció una configuración local simplificada para aplicaciones de agentes como Perplexity Portable Computer, Hermes Agent y OpenClaw.

Los desarrolladores pueden aprovechar la computación de múltiples máquinas locales para ejecutar modelos más grandes o acelerar la inferencia local sin pagar por GPUs en la nube.

SOURCES

12. ik_llama.cpp añade soporte de predicción de múltiples tokens para Qwen4exp

El proyecto ik_llama.cpp, previamente destacado por sus ganancias de rendimiento MTP en Qwen3.6, ha ampliado sus capacidades al fusionar el soporte MTP para los modelos Qwen4exp. Esta actualización permite el uso de un cabezal MTP de 2.6B para redactar y verificar tokens, duplicando las velocidades de inferencia en hardware compatible mientras se mantiene la paridad de salida.

  • • El PR #2369 en ik_llama.cpp añade soporte MTP para Qwen4exp.
  • • Utiliza un cabezal MTP de 2.6B para redacción y verificación.
  • • Las tasas de aceptación de borradores alcanzan el 93-99% para código y 60-65% para prosa.
  • • El rendimiento en una RTX 5090 alcanza los 90 tokens por segundo.
  • • Limitado a operaciones de una sola ranura sin soporte multi-GPU.

Los desarrolladores ahora pueden aprovechar las aceleraciones impulsadas por MTP para la arquitectura más nueva Qwen4exp, extendiendo los beneficios de rendimiento observados anteriormente en el proyecto.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.