Inference Brew

OpenAI implementa chats de texto ilimitados y GPT-5.6 Luna para usuarios gratuitos

00:00 / --:--

← Volver al inicio

OpenAI implementa chats de texto ilimitados y GPT-5.6 Luna para usuarios gratuitos

1. OpenAI implementa chats de texto ilimitados y GPT-5.6 Luna para usuarios gratuitos

Tras el anuncio de que estas funciones llegarían la próxima semana, OpenAI ha implementado oficialmente GPT-5.6 Luna como el modelo predeterminado para los usuarios Free y Go. La empresa también ha eliminado todos los límites de uso para chats de solo texto, cumpliendo con la actualización prometida en la cobertura de ayer. Las restricciones multimodales para archivos, imágenes y voz permanecen vigentes, y el nuevo botón 'Think' ya está disponible para un razonamiento superior opcional.

  • • GPT-5.6 Luna es ahora el modelo predeterminado para usuarios Free y Go.
  • • Los límites de uso de chat basado en texto se han eliminado con efecto inmediato.
  • • El despliegue ocurrió antes del cronograma de 'la próxima semana' comunicado anteriormente.
  • • Las restricciones sobre archivos, imágenes y voz permanecen sin cambios.
  • • El nuevo botón 'Think' ya está disponible para un razonamiento superior opcional.

Los usuarios y desarrolladores ahora tienen acceso inmediato e ilimitado a GPT-5.6 Luna para interacciones de texto, ya que el despliegue se completó antes de lo indicado inicialmente.

SOURCES

2. DeepSeek añade variantes de razonamiento al modelo V4-Flash

Basándose en el reciente lanzamiento de la beta pública de la API DeepSeek-V4-Flash, DeepSeek ha introducido el modelo V4-Flash 0731. Esta actualización añade tres variantes de razonamiento distintas a la arquitectura, alcanzando un 89.0% en el benchmark ARC-AGI-1 Semi-Private y un 61.4% en el benchmark ARC-AGI-2 Semi-Private. Estas variantes tienen un precio de $0.02 y $0.04 por tarea, respectivamente, proporcionando una opción especializada y rentable para cargas de trabajo de razonamiento complejo.

  • • DeepSeek lanzó el modelo V4-Flash 0731 con tres variantes de razonamiento.
  • • El modelo alcanzó un 89.0% en el benchmark ARC-AGI-1 Semi-Private a $0.02 por tarea.
  • • El modelo alcanzó un 61.4% en el benchmark ARC-AGI-2 Semi-Private a $0.04 por tarea.

Este lanzamiento proporciona a los desarrolladores capacidades de razonamiento especializadas dentro del ecosistema rentable V4-Flash, permitiendo un razonamiento abstracto de alta precisión a un bajo costo.

SOURCES

3. Lanzamiento del framework de animación de personajes Wan-Animate-2

Los desarrolladores de Wan-Animate-2 han lanzado los scripts de inferencia, los pesos del modelo base y los pesos del modelo de destilación para su framework de animación de personajes de extremo a extremo. Alojado en Hugging Face bajo la organización Wan-AI, el framework utiliza un Diffusion Transformer rediseñado para generar movimiento directamente a partir de videos de conducción, evitando extractores de movimiento intermedios para mejorar la preservación de la identidad y la fidelidad del movimiento. El lanzamiento también incluye Wan-Animate-2-Lite, una variante optimizada diseñada para latencia de transmisión en tiempo real, y admite control de punto de vista impulsado por texto para desacoplar la perspectiva de la cámara de salida del video fuente.

  • • Wan-Animate-2 es un framework de animación de personajes de extremo a extremo que utiliza un Diffusion Transformer rediseñado.
  • • El framework genera movimiento directamente a partir de videos de conducción, eliminando extractores de movimiento intermedios para preservar la identidad.
  • • Cuenta con control de punto de vista impulsado por texto, lo que permite a los usuarios desacoplar la perspectiva de la cámara de salida del video de conducción.
  • • Wan-Animate-2-Lite es una variante eficiente diseñada para latencia de transmisión en tiempo real.
  • • Los scripts de inferencia, los pesos del modelo base y los pesos del modelo de destilación se lanzaron el 7 de agosto de 2026 en Hugging Face.

Esto permite a los desarrolladores crear funciones de animación de personajes en tiempo real y de alta fidelidad utilizando modelos de pesos abiertos que generan movimiento directamente a partir de videos de conducción.

SOURCES

4. Cloudflare lanza Kitesurf, un navegador headless centrado en agentes

Cloudflare ha introducido Kitesurf, un navegador headless construido desde cero para agentes de IA en lugar de usuarios humanos. Desarrollado durante 12 semanas para ejecutarse en la plataforma serverless Workers de Cloudflare, Kitesurf prioriza la gestión de la ventana de contexto, los costos de tokens y la eficiencia de recursos sobre los elementos visuales. Está construido usando Rust y WebAssembly, aprovechando el motor de renderizado de Blitz, el analizador CSS Stylo de Firefox y el motor JS Boa. Aunque actualmente carece de soporte para reproducción de video, WebGL o estado persistente, supera más de 215,000 pruebas de la plataforma web y es totalmente compatible con Puppeteer y Playwright a través del protocolo Chrome DevTools.

  • • Cloudflare lanzó Kitesurf, un navegador alojado en la nube optimizado para agentes de IA, actualmente disponible de forma gratuita en beta a través de Browser Run.
  • • El navegador se ejecuta completamente en Cloudflare Workers, utilizando un motor de renderizado modular de Blitz, el analizador CSS Stylo de Firefox y el motor Rust Boa JS.
  • • Kitesurf ofrece una eficiencia de memoria y CPU de 3 a 7 veces mejor que Chromium para tareas de agentes como extracción de HTML y capturas de pantalla.
  • • Admite el protocolo Chrome DevTools (CDP), lo que lo hace compatible con herramientas existentes como Puppeteer y Playwright.
  • • La arquitectura es sin estado y aislada, comenzando desde cero para cada sesión para manejar entradas no confiables.

Esto permite a los desarrolladores ejecutar tareas de navegador headless para agentes de IA con una eficiencia de CPU y memoria de 3 a 7 veces mejor que Chromium, directamente en infraestructura serverless.

5. NVIDIA lanza el framework de agentes orientados a objetos NOOA

NVIDIA Labs ha lanzado NOOA (NVIDIA Object-Oriented Agents), un framework de Python con licencia Apache 2.0 que simplifica el desarrollo de agentes al mapear los componentes del agente directamente a conceptos de programación orientada a objetos. En NOOA, un agente completo se define como una sola clase de Python donde los métodos representan acciones, los campos representan el estado, los docstrings sirven como prompts y las anotaciones de tipo actúan como contratos aplicados en tiempo de ejecución. El framework admite tanto bucles impulsados por LLM como métodos deterministas, utiliza LiteLLM para la conectividad de modelos y maneja grandes datos mediante 'paso por referencia' con vistas previas limitadas. Debido a que el framework ejecuta código generado por LLM, NVIDIA recomienda encarecidamente ejecutar agentes NOOA dentro de entornos aislados como contenedores o máquinas virtuales.

  • • NVIDIA Labs lanzó NOOA (NVIDIA Object-Oriented Agents), un framework de Python agnóstico al modelo bajo la licencia Apache 2.0.
  • • NOOA consolida plantillas de prompt, esquemas de herramientas, código de devolución de llamada y gráficos de flujo de trabajo en una sola clase de Python.
  • • Los métodos representan acciones, los campos representan el estado, los docstrings sirven como prompts y las anotaciones de tipo actúan como contratos aplicados en tiempo de ejecución.
  • • El framework admite tanto bucles impulsados por LLM (AgenticMethod) como métodos deterministas de Python.
  • • Requiere Python 3.12–3.13 y se integra con APIs alojadas, Ollama y vLLM a través de LiteLLM.
  • • NVIDIA recomienda ejecutar agentes NOOA dentro de aislamiento a nivel de SO (contenedores o máquinas virtuales) debido a la ejecución de código generado por LLM.

Esto permite a los desarrolladores construir agentes de IA utilizando patrones de programación orientada a objetos familiares, aplicando contratos en tiempo de ejecución mediante anotaciones de tipo estándar de Python.

SOURCES

6. Microsoft libera el código de un agente de generación de pruebas unitarias políglota

Microsoft ha liberado el código de 'code-testing-generator', un agente local de generación de pruebas unitarias políglota bajo la licencia MIT. Operando completamente dentro de entornos de codificación locales existentes sin requerir un servicio alojado, el agente utiliza un pipeline de Investigación-Planificación-Implementación (RPI) para analizar las convenciones del repositorio, las ubicaciones de los archivos y los frameworks de prueba antes de escribir código. Cuenta con una puerta de verificación integrada que realiza pruebas de mutación, verifica si faltan aserciones y asegura que el comando de prueba del repositorio descubra con éxito las nuevas pruebas. En benchmarks internos, el agente logró una tasa de finalización de tareas del 92.1%, superando significativamente el 78.9% de GitHub Copilot estándar.

  • • Microsoft liberó el código de 'code-testing-generator', un agente de pruebas unitarias políglota, bajo la licencia MIT.
  • • El agente se ejecuta localmente dentro de entornos de codificación existentes y no requiere un servicio alojado.
  • • Utiliza un pipeline de Investigación-Planificación-Implementación (RPI) para analizar las convenciones del repositorio y los frameworks de prueba.
  • • En el benchmark interno de 152 tareas de Microsoft, el agente completó el 92.1% de las tareas en comparación con el 78.9% de GitHub Copilot estándar.
  • • Incluye una puerta de verificación que realiza pruebas de mutación y verifica si faltan aserciones.

Esto permite a los desarrolladores ejecutar un agente de pruebas unitarias local altamente capaz que supera a Copilot estándar y verifica automáticamente las pruebas generadas.

SOURCES

7. AgentRadio supera a Claude Code en tareas de codificación empresarial

Investigadores de Coral AI Labs y varias universidades han liberado el código de AgentRadio, una capa de paso de mensajes asíncrono diseñada para coordinar equipos de agentes de IA que trabajan en tareas de base de código de largo alcance. Lanzado bajo la licencia Apache 2.0, AgentRadio introduce tres primitivas de comunicación: create_thread, send_message y wait_for_mention, lo que permite a los agentes compartir contexto y actualizar conocimientos sin interrumpir sus bucles de ejecución principales. En benchmarks en el dataset SWE-Atlas QnA, un equipo impulsado por AgentRadio resolvió el 62.1% de las tareas en comparación con el 32.3% de un solo agente de Claude Code usando Opus 4.6. Aunque la capa de coordinación aumentó los costos promedio de API de $2.96 a $19.45 por tarea, superó significativamente a las configuraciones de agentes independientes con cómputo equivalente.

  • • Investigadores liberaron el código de AgentRadio, una capa de paso de mensajes asíncrono para la coordinación de agentes de IA, bajo la licencia Apache 2.0.
  • • AgentRadio permite la conciencia pasiva a través de tres primitivas: create_thread, send_message y wait_for_mention.
  • • En el benchmark SWE-Atlas QnA, un equipo impulsado por AgentRadio resolvió el 62.1% de las tareas, en comparación con el 32.3% de un solo agente de Claude Code.
  • • La arquitectura está disponible en GitHub y es compatible con arneses de agentes existentes como Claude Code o Codex CLI.
  • • La pila aumentó los costos promedio de API por tarea de $2.96 a $19.45, pero superó a las configuraciones independientes con cómputo equivalente.

Esto permite a los desarrolladores utilizar esta capa de coordinación de código abierto para construir equipos multi-agente que se comunican de forma asíncrona, mejorando significativamente las tasas de resolución de tareas en bases de código complejas.

SOURCES

8. Tencent Cloud actualiza TencentDB Agent Memory a la versión 2.0

Basándose en el lanzamiento inicial de TencentDB Agent Memory en mayo de 2026, Tencent Cloud ha lanzado la versión 2.0. Esta actualización cambia el enfoque de la memoria individual del agente a un centro a nivel de equipo, permitiendo que múltiples agentes compartan contexto y habilidades. La nueva versión introduce cuatro tipos de activos: Chat Memory, Skill, LLM-Wiki y Code-Graph, y añade soporte para la integración de Claude Code y OpenClaw.

  • • TencentDB Agent Memory v2.0 expande el framework original a un centro de memoria a nivel de equipo.
  • • Introduce cuatro tipos de activos reutilizables: Chat Memory, Skill, LLM-Wiki y Code-Graph.
  • • Añade soporte para la integración de Claude Code, OpenClaw y Hermes.
  • • Mantiene la naturaleza autohospedada, con licencia MIT y desplegable en Docker del lanzamiento original.
  • • Continúa utilizando un enfoque de recuperación en capas (BM25, recuperación vectorial y RRF).

Esta actualización permite a los equipos mantener una memoria persistente y compartida entre múltiples agentes de IA, yendo más allá del alcance de agente único del lanzamiento original.

SOURCES

9. Databricks libera herramientas de código abierto para reducir los costos de codificación con IA

Databricks ha compartido sus estrategias para gestionar los costos de codificación con IA que crecen exponencialmente, revelando una reducción del 70% en el gasto total y una reducción del 50% en los tokens generados mediante optimizaciones de arnés y caché. Para ayudar a otras organizaciones a gestionar sus costos de infraestructura de IA, Databricks ha liberado el código de sus herramientas Unity AI Gateway y Omnigent. Omnigent actúa como un meta-arnés que mantiene la independencia del modelo, permitiendo a los desarrolladores cambiar fácilmente los modelos subyacentes y apuntar a la 'frontera de eficiencia', priorizando modelos con la mejor relación precio-inteligencia en lugar de solo la inteligencia máxima.

  • • Databricks redujo sus tokens generados y costos en casi un 50% ajustando la configuración del arnés y la caché.
  • • La empresa ha lanzado sus herramientas Unity AI Gateway y Omnigent como código abierto o software gratuito.
  • • Omnigent es un meta-arnés diseñado para mantener la independencia del modelo y reducir los costos de cambio de desarrollador.
  • • Databricks aboga por un enfoque de 'frontera de eficiencia', priorizando modelos con la mejor relación precio-inteligencia.
  • • La empresa recomienda reemplazar los presupuestos de tokens rígidos con herramientas de visibilidad y fricción progresiva.

Esto permite a los desarrolladores utilizar herramientas de código abierto y estrategias de optimización para reducir significativamente el uso de tokens de API y los costos sin sacrificar la calidad del código.

SOURCES

10. Lanzamiento del estándar abierto Agent Plugins 1.0.0

El lanzamiento de Agent Plugins 1.0.0 introduce un nuevo estándar abierto destinado a simplificar la forma en que los desarrolladores empaquetan y distribuyen habilidades de agentes de IA reutilizables y servidores del Protocolo de Contexto de Modelo (MCP). Al establecer una especificación unificada, el estándar permite a los desarrolladores agrupar las capacidades de los agentes en plugins portátiles, agilizando la integración en diversos tiempos de ejecución y frameworks de agentes.

  • • Agent Plugins 1.0.0 es un estándar abierto diseñado para simplificar el empaquetado de habilidades de agentes de IA reutilizables y servidores MCP.
  • • El estándar tiene como objetivo hacer que las capacidades de los agentes sean fácilmente distribuibles como plugins.

Esto permite a los desarrolladores utilizar un estándar unificado para empaquetar, distribuir y reutilizar las capacidades de los agentes y los servidores MCP en diferentes frameworks de agentes.

SOURCES

11. Construcción de pipelines RAG multimodales con NVIDIA NeMo Retriever y LanceDB

NVIDIA ha esbozado un patrón integral para construir pipelines de generación aumentada por recuperación (RAG) multimodales capaces de procesar texto, tablas, gráficos e infografías de documentos PDF. Configurado en Python 3.12, el pipeline utiliza PDFium para la extracción de texto sin conexión sin requerir una GPU, luego aprovecha los endpoints NVIDIA NIM alojados para la detección de diseño, OCR, extracción de tablas, generación de embeddings y reordenamiento. Los datos procesados se almacenan en una base de datos vectorial LanceDB, lo que permite la búsqueda filtrada por metadatos, el reordenamiento de visión-lenguaje y la generación de respuestas fundamentadas con citas en línea utilizando el modelo de lenguaje Nemotron.

  • • El pipeline utiliza endpoints NVIDIA NIM alojados para la detección de diseño, OCR, extracción de tablas/gráficos, generación de embeddings y reordenamiento.
  • • El contenido procesado se almacena en una base de datos vectorial LanceDB.
  • • La extracción de texto PDF sin conexión se realiza utilizando PDFium sin requerir una GPU o clave de API externa.
  • • El sistema implementa búsqueda filtrada por metadatos, reordenamiento de visión-lenguaje y generación de respuestas fundamentadas con citas en línea.
  • • El pipeline está configurado usando Python 3.12 y utiliza el modelo de lenguaje Nemotron para respuestas fundamentadas.

Esto permite a los desarrolladores implementar una recuperación multimodal avanzada (manejando texto, tablas, gráficos e infografías) utilizando un patrón de pipeline estructurado y validado.

SOURCES

12. NVIDIA lanza activos de uso de herramientas conversacionales NeMo Gym

NVIDIA ha lanzado sus activos de uso de herramientas conversacionales NeMo Gym en Hugging Face. Este lanzamiento proporciona a los desarrolladores una colección curada de pares de referencia de política/herramienta y historiales de prompts. Estos activos están diseñados para ayudar a los desarrolladores a entrenar, ajustar y evaluar LLMs dentro de pipelines de uso de herramientas conversacionales, mejorando la confiabilidad de los flujos de trabajo de llamadas a herramientas de agentes.

  • • NVIDIA lanzó activos de uso de herramientas conversacionales NeMo Gym en la plataforma Hugging Face.
  • • El lanzamiento incluye una colección de pares de referencia de política/herramienta y historiales de prompts.
  • • Los activos están diseñados específicamente para pipelines de uso de herramientas conversacionales.

Esto permite a los desarrolladores utilizar datasets de referencia de alta calidad para entrenar, ajustar o evaluar sus propios modelos en tareas de llamadas a herramientas conversacionales.

SOURCES

13. Parakeet.wgsl permite ASR rápido y sin dependencias en el navegador mediante WebGPU

Un nuevo proyecto de código abierto llamado parakeet.wgsl lleva el reconocimiento automático de voz (ASR) de alto rendimiento y sin dependencias directamente al navegador. La implementación empaqueta el modelo de transcripción en inglés Parakeet TDT 0.6B V2 de NVIDIA utilizando shaders de cómputo WebGPU sin procesar y un frontend de audio WebAssembly SIMD. Los benchmarks muestran que el sistema puede transcribir una hora de audio en solo 20 segundos en un procesador Apple M5 ejecutando Google Chrome. Debido a que depende de WebGPU, el modelo puede ejecutarse completamente sin conexión y es compatible con cualquier dispositivo que aloje un navegador capaz de WebGPU, con potencial para la ejecución de escritorio independiente a través de Dawn o wgpu.

  • • El proyecto implementa el modelo de transcripción en inglés Parakeet TDT 0.6B V2 de NVIDIA para inferencia basada en navegador.
  • • No tiene dependencias, utilizando shaders de cómputo WebGPU sin procesar y un frontend de audio WebAssembly SIMD.
  • • En un procesador Apple M5 ejecutando Google Chrome, el modelo puede transcribir una hora de audio en 20 segundos.
  • • El software es compatible con cualquier dispositivo equipado con una GPU y un navegador capaz de WebGPU.
  • • Admite una posible ejecución sin conexión fuera del navegador utilizando frameworks como Dawn o wgpu.

Esto permite a los desarrolladores implementar voz a texto rápida, privada y sin conexión directamente en el navegador sin depender de APIs externas o servidores backend pesados.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.