Inference Brew

Alibaba lanza la API alojada Qwen3.8-Omni-Flash

00:00 / --:--

← Volver al inicio

Alibaba lanza la API alojada Qwen3.8-Omni-Flash

1. Alibaba lanza la API alojada Qwen3.8-Omni-Flash

Tras el lanzamiento en agosto del modelo de pesos abiertos Qwen3.8-Flash-Next, Alibaba ha lanzado ahora Qwen3.8-Omni-Flash como un servicio de API alojado. Esta nueva versión omnimodal admite entradas de texto, imagen, audio y vídeo con una ventana de contexto de 1 millón de tokens, disponible a través de QwenCloud y Alibaba Cloud Model Studio. Para apoyar a los desarrolladores que construyen sobre este modelo, el equipo ha lanzado Qwen-MM-Plugins bajo una licencia Apache-2.0 para facilitar los arneses agénticos.

  • • Qwen3.8-Omni-Flash es una versión de API alojada de la arquitectura Qwen3.8-Flash-Next.
  • • El servicio admite entradas de texto, imagen, audio y vídeo con una ventana de contexto de 1 millón de tokens.
  • • El precio se ha fijado en 0,15 $ por cada 1 millón de tokens de entrada y 0,47 $ por cada 1 millón de tokens de salida.
  • • El lanzamiento incluye Qwen-MM-Plugins (Apache-2.0) para soportar arneses agénticos.
  • • El modelo mejora la precisión de OmniVideoBench a 67,8 mientras reduce el uso de tokens en un 45,7%.

Los desarrolladores ahora pueden acceder a la arquitectura Qwen3.8-Flash-Next como un servicio gestionado para aplicaciones multimodales, incluyendo el procesamiento de vídeo y audio de larga duración, sin necesidad de alojar el modelo ellos mismos.

SOURCES

2. xAI lanza Grok Imagine Image 2.0 con soporte de referencia múltiple

xAI ha lanzado Grok Imagine Image 2.0, un modelo de texto a imagen y edición que ocupa el cuarto lugar en el Artificial Analysis Text to Image Leaderboard, convirtiéndose en el modelo mejor clasificado fuera de OpenAI. El modelo admite la generación de texto a imagen, la edición de imágenes y generaciones con múltiples referencias utilizando hasta cinco imágenes de entrada. Está disponible a través de la API de xAI, el sitio web de Grok Imagine, las aplicaciones de Grok, fal y Replicate. Se observaron mejoras significativas en el rendimiento en cuanto a conocimiento, renderizado de texto y capacidades de iluminación en comparación con la generación anterior.

  • • xAI lanzó Grok Imagine Image 2.0, que ocupa el cuarto lugar en el Artificial Analysis Text to Image Leaderboard.
  • • El modelo admite la generación de texto a imagen, la edición de imágenes y generaciones con múltiples referencias utilizando hasta cinco imágenes de entrada.
  • • Está disponible a través de la API de xAI, el sitio web de Grok Imagine, las aplicaciones de Grok, fal y Replicate.
  • • El modelo se posiciona en la frontera de Pareto de calidad frente a precio en el marcador de Artificial Analysis.
  • • Se observaron mejoras significativas en el rendimiento en cuanto a conocimiento, renderizado de texto y capacidades de iluminación.

Los desarrolladores pueden integrar un modelo de generación y edición de imágenes altamente competitivo y rentable que admite la generación con múltiples referencias utilizando hasta cinco imágenes de entrada.

SOURCES

3. SpaceXAI lanza Grok Voice Transcribe 2.0 con streaming de baja latencia

SpaceXAI ha lanzado Grok Voice Transcribe 2.0, un nuevo modelo de voz a texto que sucede a Grok Voice Transcribe 1.0. El modelo logra una tasa de error de palabra (WER) del 2,7% a 0,49 segundos después del final del habla para transcripciones finales en streaming, y una WER del 3,4% para las primeras transcripciones parciales. En tareas que no son de streaming, el modelo obtiene una puntuación de 2,3% en AA-WER, ocupando el quinto lugar de 59 modelos con un factor de velocidad de aproximadamente 160x. Aunque es más preciso, es más lento que los modelos de la competencia como Muse Voice Transcribe, ElevenLabs Scribe v2 Realtime y Cartesia Ink-2.

  • • SpaceXAI lanzó Grok Voice Transcribe 2.0, sucediendo a la versión 1.0 anterior.
  • • El modelo logra una tasa de error de palabra (WER) del 2,7% a 0,49 segundos después del final del habla para transcripciones finales en streaming.
  • • La transcripción en streaming tiene un precio de 0,20 $ por hora (3,33 $ por cada 1.000 minutos), mientras que la que no es en streaming cuesta 0,10 $ por hora (1,67 $ por cada 1.000 minutos).
  • • En tareas que no son de streaming, el modelo obtiene una puntuación de 2,3% en AA-WER, ocupando el quinto lugar de 59 modelos con un factor de velocidad de aproximadamente 160x.
  • • El precio del streaming es inferior al de Cartesia Ink-2 (4,00 $) y aproximadamente la mitad del coste de ElevenLabs Scribe v2 Realtime (6,50 $).

Los desarrolladores pueden implementar una transcripción de voz en streaming de alta precisión y baja latencia en sus aplicaciones a un precio competitivo de 0,20 $ por hora.

SOURCES

4. Jina AI lanza jina-ocr-v1 para GPUs de bajo presupuesto

Jina AI ha lanzado jina-ocr-v1, un analizador de documentos visuales de extremo a extremo diseñado para GPUs de bajo presupuesto como la NVIDIA L4. El modelo contiene 3,4 mil millones de parámetros totales con aproximadamente 570 millones de parámetros activos por token, construido sobre la base de DeepSeek-OCR y utilizando un decodificador DeepSeek-3B-MoE. Incluye un cabezal de decodificación especulativa FastMTP que permite una generación de salida sin pérdidas y casi determinista. El analizador genera contenido en Markdown, con tablas formateadas en HTML y fórmulas en LaTeX, logrando un rendimiento de 2,57 páginas por segundo en una sola GPU NVIDIA A100 de 40 GB.

  • • Jina AI lanzó jina-ocr-v1, un analizador de documentos visuales de extremo a extremo diseñado para GPUs de bajo presupuesto.
  • • El modelo contiene 3,4 mil millones de parámetros totales con aproximadamente 570 millones de parámetros activos por token.
  • • Está construido sobre la base de DeepSeek-OCR y utiliza un decodificador DeepSeek-3B-MoE con un cabezal de decodificación especulativa FastMTP.
  • • El modelo obtuvo puntuaciones de 91,14 en OmniDocBench v1.6 y 83,4 en olmOCR-Bench.
  • • El modelo se lanza bajo una licencia CC BY-NC 4.0, lo que requiere una licencia comercial de Jina AI.
  • • El analizador genera contenido en Markdown, con tablas formateadas en HTML y fórmulas en LaTeX.

Los desarrolladores pueden autoalojar un analizador de documentos de alta precisión que genera Markdown estructurado, tablas HTML y fórmulas LaTeX con un alto rendimiento.

SOURCES

5. Realtime-Venus abre el código de modelos audiovisuales full-duplex

El repositorio Realtime-Venus ha lanzado dos puntos de control: Realtime-Venus-Omni y Realtime-Venus-Audio. Realtime-Venus-Omni es un modelo de interacción audiovisual de 9B adaptado de MiniCPM-o 4.5 que admite interacción proactiva, manejo de interrupciones semánticas y memoria de vídeo largo sin entrenamiento. Realtime-Venus-Audio es un punto de control centrado en el audio diseñado para la comprensión de audio y la conversación impulsada por audio. El sistema cuenta con una conversación full-duplex nativa, lo que le permite percibir la entrada mientras habla simultáneamente, y utiliza solicitudes de delegado en el flujo para manejar integraciones de herramientas externas sin bloquear las conversaciones en curso.

  • • El repositorio Realtime-Venus alberga Realtime-Venus-Omni (modelo audiovisual de 9B) y Realtime-Venus-Audio (modelo centrado en el audio).
  • • El sistema cuenta con una conversación full-duplex nativa, lo que le permite percibir la entrada mientras habla simultáneamente.
  • • La función de interacción Omni-Proactiva permite al modelo iniciar respuestas a eventos sin esperar a que el usuario lo solicite.
  • • Utiliza solicitudes de delegado en el flujo para manejar integraciones de herramientas externas sin bloquear las conversaciones en curso.
  • • El sistema genera tanto texto como salida de voz nativa utilizando recursos Token2wav incluidos y una voz de referencia.

Los desarrolladores pueden crear agentes de voz y vídeo altamente interactivos capaces de manejar interrupciones semánticas e integración de herramientas en el flujo.

SOURCES

6. Lanzamiento del modelo de decisión no autorregresivo Laya de 421M

El desarrollador Laya ha lanzado un modelo de decisión no autorregresivo de 421M de parámetros diseñado para tareas que incluyen enrutamiento de intenciones, verificación de hechos, consenso de moderación, barandillas de prompts, puntuación de rúbricas y trayectorias de conversación de varios turnos. La arquitectura del modelo combina un codificador bidireccional ModernBERT-large con un cabezal Transformer desde cero para resolver esquemas tipados, logrando un tiempo de paso hacia adelante extremadamente rápido de aproximadamente 35 milisegundos. Fue entrenado en una sola GPU RTX 6000 Pro con 96 GB de VRAM utilizando más de 25.000 ejemplos del mundo real anotados por humanos, optimizado mediante un enfoque de aprendizaje por refuerzo de gradiente de política.

  • • Laya es un modelo de decisión no autorregresivo de 421M de parámetros para enrutamiento de intenciones, verificación de hechos, moderación y barandillas.
  • • La arquitectura combina un codificador bidireccional ModernBERT-large con un cabezal Transformer desde cero para resolver esquemas tipados.
  • • El modelo logra un tiempo de paso hacia adelante extremadamente rápido de aproximadamente 35 milisegundos.
  • • Fue entrenado en una sola GPU RTX 6000 Pro utilizando más de 25.000 ejemplos del mundo real anotados por humanos.
  • • Laya está disponible para pruebas a través de un espacio dedicado de Hugging Face y un repositorio de GitHub.

Los desarrolladores pueden ejecutar un modelo de enrutamiento y moderación altamente especializado y ultrarrápido localmente con un tiempo de paso hacia adelante de solo 35 milisegundos.

SOURCES

7. Lanzamiento del modelo ASR de streaming de código abierto Confucius4-R2T2

Se ha liberado como código abierto un nuevo modelo de reconocimiento automático de voz (ASR) en streaming en tiempo real llamado Confucius4-R2T2. El modelo es un sistema de 1,7 mil millones de parámetros diseñado específicamente para agentes de voz. Está disponible para acceso a través de GitHub y Hugging Face, proporcionando a los desarrolladores una opción autoalojable para tareas de voz a texto en tiempo real.

  • • Confucius4-R2T2 es un modelo de reconocimiento automático de voz (ASR) en streaming en tiempo real de código abierto.
  • • El modelo cuenta con 1,7 mil millones de parámetros y está diseñado específicamente para agentes de voz.
  • • Está disponible para acceso a través de GitHub y Hugging Face.

Los desarrolladores pueden autoalojar un modelo de voz a texto de baja latencia optimizado para agentes de voz directamente desde GitHub o Hugging Face.

SOURCES

8. Claude Code añade soporte nativo para Windows e integración con AGENTS.md

Anthropic ha ampliado las capacidades de Claude Code, basándose en el flujo de trabajo de evaluación de plugins lanzado recientemente. La última actualización añade soporte de instalación nativo para Windows, lectura de PDF y la capacidad de leer archivos AGENTS.md para la configuración del proyecto. También introduce flujos de trabajo dinámicos para la orquestación multiagente y nuevas opciones de configuración de proxy, junto con un soporte de modelos ampliado que incluye Claude Opus 4.8, 4.5 y Sonnet 4.6.

  • • Claude Code ahora admite instalaciones nativas de Windows y lectura de archivos PDF.
  • • La herramienta lee AGENTS.md para instrucciones específicas del proyecto.
  • • Los nuevos flujos de trabajo dinámicos permiten una compleja orquestación de tareas multiagente.
  • • Se añadió soporte para Claude Opus 4.8, 4.5, Sonnet 4.6 y Amazon Bedrock a través de Mantle.
  • • La nueva variable de entorno CLAUDE_GATEWAY_PROXY_IS_EGRESS_BOUNDARY=1 admite proxies de reenvío.

Los desarrolladores obtienen una mejor accesibilidad multiplataforma y control de configuración a nivel de proyecto, madurando aún más el flujo de trabajo agéntico de Claude Code.

SOURCES

9. Se descubre que el agente de codificación ZCode sube silenciosamente el historial de Git a Aliyun OSS

Una investigación de seguridad sobre ZCode, la aplicación de escritorio de codificación de IA de Zhipu, ha revelado que el software empaqueta y sube silenciosamente los espacios de trabajo de los usuarios a Aliyun OSS. Los datos capturados incluyen todo el historial .git, la caché de activos LFS, los reflogs y las configuraciones globales, siendo el directorio .git el que representa aproximadamente el 86,6% de la carga útil. El proceso de captura y carga en segundo plano se activa incondicionalmente al iniciar siempre que el usuario haya iniciado sesión, ignorando por completo los ajustes de la interfaz de usuario como 'Optimizar experiencia' y 'Indexación de instantáneas de repositorio'. Los archivos subidos se cifran mediante cifrado de sobre con una clave pública, lo que significa que los usuarios no pueden acceder ni descifrar sus propios archivos subidos.

  • • ZCode empaqueta, cifra y sube silenciosamente los espacios de trabajo de los usuarios, incluidos el historial .git, las cachés de activos LFS y los reflogs, a Aliyun OSS.
  • • La captura en segundo plano se ejecuta incondicionalmente al iniciar sesión, ignorando los interruptores de la interfaz de usuario como 'Optimizar experiencia' y 'Indexación de instantáneas de repositorio'.
  • • Los archivos subidos utilizan cifrado de sobre con una clave pública, dejando la clave privada exclusivamente bajo el control de Z.ai.
  • • El directorio .git representa aproximadamente el 86,6% de la carga útil, lo que arriesga la exposición de claves API históricas y configuraciones sensibles eliminadas.
  • • Los usuarios pueden bloquear el proceso de carga utilizando indicadores de inmutabilidad a nivel de sistema de archivos (chflags en macOS o chattr en Linux) en el directorio '~/.zcode/v2/checkpoints'.

Los desarrolladores que utilizan ZCode deben tomar medidas inmediatas para bloquear las cargas en segundo plano para evitar la exposición de claves API históricas, configuraciones eliminadas y código propietario.

10. MiniMax abre el código de la versión de terminal de MiniMax Code

MiniMax ha abierto el código de la versión de terminal de MiniMax Code en GitHub bajo la licencia MIT. El lanzamiento es una vista previa del código fuente 0.4.12 y no incluye el código fuente de la aplicación de escritorio. El repositorio cuenta con una TUI interactiva, ejecución sin cabeza, edición de código, comandos de shell, diffs, verificación de pruebas, controles de permisos y sandboxing. Admite subagentes, plugins, habilidades, Model Context Protocol (MCP) y Bring Your Own Key (BYOK) con proveedores compatibles con OpenAI y Anthropic.

  • • MiniMax abrió el código de la versión de terminal de MiniMax Code (vista previa del código fuente v0.4.12) en GitHub bajo la licencia MIT.
  • • La herramienta cuenta con una TUI interactiva, ejecución sin cabeza, edición de código, comandos de shell, diffs y sandboxing.
  • • Admite subagentes, plugins, habilidades, Model Context Protocol (MCP) y Bring Your Own Key (BYOK) para proveedores compatibles con OpenAI y Anthropic.
  • • El lanzamiento no incluye el código fuente de la aplicación de escritorio.
  • • El repositorio señala que los números de versión coincidentes no garantizan una procedencia de compilación idéntica entre el paquete publicado y la comprobación del código fuente.

Los desarrolladores pueden adoptar un agente de codificación de terminal altamente personalizable y con licencia MIT que admite subagentes, plugins y backends de LLM personalizados.

SOURCES

11. Notion añade la API de Habilidades a la plataforma de desarrolladores para la gestión de instrucciones de agentes

Tras el lanzamiento en mayo de 2026 de su plataforma de desarrolladores para agentes de IA, Notion ha introducido una API de Habilidades. Esta nueva herramienta permite a los equipos editar y distribuir de forma colaborativa las instrucciones de los agentes, integrándose con la sincronización de GitHub o el instalador de habilidades de Vercel para agilizar el despliegue en los entornos de los agentes.

  • • Amplía la plataforma de desarrolladores de Notion con una nueva API de Habilidades.
  • • Permite la edición y distribución colaborativa de las instrucciones de los agentes.
  • • Admite el despliegue a través de la sincronización de GitHub y el instalador de habilidades de Vercel.

Esta actualización proporciona la infraestructura específica necesaria para gestionar y compartir las instrucciones de los agentes a escala, haciendo evolucionar la plataforma de un centro de integración de espacios de trabajo a un entorno de desarrollo de agentes colaborativo.

SOURCES

12. NVIDIA abre el código del arnés de agentes SoL-Pi en Hugging Face

NVIDIA ha ampliado su proyecto SoL-Pi lanzando el arnés completo de agentes como una herramienta de código abierto en Hugging Face. Esto sigue al lanzamiento anterior de la extensión SoL-Pi, que fue diseñada específicamente para optimizar el agente de codificación Pi. El nuevo arnés aprovecha los bucles de auto-investigación recursivos para reducir el tráfico de tokens hasta en un 49%, proporcionando un marco más amplio para que los desarrolladores reduzcan los costes de API en varios flujos de trabajo agénticos.

  • • NVIDIA ha abierto el código del arnés de agentes SoL-Pi en Hugging Face.
  • • Este lanzamiento amplía la extensión SoL-Pi anunciada anteriormente para el agente de codificación Pi.
  • • El arnés utiliza bucles de auto-investigación recursivos para reducir el tráfico de tokens entre un 44,7% y un 49,0%.
  • • Los desarrolladores pueden reducir los costes de API en aproximadamente un tercio mientras mantienen el rendimiento del agente.

Los desarrolladores ahora pueden acceder al arnés completo de SoL-Pi para optimizar el uso de tokens y reducir los costes de API en una gama más amplia de aplicaciones agénticas más allá de la extensión inicial del agente de codificación Pi.

SOURCES

13. Guía clasifica los mejores arneses de agentes de código abierto para LLMs locales

Una guía publicada el 18 de septiembre de 2026 clasifica 11 arneses de agentes de código abierto para LLMs locales basados en licencias, documentación, mantenimiento y seguridad. La guía destaca OpenCode, Goose, Cline, OpenHands y Aider, entre otros. Describe las mejores prácticas generales, como establecer ventanas de contexto de al menos 64.000 tokens y garantizar que los modelos admitan la llamada a herramientas. También detalla los requisitos de hardware específicos, señalando que OpenHands recomienda usar Qwen3.6-35B-A3B y requiere al menos 24 GB de VRAM o 64 GB de memoria unificada en Apple Silicon.

  • • La guía clasifica 11 arneses de agentes de código abierto, incluidos OpenCode, Goose, Cline, OpenHands y Aider.
  • • Las mejores prácticas generales recomiendan establecer ventanas de contexto de al menos 64.000 tokens y garantizar que los modelos admitan la llamada a herramientas.
  • • OpenHands recomienda usar Qwen3.6-35B-A3B y requiere al menos 24 GB de VRAM o 64 GB de memoria unificada en Apple Silicon.
  • • Goose admite tiempos de ejecución que incluyen Ollama, LM Studio y Docker Model Runner bajo la Agentic AI Foundation de la Linux Foundation.
  • • Aider gestiona la llamada a herramientas débil mediante el uso de mapas de repositorio y formatos de edición específicos basados en texto.

Los desarrolladores pueden evaluar y seleccionar rápidamente el marco de trabajo de agentes local adecuado en función de las restricciones de hardware concretas y los términos de licencia.

SOURCES

14. Estudio empírico identifica diseños de arnés óptimos para agentes de codificación

Un nuevo estudio empírico evaluó agentes de codificación en 176 configuraciones diferentes utilizando SWE-Bench Verified y Terminal-Bench 2.1 para analizar la planificación, el espacio de acción y la gestión del contexto. El estudio encontró que la gestión del contexto es el factor más crítico para el rendimiento bajo presupuestos computacionales ajustados, siendo la elisión basada en reglas organizada antes de la sumarización basada en LLM la estrategia más eficiente. Además, la planificación actúa como un andamio de precisión para modelos más débiles y un mecanismo de ahorro de costes para modelos más fuertes, mientras que las herramientas predefinidas mejoran el rendimiento para modelos con una competencia en bash más débil.

  • • Los investigadores evaluaron 176 configuraciones en cuatro modelos utilizando SWE-Bench Verified y Terminal-Bench 2.1.
  • • La gestión del contexto se identificó como el factor más crítico para el rendimiento bajo presupuestos computacionales ajustados.
  • • Organizar la elisión basada en reglas antes de la sumarización basada en LLM resultó ser la estrategia de gestión del contexto más eficiente.
  • • La planificación actúa como un andamio de precisión para modelos más débiles y un mecanismo de ahorro de costes para modelos más fuertes.
  • • Las herramientas predefinidas mejoran el rendimiento para modelos con una competencia en bash más débil, mientras que los modelos capaces de bash pueden operar eficazmente utilizando solo una interfaz bash.

Los desarrolladores que construyen agentes de codificación personalizados pueden optimizar el rendimiento y reducir los costes de API mediante una gestión estructurada del contexto y una planificación adaptativa.

15. Ejecute Qwen3.8-Flash-Next de 95,5 GiB en un Mac de 64 GB mediante streaming de expertos

Los desarrolladores ahora pueden ejecutar el modelo Qwen3.8-Flash-Next de 95,5 GiB en un Mac con 64 GB de RAM manteniendo a los expertos enrutados en un SSD. Esta configuración requiere una bifurcación personalizada de llama.cpp para admitir el streaming de expertos y el punto de control nitinpanj/qwen38-flash-next-v3. En un M5 Pro con 64 GB de RAM, el modelo alcanza velocidades de procesamiento de prompts de aproximadamente 367 tokens por segundo a 4k de contexto, y las velocidades de generación alcanzan los 27,6 tokens por segundo con un cabezal de borrador habilitado. El rendimiento se mejora aún más mediante la atención dispersa basada en recolección y la fusión MoE de Metal.

  • • El modelo Qwen3.8-Flash-Next de 95,5 GiB puede ejecutarse en un Mac de 64 GB manteniendo a los expertos enrutados en un SSD.
  • • La configuración requiere una bifurcación personalizada de llama.cpp para admitir el streaming de expertos y el punto de control nitinpanj/qwen38-flash-next-v3.
  • • En un M5 Pro con 64 GB de RAM, las velocidades de generación alcanzan los 27,6 tokens por segundo con un cabezal de borrador habilitado.
  • • La atención dispersa basada en recolección mejoró el rendimiento en un 19% a 62k de contexto y un 50% a 130k de contexto.
  • • El límite práctico para la caché de expertos en una máquina Apple Silicon de 64 GB es de 36 GiB.

Los desarrolladores pueden ejecutar modelos de mezcla de expertos masivos y de alta calidad localmente en hardware estándar de Apple Silicon sin necesidad de costosas configuraciones multi-GPU.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.