Inference Brew

Alibaba lanza el modelo de pesos abiertos Qwen3.8-27B

00:00 / --:--

← Volver al inicio

Alibaba lanza el modelo de pesos abiertos Qwen3.8-27B

1. Alibaba lanza el modelo de pesos abiertos Qwen3.8-27B

Alibaba ha cumplido su compromiso de lanzar la versión de pesos abiertos del modelo Qwen3.8-27B. Este lanzamiento sigue al anterior del modelo Qwen3.8-Max y proporciona a los desarrolladores un modelo multimodal altamente capaz, optimizado para hardware de consumo.

  • • Alibaba lanzó el modelo Qwen3.8-27B de 27 mil millones de parámetros en Hugging Face bajo una licencia Apache 2.0.
  • • El modelo cuenta con comprensión nativa de imágenes y video, una ventana de contexto de 262,144 tokens y fuertes capacidades agénticas.
  • • Obtuvo una puntuación de 61.7 en SWE-bench Pro y 90.3 en LiveCodeBench v6.
  • • Ejecutar el modelo con cuantización de 4 bits requiere aproximadamente 17 GB de memoria GPU, lo que lo hace compatible con hardware de consumo de gama alta.
  • • La inferencia optimizada en una RTX 3090 alcanza hasta 124 tokens por segundo en modo codicioso (greedy).

Los desarrolladores ahora pueden acceder a la variante de 27B de la serie Qwen3.8 para despliegue local, complementando el modelo de clase frontera Max lanzado anteriormente.

2. Z.ai detalla precios, benchmarks y el nuevo servicio OpenVuln de GLM 5.3

Basándose en el anuncio del 14 de agosto sobre el modelo de razonamiento GLM 5.3, Z.ai ha proporcionado más detalles sobre su disponibilidad comercial. El modelo tiene un precio de 1.40 dólares por millón de tokens de entrada y 4.40 dólares por millón de tokens de salida, y ha logrado una puntuación de 60 en el Artificial Analysis Intelligence Index. Además, la compañía ha lanzado OpenVuln, un servicio que utiliza GLM 5.3 para escanear repositorios de código en busca de vulnerabilidades de seguridad.

  • • GLM 5.3 tiene un precio de 1.40 dólares por millón de tokens de entrada y 4.40 dólares por millón de tokens de salida.
  • • El modelo obtuvo una puntuación de 60 en el Artificial Analysis Intelligence Index, empatando con el modelo Kimi K3.
  • • Z.ai lanzó OpenVuln, un servicio de escaneo de vulnerabilidades de código impulsado por GLM 5.3.
  • • Los pesos abiertos para GLM 5.3 siguen programados para su lanzamiento bajo la licencia MIT dentro de la próxima semana.

Los desarrolladores ahora cuentan con datos claros de precios y rendimiento para evaluar GLM 5.3 para uso en producción, junto con una nueva herramienta especializada para flujos de trabajo de seguridad.

3. OpenMOSS lanza MOSS-VL 11B para comprensión de video en tiempo real

MOSS-VL de OpenMOSS es un modelo de visión-lenguaje abierto de 11B de parámetros diseñado para la comprensión de video en tiempo real. El modelo puede percibir fotogramas de video en vivo mientras genera respuestas habladas, contando con capacidades integradas para el silencio proactivo y la autocorrección dinámica.

  • • OpenMOSS lanzó MOSS-VL, un modelo de visión-lenguaje abierto de 11B de parámetros.
  • • El modelo está diseñado para la comprensión de video en tiempo real, percibiendo fotogramas en vivo mientras genera respuestas.
  • • Incluye funciones integradas para el silencio proactivo y la autocorrección dinámica.

Los desarrolladores pueden crear aplicaciones de video interactivas en tiempo real con un modelo que admite silencio proactivo y autocorrección dinámica.

SOURCES

4. El modelo de voz de código abierto Confucius4-TTS recibe una actualización importante

El modelo de código abierto Confucius4-TTS ha recibido una actualización importante centrada en mejorar la calidad de la voz y la usabilidad en el mundo real. Detallado en un artículo de arXiv recién publicado, el modelo proporciona a los desarrolladores una opción de código abierto altamente capaz para la generación de voz multilingüe y translingüe.

  • • Confucius4-TTS, un modelo de generación de voz multilingüe y translingüe de código abierto, recibió una actualización importante.
  • • La actualización se centra en mejorar la calidad de la voz y la usabilidad en el mundo real para los desarrolladores.
  • • El artículo de investigación que detalla la arquitectura y las capacidades del modelo ha sido publicado en arXiv.

Los desarrolladores que crean aplicaciones habilitadas para voz pueden aprovechar un modelo de texto a voz multilingüe de código abierto actualizado con una mejor usabilidad en el mundo real.

SOURCES

5. Lanzan variante sin censura de Qwen3.8-27B para Apple Silicon

Basándose en la reciente disponibilidad de Qwen3.8-27B en Apple Silicon, OrcaRouter ha lanzado Qwen3.8-27B-Uncensored-MLX. Esta nueva variante proporciona una versión sin censura de la arquitectura 27B, cuantizada para inferencia local en hardware Mac.

  • • OrcaRouter lanzó Qwen3.8-27B-Uncensored-MLX, un modelo denso de atención híbrida.
  • • El modelo está cuantizado para Apple Silicon y disponible en versiones de 2 a 8 bits.
  • • Esto sigue a la reciente introducción de soporte de decodificación especulativa para el modelo base Qwen3.8-27B en hardware Mac.

Este lanzamiento amplía el ecosistema de modelos locales para usuarios de Mac al proporcionar una alternativa sin censura al modelo estándar Qwen3.8-27B optimizado previamente para Apple Silicon.

SOURCES

6. GLM-5.2 añadido al ajuste fino sin servidor de Crusoe

Crusoe ha ampliado su servicio de ajuste fino sin servidor (Serverless Fine-Tuning) para incluir soporte para GLM-5.2. Esta integración permite a los desarrolladores aprovechar la infraestructura sin servidor optimizada en costos de Crusoe para ajustar y desplegar el modelo de codificación y agente con 1M de contexto, basándose en la disponibilidad general de la plataforma de ajuste fino de Crusoe y la disponibilidad existente de pesos abiertos de GLM-5.2.

  • • GLM-5.2 ahora es compatible con el ajuste fino sin servidor y el despliegue de autoservicio en Crusoe.
  • • La integración permite una personalización rentable del modelo de 1M de contexto al eliminar los cargos por GPU inactiva.
  • • Este desarrollo une la disponibilidad previamente independiente del servicio de ajuste fino de Crusoe y el modelo de pesos abiertos GLM-5.2.

Esta actualización permite a los desarrolladores combinar las capacidades de razonamiento de largo alcance de GLM-5.2 con la eficiencia de costos del ajuste fino sin servidor de Crusoe, eliminando la necesidad de pagar por tiempo de GPU inactivo durante la personalización del modelo.

SOURCES

7. Lanzan SAM (Sovereign Agent Mesh) para redes de agentes P2P

SAM (Sovereign Agent Mesh) proporciona una red P2P descentralizada y de confianza cero para que los agentes de IA autónomos compartan herramientas a través del Protocolo de Contexto de Modelo. El proyecto utiliza tokens OIDC y Biscuit Datalog para la autorización fuera de línea, asegurando el intercambio seguro de herramientas sin exponer claves API.

  • • SAM (Sovereign Agent Mesh) es un proyecto de red P2P con licencia Apache-2.0 para agentes de IA autónomos.
  • • Proporciona una superposición P2P de configuración cero y confianza cero para el intercambio de herramientas entre agentes a través del Protocolo de Contexto de Modelo (MCP).
  • • La arquitectura utiliza OIDC para la identidad, traduciendo las reclamaciones en tokens Biscuit Datalog para permitir la autorización fuera de línea.
  • • Una puerta de enlace de salida segura (Secure Outbound Gateway) intercepta el tráfico para inyectar credenciales, manteniendo las claves API reales fuera del entorno aislado del agente.
  • • La malla pública se encuentra en una fase de red de prueba beta, y se recomienda alojar el plano de control de forma propia para producción.

Los desarrolladores pueden construir redes multi-agente descentralizadas y seguras donde los agentes pueden compartir herramientas de forma segura y autorizar solicitudes fuera de línea utilizando tokens criptográficos.

SOURCES

8. Block lanza el espacio de trabajo para agentes locales Berd

Berd de Block es una aplicación de escritorio local de código abierto que proporciona un espacio de trabajo agnóstico al modelo para gestionar agentes de IA. La aplicación utiliza el Protocolo de Cliente de Agente (Agent Client Protocol) para comunicarse con el marco Goose, almacenando el historial de conversaciones localmente y las credenciales en el llavero del sistema operativo.

  • • Block lanzó Berd, una aplicación de escritorio gráfica instalada localmente para trabajar con agentes de IA.
  • • La aplicación está disponible en GitHub bajo una licencia Apache 2.0 para macOS, Windows y Linux.
  • • Berd utiliza el Protocolo de Cliente de Agente (ACP) para comunicarse con el marco de agentes Goose.
  • • Es agnóstico al modelo, lo que permite a los usuarios configurar sus propios proveedores de IA y arneses de agentes preferidos.
  • • El modelo de datos es centrado en lo local, almacenando el historial de conversaciones en el dispositivo y las credenciales en el llavero del sistema operativo.

Los desarrolladores obtienen una interfaz gráfica personalizable y centrada en lo local para configurar, ejecutar y probar agentes en diferentes modelos y marcos.

SOURCES

9. NVIDIA lanza TensorRT Model Connect en vista previa pública

TensorRT Model Connect (TRTMC) de NVIDIA simplifica el despliegue de puntos de control de Hugging Face a la inferencia TensorRT nativa en C++. La herramienta evita las exportaciones intermedias de ONNX y las dependencias de tiempo de ejecución de PyTorch, generando artefactos altamente optimizados en solo dos comandos.

  • • NVIDIA lanzó TensorRT Model Connect (TRTMC) en vista previa pública bajo una licencia Apache-2.0.
  • • La herramienta convierte puntos de control de Hugging Face o locales a inferencia TensorRT de extremo a extremo en dos comandos.
  • • Elimina el paso intermedio de exportación ONNX y genera un artefacto versionado que se ejecuta a través de APIs de tareas nativas en C++.
  • • Las versiones actuales están restringidas a Linux aarch64, mientras que las plataformas x86_64 deben usar una ruta de compilación desde la fuente en Docker.
  • • La instantánea del 29 de julio demostró mejoras de rendimiento de más del 5% en 102 perfiles.

Los desarrolladores pueden evitar las exportaciones intermedias de ONNX y desplegar modelos TensorRT altamente optimizados directamente a tiempos de ejecución nativos en C++ sin la sobrecarga de PyTorch.

SOURCES

10. Artificial Analysis lanza un índice de búsqueda para agentes de IA

El Search Index de Artificial Analysis proporciona un benchmark estandarizado para evaluar el rendimiento de la API de búsqueda dentro de los flujos de trabajo de agentes de IA. Al probar proveedores como Exa y Firecrawl utilizando el arnés de agentes Stirrup, el índice ayuda a los desarrolladores a equilibrar la calidad de recuperación, la latencia y los costos de tokens del modelo.

  • • Artificial Analysis lanzó el Search Index para evaluar proveedores de API de búsqueda para el uso de agentes de IA.
  • • La cobertura inicial incluye Parallel, Exa, Firecrawl, You.com, Tavily, Keenable y Brave.
  • • Parallel, Exa y Firecrawl lograron las puntuaciones más altas del Search Index en el lanzamiento (75, 74 y 73 respectivamente).
  • • La integración de APIs de búsqueda mejoró el rendimiento del benchmark del agente a 65-75, en comparación con 33 para la línea base solo de modelo.
  • • Los resultados de búsqueda de mayor calidad redujeron los costos totales de la tarea al disminuir el uso de tokens del modelo en más del 40%, aunque la integración de búsqueda aumentó la latencia por tarea.

Los desarrolladores pueden seleccionar la API de búsqueda óptima para sus flujos de trabajo agénticos para maximizar la calidad de recuperación y reducir los costos de tokens del modelo hasta en un 40%.

SOURCES

11. machine0 lanza CLI para máquinas virtuales de cómputo de agentes persistentes

machine0 ofrece una herramienta CLI para gestionar máquinas virtuales en la nube persistentes diseñadas específicamente para el cómputo de agentes de IA de largo alcance. El servicio proporciona máquinas virtuales KVM completas con soporte directo para GPU, lo que permite a los agentes activar, tomar instantáneas y eliminar sus propios recursos de cómputo de forma programática.

  • • machine0 lanzó una herramienta CLI para gestionar máquinas virtuales en la nube persistentes diseñadas para el cómputo de agentes de IA de largo alcance.
  • • El servicio ofrece máquinas virtuales KVM completas con un tiempo de actividad del 99.99%, facturadas por minuto a partir de 0.013 dólares/hora.
  • • Las configuraciones de hardware van desde 1 vCPU hasta 8xH200 GPUs, con almacenamiento en bloque persistente de hasta 16 TB.
  • • Los agentes pueden autoservirse utilizando la CLI o MCP para activar, tomar instantáneas y eliminar sus propios recursos de cómputo.

Los desarrolladores pueden permitir que sus agentes de IA activen, tomen instantáneas y eliminen sus propias máquinas virtuales KVM completas con soporte directo para GPU de forma programática.

SOURCES

12. Nous Research añade 'Bot Mode' multi-agente a Hermes Agent

Nous Research ha ampliado Hermes Agent (v0.20.3) con un nuevo 'Bot Mode', que permite a los desarrolladores pasar de gestionar perfiles de agentes individuales (introducidos previamente a través del Profile Builder) a orquestar una lista de bots locales con nombre. Esta actualización permite que estos bots interactúen en chats grupales de dos a seis participantes utilizando una bandeja de entrada de agente persistente (Agent Inbox), aprovechando la memoria y las primitivas de habilidades existentes del agente sin requerir una nueva capa de almacenamiento.

  • • Nous Research lanzó Bot Mode para su Hermes Agent de código abierto en la v0.20.3.
  • • Bot Mode permite la colaboración multi-agente al permitir a los usuarios agrupar perfiles de agentes con nombre en una lista.
  • • Los bots se comunican localmente a través de una bandeja de entrada de agente persistente, admitiendo chats grupales de dos a seis agentes.
  • • La función aprovecha las primitivas de perfil de Hermes existentes, manteniendo la memoria, las habilidades y las configuraciones de modelo individuales para cada bot.
  • • La herramienta está diseñada para constructores individuales y equipos pequeños, centrándose en la ejecución local en lugar de funciones de nivel empresarial.

Esta actualización evoluciona a Hermes Agent de una herramienta de agente único a un sistema multi-agente colaborativo, permitiendo a los desarrolladores desplegar equipos de agentes locales basados en perfiles sin requerir nueva infraestructura de almacenamiento.

SOURCES

13. Warp añade memoria persistente al ecosistema de agentes

Basándose en Warp Agent CLI lanzado a principios de este mes, Warp ha introducido una función de memoria persistente para sus agentes de IA. Esta actualización permite a los agentes mantener el estado y el contexto en diferentes arneses, máquinas y miembros del equipo, abordando la necesidad de flujos de trabajo de agentes colaborativos y a largo plazo. La vista previa de investigación incluye seguimiento de procedencia integrado y controles de acceso configurables.

  • • Warp introdujo una función de memoria persistente para agentes de IA en una vista previa de investigación.
  • • La función se basa en el ecosistema Warp Agent CLI para permitir flujos de trabajo colaborativos y con estado.
  • • La memoria se comparte entre arneses de agentes, máquinas y compañeros de equipo.
  • • Incluye seguimiento de procedencia integrado y controles de acceso configurables.

Este desarrollo amplía las capacidades de Warp Agent CLI al permitir que los agentes retengan el contexto en todas las sesiones y miembros del equipo, facilitando una automatización más compleja y colaborativa.

SOURCES

14. Warp introduce Warp Factories para el desarrollo de software con IA

Warp Factories proporciona a los desarrolladores un sistema de infraestructura preconstruido diseñado para simplificar la creación de fábricas de software de IA. El sistema tiene como objetivo agilizar el despliegue y el escalado de tuberías de desarrollo de IA automatizadas, reduciendo la sobrecarga de ingeniería necesaria para construir entornos de agentes personalizados.

  • • Warp introdujo Warp Factories, un nuevo sistema de infraestructura para el desarrollo de IA.
  • • El sistema está diseñado para simplificar el proceso de construcción de fábricas de software de IA.
  • • Proporciona infraestructura lista para usar para agilizar la creación de software impulsada por IA.

Los desarrolladores pueden aprovechar la infraestructura preconstruida para automatizar y escalar sus tuberías de desarrollo de software impulsadas por IA.

SOURCES

15. Atlas Cloud lanza Creator Central para pruebas multi-modelo

La plataforma Creator Central de Atlas Cloud simplifica la evaluación de modelos al permitir a los desarrolladores probar prompts en múltiples modelos simultáneamente. La herramienta Model Explorer de la plataforma ejecuta un solo prompt en hasta 10 modelos, agilizando el proceso de comparación de resultados y configuraciones.

  • • Atlas Cloud lanzó Creator Central para ayudar a los desarrolladores a probar y comparar modelos de IA.
  • • La herramienta Model Explorer permite a los usuarios ejecutar un solo prompt en hasta 10 modelos diferentes simultáneamente.
  • • La plataforma incluye un flujo de trabajo con plantillas Generator para acceder y editar prompts y configuraciones específicas.
  • • Atlas Cloud también anunció una reducción de precio para el modelo Seedance 2.5 y el próximo lanzamiento de Wan3.0.

Los desarrolladores pueden agilizar su proceso de evaluación de modelos comparando resultados lado a lado en tiempo real en lugar de gestionar múltiples pestañas y hojas de cálculo.

SOURCES

16. La biblioteca de código abierto HumanEvals integra el juicio humano en evaluaciones multimodales

La biblioteca de código abierto HumanEvals simplifica la integración de la retroalimentación humana en las tuberías de evaluación de modelos multimodales. La biblioteca admite resultados de imagen, video y audio, lo que permite a los desarrolladores recopilar rápidamente preferencias, calificaciones y clasificaciones por pares de participantes humanos.

  • • HumanEvals es una biblioteca de código abierto diseñada para integrar el juicio humano en las evaluaciones de modelos multimodales.
  • • La biblioteca admite la evaluación de resultados de imagen, video y audio de los modelos.
  • • Permite a los desarrolladores obtener preferencias, calificaciones y clasificaciones por pares de participantes humanos en segundos.

Los desarrolladores pueden agregar fácilmente retroalimentación humana real a sus tuberías de evaluación de modelos de imagen, video y audio para mejorar la alineación.

SOURCES

17. El método Role Anchor combate la 'deriva de roles' en tuberías LLM compuestas

El método Role Anchor aborda la 'deriva de roles' en las tuberías LLM compuestas, donde los módulos especializados abandonan silenciosamente sus tareas asignadas. Al restringir los módulos a sus roles designados, el método asegura que las ganancias de precisión a nivel de sistema sean genuinas en lugar del resultado de que los módulos se alimenten respuestas entre sí.

  • • Las tuberías LLM compuestas sufren de 'deriva de roles', donde los módulos especializados abandonan sus roles asignados mientras las métricas a nivel de sistema aún muestran ganancias.
  • • En una tubería evaluada, el 86% de las ganancias aparentes de aprendizaje por refuerzo fueron causadas en realidad por la deriva de roles.
  • • Role Anchor es un nuevo método diseñado para restringir los módulos a sus roles asignados dentro de una tubería.
  • • La deriva de roles suele ser invisible cuando los desarrolladores monitorean solo las métricas de rendimiento a nivel de sistema.

Los desarrolladores pueden evitar que los módulos de tubería especializados fallen o hagan trampa silenciosamente, asegurando que las ganancias de precisión a nivel de sistema sean genuinas.

SOURCES

18. llama.cpp fusiona soporte para CUDA y Vulkan para modelos ternarios

Las actualizaciones recientes de llama.cpp introducen soporte para CUDA y Vulkan para Ternary-Bonsai-27B, junto con optimizaciones de CUDA que aumentan las velocidades de generación de tokens. Las actualizaciones permiten que los modelos altamente cuantizados de 1 bit y ternarios se ejecuten de manera eficiente en hardware de consumo.

  • • El soporte para CUDA y Vulkan para Ternary-Bonsai-27B se fusionó en la línea principal de llama.cpp.
  • • Una PR de optimización de CUDA fusionada proporciona un aumento del 15-40% en la generación de tokens y un aumento del 8% en el procesamiento de prompts.
  • • El modelo Maple-Preview 20B-A1B alcanza más de 200 tokens por segundo en un Mac Mini M4.
  • • Se han abierto varias solicitudes de extracción (pull requests) de llama.cpp para la cuantización ternaria basada en CPU y mejoras de velocidad de CPU compatibles con VNNI.

Los desarrolladores pueden ejecutar modelos altamente cuantizados de 1 bit y ternarios localmente en hardware de consumo con mejoras de velocidad masivas.

SOURCES

19. llama.cpp añade soporte oficial para modelos Ling-3.0

Basándose en el lanzamiento de los pesos del modelo Ling-3.0-flash el 4 de agosto, el proyecto llama.cpp ha integrado oficialmente el soporte para la arquitectura BailingMoE3. Esta actualización permite a los desarrolladores ejecutar los modelos Ling-3.0-tiny y Ling-3.0-flash localmente utilizando cuantizaciones GGUF optimizadas.

  • • El soporte para Ling-3.0 (BailingMoE3) se fusionó en la rama maestra de llama.cpp a través de la solicitud de extracción #26608 comenzando con la compilación b10472.
  • • Bartowski lanzó cuantizaciones GGUF imatrix para los modelos Ling-3.0-tiny (8B) y Ling-3.0-flash (127B).
  • • Un benchmark de usuario de Ling-3.0-tiny-Q8_0 en una GPU Intel Arc B580 alcanzó 120.76 tokens por segundo para el procesamiento de prompts.
  • • El modelo puede ejecutarse con una ventana de contexto de 128K en 12GB de VRAM utilizando indicadores de configuración específicos.

Los desarrolladores ahora pueden desplegar la familia de modelos Ling-3.0 localmente con cuantizaciones GGUF optimizadas, ampliando la utilidad de los pesos lanzados a principios de este mes.

SOURCES

20. Anthropic extiende los límites de uso de Claude Code con una nueva promoción de agosto

Tras los ajustes anteriores a la capacidad de Claude Code, Anthropic ha introducido una nueva promoción que aumenta automáticamente los límites de uso semanal en un 50% para los planes Pro, Max, Team y Enterprise heredados. Este aumento, que se aplica en todas las plataformas, está activo hasta el 31 de agosto de 2026, ampliando aún más la capacidad proporcionada en actualizaciones anteriores.

  • • Nuevo aumento del 50% en los límites de uso semanal para Claude Code activo hasta el 31 de agosto de 2026.
  • • Se aplica a los planes Pro, Max, Team y Enterprise heredados.
  • • Cubre plataformas CLI, extensiones de IDE, escritorio y web.
  • • Excluye planes gratuitos y asientos Enterprise basados en consumo.

Esta promoción proporciona a los desarrolladores un impulso adicional en la capacidad de codificación durante el resto de agosto, basándose en las actualizaciones de infraestructura y límites implementadas anteriormente para Claude Code.

SOURCES

21. OpenRouter traslada el recorte de precio de GPT-5.6 Sol de OpenAI

Tras la reducción del 50% de OpenAI en los precios estándar de API para el modelo GPT-5.6 Sol el 17 de agosto, OpenRouter ha actualizado su plataforma para ofrecer el mismo descuento del 50% en sus niveles de lote, flexible y prioritario. Esto asegura que los desarrolladores que utilizan la infraestructura de enrutamiento de OpenRouter puedan beneficiarse inmediatamente de los costos más bajos para el modelo insignia.

  • • OpenRouter ha igualado el recorte de precio del 50% de OpenAI para GPT-5.6 Sol.
  • • El descuento se aplica a los niveles de lote, flexible y prioritario de OpenRouter.
  • • Esto sigue a la reducción oficial de precios de OpenAI anunciada el 17 de agosto.

Esta actualización confirma que los recientes recortes de precios en toda la industria para GPT-5.6 Sol se están reflejando en los agregadores de terceros, reduciendo aún más el costo de los flujos de trabajo agénticos a escala de producción.

SOURCES

22. Snowflake Cortex AI Gateway añade enrutamiento dinámico de modelos

Snowflake ha ampliado las capacidades de su Cortex AI Gateway, lanzado originalmente en julio para proporcionar gobernanza y seguridad centralizadas para agentes de IA, añadiendo enrutamiento dinámico de modelos. Esta actualización permite que la puerta de enlace dirija automáticamente las tareas al modelo más rentable utilizando un patrón de asesor y datos históricos de tareas, reduciendo potencialmente los costos de tokens hasta en 3 veces mientras mantiene los límites de seguridad.

  • • Snowflake ha añadido enrutamiento dinámico de modelos a Cortex AI Gateway, que se lanzó anteriormente para la gobernanza de agentes.
  • • La nueva función de enrutamiento utiliza un patrón de asesor y clasificación histórica de tareas para optimizar la selección del modelo.
  • • La actualización puede reducir los costos de tokens hasta en 3 veces al descargar tareas simples a modelos más pequeños.
  • • El servicio permanece dentro del límite de seguridad regional del cliente y se incluye sin cargo adicional.
  • • La puerta de enlace admite modelos abiertos como DeepSeek-V4-Flash y GLM-5.3.

Esta actualización se basa en el marco de gobernanza existente de la puerta de enlace al añadir optimización de costos automatizada, permitiendo a los desarrolladores gestionar tanto la seguridad como los gastos de inferencia dentro de una sola plataforma.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.