1. Google actualiza el rendimiento de DiffusionGemma a 1.500 tokens por segundo
Tras el lanzamiento inicial de DiffusionGemma en junio, Google ha publicado un informe técnico que detalla optimizaciones adicionales que elevan el rendimiento del modelo a 1.500 tokens por segundo en una NVIDIA H100. Esta actualización se basa en el punto de referencia original de 1.000 tokens por segundo, demostrando las continuas ganancias de eficiencia de la arquitectura de difusión discreta del modelo.
- • El rendimiento de DiffusionGemma ha aumentado a 1.500 tokens por segundo en una NVIDIA H100.
- • La mejora de rendimiento se detalla en un nuevo informe técnico tras el lanzamiento inicial del modelo en junio.
- • El modelo continúa utilizando la arquitectura Gemma 4 MoE con 3.8B de parámetros activos.
- • El proceso de entrenamiento para estas optimizaciones requirió menos del 10% del presupuesto de entrenamiento del modelo autorregresivo original.
El aumento en el rendimiento consolida aún más a DiffusionGemma como una alternativa de alto rendimiento frente a los modelos autorregresivos para implementaciones locales, reduciendo significativamente la latencia en aplicaciones en tiempo real.
2. Liquid AI lanza modelos de borrador DSpark para una inferencia local hasta 3,18 veces más rápida
Los borradores DSpark añaden unos modestos 300M de parámetros a los modelos objetivo, intercambiando un pequeño aumento de memoria por un impulso masivo en la velocidad de decodificación. Este enfoque es altamente efectivo para escenarios de llamadas a funciones con múltiples herramientas, donde DSpark reduce la latencia en un promedio del 57% para el modelo LFM2.5-2.6B, aunque las limitaciones de MoE en el backend Metal de llama.cpp limitan actualmente la aceleración del modelo de 8B en Apple silicon.
- • Liquid AI lanzó puntos de control de modelos de borrador DSpark para LFM2.5-1.2B-Instruct, LFM2.5-2.6B y LFM2.5-8B-A1B.
- • Los modelos de borrador utilizan decodificación especulativa para proponer bloques de 9 tokens, logrando aceleraciones de hasta 3,18x en H100 y 2,87x en M4 Max.
- • Debido a que los borradores utilizan decodificación codiciosa, la secuencia de salida es idéntica a la del modelo objetivo, preservando la precisión de los benchmarks.
- • Los modelos están disponibles en formatos Safetensors y GGUF para autoalojamiento a través de SGLang o llama.cpp.
- • La LFM Open License v1.0 permite el uso comercial gratuito para organizaciones con menos de 10 millones de dólares en ingresos anuales.
Esto permite a los desarrolladores reducir significativamente la latencia de inferencia local y acelerar las llamadas a funciones con múltiples herramientas utilizando llama.cpp o SGLang en su propio hardware.
3. Superwhisper lanza S1-mini, un normalizador de texto de 0.6B de pesos abiertos para transcripciones ASR
S1-mini es parte de la nueva familia de modelos S1 de Superwhisper, que también incluye los modelos S1-Voice y S1-Language basados en la nube. A diferencia de sus hermanos en la nube, S1-mini tiene pesos abiertos y está optimizado para la ejecución local, lo que lo hace altamente accesible para los desarrolladores que crean aplicaciones habilitadas por voz. Para funcionar correctamente, el modelo requiere un formato de entrada específico, incluida una línea de control para gestionar la configuración de contexto, estructura y estilo.
- • Superwhisper lanzó S1-mini, un normalizador de texto de 0.6B de parámetros con pesos abiertos ajustado a partir de Qwen3-0.6B.
- • El modelo está diseñado para limpiar transcripciones ASR sin procesar eliminando rellenos, resolviendo autocorrecciones y formateando entidades como fechas y correos electrónicos.
- • La compilación GGUF Q4_K_M tiene 462 MB y se ejecuta localmente en CPUs de portátiles.
- • S1-mini alcanzó una precisión de token del 94,8% en un conjunto de pruebas interno de 7.519 casos.
- • El modelo tiene licencia Apache 2.0 (con una cláusula de nomenclatura) y requiere un prompt del sistema fijo, temperatura 0 y una línea de control de tres ejes.
Esto permite a los desarrolladores ejecutar un modelo ligero de 462 MB localmente en CPUs de portátiles para eliminar palabras de relleno, corregir autocorrecciones y formatear salidas ASR sin procesar con alta precisión.
4. Google lanza el modelo de visión-lenguaje TIPS en Hugging Face
El lanzamiento de TIPS proporciona a los desarrolladores una potente herramienta de pesos abiertos para tareas de visión espacial. Al centrarse en la comprensión densa, el modelo permite una segmentación de objetos y un mapeo de profundidad más precisos que los modelos de visión-lenguaje de propósito general, lo que lo hace ideal para la integración en tuberías de análisis espacial.
- • Google lanzó el modelo de visión-lenguaje TIPS en Hugging Face.
- • El modelo está diseñado con capacidades de conciencia espacial.
- • TIPS está optimizado para tareas de comprensión densa, específicamente segmentación y estimación de profundidad.
Esto permite a los desarrolladores que crean funciones de computación espacial, robótica o análisis de imágenes avanzado aprovechar un modelo abierto especializado para tareas precisas de profundidad y segmentación.
5. Ornith-1.5-35B-A3B enviado con cabezal MTP no entrenado
El descubrimiento del cabezal MTP no entrenado en el lanzamiento de Ornith-1.5-35B-A3B destaca un descuido significativo en el empaquetado del modelo. Debido a que los pesos para el cabezal de predicción de múltiples tokens nunca fueron entrenados, los desarrolladores que intenten aprovechar esta función experimentarán un rendimiento degradado y deberían esperar a un lanzamiento corregido o deshabilitar el cabezal MTP.
- • Una publicación en HuggingFace informó que el modelo Ornith-1.5-35B-A3B se envió con un cabezal MTP no entrenado.
- • El cabezal MTP contiene solo pesos inicializados aleatoriamente.
- • Este problema explica por qué el rendimiento de predicción de múltiples tokens del modelo es lento.
Esto advierte a los desarrolladores que intentan usar este modelo sobre el cabezal MTP no entrenado, lo que explica su rendimiento inesperadamente lento.
6. Replit introduce el Modo Gratuito impulsado por GPT-5.6 Luna
El nuevo Modo Gratuito de Replit reduce la barrera para la codificación asistida por IA al ofrecer acceso ilimitado a GPT-5.6 Luna de OpenAI para tareas de desarrollo estándar. El lanzamiento va acompañado de una revisión de la interfaz de usuario diseñada para facilitar el movimiento entre la asistencia basada en chat, las tareas discretas y la creación de proyectos a gran escala.
- • Replit introdujo el 'Modo Gratuito', permitiendo el uso sin créditos del modelo GPT-5.6 Luna de OpenAI.
- • La compañía afirma que el nuevo modo permite a los usuarios crear hasta 30 veces más contenido.
- • Una interfaz de usuario rediseñada de Replit agiliza las transiciones entre chat, tareas y compilaciones completas.
- • Los usuarios Pro reciben límites de uso aumentados, mientras que los suscriptores Core obtienen capacidades para crear proyectos de alta calidad a escala.
Esto permite a los desarrolladores aprovechar un nuevo modelo de frontera para tareas de codificación cotidianas en la plataforma de Replit sin preocuparse por el consumo de créditos.
7. Desafíos de codificación falsos en LinkedIn distribuyen malware de robo de credenciales
Esta campaña altamente dirigida explota los flujos de trabajo estándar de los desarrolladores al ocultar código malicioso dentro de un proyecto que contiene aproximadamente 180 archivos. Debido a que el malware se activa con comandos de desarrollo comunes y no requiere privilegios administrativos para acceder a los archivos de credenciales propiedad del usuario, ejecutar estos proyectos en un host bare-metal representa un grave riesgo de seguridad para la infraestructura en la nube de un desarrollador.
- • Los atacantes están distribuyendo malware disfrazado de desafíos de codificación a través de ofertas de trabajo falsas en LinkedIn.
- • El malware se ejecuta automáticamente cuando un desarrollador ejecuta comandos estándar como `npm run dev` o `npm start`.
- • Tiene como objetivo datos confidenciales de los desarrolladores, incluidas credenciales de AWS, claves SSH, perfiles de navegador y archivos `.env`, sin requerir privilegios de root.
- • La carga útil maliciosa se conecta a un servidor de Comando y Control en `147.189.174.138` para descargar un troyano de acceso remoto y ladrones de credenciales.
- • Los expertos en seguridad recomiendan ejecutar todos los desafíos de codificación no confiables en entornos aislados como Docker o Vagrant sin montar datos del host.
Esto advierte a los desarrolladores que aíslen los desafíos de codificación no confiables en Docker o Vagrant sin montar directorios host para evitar el robo silencioso de credenciales en la nube y claves SSH confidenciales.
8. Grok vulnerable a inyección de prompts mediante instrucciones web cifradas
Descubierta por el investigador de seguridad Rony Utevsky en Adversa, esta vulnerabilidad elude las barandillas estándar de LLM al ocultar la carga útil maliciosa en un formato cifrado. Cuando se le pide a Grok que resuma la página, descifra y ejecuta las instrucciones, lo que demuestra un vector sofisticado para la exfiltración de datos contra el que los desarrolladores de sistemas de generación aumentada por recuperación (RAG) deberían protegerse.
- • Una vulnerabilidad de inyección de prompts en Grok permite a los atacantes robar chats de usuario e información personal.
- • El ataque funciona alojando instrucciones maliciosas cifradas en una página web junto con una clave de descifrado, que la IA ejecuta durante el resumen.
- • El exploit se ejecuta automáticamente sin ninguna advertencia o confirmación del asistente.
- • xAI fue notificado de la vulnerabilidad en junio, pero el asistente seguía siendo susceptible en el momento del informe.
Esto advierte a los desarrolladores que crean funciones de web-scraping o resumen utilizando LLMs que implementen una estricta desinfección de entradas para evitar que las cargas útiles cifradas secuestren sus aplicaciones.
9. Slack lanza canales Slack Code para flujos de trabajo colaborativos con agentes de IA
Slack Code lleva el desarrollo asistido por IA directamente al chat del equipo, permitiendo a los desarrolladores etiquetar agentes para iniciar tareas de codificación como la creación de funciones o la corrección de errores. El entorno proporciona visibilidad total de las acciones del agente, ofreciendo vistas previas en vivo de salidas HTML y comparaciones de cambios de código para la revisión del equipo antes de la aprobación. La función está disponible a partir de hoy en todos los planes de Slack.
- • Slack lanzó 'Slack Code', canales dedicados diseñados para colaborar con agentes de codificación de IA.
- • La función se integra con agentes asociados, incluidos Claude Code, Devin, Vercel Agent y GitHub Copilot.
- • Slack Code incluye canales específicos para proyectos, pestañas de usuario dedicadas, herramientas de comparación de cambios de código y vistas previas de salida HTML.
- • Los equipos pueden revisar y aprobar las salidas de los agentes con visibilidad total, vistas previas en vivo y registros de auditoría.
- • Los canales están diseñados para archivarse automáticamente una vez que se completan sus tareas de codificación asignadas.
Esto permite a los desarrolladores colaborar y monitorear agentes de codificación de IA en canales dedicados de Slack con herramientas integradas de comparación de código, vistas previas en vivo y registros de auditoría.
10. Cursor introduce agentes en la nube basados en eventos y máquinas virtuales subagentes
Esta actualización amplía significativamente las capacidades agénticas de Cursor más allá del editor local. Al permitir que los agentes alojados en la nube se ejecuten continuamente en segundo plano y pongan en marcha subagentes aislados en máquinas virtuales dedicadas, los desarrolladores pueden delegar tareas complejas y de larga duración, como el monitoreo de PR y la resolución de problemas basada en Slack.
- • Los agentes de Cursor ahora pueden suscribirse a fuentes de eventos como solicitudes de extracción y hilos de Slack, despertándose automáticamente cuando ocurren eventos.
- • Las suscripciones basadas en eventos están actualmente restringidas a los agentes basados en la nube de Cursor.
- • Los subagentes de Cursor ahora pueden ejecutarse en sus propias máquinas virtuales dedicadas.
- • Los usuarios pueden enviar mensajes de dirección en tiempo real a los agentes de Cursor activos sin interrumpir su ejecución.
Esto permite a los desarrolladores crear flujos de trabajo más autónomos que se ejecutan en segundo plano, donde los agentes de codificación reaccionan a eventos externos y pueden ser guiados a mitad de la tarea sin interrupción.
11. NVIDIA lanza el servidor oficial del Protocolo de Contexto de Modelo CUDA
El lanzamiento de un servidor oficial CUDA MCP facilita significativamente a los desarrolladores la escritura de código GPU de alto rendimiento. Al exponer la documentación oficial y las capacidades de análisis de rendimiento a través del Protocolo de Contexto de Modelo estandarizado, los desarrolladores pueden aprovechar sus configuraciones de codificación de IA existentes para generar implementaciones CUDA más precisas y optimizadas.
- • NVIDIA lanzó un servidor oficial del Protocolo de Contexto de Modelo (MCP) CUDA alojado por NVIDIA.
- • La herramienta permite a los asistentes de IA buscar documentación oficial de CUDA actualizada.
- • Ayuda a las herramientas de IA a escribir código GPU optimizado y analizar datos de rendimiento.
Esto permite a los desarrolladores conectar sus asistentes de IA compatibles con MCP directamente a la documentación oficial de CUDA y a las herramientas de análisis de rendimiento de NVIDIA.
12. NanoClaw lanza integración con Slack para equipos de agentes de IA autoalojados
NanoClaw, un arnés de agentes de código abierto con licencia MIT, ahora permite a los equipos poner en marcha escuadrones de agentes autónomos directamente desde los prompts de Slack. Debido a que NanoClaw es una solución autoalojada, las organizaciones ejecutan la infraestructura de agentes subyacente en sus propias máquinas locales o máquinas virtuales en la nube, manteniendo el control sobre los datos y la selección del modelo. La plataforma también admite la continuidad entre canales, lo que permite que estos agentes persistentes operen en Slack, Telegram y WhatsApp mientras comparten contexto.
- • NanoCo lanzó una integración gratuita de Slack para su arnés de agentes de IA autoalojado de código abierto, NanoClaw.
- • A cada agente se le asigna una identidad, nombre y avatar únicos, y se puede configurar con roles, contextos de memoria y permisos específicos.
- • El sistema admite el aprovisionamiento recursivo, lo que permite a los agentes existentes crear y coordinar agentes adicionales dentro de un canal de Slack.
- • NanoClaw admite la continuidad entre canales, compartiendo contexto persistente en Slack, Telegram y WhatsApp.
- • La integración es gratuita a través de Slack Marketplace, y los usuarios son responsables de sus propios costos de inferencia y alojamiento de modelos.
Esto permite a los desarrolladores implementar y gestionar flujos de trabajo persistentes de múltiples agentes en Slack, Telegram y WhatsApp utilizando su propia infraestructura autoalojada y APIs de modelos.
13. Serval lanza la plataforma de agentes de IA Catalyst para flujos de trabajo de TI automatizados
Catalyst de Serval actúa como un superagente administrativo, analizando datos históricos de tickets y procedimientos operativos estándar para redactar flujos de trabajo y políticas de acceso personalizados. La plataforma prioriza la privacidad de los datos, asegurando que las entradas y salidas de los clientes nunca se utilicen para entrenar o ajustar los modelos subyacentes, lo que la hace adecuada para entornos empresariales altamente regulados.
- • Serval lanzó su agente de automatización empresarial, Catalyst, para disponibilidad general el 20 de agosto de 2026.
- • Catalyst genera código TypeScript subyacente para los flujos de trabajo, lo que permite a los administradores revisarlos y aprobarlos antes de la implementación.
- • La plataforma utiliza agentes en segundo plano para monitorear continuamente los sistemas y proponer correcciones automatizadas antes de que se presenten tickets de soporte.
- • Es agnóstica al modelo, admite modelos de OpenAI y Anthropic, y permite a los clientes proporcionar sus propias claves API.
- • Catalyst se puede implementar como SaaS en la nube, en las instalaciones o dentro de la VPC o clúster de Kubernetes de un cliente.
Esto permite a los desarrolladores implementar una plataforma de agentes agnóstica al modelo y autoalojable que escribe y ejecuta código TypeScript para automatizar el monitoreo de sistemas y la resolución de problemas.
14. Atlassian añade Teamwork Graph a la integración de IA de Jira para reducir el uso de tokens en un 48%
Tras el anuncio de julio que permitía a los desarrolladores asignar tareas de Jira directamente a agentes de IA, Atlassian ha introducido ahora Teamwork Graph. Esta nueva función mapea las relaciones entre problemas, código y actividades del equipo para proporcionar a los agentes un contexto más relevante, lo que resulta en una reducción del 48% en el consumo de tokens mientras se mantiene la mejora del 44% en la precisión de salida reportada anteriormente.
- • Teamwork Graph es una nueva incorporación a la integración de IA de Jira anunciada en julio.
- • Optimiza la entrega de contexto para los agentes de IA, reduciendo el uso de tokens en un 48%.
- • La función mantiene la mejora del 44% en la precisión de salida reportada anteriormente.
- • Se integra con agentes como Claude, Cursor y Copilot.
Esta actualización mejora la integración existente de Jira-IA al reducir significativamente los costos de API para los desarrolladores que utilizan agentes como Claude, Cursor y Copilot mediante una gestión de contexto más eficiente.
15. El framework Agent Lightning v1.0 aumenta el rendimiento en SWE-bench en 14,6 puntos
Agent Lightning v1.0 ofrece un camino simplificado para los desarrolladores que buscan aplicar el aprendizaje por refuerzo a sus flujos de trabajo agénticos. Al centrarse en la integración del arnés y la estabilidad del entrenamiento, el framework compacto permite a los desarrolladores lograr capacidades de ingeniería de software de nivel de frontera en modelos de pesos abiertos más pequeños y rentables.
- • Agent Lightning v1.0 es un framework de aprendizaje por refuerzo agéntico ligero escrito en 3.500 líneas de código.
- • El framework integra arneses de agentes arbitrarios para resolver problemas como la retokenización y la inestabilidad del entrenamiento.
- • Mejoró el rendimiento de Qwen3.5-9B en SWE-bench Verified en 14,6 puntos.
- • La mejora en el benchmark se logró utilizando 6.000 ejemplos de entrenamiento.
Esto permite a los desarrolladores utilizar un framework compacto para ajustar modelos más pequeños como Qwen3.5-9B para tareas complejas de ingeniería de software con ganancias significativas en los benchmarks.
16. Tutorial paso a paso detalla el ajuste fino de DPO con TRL y LoRA
Este tutorial es muy valioso para los desarrolladores que buscan alinear modelos pequeños y locales con preferencias de usuario específicas. Al recorrer la auditoría de conjuntos de datos y los diagnósticos de entrenamiento, la guía garantiza que los desarrolladores puedan lograr un aprendizaje de preferencias genuino en lugar de dejar que el modelo explote patrones superficiales como la longitud de la respuesta.
- • El tutorial proporciona un flujo de trabajo de extremo a extremo para la Optimización de Preferencia Directa (DPO) utilizando la biblioteca TRL.
- • Demuestra el ajuste fino de un modelo Qwen2.5-0.5B-Instruct con adaptación LoRA opcional.
- • La guía incluye pasos para auditar conjuntos de datos en busca de sesgos estructurales, de longitud y de atajos léxicos.
- • Cubre la evaluación de la precisión de la recompensa, el comportamiento de entrenamiento y el guardado de la política y el tokenizador finales.
Esto permite a los desarrolladores seguir un flujo de trabajo estructurado para ajustar modelos pequeños y específicos de tareas en datos de preferencia mientras auditan los sesgos comunes del conjunto de datos.
17. Lanzado conjunto de datos de preferencias de imágenes humanas de código abierto con una subvención de 1 millón de dólares
Este conjunto de datos masivo proporciona a los desarrolladores datos empíricos votados por humanos sobre el rendimiento de los modelos de imagen. Al cubrir diversas categorías como el diseño de productos y el marketing, el conjunto de datos ayuda a los desarrolladores a seleccionar los modelos de generación de imágenes con mejor rendimiento para sus casos de uso empresarial específicos.
- • El proyecto lanzó el conjunto de datos de preferencias de imágenes humanas de código abierto más grande, con más de 2 millones de anotaciones.
- • Se anunció una subvención de datos de 1 millón de dólares junto con el lanzamiento del conjunto de datos.
- • El conjunto de datos clasifica 30 modelos de imagen de última generación en 10 categorías distintas, incluyendo marketing y diseño de productos.
Esto permite a los desarrolladores que crean funciones multimodales o de generación de imágenes aprovechar un conjunto de datos masivo anotado por humanos para evaluar y ajustar sus modelos de imagen.
18. El Índice de Precisión de Endpoint cuantifica la degradación silenciosa del modelo
Tras las preocupaciones sobre la 'fractura de identidad del modelo', donde los proveedores sirven silenciosamente pesos cuantizados o modificados, el evento 'Inference, Measured' ha introducido el Índice de Precisión de Endpoint. Esta herramienta proporciona una forma estandarizada de cuantificar la degradación del rendimiento que los desarrolladores luchaban por rastrear anteriormente. Al comparar los endpoints de los proveedores con pesos de referencia autoalojados y no cuantizados, el índice revela que algunos modelos alojados operan con una precisión tan baja como el 73%, confirmando que las optimizaciones silenciosas como la compresión de caché KV y la cuantización afectan significativamente la calidad de la salida.
- • El Índice de Precisión de Endpoint mide los endpoints de los proveedores frente a pesos autoalojados y no cuantizados como referencia del 100%.
- • Los endpoints de los proveedores probados obtuvieron una puntuación de entre el 73% y el 100% en el índice, cuantificando el impacto de las optimizaciones silenciosas.
- • El índice proporciona una métrica concreta para los problemas de 'fractura de identidad del modelo' y cuantización silenciosa reportados anteriormente.
- • Las optimizaciones que afectan al rendimiento, como la compresión de caché KV y la cuantización, permanecen en gran medida sin revelar en las páginas de precios de los proveedores.
Este índice mueve a la industria de la identificación del problema de la degradación silenciosa del modelo a su medición activa, permitiendo a los desarrolladores responsabilizar a los proveedores de API por el rendimiento de los modelos que sirven.
19. El motor de inferencia Qwen3.8-27B hiperoptimizado alcanza 382 TPS en RTX 3090
Este motor hiperoptimizado hace que ejecutar un modelo de 27B de parámetros en una sola GPU de consumo sea muy práctico para cargas de trabajo similares a la producción. La implementación de una caché KV int8 lo hace particularmente adecuado para tareas de QA de documentos donde un documento grande se carga una vez y se consulta repetidamente, maximizando los beneficios de rendimiento del almacenamiento en caché de prefijos y la verificación especulativa.
- • Se ha lanzado un motor de inferencia de código abierto para Qwen3.8-27B en GitHub, optimizado para la RTX 3090.
- • El motor alcanza 133 tps en prompts de chat reales y hasta 382 tps al reproducir contexto.
- • Una caché KV int8 aumenta la capacidad de contexto a 138.696 tokens, aunque cuesta el doble de prellenado que bf16.
- • El motor utiliza redacción de bloques DFlash2, redacción aumentada por búsqueda, almacenamiento en caché de prefijos y activaciones int8 mientras mantiene una puntuación GSM8K del 96,5%.
- • Las nuevas actualizaciones permiten verificar 16 tokens por paso utilizando bloques de verificación más largos.
Esto permite a los desarrolladores ejecutar un modelo de 27B altamente capaz localmente en hardware de consumo con un rendimiento masivo de tokens y una capacidad de 138k tokens.
20. Anthropic permitirá la retención de datos empresariales en los sistemas en la nube del cliente
Anthropic se está preparando para ofrecer a los clientes empresariales un mayor control sobre sus datos al utilizar sus modelos de inteligencia artificial más avanzados. Si bien el requisito estándar de retención de datos de 30 días permanece vigente, cambiar la ubicación de almacenamiento a la propia infraestructura en la nube del cliente ayuda a las empresas a cumplir con los mandatos internos de seguridad y cumplimiento.
- • Anthropic planea permitir a los clientes empresariales retener los datos requeridos en sus propios sistemas en la nube.
- • El cambio de política está planeado para finales de este año.
- • Las empresas aún deberán retener los datos durante 30 días, pero controlarán el entorno de alojamiento.
Esto permite a los desarrolladores que crean aplicaciones de IA de grado empresarial cumplir con estrictos requisitos de cumplimiento y soberanía de datos mientras siguen utilizando los modelos de frontera de Anthropic.
21. Ramp hace que su 'Router' interno esté disponible como servicio de API pública
Ramp ha lanzado oficialmente su servicio Router, haciendo la transición de la arquitectura interna detallada anteriormente en julio a una API orientada al público. El servicio permite a los desarrolladores enrutar dinámicamente las solicitudes a los modelos más rentables mientras mantienen el rendimiento, ofreciendo ahora una reducción de costos promedio del 40% en comparación con el 30% reportado anteriormente para su implementación interna.
- • Ramp ha lanzado su arquitectura de enrutamiento interna como un servicio de API pública.
- • El servicio hace coincidir dinámicamente las solicitudes con el modelo de menor costo que cumple con los criterios de rendimiento.
- • Ramp reporta una reducción de costos promedio del 40% para los usuarios del nuevo servicio.
- • El sistema monitorea la latencia en vivo y las tasas de error para optimizar la selección del modelo en tiempo real.
Los desarrolladores ahora pueden aprovechar la misma tecnología de enrutamiento dinámico que Ramp utilizó internamente para optimizar sus propios costos y latencia de API de LLM a través de una única puerta de enlace.