1. Nvidia lanza NeMo Switchyard y Nemotron 3.5 Lightning
Nvidia ha presentado NeMo Switchyard, una biblioteca de código abierto diseñada para enrutar dinámicamente pasos individuales de un flujo de trabajo de agentes hacia el modelo más rentable y capaz, basándose en predicciones de estado y costo de tokens. Junto con el enrutador, Nvidia lanzó Nemotron 3.5 Lightning, un modelo de mezcla de expertos abierto de 30 mil millones de parámetros que cuenta con una arquitectura híbrida Mamba-Transformer y una ventana de contexto de 1 millón de tokens. Las integraciones tempranas de Switchyard con marcos como LangChain y plataformas como Devin Desktop de Cognition han demostrado reducciones de costos de hasta un 74% en tareas de agentes de múltiples turnos.
- • Nvidia lanzó NeMo Switchyard, una biblioteca de código abierto para el enrutamiento dinámico de modelos en flujos de trabajo de agentes.
- • Nvidia lanzó Nemotron 3.5 Lightning, un modelo de mezcla de expertos abierto de 30B con 3B de parámetros activos y una ventana de contexto de 1M de tokens.
- • NeMo Switchyard está integrado con LangChain, Kong, LiteLLM, OpenRouter y Devin Desktop de Cognition.
- • LangChain informó una reducción de costos del 74% en 145 tareas de múltiples turnos al enrutar el 7% de las llamadas a un modelo de frontera a través de Switchyard.
- • Nemotron 3.5 Lightning se lanza bajo la licencia OpenMDW-1.1 para uso comercial y está disponible en Hugging Face.
Los desarrolladores ahora pueden usar una biblioteca de enrutamiento de código abierto para cambiar automáticamente de modelo a mitad de una tarea, reduciendo drásticamente los costos de API para flujos de trabajo de agentes complejos sin sacrificar la precisión.
2. Lanzamiento de LTX-2.5, modelo de video y mundo de pesos abiertos
LTX, una escisión de Lightricks, ha lanzado LTX-2.5, un modelo de video y mundo de pesos abiertos diseñado para la ejecución local de baja latencia en GPUs Nvidia RTX. El modelo cuenta con un decodificador de video de difusión, generación nativa de múltiples tomas y una estructura base de lenguaje Gemma 4 personalizada. Está integrado de forma nativa en la herramienta de flujo de trabajo basada en nodos ComfyUI y está disponible a través de Hugging Face y la API de LTX, ofreciendo una licencia comunitaria gratuita para organizaciones con menos de 10 millones de dólares en ingresos recurrentes anuales.
- • LTX lanzó LTX-2.5, un modelo de video y mundo de pesos abiertos, el 11 de agosto de 2026.
- • El modelo está integrado de forma nativa en ComfyUI y disponible en Hugging Face y la API de LTX.
- • LTX-2.5 es gratuito para organizaciones con menos de 10 millones de dólares en ingresos recurrentes anuales bajo la Licencia Comunitaria LTX-2.5.
- • Las nuevas características incluyen un decodificador de video de difusión, generación nativa de múltiples tomas y una estructura base Gemma 4 personalizada.
- • El modelo admite la ejecución local en GPUs NVIDIA RTX y está optimizado para inferencia de baja latencia.
Los desarrolladores pueden crear funciones de generación de video locales y de baja latencia en sus aplicaciones utilizando pesos abiertos e integración nativa con ComfyUI.
3. SpaceXAI y Cursor lanzan los agentes de IA persistentes Grok Bot
SpaceXAI (anteriormente xAI) y Cursor, actualmente en proceso de fusión, han lanzado la versión beta de Grok Bot para macOS, Windows, Linux e iOS. Grok Bot despliega agentes de IA persistentes que se ejecutan en sus propias computadoras en la nube dedicadas, lo que les permite iniciar sesión en aplicaciones, aprender flujos de trabajo de los usuarios y coordinar tareas las 24 horas del día, los 7 días de la semana. El sistema enruta automáticamente las tareas a los modelos de backend de forma dinámica, y tiene un precio de 120 dólares por asiento al mes para organizaciones a través de Cursor Premium Teams o 200 dólares al mes para individuos a través de Cursor Ultra.
- • SpaceXAI y Cursor lanzaron Grok Bot en versión beta para macOS, Windows, Linux e iOS.
- • A los Grok Bots se les asignan sus propias computadoras en la nube para iniciar sesión en aplicaciones y trabajar las 24 horas del día, los 7 días de la semana.
- • El servicio cuesta 120 dólares por asiento/mes para organizaciones (Cursor Premium Teams) y 200 dólares/mes para individuos (Cursor Ultra).
- • El sistema enruta automáticamente las tareas a los modelos de backend sin necesidad de selección manual de modelos.
- • SpaceXAI y Cursor están en proceso de fusionarse en una sola empresa.
Introduce un entorno de agentes persistente y altamente integrado vinculado directamente a Cursor, lo que permite a los desarrolladores delegar flujos de trabajo de múltiples pasos y entre aplicaciones a compañeros de equipo autónomos alojados en la nube.
4. Lanzamiento de la aplicación de escritorio Unsloth para entrenamiento e inferencia de modelos locales
Unsloth ha lanzado Unsloth Desktop, una aplicación de código abierto para macOS, Windows y Linux diseñada para ejecutar y entrenar modelos localmente. La aplicación admite formatos MLX, GGUF, difusión y audio, con soporte nativo para modelos como MiniMax-H3 y Muse Glimmer. Unsloth Desktop permite a los desarrolladores conectar Claude Code y Codex a LLMs locales, afirmando una precisión un 50% mayor a través de llamadas a herramientas de autocuración y ejecución de código en sandbox, al tiempo que permite un entrenamiento de modelos 2 veces más rápido con un 70% menos de uso de VRAM.
- • Unsloth Desktop se lanzó como una aplicación de código abierto para macOS, Windows y Linux.
- • La aplicación permite a los desarrolladores conectar Claude Code y Codex a LLMs locales.
- • Admite formatos MLX, GGUF, difusión y audio, incluidos MiniMax-H3 y Muse Glimmer.
- • Unsloth afirma que el software permite un entrenamiento de modelos 2 veces más rápido utilizando un 70% menos de VRAM.
- • Las características incluyen búsqueda web privada, investigación profunda, RAG, MCP y exportaciones para NVFP4 y GGUF.
- • La aplicación no recopila ninguna telemetría ni datos del usuario.
Proporciona un entorno local potente y sin telemetría que conecta asistentes de codificación basados en la nube como Claude Code con modelos locales autohospedados.
5. Qwen-MM-Plugins implementa el estándar Agent Plugins 1.0.0
Tras el lanzamiento del estándar Agent Plugins 1.0.0, se ha lanzado el nuevo repositorio de código abierto Qwen-MM-Plugins para proporcionar complementos multimodales nativos para los modelos Qwen. Al utilizar la especificación 1.0.0, estos complementos agrupan habilidades específicas y servidores opcionales del Protocolo de Contexto de Modelo (MCP), lo que permite a los desarrolladores integrar capacidades de visión, audio e imagen en los arneses de agentes.
- • Qwen-MM-Plugins adopta el estándar Agent Plugins 1.0.0 para empaquetar capacidades multimodales.
- • El repositorio incluye complementos nativos y servidores MCP opcionales para agentes impulsados por Qwen.
- • Se proporcionan libros de cocina (cookbooks) para ayudar a los desarrolladores con los listados de herramientas y las instrucciones de configuración.
- • El lanzamiento permite que los arneses de agentes funcionen como sistemas nativos multimodales.
Esta implementación demuestra la aplicación práctica del estándar Agent Plugins 1.0.0, proporcionando a los desarrolladores herramientas listas para usar para construir flujos de trabajo de agentes nativos multimodales para los modelos Qwen.
6. Investigadores extraen rastros de razonamiento ocultos de las API de frontera
Investigadores de la Universidad de Tubinga, el Instituto Max Planck, MATS Research y Snyk han identificado una vulnerabilidad en los modelos de frontera accedidos por API de OpenAI, Anthropic y Google que permite la extracción de rastros de razonamiento ocultos. La técnica de ataque consiste en alimentar rastros de razonamiento cifrados a una versión más pequeña y menos alineada del mismo modelo para revelar sus pensamientos internos. Si bien las empresas han implementado mitigaciones de API a corto plazo para abordar la vulnerabilidad (que anteriormente permitía la recuperación de datos confidenciales como contraseñas y claves API), los investigadores también notaron que el modelo de pesos abiertos Kimi K3 de Moonshot AI produjo resultados muy similares a los rastros de Claude Opus 4.8 y GPT 5.6 Sol, lo que plantea dudas sobre la destilación de modelos.
- • Los investigadores descubrieron un método para extraer rastros de razonamiento ocultos de los modelos de OpenAI, Anthropic y Google a través de la API.
- • La técnica de ataque alimenta rastros de razonamiento cifrados a versiones más pequeñas y menos alineadas del modelo para revelar pensamientos internos.
- • La vulnerabilidad permitía anteriormente la recuperación de contraseñas y claves API, pero los proveedores han implementado mitigaciones de API.
- • El modelo chino de pesos abiertos Kimi K3 produjo resultados muy similares a los rastros de razonamiento ocultos de Claude Opus 4.8 y GPT 5.6 Sol.
- • Anthropic confirmó que ha comenzado a crear mitigaciones a corto plazo para los comportamientos de reproducción descritos en el informe.
Destaca una vulnerabilidad de seguridad crítica en las API de razonamiento de frontera que podría exponer estados o datos internos confidenciales, lo que provocó mitigaciones inmediatas por parte de los principales proveedores de API.
7. La ingeniería inversa expone los riesgos de privacidad de GitHub Copilot
El ingeniero Rafael ha realizado ingeniería inversa a GitHub Copilot utilizando un proxy Man-in-the-Middle (MitM) para inspeccionar el tráfico de red desde la extensión de VS Code. El análisis reveló que Copilot incluye automáticamente el contexto de los archivos editados recientemente en las solicitudes de API, lo que puede exponer inadvertidamente datos confidenciales de archivos como .env si están en el historial de edición. Además, Copilot escribe los avisos de los usuarios y las respuestas del asistente en texto plano en una base de datos SQLite local (session-store.db) sin realizar ninguna redacción, desinfección o filtrado de secretos, lo que permite a su herramienta interna Chronicle consultar el historial pasado mediante SQL.
- • Un ingeniero realizó ingeniería inversa a GitHub Copilot utilizando mitmproxy para inspeccionar el tráfico de red de VS Code.
- • Copilot incluye automáticamente el contexto de los archivos editados recientemente, lo que puede filtrar datos confidenciales de archivos como .env.
- • Los avisos de los usuarios y las respuestas del asistente se almacenan en texto plano en una base de datos SQLite local (session-store.db).
- • El código de la base de datos local no realiza ninguna redacción, desinfección o filtrado de secretos en los datos almacenados.
- • La herramienta Chronicle de Copilot consulta esta base de datos local mediante SQL para recuperar el historial de sesiones pasadas.
Los desarrolladores que usan Copilot deben ser conscientes de que los archivos confidenciales como .env pueden filtrarse silenciosamente en las cargas útiles de la API, y todo su historial de avisos se almacena sin cifrar en su máquina local.
8. Anthropic implementará marcas de agua invisibles en los modelos Claude
Anthropic se ha comprometido a implementar sistemas de marcas de agua invisibles legibles por máquina en toda su línea de modelos, incluidos los modelos más antiguos, para cumplir con los mandatos de transparencia de la Ley de IA de la UE. La marca de agua se aplicará globalmente en la plataforma Claude, Claude, Claude Code, Claude Cowork y Claude Tag, independientemente de si se accede a los modelos directamente o a través de proveedores de la nube como AWS, Google Cloud o Microsoft Foundry. Las imágenes generadas por Claude adoptarán el estándar de metadatos C2PA, mientras que el texto contará con una marca de agua esteganográfica imperceptible que persiste a través de las acciones de copiar y pegar.
- • Anthropic aplicará marcas de agua invisibles legibles por máquina al texto y las imágenes generados por Claude a nivel mundial.
- • La marca de agua se aplica a todos los métodos de acceso, incluidos API directa, AWS, Google Cloud y Microsoft Foundry.
- • Las imágenes generadas por Claude utilizarán el estándar de metadatos de procedencia C2PA, mientras que el texto utilizará marcas de agua esteganográficas.
- • La implementación está diseñada para cumplir con la Ley de IA de la UE, que entró en vigor el 2 de agosto de 2024.
- • Anthropic planea publicar documentación técnica para que terceros detecten estas marcas de agua.
Los desarrolladores que utilizan las API de Claude deben prepararse para que todo el texto y las imágenes generados lleven marcas de agua persistentes legibles por máquina, lo que puede afectar el procesamiento posterior o los flujos de trabajo de cumplimiento.
9. El proyecto H3-metal permite la inferencia local de MiniMax-H3 en Apple Silicon
Basándose en el reciente lanzamiento del modelo multimodal MiniMax-H3, el proyecto H3-metal ha introducido soporte de inferencia nativa para Apple Silicon. Optimizado para chips M3 Max y M5 Max, la implementación admite la generación de aviso a video/audio, condicionamiento de primer/último fotograma y referencias Ref2VA. Incluye un modo --ssd-streaming que reduce los requisitos de memoria a 2.0–2.1 GiB de almacenamiento DiT en M5 Max, junto con soporte para cuantización int8.
- • H3-metal proporciona inferencia nativa para el modelo MiniMax-H3 en Apple Silicon.
- • Admite generación de aviso a video/audio, condicionamiento de primer/último fotograma y referencias Ref2VA.
- • Cuenta con un modo --ssd-streaming que requiere solo de 2.0 a 2.1 GiB de almacenamiento DiT en M5 Max.
- • Optimizado para chips M3 Max y M5 Max con soporte de cuantización int8.
Este desarrollo permite a los desarrolladores ejecutar el modelo MiniMax-H3 lanzado recientemente de forma local en hardware Apple Silicon con huellas de memoria altamente optimizadas.