1. Stanford y Lambda Labs lanzan el framework de agentes locales OpenJarvis
Investigadores de la Universidad de Stanford y Lambda Labs han lanzado OpenJarvis, un framework de código abierto y centrado en el entorno local para ejecutar inferencia, agentes, memoria y aprendizaje completamente en el dispositivo. El framework utiliza un objeto de configuración declarativo llamado "spec" para descomponer los sistemas de IA en cinco primitivas intercambiables: Inteligencia, Motor, Agentes, Herramientas y Memoria, y Aprendizaje. OpenJarvis optimiza las especificaciones locales utilizando un modelo de nube de vanguardia como profesor durante el tiempo de búsqueda, lo que resulta en cero llamadas a la nube durante la inferencia. El framework admite 11 modelos locales en cuatro familias, incluyendo Qwen3.5, Gemma4, Nemotron y Granite.
- • Lanzado bajo la licencia Apache 2.0 el 12 de marzo de 2026.
- • Funciona con una diferencia de 3.2 puntos porcentuales respecto a los mejores modelos en la nube, con un costo marginal de API 800 veces menor y una latencia 4 veces menor.
- • Utiliza una especificación de configuración declarativa para descomponer los sistemas de IA en cinco primitivas intercambiables.
- • Admite 11 modelos locales en las familias Qwen3.5, Gemma4, Nemotron y Granite.
- • Proporciona soporte integrado para más de 25 conectores de datos y más de 32 canales de mensajería.
Permite a los desarrolladores crear agentes de IA personales centrados en el entorno local que funcionan con una diferencia de 3.2 puntos porcentuales respecto a los mejores modelos en la nube, reduciendo los costos de API en 800 veces.
2. Huawei libera KVarN para una compresión de KV-Cache de 3-5x en vLLM
Huawei ha liberado KVarN, un método de cuantización de caché KV diseñado para cargas de trabajo de agentes y de contexto largo. Implementado como un backend de atención nativo para vLLM, KVarN se integra en el framework vLLM mediante una única bandera y no requiere cambios en el modelo, reentrenamiento ni calibración. El sistema cuantiza la caché KV mediante un proceso de cuatro etapas, con una configuración predeterminada (kvarn_k4v2_g128) que utiliza claves de 4 bits y valores de 2 bits. KVarN ofrece entre 3 y 5 veces más capacidad de contexto y hasta 1.3 veces el rendimiento de FP16, manteniendo la calidad de salida y la precisión de razonamiento de FP16.
- • Lanzado bajo la licencia Apache 2.0 y construido sobre vLLM v0.22.0.
- • Proporciona entre 3 y 5 veces más capacidad de contexto en comparación con la capacidad de ~2x ofrecida por FP8.
- • Logra hasta ~1.4 veces el rendimiento de FP16 manteniendo la calidad de salida de FP16.
- • Ofrece hasta ~2.4 veces el rendimiento de TurboQuant manteniendo una mayor precisión en tareas de razonamiento.
- • Se integra en vLLM mediante una única bandera sin necesidad de cambios en el modelo ni calibración.
Permite a los desarrolladores ejecutar cargas de trabajo de agentes y de contexto largo en vLLM con una huella de memoria significativamente reducida y hasta 1.3 veces más rendimiento que FP16.
3. Boxes.dev lanza entornos exclusivos en la nube para Claude Code y Codex
Los fundadores Nick y Drew han lanzado boxes.dev, un entorno de desarrollo agente (ADE) exclusivo en la nube que proporciona computación remota dedicada para ejecutar agentes de Codex y Claude Code. La plataforma permite a los desarrolladores ejecutar agentes de codificación que consumen muchos recursos en computación remota utilizando instantáneas de su entorno de desarrollo completo, evitando las limitaciones del hardware local y los problemas de gestión de árboles de trabajo de git. Boxes.dev cuenta con una aplicación de escritorio, una aplicación móvil, automatizaciones programadas y una integración con Slack.
- • Proporciona computadoras en la nube dedicadas para agentes de Codex y Claude Code.
- • Ejecuta agentes en computación remota utilizando instantáneas del entorno de desarrollo completo.
- • Cuenta con una aplicación de escritorio, aplicación móvil, automatizaciones programadas e integración con Slack.
- • Desarrollado por el ex cofundador/CTO y primer empleado de Gem.
Permite a los desarrolladores ejecutar agentes de codificación que consumen muchos recursos en paralelo sin saturar los árboles de trabajo locales de git ni alcanzar las limitaciones del hardware local.
4. Anthropic libera una implementación de referencia para el descubrimiento de vulnerabilidades mediante IA
Anthropic ha lanzado una implementación de referencia sin mantenimiento para el descubrimiento y remediación autónoma de vulnerabilidades utilizando Claude. El repositorio proporciona un pipeline de múltiples etapas (Construcción, Reconocimiento, Búsqueda, Verificación, Deduplicación, Informe y Parche) que utiliza el sandboxing de gVisor para aislar a los agentes autónomos durante la ejecución. El pipeline está configurado específicamente para encontrar vulnerabilidades de memoria en C/C++ utilizando Docker y ASAN, y es compatible con las API de Claude en Bedrock, Vertex y Azure.
- • Proporciona una implementación de referencia para procesos autónomos de reconocimiento, búsqueda, triaje, informe y parcheo.
- • Utiliza el sandboxing de gVisor para aislar a los agentes autónomos durante la ejecución.
- • Admite las API de Claude, incluyendo Bedrock, Vertex y Azure.
- • Configurado específicamente para encontrar vulnerabilidades de memoria en C/C++ utilizando Docker y ASAN.
- • El repositorio no tiene mantenimiento y no acepta contribuciones.
Proporciona a los desarrolladores una arquitectura de pipeline concreta y de múltiples etapas para construir sus propios agentes autónomos de seguridad y parcheo.
5. Miso Labs lanza MisoTTS 8B, un modelo de voz emotiva con pesos abiertos
Miso Labs ha lanzado MisoTTS, un modelo de texto a voz de 8 mil millones de parámetros con pesos abiertos bajo una licencia MIT modificada. El modelo utiliza una arquitectura de cuantización vectorial residual (RVQ) compuesta por una columna vertebral de 7.7B para la predicción temporal y un decodificador de 300M para la predicción de profundidad. Al condicionarse tanto al texto como al contexto de audio, MisoTTS puede responder dinámicamente al tono de un hablante. Miso Labs afirma una latencia de 110ms, en comparación con los 300ms de Sesame y los 700ms de ElevenLabs, aunque el modelo actualmente está limitado a interacciones semidúplex de un solo turno.
- • Lanzado bajo una licencia MIT modificada con pesos abiertos.
- • Cuenta con 8 mil millones de parámetros (7.7B en la columna vertebral, 300M en el decodificador).
- • Utiliza una arquitectura de cuantización vectorial residual (RVQ) con 32 libros de códigos de audio.
- • Se condiciona al contexto de texto y audio para responder al tono del hablante.
- • Afirma una latencia de 110ms, en comparación con los 300ms de Sesame y los 700ms de ElevenLabs.
Permite a los desarrolladores crear agentes de voz altamente receptivos, con una latencia declarada de 110ms en comparación con los 700ms de ElevenLabs.
6. NVIDIA lanza LocateAnything 3B para localización local de objetos e interfaz de usuario
NVIDIA ha lanzado LocateAnything 3B, un modelo ligero diseñado para ejecutarse localmente para la localización de objetos e interfaz de usuario. El modelo combina la localización, OCR y la comprensión de la interfaz de usuario para localizar instantáneamente objetos, botones o texto basados en descripciones verbales en lenguaje natural. Está optimizado para la implementación local con el fin de admitir la automatización rápida y la interacción con interfaces en el dispositivo.
- • Modelo de 3B de parámetros diseñado para ejecutarse localmente.
- • Combina localización, OCR y comprensión de la interfaz de usuario.
- • Localiza instantáneamente objetos, botones o texto basados en descripciones verbales.
Permite a los desarrolladores crear flujos de trabajo de agentes locales y rápidos que pueden interactuar con interfaces de usuario y documentos sin depender de las API en la nube.
7. BeeLlama v0.3.1 integra funciones de llama.cpp y mejoras de velocidad DFlash
Se han lanzado las versiones 0.3.0 y 0.3.1 de BeeLlama con actualizaciones arquitectónicas para alinearse con el llama.cpp original. La actualización integra funciones como la Predicción de Múltiples Tokens (MTP) y soporte para Gemma 4 12B, mientras mejora DFlash para manejar configuraciones de múltiples ranuras y múltiples GPU. El lanzamiento también añade soporte para la caché KV q6_0 y opciones de cuantización de modelos TQ3_1S y TQ4_1S, proporcionando binarios precompilados e imágenes de Docker para todas las plataformas principales.
- • Se alinea con el llama.cpp original e integra la Predicción de Múltiples Tokens (MTP).
- • Añade soporte para Gemma 4 12B y caché KV q6_0.
- • Mejora DFlash para manejar configuraciones de múltiples ranuras y múltiples GPU.
- • Logra aceleraciones de hasta 4.93 veces para Qwen 3.6 27B y Gemma 4 31B en una sola RTX 3090.
- • Proporciona binarios precompilados e imágenes de Docker para todas las plataformas principales.
Los desarrolladores que ejecutan modelos locales pueden aprovechar aceleraciones de hasta 4.93 veces para Qwen 3.6 27B y Gemma 4 31B en hardware de consumo como una sola RTX 3090.
8. Anthropic detalla la contención de seguridad y el sandboxing para Claude Code
Anthropic ha detallado sus prácticas de seguridad para contener productos de agentes como Claude Code y Claude Cowork. Para mitigar riesgos como el uso indebido por parte del usuario, el comportamiento incorrecto del modelo y ataques externos, Claude Code utiliza sandboxing a nivel de sistema operativo (Seatbelt en macOS y bubblewrap en Linux), lo que ha reducido las solicitudes de permisos en un 84%. Anthropic también reveló vulnerabilidades pasadas donde la configuración local del proyecto se analizaba antes de establecer un límite de confianza, y demostró mediante un ejercicio interno de red-team que un empleado podía ser engañado mediante phishing para exfiltrar credenciales de AWS a través de Claude Code.
- • Claude Code utiliza sandboxing a nivel de sistema operativo (Seatbelt en macOS, bubblewrap en Linux) para reducir las solicitudes de permisos en un 84%.
- • El modo automático de Claude Code está diseñado para detectar aproximadamente el 83% de los comportamientos excesivamente entusiastas de los agentes antes de su ejecución.
- • Reveló vulnerabilidades pasadas donde la configuración local del proyecto se analizaba antes de establecer un límite de confianza del usuario.
- • Un ejercicio interno de red-team demostró que un empleado podía ser engañado mediante phishing para exfiltrar credenciales de AWS a través de Claude Code.
- • Claude Cowork emplea una arquitectura de máquina virtual completa utilizando el framework de virtualización de Apple en macOS o HCS en Windows.
Proporciona un contexto de seguridad crítico para los desarrolladores que ejecutan Claude Code localmente, destacando vulnerabilidades pasadas en configuraciones locales del proyecto y la importancia de la contención a nivel de entorno.
9. Lanzamiento de Gradio 6.16.0 con parches de seguridad y actualizaciones de MCP
Se ha lanzado la versión 6.16.0 de Gradio, introduciendo una función de latido configurable a través de la variable de entorno GRADIO_HEARTBEAT_INTERVAL y actualizando el endpoint MCP para mostrar una página de aterrizaje en el navegador. El lanzamiento implementa parches de seguridad críticos para el recorrido de rutas en gr.FileExplorer, una omisión de redirección abierta en OAuth y SSRF en el post-procesamiento de Imágenes, Galerías y Audio. También incluye correcciones de errores para bloqueos del navegador en Dataframe y Tabs.
- • Parchea el recorrido de rutas en gr.FileExplorer y la omisión de redirección abierta en OAuth.
- • Parchea SSRF en el post-procesamiento de Imágenes, Galerías y Audio.
- • Introduce un latido configurable a través de la variable de entorno GRADIO_HEARTBEAT_INTERVAL.
- • Actualiza el endpoint MCP para mostrar una página de aterrizaje cuando se visita a través de un navegador.
- • Corrige bloqueos del navegador en Dataframe y Tabs.
Los desarrolladores que utilizan Gradio deben actualizar para parchear vulnerabilidades, incluyendo el recorrido de rutas en FileExplorer y SSRF en el post-procesamiento de imágenes/audio.
10. NVIDIA lanza un conjunto de datos de seguridad de agentes para pruebas de inyección de prompts indirecta
NVIDIA ha lanzado un conjunto de datos de seguridad de agentes en Hugging Face que consta de 1,272 registros sintéticos de red-teaming. El conjunto de datos cubre nueve dominios empresariales distintos y está diseñado para probar la capacidad de los agentes que utilizan herramientas para resistir inyecciones de prompts indirectas ocultas dentro de los datos devueltos por las herramientas.
- • Consta de 1,272 registros sintéticos de red-teaming.
- • Cubre nueve dominios empresariales distintos.
- • Diseñado para probar la resistencia a inyecciones de prompts indirectas ocultas en los datos devueltos por las herramientas.
- • Publicado en la plataforma Hugging Face.
Proporciona a los desarrolladores un conjunto de datos concreto para evaluar y fortalecer a sus agentes que utilizan herramientas contra inyecciones de prompts indirectas ocultas en los datos recuperados.
11. Lanzamiento de Higgs Audio v3 TTS 4B para chat de voz multilingüe
Higgs Audio v3 TTS 4B es un modelo de texto a voz construido específicamente para aplicaciones de chat de voz. El modelo admite 100 idiomas e incluye soporte para control en línea, lo que permite a los desarrolladores crear interfaces de audio conversacionales altamente interactivas y multilingües.
- • Modelo de texto a voz de 4B de parámetros.
- • Construido específicamente para aplicaciones de chat de voz.
- • Admite 100 idiomas.
- • Incluye soporte para control en línea.
Proporciona a los desarrolladores un modelo ligero y altamente multilingüe optimizado para interfaces de audio conversacionales en tiempo real.
12. Alibaba lanza Qwen-Image-Flash para una generación de imágenes rápida
Alibaba ha lanzado Qwen-Image-Flash, un modelo diseñado para una generación de texto a imagen rápida y de alta calidad, y edición guiada por instrucciones. El modelo utiliza destilación de pocos pasos, composición de datos, guía del profesor y mezcla de tareas para lograr un alto rendimiento y baja latencia.
- • Diseñado para una generación de texto a imagen rápida y de alta calidad.
- • Admite edición de imágenes guiada por instrucciones.
- • Utiliza destilación de pocos pasos, composición de datos, guía del profesor y mezcla de tareas.
Proporciona una opción ligera y rápida para los desarrolladores que integran capacidades de generación y edición de imágenes en sus aplicaciones.
13. Lanzamiento de SynthTraces para generar trazas de sesiones de agentes de codificación sintéticos
SynthTraces es una nueva base de código mínima diseñada para generar trazas de sesiones de agentes de codificación sintéticos utilizando Pi. El proyecto utiliza un arnés donde un modelo abierto actúa como agente de codificación con acceso de lectura y bash a proyectos de código abierto de Hugging Face, mientras que un pequeño modelo local que se ejecuta en llama.cpp actúa como un usuario humano para solicitar al agente. El proyecto ha generado y publicado más de 2,000 trazas de sesiones en Hugging Face para el entrenamiento o ajuste fino de LLMs.
- • Base de código mínima para generar trazas de sesiones de agentes de codificación sintéticos.
- • Utiliza un modelo abierto como agente de codificación con acceso de lectura y bash.
- • Utiliza un modelo local que se ejecuta en llama.cpp para actuar como un usuario humano.
- • Generó más de 2,000 trazas de sesiones de Pi publicadas en Hugging Face.
Proporciona a los desarrolladores un conjunto de datos de más de 2,000 trazas de sesiones en Hugging Face para entrenar o ajustar sus propios LLMs y agentes de codificación específicos para tareas.