1. MirroS lanza modelos de pesos abiertos Code-as-World para la traducción de video a física
MirroS ha presentado Code-as-World, un marco de trabajo que representa escenas físicas como código ejecutable en lugar de píxeles o subtítulos. Junto con el marco, lanzaron Code-as-World-VL-4B y Code-as-World-VL-9B como modelos de pesos abiertos bajo licencia Apache 2.0. Ajustados a partir de Qwen3.5 y servidos a través de vLLM, el modelo de 9B supera a Gemini-3.1 Flash en el benchmark QuantiPhy. El sistema utiliza MuJoCo como motor de ejecución para verificar la consistencia física a través de cinco rondas iterativas.
- • MirroS lanzó Code-as-World-VL-4B y Code-as-World-VL-9B bajo la licencia Apache 2.0.
- • Los modelos están ajustados a partir de Qwen3.5 y se sirven como safetensors BF16 a través de vLLM.
- • Code-as-World-VL-9B obtuvo una puntuación de 55.4 en el benchmark QuantiPhy, superando la puntuación de 54.8 de Gemini-3.1 Flash.
- • El marco utiliza un bucle agéntico para proponer, instanciar, ejecutar, renderizar y verificar la consistencia física utilizando MuJoCo.
- • La implementación actual se limita a la física de cuerpos rígidos y no integra el bucle de descubrimiento dentro del propio modelo.
Los desarrolladores pueden extraer representaciones del mundo físico estructuradas y ejecutables a partir de archivos de video utilizando modelos con licencia Apache 2.0.
2. Claude Code añade URLs de sesión a los commits de Git por defecto
Los desarrolladores han descubierto que Claude Code añade automáticamente URLs de sesión a todos los mensajes de commit de git y descripciones de pull requests por defecto. Este comportamiento ocurre sin un aviso explícito de aceptación o advertencia durante la configuración inicial. Para evitar que estas URLs saturen el historial de git o expongan detalles de la sesión, los desarrolladores pueden desactivar manualmente la función modificando el ajuste attribution.commit en su archivo .claude/settings.json.
- • Claude Code añade automáticamente una URL de sesión a cada mensaje de commit y descripción de PR sin un aviso de aceptación.
- • Los usuarios informan que la inclusión automática de URLs satura el historial de git y parece poco profesional para colaboradores externos.
- • El comportamiento puede suprimirse estableciendo 'attribution.commit' en false en el archivo '.claude/settings.json'.
- • El ajuste no es fácilmente descubrible durante la configuración inicial o el primer uso.
Los desarrolladores deben desactivar manualmente este ajuste para evitar que las URLs de sesión internas se expongan en historiales públicos de git.
3. Anthropic restablece las sesiones de Claude tras ataques de malware infostealer
Anthropic ha tomado medidas de protección tras descubrir que malware infostealer en las computadoras de algunos usuarios secuestró con éxito sesiones de inicio de sesión activas de Claude. Para mitigar el impacto del uso no autorizado y los cargos indebidos, Anthropic cerró la sesión de los usuarios afectados, eliminó los métodos de pago guardados y emitió reembolsos. Se recomienda a los desarrolladores asegurarse de que sus entornos de desarrollo locales estén protegidos contra malware de robo de sesiones.
- • Anthropic emitió una advertencia a los usuarios de Claude sobre malware infostealer local.
- • El malware secuestró con éxito sesiones de inicio de sesión activas de Claude desde las computadoras de los usuarios para agotar el uso.
- • Anthropic respondió cerrando la sesión de los usuarios afectados, eliminando métodos de pago guardados y emitiendo reembolsos.
Los desarrolladores que utilizan Claude deben asegurar sus entornos locales para evitar el secuestro de sesiones que podría derivar en uso no autorizado de la API y cargos financieros.
4. Google lanza EnvHarness para adaptar benchmarks de agentes estáticos para entrenamiento
Google Cloud AI Research, en colaboración con socios académicos, ha lanzado EnvHarness bajo una licencia Apache-2.0. EnvHarness es una capa programable diseñada para adaptar benchmarks de agentes estáticos para el entrenamiento de políticas sin modificar los simuladores subyacentes. Utiliza un diseñador basado en LLM llamado EnvRigger para diagnosticar fallos en las políticas y generar envoltorios específicos. En cinco benchmarks, incluido SWE-bench Verified, la herramienta mejoró el rendimiento de los agentes hasta en 9.0 puntos y redujo los pasos de ejecución en casi un 10%.
- • EnvHarness envuelve entornos existentes utilizando componentes plug-in a través de una interfaz estándar de step/reset.
- • La herramienta utiliza EnvRigger, un diseñador basado en LLM, para diagnosticar fallos en las políticas y escribir envoltorios específicos.
- • Proporciona tres componentes de modificación: Stage (reproduce acciones), Contract (instala hooks por paso) y Chain (compone entornos).
- • La herramienta se lanza bajo una licencia Apache-2.0 pero excluye cuentas de usuario reales o robots físicos.
- • Las pruebas en SWE-bench Verified y ALFWorld mostraron mejoras de hasta 9.0 puntos y una reducción del 9.8% en los pasos de ejecución.
Los desarrolladores pueden diagnosticar automáticamente fallos en las políticas y envolver entornos de agentes existentes para mejorar el rendimiento.
5. Un benchmark muestra que los VLM abiertos Gemma 4 y Qwen igualan a Gemini Flash en datos egocéntricos
Hebbian-Robotics ha publicado una evaluación de modelos de visión-lenguaje (VLM) de pesos abiertos que procesan datos egocéntricos utilizando la herramienta HFlow. Las pruebas en el conjunto de datos Egocentric-10k revelaron que Gemma 4 26B-A4B y Qwen 3.8 27B funcionan casi a la par con una línea base de Gemini 2.5 Flash. Cabe destacar que Gemma 4 logró resultados comparables siendo 19 veces más barato, lo que hace que los VLM abiertos autohospedados sean altamente prácticos para el procesamiento de datos privado y de alto rendimiento.
- • Hebbian-Robotics evaluó VLM de pesos abiertos en el conjunto de datos Egocentric-10k utilizando la herramienta HFlow.
- • Gemma 4 26B-A4B logró un 90.87% de concordancia con la línea base de Gemini 2.5 Flash (91.65%) siendo 19 veces más barato.
- • Qwen 3.8 27B obtuvo 90.79% y GLM 5.3 Flash obtuvo 91.00% en la misma evaluación.
- • El estudio destaca el costo, el rendimiento, la fiabilidad de la salida y la facilidad de autohospedaje como los principales diferenciadores para los VLM abiertos modernos.
Los desarrolladores pueden autohospedar Gemma 4 o Qwen 3.8 para el procesamiento privado de video e imágenes de alto rendimiento a un costo 19 veces menor que las APIs comerciales.