1. Mistral AI lanza Leanstral 1.5 para la verificación de código en Lean 4
El nuevo Leanstral 1.5 de Mistral AI es un modelo de mezcla de expertos con 119B de parámetros totales y 6.5B de parámetros activos por token. El modelo cuenta con una longitud de contexto de 256k tokens y admite entradas multimodales. Fue entrenado mediante un proceso de tres etapas que consiste en entrenamiento intermedio, ajuste fino supervisado y aprendizaje por refuerzo con CISPO. En pruebas del mundo real en 57 repositorios, el modelo identificó con éxito 11 errores genuinos, cinco de los cuales no habían sido reportados previamente en GitHub. Está disponible a través de pesos en Hugging Face, una API gratuita o mediante alojamiento propio con vLLM 0.24.0 o superior.
- • Mistral AI lanzó Leanstral 1.5 bajo la licencia Apache 2.0, disponible a través de pesos en Hugging Face, una API gratuita o alojamiento propio con vLLM 0.24.0+.
- • El modelo es una arquitectura de mezcla de expertos con 119B de parámetros totales y 6.5B de parámetros activos por token.
- • Cuenta con una longitud de contexto de 256k tokens y admite entradas multimodales, incluyendo texto e imágenes.
- • Leanstral 1.5 logró una tasa de éxito del 100% en el benchmark miniF2F y resolvió 587 de 672 problemas en PutnamBench.
- • En pruebas del mundo real en 57 repositorios, el modelo identificó 11 errores genuinos, incluyendo 5 que no habían sido reportados previamente en GitHub.
Los desarrolladores pueden utilizar este modelo de pesos abiertos o su API gratuita para automatizar la verificación de la corrección del software e identificar errores en sus bases de código.
2. Interfaze lanza el modelo ASR de difusión de audio multilingüe de código abierto
Interfaze ha liberado como código abierto diffusion-gemma-asr-small, descrito como el primer modelo ASR de difusión de audio multilingüe de código abierto. Admite inglés, alemán, francés, español, hindi y mandarín. El modelo consiste en un adaptador de ~42M de parámetros entrenado sobre una base DiffusionGemma congelada de 26B de parámetros, utilizando un codificador Whisper congelado como extractor de características. A diferencia de la mayoría de los LLM de difusión, emplea difusión uniforme de tokens aleatorios, lo que significa que el costo de transcripción escala con el número de pasos de eliminación de ruido en lugar de la longitud de la transcripción. El adaptador se lanza bajo la licencia Apache-2.0.
- • Interfaze liberó como código abierto diffusion-gemma-asr-small, un modelo ASR de difusión de audio multilingüe que admite inglés, alemán, francés, español, hindi y mandarín.
- • El modelo utiliza un adaptador de ~42M de parámetros entrenado sobre una base DiffusionGemma congelada de 26B de parámetros.
- • Emplea difusión uniforme de tokens aleatorios y un codificador Whisper congelado como extractor de características.
- • El costo de transcripción escala con el número de pasos de eliminación de ruido en lugar de la longitud de la transcripción.
- • El adaptador se lanza bajo la licencia Apache-2.0, mientras que los modelos subyacentes están sujetos a sus propias licencias.
- • Los benchmarks en LibriSpeech muestran que supera a otros modelos ASR basados en difusión, pero queda por detrás de los modelos Whisper autorregresivos.
Los desarrolladores obtienen un modelo de voz a texto de código abierto y no autorregresivo donde los costos de transcripción escalan con los pasos de eliminación de ruido en lugar de la longitud de la transcripción.
3. Wafer ejecuta GLM 5.2 en AMD MI355X con el doble de eficiencia de costos que Blackwell
Wafer logró un rendimiento agregado de 2626 tok/s/nodo y un rendimiento de flujo único de 213 tok/s para el modelo GLM 5.2 en hardware AMD MI355X. Este rendimiento de inferencia se logró a un costo más de dos veces menor que el hardware comparable NVIDIA Blackwell. Wafer utilizó el framework de inferencia sglang y cuantizó el modelo GLM-5.2 a MXFP4 usando AMD Quark. El equipo implementó dos correcciones específicas en la imagen ROCm de sglang para habilitar la decodificación especulativa, lo que resultó en una ganancia de casi 3x en el rendimiento de flujo único, y mejoró el rendimiento de prellenado ajustando manualmente la selección del kernel MoE para las formas fp4 de GLM-5.2.
- • Wafer logró un rendimiento agregado de 2626 tok/s/nodo y un rendimiento de flujo único de 213 tok/s para GLM 5.2 en AMD MI355X.
- • El rendimiento de inferencia se logró a un costo más de dos veces menor que el hardware comparable NVIDIA Blackwell.
- • La configuración utilizó el framework de inferencia sglang y cuantizó el modelo GLM-5.2 a MXFP4 usando AMD Quark.
- • El equipo implementó dos correcciones en la imagen ROCm de sglang para habilitar la decodificación especulativa, obteniendo una ganancia de casi 3x en el rendimiento de flujo único.
- • El rendimiento de prellenado se mejoró ajustando manualmente la selección del kernel MoE para las formas fp4 de GLM-5.2.
Los desarrolladores que buscan optimizar los costos de inferencia pueden aprovechar el hardware AMD MI355X y sglang para lograr un rendimiento de alto flujo a una fracción del costo de los chips más recientes de NVIDIA.
4. Lanzamiento de Laguna XS 2.1 para codificación agentica y tareas de largo alcance
Laguna XS 2.1 está optimizado específicamente para la codificación agentica y tareas de largo alcance. El modelo logró una mejora de 5.4 puntos en el benchmark SWE-bench Multilingual, resultando en una puntuación del 63.1%. Se lanza bajo la licencia OpenMDW-1.1 y está disponible para descarga en Hugging Face o a través de una API. Para apoyar el despliegue eficiente en recursos, el lanzamiento incluye tres puntos de control cuantizados.
- • Laguna XS 2.1 es un modelo de mezcla de expertos de 33B de parámetros optimizado para la codificación agentica.
- • El modelo logró una puntuación del 63.1% en el benchmark SWE-bench Multilingual, lo que representa una mejora de 5.4 puntos.
- • Se lanza bajo la licencia OpenMDW-1.1 y está disponible en Hugging Face o a través de una API.
- • Se proporcionan tres puntos de control cuantizados para apoyar el despliegue eficiente en recursos.
Los desarrolladores obtienen una nueva opción de modelo de codificación de pesos abiertos que mejora el rendimiento de la ingeniería de software multilingüe y ofrece puntos de control cuantizados para un despliegue local eficiente en recursos.
5. Micro-World lanza un modelo de mundo interactivo controlado por acciones
Micro-World es un modelo de mundo interactivo controlado por acciones diseñado para generar escenas de dominio abierto de alta calidad. Construido sobre la familia de modelos Wan2.1, el proyecto incluye variantes de imagen a mundo (I2W) y texto a mundo (T2W). El modelo T2W utiliza ControlNet para la inyección de acciones, mientras que el modelo I2W utiliza adaLN para su huella de parámetros ligera. El proyecto ha liberado pesos del modelo, código completo de entrenamiento e inferencia, y un conjunto de datos curado en GitHub.
- • Micro-World es un modelo de mundo interactivo controlado por acciones diseñado para generar escenas de dominio abierto.
- • El modelo está construido sobre la familia Wan2.1 e incluye variantes de imagen a mundo (I2W) y texto a mundo (T2W).
- • El modelo T2W utiliza ControlNet para la inyección de acciones, mientras que el modelo I2W utiliza adaLN para una huella de parámetros ligera.
- • El proyecto ha liberado pesos del modelo, código completo de entrenamiento e inferencia, y un conjunto de datos curado en GitHub.
Los desarrolladores pueden usar estos pesos de código abierto y el código de entrenamiento para construir funciones interactivas de generación de video o escenas controladas por acciones.
6. Portugal lanza el LLM de pesos abiertos AMALIA 9B
El gobierno portugués ha anunciado el lanzamiento del LLM AMALIA, un modelo de 9B de parámetros. El modelo está disponible tanto en versiones SFT como DPO (Optimización de Preferencia Directa) en Hugging Face. El proyecto LLM AMALIA se lanza bajo una licencia Apache 2.0, y un artículo de investigación que detalla el modelo está disponible en arXiv bajo el identificador 2603.26511.
- • El gobierno portugués lanzó el LLM AMALIA, un modelo de 9B de parámetros.
- • El modelo está disponible tanto en versiones SFT como DPO (Optimización de Preferencia Directa) en Hugging Face.
- • Se lanza bajo la licencia Apache 2.0.
- • Un artículo de investigación que detalla el modelo está disponible en arXiv (identificador 2603.26511).
Los desarrolladores tienen acceso a un nuevo modelo de 9B con licencia Apache 2.0 optimizado con SFT y DPO para despliegue local o ajuste fino.
7. Meituan-Longcat publica los pesos del modelo LongCat 2.0 FP8 e INT8
Meituan-longcat ha publicado los pesos del modelo para dos versiones cuantizadas de su modelo LongCat 2.0. Tanto los pesos del modelo LongCat-2.0-INT8 como los de LongCat-2.0-FP8 ya están disponibles para su descarga en la plataforma Hugging Face.
- • Meituan-longcat publicó los pesos del modelo LongCat-2.0-INT8 en Hugging Face.
- • Meituan-longcat también publicó los pesos del modelo LongCat-2.0-FP8 en Hugging Face.
Los desarrolladores ahora pueden descargar y ejecutar versiones cuantizadas del modelo LongCat 2.0 localmente o en sus propios pipelines de inferencia.
8. El proxy pxpipe reduce los costos de tokens de Claude Code al convertir el contexto en imágenes
pxpipe es un proxy local que reduce los costos de tokens de entrada de Claude Code al convertir contextos voluminosos como prompts del sistema, documentación de herramientas e historial antiguo en imágenes PNG compactas. El sistema aprovecha el hecho de que los costos de tokens de imagen son fijos según las dimensiones de los píxeles, lo que permite que el contenido denso como código y JSON se represente de manera más eficiente que como texto. Está ajustado principalmente para el modelo Claude Fable 5, que logra 100/100 en benchmarks de lectura para contenido en imágenes. La herramienta tiene pérdida, lo que significa que la recuperación textual exacta para elementos como ID, hashes o secretos no es confiable cuando se almacena en contenido de imagen.
- • pxpipe es un proxy local que convierte contextos voluminosos (prompts del sistema, documentación de herramientas, historial) en imágenes PNG compactas para reducir los costos de tokens de entrada de Claude Code.
- • La herramienta aprovecha los costos fijos de tokens de imagen basados en dimensiones de píxeles, reduciendo las facturas de tokens de extremo a extremo en aproximadamente un 59% a 70%.
- • Está ajustado principalmente para el modelo Claude Fable 5, que obtuvo 100/100 en benchmarks de lectura para contenido en imágenes.
- • La herramienta tiene pérdida, lo que hace que la recuperación textual exacta para elementos como ID, hashes o secretos no sea confiable.
- • En pruebas de SWE-bench Pro, las instancias habilitadas con pxpipe lograron una tasa de resolución de 14/19 en comparación con 15/19 para el grupo de control.
- • Los usuarios pueden desplegar el proxy usando `npx pxpipe-proxy` y apuntar Claude Code hacia él a través de la variable de entorno `ANTHROPIC_BASE_URL`.
Los desarrolladores pueden reducir significativamente sus facturas de API al usar Claude Code aprovechando los precios fijos de tokens de imagen, aunque la recuperación textual exacta para secretos no es confiable.
9. Apple introduce el servidor Safari MCP para la depuración web automatizada
Safari Technology Preview 247 de Apple introduce el servidor Safari MCP, un servidor de Protocolo de Contexto de Modelo diseñado para desarrolladores web. El servidor permite que los agentes compatibles con MCP se conecten a una ventana del navegador Safari para depurar y solucionar problemas de aplicaciones web. Los agentes conectados pueden acceder a datos del navegador, incluyendo el DOM, solicitudes de red, capturas de pantalla y salida de consola. La herramienta opera completamente en la máquina local, transmitiendo los datos capturados directamente al agente en lugar de a Apple, y no accede a datos personales del navegador como el autorrelleno.
- • Safari Technology Preview 247 introduce el servidor Safari MCP para desarrolladores web.
- • El servidor permite que los agentes compatibles con MCP se conecten a una ventana del navegador Safari para depurar y solucionar problemas de aplicaciones web.
- • Los agentes conectados pueden acceder a datos del navegador, incluyendo el DOM, solicitudes de red, capturas de pantalla y salida de consola.
- • La herramienta opera completamente en la máquina local, transmitiendo los datos capturados directamente al agente en lugar de a Apple.
- • Para usarlo, los desarrolladores deben instalar Safari Technology Preview y habilitar la automatización remota y agentes externos en la configuración del navegador.
Los desarrolladores ahora pueden permitir que los agentes de IA inspeccionen de forma autónoma el DOM, las solicitudes de red, las capturas de pantalla y los registros de consola en Safari para automatizar la depuración de aplicaciones web.
10. Cognition lanza Devin Security Swarm para la detección de vulnerabilidades en toda la base de código
Cognition ha lanzado Devin Security Swarm, una herramienta especializada diseñada para identificar vulnerabilidades de seguridad dentro de bases de código complejas. El sistema está construido sobre una arquitectura novedosa llamada MapReduce Agentico, que permite el razonamiento sobre toda la base de código. El proceso mapea señales a través de un repositorio, distribuye tareas a agentes sobre fragmentos delimitados, reduce los hallazgos en un solo informe y verifica las vulnerabilidades en entornos aislados. Cognition ha publicado documentación técnica que detalla la arquitectura.
- • Cognition introdujo Devin Security Swarm para identificar vulnerabilidades de seguridad dentro de bases de código complejas.
- • El sistema utiliza una nueva arquitectura de "MapReduce Agentico" para realizar razonamiento sobre toda la base de código.
- • El proceso mapea señales a través de un repositorio, distribuye tareas a agentes sobre fragmentos delimitados, reduce los hallazgos en un solo informe y verifica las vulnerabilidades en entornos aislados.
- • Cognition ha publicado documentación técnica que detalla la arquitectura de MapReduce Agentico.
Los desarrolladores pueden aprovechar este sistema agentico para escanear automáticamente repositorios completos, mapear posibles fallas de seguridad y verificarlas en entornos aislados.
11. mcpsnoop se lanza como un depurador TUI en vivo para el tráfico del Protocolo de Contexto de Modelo
mcpsnoop es una herramienta de proxy transparente diseñada para depurar el tráfico del Protocolo de Contexto de Modelo (MCP) entre clientes y servidores de IA. La herramienta opera situándose en la ruta de datos, permitiendo a los usuarios ver marcos JSON-RPC en vivo en una interfaz de terminal. Las características clave incluyen detección de llamadas colgadas, inspección de capacidades, búsqueda de marcos y la capacidad de reproducir llamadas de herramientas capturadas. Los usuarios pueden integrar mcpsnoop envolviendo su comando de servidor en la configuración MCP del cliente o ejecutándolo como un proxy inverso para servidores HTTP transmitibles.
- • mcpsnoop es una herramienta de proxy transparente que se sitúa en la ruta de datos para depurar el tráfico MCP entre clientes y servidores de IA.
- • La herramienta muestra marcos JSON-RPC en vivo en una interfaz de terminal y admite búsqueda de marcos, inspección de capacidades y detección de llamadas colgadas.
- • Permite a los desarrolladores reproducir llamadas de herramientas capturadas para probar el comportamiento del servidor.
- • La instalación es compatible a través de `go install` o Homebrew, y el proyecto se encuentra actualmente en estado pre-1.0.
- • Solo ejecuta servidores especificados en la configuración del cliente del usuario.
Los desarrolladores que construyen servidores MCP pueden inspeccionar fácilmente marcos JSON-RPC en vivo, detectar llamadas colgadas y reproducir llamadas de herramientas para agilizar la depuración.
12. WebBrain se lanza como un agente de navegador de IA de código abierto y centrado en lo local
WebBrain es un agente de navegador de IA gratuito y de código abierto para Chrome y Firefox creado por Emre Sokullu y licenciado bajo MIT. Operando dentro del panel lateral del navegador, el agente puede ejecutarse completamente en modelos locales (como llama.cpp y Ollama) o conectarse a API en la nube, con Qwen 3.6 35B recomendado para un rendimiento óptimo. Cuenta con dos modos: modo Ask para tareas de solo lectura y modo Act para interactuar con páginas a través del Protocolo de DevTools de Chrome. WebBrain está diseñado con un enfoque de seguridad primero, requiriendo aprobación para acciones consecuentes y utilizando la interfaz de usuario visible para mutaciones en lugar de llamadas directas a la API.
- • WebBrain es un agente de navegador de IA gratuito y de código abierto para Chrome y Firefox licenciado bajo MIT.
- • El agente opera en el panel lateral del navegador y admite modelos locales (llama.cpp, Ollama) o API en la nube, recomendando Qwen 3.6 35B.
- • Cuenta con modo "Ask" para tareas de solo lectura y modo "Act" para interactuar con páginas a través del Protocolo de DevTools de Chrome.
- • Utiliza un enfoque de seguridad primero, requiriendo aprobación para acciones consecuentes y utilizando la interfaz de usuario visible para mutaciones.
- • Una opción gestionada, WebBrain Cloud, está disponible por $5 al mes por perfil de dispositivo.
Los desarrolladores pueden usar o personalizar este agente de código abierto para automatizar flujos de trabajo basados en el navegador localmente utilizando modelos como Ollama o llama.cpp.
13. El equipo de SGLang estandariza los flujos de trabajo de agentes en libros de jugadas reutilizables
El equipo de SGLang está estandarizando sus procesos de desarrollo de agentes convirtiendo los flujos de trabajo en activos reutilizables. Estos activos incluyen archivos SKILL.md, contratos de benchmark, bucles de revisión y libros de jugadas de depuración de producción. El equipo define el valor de los agentes como conocimiento de ingeniería procedimental que es capaz de ser ejecutado, probado y revisado.
- • El equipo de SGLang está convirtiendo los flujos de trabajo de agentes en archivos SKILL.md reutilizables y contratos de benchmark.
- • La iniciativa incluye bucles de revisión y libros de jugadas de depuración de producción.
- • El equipo define el valor de los agentes como conocimiento de ingeniería procedimental que puede ser ejecutado, probado y revisado.
Los desarrolladores obtienen un framework estructurado y ejecutable para la ingeniería, prueba y revisión de flujos de trabajo agenticos dentro del ecosistema SGLang.
14. llama.cpp añade un muestreador experimental de dispersión de partículas
El muestreador de dispersión es una característica experimental añadida a llama.cpp que suaviza la distribución de probabilidad del siguiente token entre los candidatos top-K. Está diseñado para reducir la rigidez de la generación sin los efectos secundarios de aumentar la temperatura, como atraer tokens de cola débiles. El muestreador opera después de que otros filtros como top-K, top-P, min-P y XTC hayan definido el medio candidato, utilizando un kernel de suavizado gaussiano basado en la distancia de rango para redistribuir la masa de probabilidad entre los candidatos sobrevivientes más fuertes. Está deshabilitado por defecto y posicionado en la cadena de muestreador predeterminada entre XTC y la temperatura.
- • llama.cpp añadió un "muestreador de dispersión" experimental que suaviza las distribuciones de probabilidad del siguiente token entre los candidatos top-K.
- • El muestreador utiliza un kernel de suavizado gaussiano basado en la distancia de rango para redistribuir la masa de probabilidad entre los candidatos sobrevivientes más fuertes.
- • Opera después de otros filtros (como top-K, top-P, min-P y XTC) y se posiciona entre XTC y la temperatura.
- • Las características opcionales incluyen fuerza adaptativa basada en entropía, absorción de tokens repetidos y control de colisiones.
- • El muestreador está deshabilitado por defecto y se recomienda para escritura creativa, pero no para tareas estrictas de codificación o matemáticas.
Los desarrolladores pueden usar este muestreador para reducir la rigidez en generaciones creativas o de juego de roles mientras evitan tokens de cola débiles, aunque es arriesgado para tareas estrictas de codificación o matemáticas.
15. Tutorial detalla el pipeline de extracción de facturas guiado por esquema usando lift-pdf
Un nuevo tutorial demuestra un pipeline de extracción de cuentas por pagar de extremo a extremo utilizando lift-pdf para convertir facturas PDF sintéticas en JSON estructurado. El pipeline enmarca el análisis de facturas como comprensión de documentos guiada por esquema, apuntando a campos como identidad del proveedor, números de orden de compra, partidas y estado de pago. La implementación utiliza carga de modelos consciente de GPU con cuantización NF4 de 4 bits opcional y un InferenceManager reutilizable para optimizar el rendimiento. Las facturas sintéticas se generan utilizando ReportLab para garantizar la consistencia matemática, y el pipeline incluye un paso de validación que calcula la precisión a nivel de campo y convierte los datos extraídos en un libro mayor de cuentas por pagar basado en pandas.
- • El tutorial demuestra un pipeline de extracción de cuentas por pagar de extremo a extremo utilizando lift-pdf para convertir facturas PDF sintéticas en JSON estructurado.
- • El pipeline apunta a campos como identidad del proveedor, números de orden de compra, partidas y estado de pago, abordando desafíos como separar el subtotal de los totales después de impuestos.
- • La implementación utiliza carga de modelos consciente de GPU con cuantización NF4 de 4 bits opcional y un InferenceManager reutilizable.
- • Incluye un paso de validación que calcula la precisión a nivel de campo y convierte los datos extraídos en un libro mayor de cuentas por pagar basado en pandas.
- • El tutorial se proporciona como un cuaderno de Colab reproducible.
Los desarrolladores pueden implementar este patrón para construir pipelines de inteligencia documental altamente precisos que manejen desafíos de extracción complejos como distinguir direcciones de facturación.
16. Lanzamiento de CursorBench 3.1 para evaluar agentes de IA en tareas del mundo real
CursorBench 3.1 ha sido lanzado como un benchmark diseñado para evaluar el rendimiento de los agentes de IA. El benchmark prueba a los agentes utilizando tareas ambiguas de múltiples archivos. Todas las tareas provienen de sesiones de usuario reales de Cursor, proporcionando un entorno de evaluación realista para herramientas de codificación agentica.
- • CursorBench 3.1 es un benchmark diseñado para evaluar el rendimiento de los agentes de IA.
- • El benchmark prueba a los agentes utilizando tareas ambiguas de múltiples archivos.
- • Todas las tareas provienen de sesiones de usuario reales de Cursor.
Los desarrolladores pueden usar este benchmark para medir qué tan efectivamente sus agentes de codificación manejan escenarios complejos, de múltiples archivos y ambiguos del mundo real.