Inference Brew

Qwen 3.8 27B realiza ingeniería inversa con éxito de código arm64 en 30 minutos

00:00 / --:--

← Volver al inicio

Qwen 3.8 27B realiza ingeniería inversa con éxito de código arm64 en 30 minutos

1. Qwen 3.8 27B realiza ingeniería inversa con éxito de código arm64 en 30 minutos

Qwen 3.8 27B, que ocupa el primer lugar en la clase de tamaño de 4B a 40B en el índice de inteligencia de Artificial Analysis, realizó con éxito la ingeniería inversa de la verificación de licencia de una aplicación comercial. Operando en una Lenovo ThinkStation PGX con un chip Nvidia GB10 Grace Blackwell, el modelo realizó un análisis estático de código arm64, identificó y corrigió sus propios errores, recuperó una clave RSA oculta y creó una derivación de autenticación funcional en 30 minutos. El modelo también demostró la capacidad de reconocer y rechazar intentos iniciales de jailbreak antes de auditar el código.

  • • Qwen 3.8 27B se clasifica como el modelo superior en la clase de tamaño de 4B a 40B en el índice de inteligencia de Artificial Analysis con una puntuación de 52.
  • • El modelo realizó con éxito la ingeniería inversa de la verificación de licencia de una aplicación comercial utilizando análisis estático de código arm64.
  • • Durante el proceso de 30 minutos, el modelo identificó y corrigió sus propios errores para recuperar una clave RSA oculta y omitir la autenticación.
  • • El rendimiento alcanzó hasta 50 tokens por segundo en un chip Nvidia GB10 Grace Blackwell utilizando SGLang, NVFP4 y decodificación especulativa DFlash2.

Esto demuestra la capacidad del modelo para realizar razonamientos complejos de varios pasos y autocorrección de forma local, desbloqueando flujos de trabajo avanzados de auditoría de seguridad.

SOURCES

2. Vercel lanza 'fx', un agente de codificación basado en Zig

Vercel ha lanzado `fx`, un agente de codificación ligero y rápido escrito en Zig. Este lanzamiento coincide con un cambio más amplio en la industria donde los LLMs están reduciendo la barrera de entrada para lenguajes de programación de sistemas complejos como Rust y Zig. Los desarrolladores utilizan cada vez más la IA para ayudar con la optimización del rendimiento y para navegar por tecnologías de bajo nivel como eBPF, archivos DWARF y controladores de red personalizados. Por ejemplo, el servicio Artifacts de Cloudflare ahora ejecuta un motor de protocolo Git en Zig puro compilado en un módulo WebAssembly de 100 KB.

  • • Vercel lanzó fx, un agente de codificación basado en Zig comercializado por su pequeño tamaño y alta velocidad.
  • • El servicio Artifacts de Cloudflare utiliza un motor de protocolo Git en Zig puro compilado en un módulo WebAssembly de 100 KB.
  • • Los LLMs están reduciendo la barrera de entrada para lenguajes complejos como Rust y Zig, permitiendo a los desarrolladores confiar en la IA para la optimización del rendimiento.
  • • La asistencia de IA está permitiendo a los desarrolladores trabajar con tecnologías complejas como eBPF, archivos DWARF y criptografía personalizada.

El lanzamiento de fx proporciona a los desarrolladores un agente de codificación altamente optimizado y de baja sobrecarga que aprovecha la velocidad y la pequeña huella de Zig.

SOURCES

3. Claude Code con Opus 5 supera a Qwen 3.8 27B en la migración de código a gran escala

Un experimento comparó el modelo local Qwen 3.8 27B frente a Opus 5 en la migración de un archivo C de 2.1MB (39,000 líneas) a un proyecto HTML/three.js de un solo archivo utilizando un único prompt. Claude Code ejecutando Opus 5 completó la tarea en 21 minutos con una calidad 'aceptable'. Por el contrario, Qwen 3.8 27B ejecutándose localmente mediante FP8 en vLLM tardó 4 horas y 18 minutos en el arnés Hermes, y 1 hora y 40 minutos en el arnés Codehamr, produciendo ambas ejecuciones locales una salida de 'mala' calidad.

  • • Claude Code utilizando Opus 5 completó la migración del archivo C de 2.1MB en 21 minutos, produciendo 1759 líneas de salida de calidad 'aceptable'.
  • • Qwen 3.8 27B ejecutándose en el arnés Hermes tardó 4 horas y 18 minutos en producir 949 líneas de salida de 'mala' calidad.
  • • El arnés Codehamr ejecutando Qwen 3.8 27B completó la tarea en 1 hora y 40 minutos, produciendo 1056 líneas de salida de 'mala' calidad.
  • • La configuración local de Qwen 3.8 27B utilizó FP8 en vLLM con una GPU RTX 6000 Pro de 96GB.

Este benchmark destaca los límites de rendimiento entre los modelos locales y las APIs de frontera al ejecutar migraciones de bases de código complejas mediante un solo prompt.

SOURCES

4. Entendiendo los arneses de agentes y el framework de código abierto Pi

Los arneses de agentes están emergiendo como un patrón arquitectónico clave, proporcionando un entorno estructurado para que los modelos de IA operen como agentes. Por lo general, compuestos por un prompt del sistema, herramientas, un bucle agéntico y una capa de traducción, los arneses permiten a los desarrolladores intercambiar modelos de varios proveedores o ejecutar modelos de pesos abiertos localmente. Pi, desarrollado por Earendil, es un arnés gratuito de código abierto que se ejecuta localmente en una computadora portátil y cuenta con más de 5,000 extensiones compartidas por la comunidad para maximizar la agencia del usuario.

  • • Un arnés de agente consiste en un prompt del sistema, un conjunto de herramientas, un bucle agéntico y una capa de traducción para la compatibilidad del modelo.
  • • La capa de traducción permite a los desarrolladores intercambiar modelos de diferentes proveedores (por ejemplo, Anthropic, OpenAI) o utilizar modelos de pesos abiertos.
  • • Pi es un arnés de agente gratuito de código abierto que se ejecuta localmente en una computadora portátil y admite más de 5,000 extensiones compartidas por la comunidad.
  • • Los arneses pueden ser propiedad total, personalizados y ejecutados localmente en el propio hardware del usuario.

Los arneses brindan a los desarrolladores propiedad total y control local sobre la ejecución del agente, desacoplando el bucle agéntico de los proveedores de API propietarios.

SOURCES

5. DeepSeek Harness permite la mensajería de agentes cifrada basada en TOR

DeepSeek Harness (DSH) ha ganado terreno por su configuración progresiva, sin frustraciones y su diseño imparcial. La herramienta cuenta con una interfaz web para registros fáciles y permite la mensajería cifrada de extremo a extremo basada en TOR con agentes de IA. En una implementación reciente, un desarrollador integró con éxito DSH con SimpleX instruyendo a la IA para realizar la integración directamente, demostrando la flexibilidad de la herramienta sin requerir solicitudes de extracción manuales o complementos de la comunidad.

  • • DeepSeek Harness (DSH) cuenta con una interfaz web para registros fáciles y un proceso de configuración progresivo y sin frustraciones.
  • • DSH permite la mensajería cifrada de extremo a extremo y basada en TOR con un agente de IA.
  • • Un usuario integró con éxito DSH con SimpleX dirigiendo a la IA para realizar la integración directamente, evitando solicitudes de extracción o complementos de la comunidad.
  • • DSH es imparcial, lo que permite a los desarrolladores personalizar completamente su comportamiento.

Esta herramienta proporciona a los desarrolladores un entorno de agente imparcial y altamente personalizable que prioriza la privacidad y la comunicación segura desde el primer momento.

SOURCES

6. Qwen 3.8 27B NVFP4 alcanza 120 tok/s con 451K KV-Cache en RTX 5090

Un desarrollador configuró con éxito el modelo Qwen 3.8 27B NVFP4 para ejecutarse en una NVIDIA RTX 5090 con potencia limitada (400W) utilizando vLLM. Ejecutándose en Linux (Bazzite) con la interfaz de usuario desactivada para maximizar la utilización de memoria al 0.98, el sistema admite un contexto de 196K por sesión y una KV-cache global de 451K con concurrencia habilitada para tres sesiones paralelas. La configuración alcanza una velocidad promedio de 120 tokens por segundo, con benchmarks validados a través de llama-benchy 0.4.0.

  • • La configuración admite una ventana de contexto de 196K por sesión y una KV-cache global de 451K en tres sesiones paralelas.
  • • El sistema alcanza una velocidad de generación promedio de 120 tokens por segundo en una NVIDIA RTX 5090 con potencia limitada (400W).
  • • El entorno se ejecuta en Linux (Bazzite) con la interfaz de usuario desactivada para lograr una utilización de memoria de 0.98.
  • • Los benchmarks de rendimiento se realizaron utilizando llama-benchy 0.4.0 en longitudes de contexto de 4K a 185K.

Esta configuración demuestra cómo los desarrolladores pueden ejecutar ventanas de contexto masivas y sesiones paralelas localmente en hardware de consumo.

SOURCES

7. Lanzamiento de cuantizaciones GGUF dinámicas atómicas para Qwen 3.8 27B

El equipo de Atomic Chat ha lanzado cuantizaciones GGUF dinámicas (AD) para el modelo Qwen 3.8 27B, evaluándolas en una RTX PRO 6000 utilizando una tarea de creación de islas de vóxeles. El equipo recomienda la variante AD-Q6_K (25.0 GB) como la opción más segura, obteniendo un 98.7% de precisión top-1 en comparación con BF16 a 49 tokens por segundo. Para restricciones de memoria más estrictas, la variante AD-Q4_K_M reduce el tamaño a 17.1 GB mientras mantiene un 95.6% de precisión y aumenta la velocidad a 67 tokens por segundo.

  • • La cuantización AD-Q6_K se recomienda como la opción más segura, ofreciendo un 98.7% de precisión top-1 en comparación con BF16 y una velocidad de decodificación de 49 tok/s.
  • • La cuantización AD-Q4_K_M reduce el tamaño del modelo a 17.1 GB mientras mantiene un 95.6% de precisión top-1 y alcanza 67 tok/s.
  • • La cuantización AD-Q5_K_M proporciona un 97.3% de precisión top-1 con un tamaño de 20.2 GB y una velocidad de decodificación de 57 tok/s.
  • • Todas las cuantizaciones están disponibles para descargar a través de la aplicación atomic.chat o la colección AtomicChat de Hugging Face.

Los desarrolladores ahora pueden implementar cuantizaciones locales altamente optimizadas de Qwen 3.8 27B, equilibrando la huella de memoria y la precisión en GPUs de estaciones de trabajo profesionales.

SOURCES

8. GLM-4.5-Air obtiene soporte de predicción de múltiples tokens en Llama.cpp

Basándose en la integración inicial de la predicción de múltiples tokens (MTP) en llama.cpp, el proyecto ha añadido soporte para el modelo GLM-4.5-Air. Este modelo de mezcla de expertos (MoE) de 106B de parámetros ahora puede aprovechar MTP para mejorar las velocidades de generación en hardware con alta capacidad de memoria pero cómputo limitado, como Strix Halo o GPUs NVIDIA 3090. El bloque MTP necesario para archivos GGUF está disponible a través de un repositorio mantenido por jacek2024.

  • • GLM-4.5-Air es un modelo MoE de 106B de parámetros con 12B de parámetros activos.
  • • El soporte MTP en llama.cpp ahora cubre el modelo GLM-4.5-Air y los modelos GLM-4.5 completos.
  • • La implementación está optimizada para hardware de alta memoria y cómputo limitado.
  • • Los usuarios pueden acceder al bloque MTP requerido para archivos GGUF a través de un repositorio mantenido por jacek2024.

Esta actualización extiende los beneficios de rendimiento de MTP al modelo GLM-4.5-Air, permitiendo una implementación local más eficiente de arquitecturas MoE grandes en hardware con mucha memoria pero cómputo limitado.

SOURCES

9. Nuevo benchmark: MXFP4 en B300s supera a GGUF de 1 bit en A100s para Kimi K3

Basándose en análisis previos de costo-beneficio para el autoalojamiento del modelo Kimi K3, nuevos datos de benchmark revelan que MXFP4 nativo en 8x GPUs B300 es significativamente más eficiente que la cuantización de 1 bit en hardware más antiguo. Si bien GGUF de 1 bit en 8x A100s ofrece un costo por hora más bajo, el rendimiento superior de la configuración B300 lo hace 3.3 veces más rentable por millón de tokens.

  • • Alojar Kimi K3 mediante vLLM en 8x GPUs B300 utilizando MXFP4 nativo cuesta $190 por millón de tokens a 92 tok/s.
  • • Ejecutar GGUF UD-IQ1_S de 1 bit en 8x GPUs A100-80GB cuesta $620 por millón de tokens a 9 tok/s.
  • • La configuración B300 es 3.3 veces más rentable a pesar de la tarifa de alquiler por hora más alta.

Este benchmark proporciona datos críticos para los ingenieros de infraestructura que eligen entre estrategias de hardware y cuantización para modelos MoE masivos.

SOURCES

10. Nvidia notifica a los clientes sobre aumentos de precios de productos de IA superiores al 15%

Nvidia ha notificado a sus clientes sobre los próximos aumentos de precios para sus productos relacionados con la IA. Los aumentos anunciados superarán el 15%, una medida que se espera que afecte directamente a los costos de adquisición de hardware y a las tarifas de alquiler de GPU en la nube para los desarrolladores que alojan sus propios modelos.

  • • Nvidia ha notificado oficialmente a sus clientes sobre los aumentos de precios para productos relacionados con la IA.
  • • Los aumentos de precios anunciados para estos productos relacionados con la IA son superiores al 15%.

Este aumento de precio incrementará directamente los costos de adquisición de hardware y probablemente elevará los precios de las instancias de GPU en la nube, afectando los presupuestos de infraestructura de los desarrolladores.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.