Inference Brew

Meta lanza Muse Glimmer, un modelo agente de 30B de parámetros con pesos abiertos

00:00 / --:--

← Volver al inicio

Meta lanza Muse Glimmer, un modelo agente de 30B de parámetros con pesos abiertos

1. Meta lanza Muse Glimmer, un modelo agente de 30B de parámetros con pesos abiertos

Meta ha vuelto a una estrategia de IA de pesos abiertos con el lanzamiento de Muse Glimmer, su primer modelo de este tipo desde Llama 4. Destilado del modelo más grande Muse Spark, Muse Glimmer está diseñado específicamente para flujos de trabajo de agentes locales y siempre activos, como la finalización de tareas de extremo a extremo y la llamada a herramientas. El modelo es compatible con los principales entornos de ejecución locales, incluidos Ollama, LM Studio, vLLM y SGLang, y está disponible para su descarga en Hugging Face.

  • • Muse Glimmer es un transformador causal denso de 30 mil millones de parámetros que cuenta con un codificador de percepción de 1.8 mil millones de parámetros para entradas multimodales de texto e imagen.
  • • El modelo se lanza bajo la permisiva licencia Apache 2.0, lo que permite el uso comercial, la modificación y la redistribución sin restricciones.
  • • Admite una longitud de contexto de más de 128,000 tokens y está optimizado para ejecutarse en GPU de consumo con 24GB a 32GB de VRAM utilizando cuantización de 4 bits.
  • • El lanzamiento incluye la decodificación especulativa DFlash, que según Meta ofrece una aceleración de generación de hasta 3.1x en una Nvidia RTX 5090.
  • • Meta anunció planes para lanzar los pesos de su modelo más potente, Muse Spark 1.2, en un futuro próximo.

Los desarrolladores ahora pueden ejecutar un modelo agente de pesos abiertos altamente capaz y permisivo localmente en hardware de consumo sin depender de API en la nube.

2. Cactus lanza Needle 2, sucesor del LLM original para el borde (edge)

Basándose en el Cactus Needle original de 26M de parámetros lanzado en mayo de 2026, Cactus ha lanzado Needle 2. Esta nueva iteración es un modelo de 45 millones de parámetros comprimido a 2 bits, lo que le permite ejecutarse con solo 28MB de RAM. Mientras que el modelo original se centraba en la ejecución local general, Needle 2 está optimizado específicamente para tareas de agentes como la extracción estructurada y la llamada a herramientas en hardware de borde, logrando un rendimiento de tokens significativamente mayor en dispositivos como Raspberry Pi 5 y Meta Quest 3S.

  • • Needle 2 es un modelo de 45M de parámetros comprimido a 2 bits, que requiere 28MB de RAM.
  • • Mejora el Cactus Needle original al añadir soporte nativo para extracción estructurada y llamada a herramientas.
  • • El modelo alcanza 500 tokens/seg en Raspberry Pi 5 y 1,500 tokens/seg en Meta Quest 3S.
  • • Incluye una puntuación de confianza aprendida para gestionar la ejecución local frente a la nube.
  • • Utiliza redes de atención simple con una eficiencia de 70 MFLOPs por token.

Este lanzamiento hace avanzar la línea Cactus Needle al permitir flujos de trabajo de agentes más complejos en hardware ultra limitado, superando las capacidades del lanzamiento inicial de 26M de parámetros.

SOURCES

3. Anthropic elimina las tarifas de clasificador para Claude Code

Basándose en el reciente anuncio de que el modo automático se convertirá en la configuración predeterminada para Claude Code el 14 de agosto de 2026, Anthropic ha actualizado aún más el servicio eliminando todas las tarifas por gastos generales del clasificador. Este cambio, efectivo de inmediato, elimina los costos adicionales asociados anteriormente con el clasificador de seguridad que intercepta comandos potencialmente peligrosos.

  • • Anthropic ha eliminado todos los cargos por gastos generales del clasificador para los usuarios de Claude Code en planes de pago, con efecto inmediato.
  • • Esto sigue a la transición previamente anunciada al modo automático como la configuración predeterminada para nuevas sesiones a partir del 14 de agosto de 2026.
  • • El clasificador permanece activo para bloquear acciones destructivas y activar la aprobación manual cuando sea necesario.
  • • Las nuevas funciones de seguridad incluyen denegaciones estrictas para la exfiltración de datos y comprobaciones de estado de git previas a la acción.

La eliminación de las tarifas del clasificador reduce el costo de ejecutar flujos de trabajo de agentes autónomos, haciendo que el modo automático predeterminado sea más accesible para los desarrolladores en los planes Pro, Max y Team.

SOURCES

4. Ante se lanza como un agente de codificación offline de 15MB en Rust

Ante se ha lanzado en vista previa alfa como una alternativa ligera y de alta eficiencia a las herramientas de codificación de terminal como Claude Code. Escrito en Rust, el binario único gestiona su propia instancia local de llama.cpp para ejecutar modelos GGUF sin conexión, reduciendo significativamente el uso de memoria, CPU y E/S de disco. La telemetría está habilitada de forma predeterminada, pero puede desactivarse por completo configurando la variable de entorno ANTE_TELEMETRY en off.

  • • Ante es un agente de codificación binario en Rust de ~15MB para macOS y Linux que admite un funcionamiento totalmente offline.
  • • Cuenta con una versión integrada y gestionada de llama.cpp para ejecutar modelos GGUF localmente sin claves API ni acceso a Internet.
  • • El agente admite más de 12 proveedores de LLM y permite la configuración personalizada del proveedor a través de variables de entorno o un catálogo JSON.
  • • Reporta una tasa de éxito del 82.7% en Terminal-Bench 2.1 cuando se combina con el modelo DeepSeek V4 Flash.
  • • El SDK, el protocolo y la canalización de evaluación tienen licencia Apache 2.0, mientras que el arnés central se distribuye como un binario precompilado.

Los desarrolladores pueden ejecutar un agente de codificación altamente eficiente y totalmente offline en hardware local sin incurrir en costos de API ni enviar código a servidores externos.

SOURCES

5. Spotify abre el código fuente del orquestador de agentes de codificación Xirp

Spotify ha abierto la beta pública de Xirp, una herramienta de desarrollo interna diseñada para orquestar múltiples agentes de codificación de IA. Xirp permite a los desarrolladores ejecutar y comparar agentes como Claude Code, Gemini CLI y OpenAI Codex uno al lado del otro, aprovechando flujos de trabajo refinados durante decenas de miles de sesiones internas para agilizar el desarrollo de agentes.

  • • Spotify ha lanzado su herramienta interna, Xirp, al público en versión beta.
  • • Xirp permite a los usuarios ejecutar agentes de Claude Code, Gemini CLI y OpenAI Codex uno al lado del otro.
  • • La herramienta ha sido probada internamente en más de 36,000 sesiones de agentes de codificación en Spotify.

Los desarrolladores pueden comparar, ejecutar y orquestar múltiples agentes de codificación de vanguardia simultáneamente dentro de una interfaz unificada.

SOURCES

6. Juror ofrece revisiones de PR de código abierto utilizando LLM en paralelo

Juror se ha lanzado como una alternativa de código abierto a las herramientas comerciales de revisión de PR como Greptile. Diseñado para ejecutarse como una acción de GitHub o una herramienta CLI, Juror coordina un "jurado" de diferentes LLM para analizar las diferencias de código, utilizando similitud consciente del código y un modelo árbitro para eliminar informes duplicados. La herramienta prioriza la seguridad aislando las credenciales y aplicando acceso de solo lectura, asegurando que el código nunca abandone el entorno del ejecutor local excepto a través de llamadas API directas a los proveedores de modelos configurados.

  • • Juror ejecuta múltiples modelos de vanguardia en paralelo para revisar las solicitudes de extracción de GitHub y elimina los hallazgos duplicados utilizando un modelo árbitro.
  • • La herramienta se ejecuta completamente en el propio ejecutor de GitHub Actions del usuario, manteniendo el código seguro excepto para las llamadas API del modelo.
  • • Admite múltiples proveedores de API, incluidos OpenAI, Anthropic, xAI y Fireworks, con ajustes preestablecidos de jurado personalizables.
  • • Las funciones de seguridad incluyen aislamiento de credenciales por arnés, acceso de solo lectura al repositorio y políticas de revisión base para evitar la manipulación de la configuración.
  • • Cada revisión genera un recibo de costo que detalla los modelos utilizados, el tiempo empleado y el gasto estimado.

Los desarrolladores pueden implementar un asistente de revisión de código seguro y autohospedado que aprovecha múltiples LLM sin exponer el código fuente a plataformas SaaS de terceros.

SOURCES

7. AWS Continuum integra Claude Code y Codex para la remediación automatizada de vulnerabilidades

Basándose en la disponibilidad previa de Codex de OpenAI en Bedrock y el complemento de seguridad Claude Code de Anthropic, AWS ha integrado ambas herramientas en su plataforma Continuum. Anunciada en Black Hat USA 2026, esta integración permite a los desarrolladores utilizar un bucle de equipo de agentes para automatizar el ciclo de vida de la remediación de vulnerabilidades, junto con el nuevo monitoreo de GuardDuty para la recolección de costos relacionados con la IA y una herramienta de inventario de IA gratuita en Security Hub.

  • • AWS Continuum ahora orquesta Claude Code y OpenAI Codex en un bucle de equipo de agentes para la remediación de vulnerabilidades.
  • • La plataforma automatiza el descubrimiento, la priorización, la validación y la remediación de vulnerabilidades de código.
  • • AWS GuardDuty ahora monitorea los eventos del plano de datos para detectar inferencia de IA no autorizada (recolección de costos).
  • • AWS Security Hub añadió una categoría de protección de la cadena de suministro y una capacidad de inventario de IA gratuita.

Esta integración va más allá del uso de herramientas independientes al proporcionar un bucle de remediación unificado y automatizado dentro del entorno de la nube de AWS.

SOURCES

8. Anthropic cancela el aumento de precio planificado para Claude 3.5 Sonnet

Anthropic ha anunciado que el precio de introducción de Claude 3.5 Sonnet, que expiraba el 31 de agosto de 2026, permanecerá vigente de forma permanente. Esta actualización anula el plan anterior de aumentar las tarifas a $3 por millón de tokens de entrada y $15 por millón de tokens de salida, manteniendo la tarifa actual de $2/$10 para los desarrolladores.

  • • El precio de introducción de $2 por millón de tokens de entrada y $10 por millón de tokens de salida es ahora permanente.
  • • El aumento de precio previamente programado a $3/$15 el 1 de septiembre de 2026 ha sido cancelado.
  • • Este cambio garantiza la estabilidad de costos a largo plazo para las aplicaciones creadas sobre Claude 3.5 Sonnet.

Los desarrolladores ahora pueden confiar en el precio actual y más bajo de Claude 3.5 Sonnet indefinidamente, eliminando la necesidad de ajustar las proyecciones presupuestarias para el aumento de precio previamente planificado para septiembre.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.