Inference Brew

Anthropic restablece el acceso global a Claude Fable 5

00:00 / --:--

← Volver al inicio

Anthropic restablece el acceso global a Claude Fable 5

1. Anthropic restablece el acceso global a Claude Fable 5

Anthropic ha redistribuido oficialmente su modelo Claude Fable 5 a nivel mundial tras la decisión del gobierno de EE. UU. de levantar los controles de exportación el 30 de junio de 2026. Esta restauración sigue a la suspensión global del modelo el 12 de junio. Para abordar las preocupaciones de seguridad que provocaron el bloqueo inicial, Anthropic ha introducido un nuevo clasificador de seguridad que bloquea vulnerabilidades específicas de jailbreak y enruta automáticamente las solicitudes afectadas a Claude Opus 4.8. Aunque Fable 5 ya está disponible de forma general, el modelo Mythos 5 sigue restringido a una lista preaprobada de organizaciones estadounidenses.

  • El acceso global a Claude Fable 5 se restableció el 1 de julio de 2026.
  • Un nuevo clasificador de seguridad bloquea intentos específicos de jailbreak y enruta las solicitudes a Claude Opus 4.8.
  • Claude Mythos 5 sigue restringido a un modelo de acceso verificado para organizaciones estadounidenses aprobadas.
  • Anthropic ofrece un período promocional hasta el 7 de julio de 2026 para suscriptores seleccionados.

Los desarrolladores ahora pueden reanudar el uso en producción de Claude Fable 5, con la garantía adicional de un nuevo mecanismo de enrutamiento de seguridad para consultas de alto riesgo.

2. Desarrollador independiente expande Gemma 4 de 31B a 44B de parámetros

Un desarrollador independiente ha lanzado extGemma4-44B en Hugging Face, un modelo creado mediante la expansión de la arquitectura Gemma 4 31B de Google. El proceso de expansión aumentó las capas del modelo de 60 a 80, y finalmente a 88, utilizando identity-init y una corrección personalizada de layer_scalar. El modelo denso resultante fue ajustado con conjuntos de datos legales y STEM en coreano, demostrando una técnica para añadir capacidad para nuevos dominios sin sobrescribir los pesos originales del modelo. El desarrollador busca actualmente la colaboración de la comunidad para mejorar las capacidades de codificación y llamada a herramientas del modelo.

  • Un desarrollador independiente expandió la arquitectura Gemma 4 31B para crear un modelo de ~47B de parámetros llamado extGemma4-44B.
  • La expansión aumentó las capas de 60 a 80, y luego a 88, usando identity-init y una corrección de layer_scalar específica para Gemma4.
  • El modelo fue ajustado con conjuntos de datos legales y STEM en coreano para crear capacidad en nuevos dominios sin sobrescribir pesos existentes.
  • El modelo está disponible en Hugging Face y el desarrollador busca colaboración para mejorar las capacidades de codificación y llamada a herramientas.

Demuestra una técnica novedosa de expansión de arquitectura para añadir capacidad a nuevos dominios (como legal y STEM) sin sobrescribir los pesos existentes.

SOURCES

3. Claude Opus 4.7 utilizado para descubrir una vulnerabilidad crítica en la venta de entradas de festivales de música en EE. UU.

El investigador de seguridad Ian Carroll utilizó Claude Opus 4.7 para descubrir una vulnerabilidad crítica en Front Gate Tickets, una importante plataforma de venta de entradas propiedad de Live Nation Entertainment. Al generar una consulta SQL anidada, la IA ayudó a Carroll a eludir el firewall de aplicaciones web de la plataforma, lo que finalmente le permitió restablecer la contraseña de un miembro del personal y obtener acceso de superadministrador debido a la falta de autenticación de dos factores. Con estos privilegios, Carroll pudo emitir pases VIP para el backstage y acceder a registros de clientes. La vulnerabilidad, que afectaba a una API interna utilizada por los escáneres de entrada, fue parcheada dentro de las 24 horas posteriores a su divulgación. Carroll realizó la investigación bajo el Programa de Verificación Cibernética de Anthropic, que permite pruebas de seguridad aprobadas que de otro modo serían bloqueadas por los filtros de seguridad.

  • El investigador Ian Carroll utilizó Claude Opus 4.7 para descubrir una vulnerabilidad de consulta SQL anidada en Front Gate Tickets, una subsidiaria de Live Nation.
  • El exploit eludió un firewall de aplicaciones web, otorgando acceso potencial a millones de registros de clientes y personal.
  • Carroll obtuvo acceso de superadministrador al restablecer la contraseña de una cuenta de personal que carecía de autenticación de dos factores, permitiéndole emitir entradas VIP.
  • Front Gate Tickets parcheó la vulnerabilidad dentro de las 24 horas posteriores a la notificación y no informó evidencia de explotación externa.
  • Carroll realizó la prueba como parte del Programa de Verificación Cibernética de Anthropic; Anthropic señaló que la actividad habría sido bloqueada para usuarios estándar.

Destaca la capacidad real de los LLM de frontera para identificar vulnerabilidades de seguridad complejas, enfatizando la importancia de una seguridad de API robusta y la autenticación multifactor.

SOURCES

4. Cloudflare convierte el protocolo x402 en producto con una nueva pasarela de monetización

Cloudflare ha ampliado su soporte para el protocolo x402, destacado anteriormente como un estándar emergente para el comercio de agentes, mediante el lanzamiento de la Monetization Gateway. Este nuevo servicio permite a los desarrolladores monetizar APIs, conjuntos de datos y herramientas del Protocolo de Contexto de Modelo (MCP) a través de micropagos de stablecoins basados en el uso y sin fricciones. Al aprovechar el código de estado HTTP 402 Payment Required, la pasarela permite a los agentes de IA acceder a recursos sin registro previo, marcando un cambio desde el uso inicial del protocolo en pagos de investigación dirigidos por agentes hacia una infraestructura más amplia para la monetización de activos digitales.

  • La Monetization Gateway de Cloudflare operacionaliza el protocolo x402 para uso comercial.
  • Los desarrolladores ahora pueden cobrar por APIs, conjuntos de datos y herramientas MCP utilizando pagos de stablecoins basados en el uso.
  • El servicio automatiza la liquidación mediante el código de estado HTTP 402, eliminando la necesidad de flujos de pago tradicionales.
  • Admite acceso sin fricciones para agentes de IA, permitiéndoles pagar por recursos sobre la marcha sin cuentas preexistentes.

Esta transición mueve el protocolo x402 de un estándar de pago conceptual a un servicio listo para producción, permitiendo a los desarrolladores monetizar fácilmente los recursos accesibles por agentes.

SOURCES

5. OpenWiki CLI automatiza la documentación de bases de código para agentes de codificación de IA

OpenWiki es una herramienta CLI recién lanzada diseñada para cerrar la brecha entre las bases de código y los agentes de codificación de IA. Instalada globalmente a través de npm, la herramienta genera automáticamente documentación estructurada en un directorio `openwiki/` y actualiza los archivos `AGENTS.md` o `CLAUDE.md` para instruir a los agentes de codificación a que la consulten. OpenWiki actualiza esta documentación dinámicamente según los cambios en el repositorio y admite una amplia gama de proveedores de inferencia, incluidos OpenRouter, Fireworks, Baseten, OpenAI y Anthropic. Los desarrolladores pueden automatizar las actualizaciones de documentación integrando una GitHub Action y rastrear las ejecuciones mediante LangSmith.

  • OpenWiki es una herramienta CLI instalada vía npm que escribe y mantiene documentación de bases de código para agentes de IA.
  • La herramienta actualiza automáticamente los archivos 'AGENTS.md' o 'CLAUDE.md' para instruir a los agentes de codificación a consultar la documentación generada.
  • Genera documentación en un directorio 'openwiki/' y la actualiza según los cambios en el repositorio.
  • OpenWiki admite múltiples proveedores de inferencia, incluidos OpenRouter, Fireworks, Baseten, OpenAI y Anthropic.
  • Las actualizaciones se pueden automatizar mediante GitHub Actions y las ejecuciones se pueden rastrear usando LangSmith.

Los desarrolladores pueden asegurarse de que sus agentes de codificación de IA (como Cursor o Claude Code) tengan un contexto estructurado y actualizado de la base de código, reduciendo errores y APIs alucinadas.

SOURCES

6. Plurality lanza una plataforma de chatbot y agentes de IA locales de código abierto

Tras más de un año y medio de desarrollo, Plurality se ha lanzado como una plataforma de IA local totalmente gratuita y de código abierto. Plurality cierra la brecha entre las interfaces de chatbot estándar y los flujos de trabajo de agentes complejos al ofrecer procesamiento en segundo plano, acceso a shell y sistema de archivos en sandbox, y compatibilidad nativa con el Protocolo de Contexto de Modelo (MCP). Los desarrolladores pueden adjuntar carpetas locales directamente a la plataforma para tareas automatizadas de codificación o documentación, proporcionando un entorno seguro y autohospedado para ejecutar agentes autónomos.

  • Plurality es una plataforma de IA local totalmente gratuita y de código abierto que integra flujos de trabajo de agentes con una interfaz de chatbot.
  • La plataforma admite procesamiento de IA en segundo plano y acceso a shell y sistema de archivos en sandbox.
  • Es totalmente compatible con habilidades y el Protocolo de Contexto de Modelo (MCP).
  • Las características incluyen capacidades de control remoto y la capacidad de adjuntar carpetas locales para tareas de codificación o documentación.
  • El proyecto está disponible públicamente en GitHub.

Los desarrolladores pueden implementar un entorno local y en sandbox para ejecutar agentes de IA con acceso al sistema de archivos y soporte para el Protocolo de Contexto de Modelo.

SOURCES

7. Aplicación de voz de código abierto permite inferencia ultrarrápida de Gemma 4 31B a través de Cerebras

Se ha lanzado una nueva aplicación de voz totalmente de código abierto que muestra interacciones ultrarrápidas y casi instantáneas con el modelo Gemma 4 31B. Al aprovechar Cerebras para la inferencia de alta velocidad, la aplicación logra la baja latencia necesaria para conversaciones de voz naturales. La pila incluye capacidades de búsqueda web y está diseñada como un reemplazo directo de la API en tiempo real propietaria de OpenAI, ofreciendo a los desarrolladores una alternativa autohospedable y de código abierto para agentes de voz en tiempo real.

  • Se ha lanzado una nueva aplicación de voz de código abierto para interactuar con el modelo Gemma 4 31B.
  • La aplicación utiliza Cerebras para una inferencia ultrarrápida para ofrecer respuestas de voz casi instantáneas.
  • Toda la pila de software es totalmente de código abierto e incluye capacidades de búsqueda web integradas.
  • La pila está diseñada como un reemplazo directo de la API en tiempo real de OpenAI.

Los desarrolladores pueden implementar una pila de voz de código abierto y latencia ultrabaja que integra búsqueda web y actúa como un reemplazo directo de las APIs propietarias en tiempo real.

SOURCES

8. audio.cpp amplía el soporte de modelos para incluir VibeVoice 1.5B

El proyecto audio.cpp, que se lanzó el 25 de junio para unificar la inferencia de modelos de audio en C++, ha ampliado sus capacidades añadiendo soporte para el modelo VibeVoice 1.5B. Los benchmarks en una RTX 5090 muestran que el modelo alcanza velocidades de generación en tiempo real 4.08x, una mejora de 2.86x sobre la línea base de Python. Esta actualización lleva al marco a 16 de sus 28 familias de modelos planificadas.

  • audio.cpp ha añadido soporte para el modelo de audio VibeVoice 1.5B.
  • El marco ahora admite 16 de las 28 familias de modelos planificadas.
  • VibeVoice 1.5B alcanzó velocidades de generación en tiempo real 4.08x en una RTX 5090.
  • El tiempo de ejecución de C++ proporciona una aceleración de 2.86x sobre las implementaciones estándar de Python.

Esta actualización demuestra la expansión continua del ecosistema audio.cpp, permitiendo a los desarrolladores aprovechar el rendimiento nativo de C++ para una gama más amplia de modelos de audio locales.

SOURCES

9. Conjunto de datos abierto mapea los requisitos de hardware para LLM locales en niveles de RAM

Un desarrollador ha lanzado un conjunto de datos de código abierto y una herramienta CLI complementaria, modelfit.io, diseñados para simplificar la implementación de LLM locales. El conjunto de datos mapea 62 modelos locales populares a niveles de RAM de hardware que van desde 8GB a 128GB, utilizando una regla general de 0.6GB de memoria por mil millones de parámetros para la cuantización Q4_K_M. Para garantizar una ejecución estable, la herramienta aconseja a los desarrolladores asignar un presupuesto de memoria utilizable del 70% de la RAM o VRAM total para tener en cuenta el sistema operativo, la ventana de contexto y la caché KV. El proyecto está alojado en GitHub bajo una licencia CC BY e incluye una API JSON, lo que facilita la integración de comprobaciones de compatibilidad de hardware directamente en los pipelines de implementación local.

  • Se ha lanzado un conjunto de datos de código abierto (CC BY) que mapea 62 modelos locales a niveles de RAM de hardware de 8GB a 128GB.
  • El conjunto de datos asume una regla general de 0.6GB de memoria por mil millones de parámetros para la cuantización Q4_K_M.
  • Aconseja apuntar a un presupuesto de memoria utilizable del 70% de la RAM/VRAM total para acomodar el SO, el contexto y la caché KV.
  • El proyecto incluye una API JSON, una herramienta CLI y un sitio web complementario llamado modelfit.io.
  • La cobertura del conjunto de datos es más fuerte para Apple Silicon y hardware de consumo NVIDIA.

Los desarrolladores pueden verificar rápidamente qué modelos cuantizados de pesos abiertos pueden ejecutarse en su hardware de implementación objetivo sin prueba y error manual.

SOURCES

10. Tabla de clasificación SWE-rebench actualizada con benchmarks de GLM-5.2 y Gemma 4

La tabla de clasificación SWE-rebench, que evalúa modelos de IA en tareas de ingeniería de software del mundo real, ha recibido una actualización importante con una interfaz de usuario rediseñada y nuevos benchmarks para varios modelos lanzados recientemente. En las últimas posiciones, Claude Opus 4.8 xhigh lidera con una puntuación del 56.5%, seguido de cerca por el modelo de pesos abiertos GLM-5.2 con un 51.1% y Gemini 3.5 Flash con un 49.5%. La actualización también incluye puntuaciones para DeepSeek-V4 Pro (42.7%), Qwen3.6-27B (36.5%) y Gemma 4 31B (16.5%), proporcionando a los desarrolladores una visión comparativa clara del rendimiento del modelo en tareas de codificación y a nivel de repositorio.

  • La tabla de clasificación SWE-rebench se ha actualizado con nuevos modelos, resultados actualizados y una interfaz de usuario rediseñada.
  • Claude Opus 4.8 xhigh lidera con una puntuación del 56.5% utilizando 2.48M de tokens.
  • GLM-5.2 obtuvo un 51.1% con 2.62M de tokens, superando a varios otros modelos.
  • Gemini 3.5 Flash obtuvo un 49.5% con 1.85M de tokens, mientras que Gemma 4 31B obtuvo un 16.5% con 2.24M de tokens.
  • Otros modelos evaluados incluyen MiniMax M3 (45.6%), DeepSeek-V4 Pro (42.7%) y Qwen3.6-27B (36.5%).

Ayuda a los desarrolladores a comparar las capacidades reales de ingeniería de software y codificación de modelos de frontera y de pesos abiertos en un benchmark estandarizado.

SOURCES

11. Benchmark VCCB de código abierto evalúa la extracción de calendarios mediante LLM multimodales

El desarrollador Kevin Fleischer ha liberado como código abierto el Visual Calendar Comprehension Benchmark (VCCB), una herramienta diseñada para evaluar con qué precisión los LLM multimodales extraen datos estructurados de eventos de imágenes de vista semanal de calendarios. El benchmark prueba modelos utilizando capturas de pantalla, fotos frontales y fotos en perspectiva angular en tres clientes de escritorio: Outlook, HCL Notes y Thunderbird. Califica a los modelos por su capacidad para analizar detalles visuales complejos como eventos superpuestos, recurrencia y lapsos de varios días. Los resultados iniciales muestran una amplia brecha de rendimiento: mientras que los humanos logran aproximadamente un 99% de precisión, los modelos alojados de frontera alcanzan un máximo del 80-85%, y los modelos locales o Claude Haiku obtienen entre un 38% y un 58%. El benchmark está disponible en GitHub para ayudar a los desarrolladores a probar cómo los diferentes modelos y niveles de cuantización manejan la extracción visual estructurada.

  • El Visual Calendar Comprehension Benchmark (VCCB) mide con qué precisión los modelos de IA extraen datos estructurados de eventos de imágenes de vista semanal de calendarios.
  • El benchmark utiliza capturas de pantalla, fotos frontales y fotos en perspectiva de Outlook, HCL Notes y Thunderbird.
  • VCCB evalúa a los modelos en la identificación de títulos de eventos, horas de inicio, duraciones, superposiciones, recurrencia y lapsos de varios días.
  • Las pruebas iniciales muestran que los humanos logran ~99% de precisión, los modelos alojados de frontera alcanzan 80-85%, y los modelos locales o Claude Haiku obtienen entre 38-58%.
  • El proyecto es de código abierto y está disponible en GitHub, y el creador busca ejecuciones de la comunidad para probar los efectos de la cuantización.

Los desarrolladores que crean agentes de procesamiento de documentos visuales o de programación pueden utilizar este benchmark para evaluar y optimizar modelos de visión locales y alojados.

SOURCES

12. Flujo de trabajo de extracción de PDF a JSON demostrado utilizando el modelo cuantizado Lift

Un nuevo tutorial demuestra un flujo de trabajo robusto para convertir archivos PDF de investigación complejos en JSON estructurado utilizando el modelo Lift. Para hacer que el pipeline sea accesible para la implementación local, la implementación utiliza cuantización NF4 de 4 bits, lo que permite que el backend de Lift se ejecute en una sola GPU de 16 GB. El flujo de trabajo guía al modelo utilizando un esquema de extracción basado en JSON para apuntar a campos específicos (como autores, conjuntos de datos, métricas e hiperparámetros) mientras ignora distractores sintéticos en documentos de varias páginas. Además, el sistema cuenta con un mecanismo de puntuación a nivel de campo para validar la precisión de la extracción frente a datos de verdad fundamental, proporcionando una plantilla para construir bases de conocimiento locales consultables a partir de archivos PDF académicos o empresariales.

  • El tutorial describe un flujo de trabajo para extraer JSON estructurado de archivos PDF de investigación utilizando el modelo Lift.
  • Utiliza cuantización NF4 de 4 bits para ejecutar el backend de Lift en GPUs limitadas de 16 GB.
  • El flujo de trabajo utiliza informes sintéticos de varias páginas con distractores para evaluar la extracción guiada por esquema.
  • Un esquema basado en JSON guía al modelo para extraer campos específicos como autores, conjuntos de datos, métricas e hiperparámetros.
  • El sistema incluye un mecanismo de puntuación a nivel de campo para comparar las salidas del modelo con la verdad fundamental.

Los desarrolladores pueden implementar pipelines de extracción de documentos locales altamente precisos para archivos PDF complejos sin depender de costosas APIs alojadas.

SOURCES

13. Cuantizaciones GGUF de Deepseek V4 Flash expandidas a 2-bit, 3-bit y 4-bit

Basándose en el lanzamiento inicial de GGUF de Deepseek V4 Flash, los desarrolladores ahora pueden acceder al modelo en formatos cuantizados de 2-bit, 3-bit y 4-bit. Estas opciones adicionales permiten una mayor optimización en hardware con recursos limitados, ampliando la utilidad del modelo para inferencia local fuera de línea o de bajo costo.

  • Deepseek V4 Flash ahora está disponible en formatos GGUF de 2-bit, 3-bit y 4-bit.
  • Estos formatos se expanden sobre el lanzamiento inicial de GGUF para admitir entornos de hardware más limitados.

Estos niveles de cuantización específicos permiten a los desarrolladores reducir aún más los requisitos de memoria para la implementación local en hardware de grado de consumo más allá del lanzamiento estándar de GGUF.

SOURCES

14. AMD e Intel se unen a NVIDIA en la expansión del soporte de cuantización optimizada por hardware

Basándose en la reciente serie de lanzamientos de NVFP4 para modelos como Qwen3.6-27B, GLM-5.2 y MiniMax-M3, el ecosistema de hardware ha ampliado su soporte de cuantización. AMD ha implementado ahora soporte para MXFP4 para Kimi-K2.7-Code y Qwen3.5-397B-A17B, mientras que Intel ha introducido soporte para AutoRound para DiffusionGemma-26B-A4B, DeepSeek-V4-Pro y Gemma-4-31B-it. Estas adiciones brindan a los desarrolladores opciones más amplias para implementar modelos grandes de manera eficiente en diferentes arquitecturas de hardware.

  • AMD introdujo soporte para MXFP4 para Kimi-K2.7-Code, GLM-5.2, Qwen3.5-397B-A17B y MiniMax-M3.
  • Intel lanzó soporte para AutoRound para DiffusionGemma-26B-A4B, DeepSeek-V4-Pro y Gemma-4-31B-it.
  • Estos lanzamientos complementan el soporte de NVIDIA NVFP4 reportado anteriormente para modelos que incluyen Nemotron-3-Ultra-550B-A55B, Qwen3.6-27B y GLM-5.2.

La expansión de formatos de baja precisión más allá de NVIDIA a hardware AMD e Intel permite a más desarrolladores optimizar la inferencia de modelos a gran escala en diversas plataformas de GPU y CPU.

SOURCES

15. Cloudflare establece fecha límite de septiembre para la separación de rastreadores de IA

Cloudflare ha anunciado una nueva política que requiere que las empresas de IA distingan claramente entre los rastreadores web utilizados para la indexación de búsqueda y los utilizados para el entrenamiento de IA o agentes autónomos. Las empresas tienen hasta el 15 de septiembre para separar sus agentes de usuario de rastreadores. El incumplimiento de esta fecha límite resultará en que los rastreadores sean bloqueados por defecto en una gran cantidad de sitios web de editores que utilizan los servicios de seguridad de Cloudflare. Esta medida está diseñada para dar a los editores un mayor control sobre su contenido y alentar a los desarrolladores de IA a establecer acuerdos de licencia formales.

  • Cloudflare estableció una fecha límite del 15 de septiembre para que las empresas de IA distingan entre rastreadores de búsqueda y rastreadores de entrenamiento/agentes.
  • Las empresas de IA que no separen sus rastreadores corren el riesgo de ser bloqueadas por defecto en muchos sitios de editores.
  • La política tiene como objetivo presionar a las empresas de IA para que paguen por el contenido de los editores.

Los desarrolladores que ejecutan agentes de web-scraping personalizados o rastreadores de búsqueda deben actualizar sus configuraciones de agente de usuario para evitar ser bloqueados por sitios protegidos por Cloudflare.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.