Inference Brew

Anthropic implementa cuotas de uso y amplía el acceso a Fable 5 y Mythos 5

00:00 / --:--

← Volver al inicio

Anthropic implementa cuotas de uso y amplía el acceso a Fable 5 y Mythos 5

1. Anthropic implementa cuotas de uso y amplía el acceso a Fable 5 y Mythos 5

Tras el reciente levantamiento de los controles de exportación de EE. UU., Anthropic ha redistribuido oficialmente sus modelos Claude Fable 5 y Mythos 5. Fable 5 está disponible actualmente con un límite de uso semanal del 50%, y pasará a un modelo basado en créditos después del 7 de julio. Además, se está ampliando el acceso a Mythos 5 para organizaciones estadounidenses seleccionadas, y Anthropic está coordinando con el gobierno para ampliar la disponibilidad a socios nacionales e internacionales bajo el programa Glasswing.

  • Claude Fable 5 y Mythos 5 han sido redistribuidos oficialmente.
  • El uso de Fable 5 está limitado al 50% de los límites semanales hasta el 7 de julio, cuando cambiará a un sistema basado en créditos.
  • El acceso a Mythos 5 se está ampliando para organizaciones estadounidenses seleccionadas.
  • Anthropic está trabajando con el gobierno de EE. UU. para extender el acceso a Mythos 5 a socios internacionales en el programa Glasswing.

Los desarrolladores ahora pueden reanudar el uso en producción de ambos modelos, aunque deben tener en cuenta las nuevas cuotas de uso y las rutas de acceso actualizadas para el modelo Mythos 5.

SOURCES

2. Google comienza a probar al sucesor de Gemini 3.5 Flash en LM Arena

Google está probando una versión mejorada de su modelo Gemini Flash en la plataforma LM Arena, lo que indica un posible sucesor del recientemente lanzado Gemini 3.5 Flash. Dado que las pruebas en LM Arena históricamente preceden a los lanzamientos públicos oficiales, este desarrollo sugiere que Google está preparando una nueva iteración (se rumorea que es Gemini 3.6 o 4 Flash) para su nivel de modelo de alta velocidad y bajo costo.

  • Un modelo Gemini Flash mejorado se encuentra actualmente en fase de pruebas en la plataforma LM Arena.
  • Esta prueba sigue al reciente lanzamiento de Gemini 3.5 Flash.
  • La actividad en LM Arena sirve históricamente como precursor de los lanzamientos oficiales de modelos de Google.
  • Se espera que el nuevo modelo ofrezca mejoras de rendimiento incrementales sobre la versión 3.5 Flash actual.

Los desarrolladores que actualmente utilizan Gemini 3.5 Flash para tráfico de API de alto volumen deben monitorear estas pruebas, ya que indican la próxima mejora de rendimiento en la hoja de ruta de modelos de baja latencia de Google.

SOURCES

3. Kimi K2.7 Code ya está disponible de forma general en GitHub Copilot

Tras su lanzamiento inicial como modelo de pesos abiertos el 12 de junio de 2026, Kimi K2.7 Code ya está disponible de forma general dentro de GitHub Copilot. Esta integración permite a los desarrolladores seleccionar el modelo directamente en su IDE, con el uso facturado a través de Microsoft Azure. El despliegue está activo para los planes Copilot Pro, Pro+ y Max, y requiere la habilitación de políticas administrativas para los usuarios de Business y Enterprise.

  • Kimi K2.7 Code, lanzado anteriormente como modelo de pesos abiertos, ya está disponible en el selector de modelos de GitHub Copilot.
  • La integración está alojada en Microsoft Azure con facturación basada en el uso.
  • El despliegue cubre los planes Copilot Pro, Pro+ y Max en los principales IDE, incluidos VS Code, Visual Studio, JetBrains, Xcode y Eclipse.
  • Los usuarios de Business y Enterprise requieren la habilitación manual de políticas para acceder al modelo.

Esta integración proporciona una forma simplificada para que los desarrolladores accedan al modelo Kimi K2.7 Code directamente dentro de sus flujos de trabajo de IDE existentes, yendo más allá del despliegue manual de los pesos de código abierto.

SOURCES

4. Un desarrollador ajusta Gemma-4-31B para escritura creativa y redacción publicitaria

El desarrollador akwin123 ha lanzado una versión ajustada del modelo Gemma-4-31B-it optimizada específicamente para redacción publicitaria de respuesta directa y escritura creativa. Entrenado mediante QLoRA SFT en un corpus curado de resúmenes de marketing y anuncios del mundo real, el modelo obtuvo 1657 puntos Elo en un benchmark personalizado EQ-Bench 3, un salto de 290 puntos sobre el modelo base. Los pesos finales se fusionan a bf16 completo, admiten una ventana de contexto de 256K y están disponibles en Hugging Face, y el desarrollador recomienda desactivar el modo de pensamiento para obtener un resultado creativo óptimo.

  • El modelo Gemma-4-31B-it fue ajustado usando QLoRA SFT en un corpus curado de resúmenes de marketing y ejemplos de anuncios del mundo real.
  • El modelo ajustado alcanzó una puntuación Elo de 1657 en comparación con los 1367 del modelo base en un benchmark personalizado EQ-Bench 3.
  • El modelo ganó 24 de 30 (80%) casos de prueba cara a cara juzgados a ciegas por DeepSeek V4 Flash.
  • Los pesos finales del modelo se fusionan a bf16 completo, admiten una ventana de contexto de 256K y están disponibles en Hugging Face.
  • El desarrollador recomienda desactivar el modo de pensamiento (enable_thinking = false) para una calidad de salida óptima.

Los desarrolladores que crean aplicaciones de marketing o escritura creativa pueden descargar modelos de pesos abiertos optimizados específicamente para reducir la jerga genérica de la IA y mejorar la inteligencia emocional.

SOURCES

5. Fijik 2.0 350m lanzado bajo licencia Apache-2.0

El desarrollador 'Fijik' ha lanzado Fijik 2.0 350m, un pequeño modelo de pesos abiertos basado en la arquitectura Granite 4 350M. Lanzado bajo la licencia Apache-2.0, el modelo fue preentrenado continuamente en 6 mil millones de tokens y post-entrenado en un corpus SFT personalizado que presenta esfuerzos de razonamiento mixto. Disponible en Hugging Face en formatos Safetensors y GGUF, el modelo está altamente optimizado para entornos restringidos, aunque el desarrollador recomienda combinarlo con herramientas de búsqueda web debido a su pequeño tamaño de parámetros.

  • Fijik 2.0 350m se basa en la arquitectura Granite 4 350M y se lanza bajo la licencia Apache-2.0.
  • El modelo fue preentrenado continuamente en 6 mil millones de tokens con una fecha de corte de conocimiento de agosto de 2025.
  • Se sometió a un post-entrenamiento en un corpus SFT personalizado con esfuerzos de razonamiento mixto.
  • El modelo está disponible en Hugging Face en formatos Safetensors y GGUF.
  • El desarrollador recomienda usar el modelo con herramientas de búsqueda web debido a su pequeño tamaño de parámetros.

Proporciona un modelo pequeño con licencia abierta adecuado para entornos locales altamente restringidos o tareas asistidas por búsqueda web.

SOURCES

6. Manufact lanza la plataforma en la nube MCP para aplicaciones del Protocolo de Contexto de Modelo

La startup respaldada por YC, Manufact, ha lanzado una plataforma en la nube dedicada al ecosistema del Protocolo de Contexto de Modelo (MCP). Posicionada como una nube vertical para MCP (análoga a la relación de Vercel con Next.js), Manufact permite a los equipos de desarrollo construir, probar, monitorear y desplegar aplicaciones y servidores MCP. La plataforma cuenta con integración de GitHub, despliegues de vista previa para ramas experimentales, pruebas automatizadas en ChatGPT y Claude, y soporte para interfaces de usuario interactivas que muestran la marca personalizada directamente dentro de las interfaces de los clientes de IA.

  • Manufact es una plataforma en la nube diseñada para construir, probar, monitorear y desplegar aplicaciones y servidores del Protocolo de Contexto de Modelo (MCP).
  • La plataforma funciona como una nube vertical MCP, ofreciendo integración con GitHub, despliegues de vista previa y análisis específicos de MCP.
  • Manufact admite pruebas automatizadas en clientes importantes como ChatGPT y Claude.
  • Los servidores MCP pueden devolver interfaces de usuario interactivas, lo que permite a las empresas mostrar datos y marcas directamente dentro de los productos de IA.
  • Los fundadores operaban anteriormente bajo el nombre mcp-use y mantienen SDK de código abierto para MCP.

Proporciona un flujo de trabajo de despliegue y prueba similar al de Vercel específicamente para servidores MCP, lo que facilita la creación y distribución de herramientas interactivas para ChatGPT y Claude.

SOURCES

7. Alibaba abre el código de Page Agent para la automatización de GUI en el navegador

Alibaba ha abierto el código de Page Agent, una biblioteca de JavaScript orientada a TypeScript diseñada para la automatización del navegador en la página. A diferencia de herramientas externas como Selenium o Playwright, Page Agent se ejecuta directamente dentro de la sesión del navegador, heredando las cookies, la autenticación y el estado de la sesión activos del usuario. Al utilizar una técnica de 'deshidratación de DOM' para comprimir el DOM en vivo en un mapa de texto compacto, la biblioteca puede automatizar interfaces utilizando LLM basados en texto estándar a través de cualquier punto final compatible con OpenAI.

  • Page Agent es una biblioteca de JavaScript de código abierto orientada a TypeScript lanzada bajo la licencia MIT.
  • La biblioteca se ejecuta dentro de la sesión del navegador, heredando las cookies, la autenticación y el estado de la sesión del usuario.
  • Utiliza 'deshidratación de DOM' para convertir el DOM en vivo en un mapa de texto compacto, lo que permite la compatibilidad con LLM solo de texto.
  • La biblioteca es agnóstica al modelo y admite cualquier punto final compatible con OpenAI.
  • Está limitada a interacciones de una sola página y se basa en la seguridad basada en prompts, lo que requiere validación del lado del servidor para acciones confidenciales.

Permite a los desarrolladores crear copilotos de IA que heredan la sesión activa, las cookies y el estado de autenticación del usuario directamente, evitando herramientas de automatización externas.

SOURCES

8. SkillWeaver de Alibaba reduce el consumo de tokens de agentes en un 99%

Investigadores de Alibaba han desarrollado SkillWeaver, un marco de código abierto diseñado para enrutar subtareas a las herramientas adecuadas en flujos de trabajo de IA empresarial complejos. Al emplear un enfoque de recuperación y enrutamiento en lugar de exponer una biblioteca completa de herramientas al LLM, SkillWeaver reduce el consumo de la ventana de contexto en más de un 99%. El marco utiliza un proceso de tres etapas para generar un Grafo Acíclico Dirigido (DAG) para la ejecución paralela, e introduce un bucle de retroalimentación que aumenta la precisión de la descomposición de tareas para modelos de 7B del 51.0% al 67.7%.

  • SkillWeaver utiliza un proceso de tres etapas (Descomponer, Recuperar, Componer) para crear un grafo de ejecución para tareas de varios pasos.
  • El marco introduce la Descomposición Consciente de Habilidades (SAD), un bucle de retroalimentación que refina la descomposición de tareas en función de las herramientas recuperadas.
  • La activación del bucle de retroalimentación SAD aumentó la precisión de la descomposición para un modelo de 7B del 51.0% al 67.7%.
  • El enfoque de recuperación y enrutamiento redujo el consumo de la ventana de contexto en más de un 99% en comparación con la exposición de toda la biblioteca de herramientas.
  • El marco crea un Grafo Acíclico Dirigido (DAG) para mapear dependencias y permitir la ejecución paralela.

Permite a los desarrolladores construir flujos de trabajo de agentes complejos con miles de herramientas sin agotar las ventanas de contexto ni pagar costos masivos de tokens.

SOURCES

9. Z.ai lanza el entorno de desarrollo de agentes ZCode para GLM-5.2

Z.ai (anteriormente Zhipu AI) ha lanzado ZCode, una aplicación de escritorio gratuita diseñada para competir con Cursor y Claude Code. Construido como un Entorno de Desarrollo de Agentes para el modelo GLM-5.2 recientemente abierto, ZCode se ejecuta en macOS, Windows y Linux. El modelo GLM-5.2 subyacente es un modelo de mezcla de expertos de 744 mil millones de parámetros entrenado completamente en silicio de Huawei y lanzado bajo la licencia MIT. ZCode también admite modelos de terceros a través de configuraciones de 'trae tu propia clave' y ofrece integraciones únicas de control remoto con plataformas de mensajería como WeChat y Telegram.

  • ZCode es un Entorno de Desarrollo de Agentes de escritorio gratuito disponible en macOS, Windows y Linux.
  • El entorno está diseñado para GLM-5.2, un modelo de mezcla de expertos de 744 mil millones de parámetros con una ventana de contexto de 1 millón de tokens.
  • Z.ai lanzó los pesos de código abierto de GLM-5.2 bajo la licencia MIT en Hugging Face el 16 de junio.
  • ZCode admite configuraciones de 'trae tu propia clave' para modelos de terceros.
  • El entorno cuenta con capacidades de control remoto a través de WeChat, Feishu o Telegram para gestionar tareas de codificación desde el móvil.

Proporciona a los desarrolladores un entorno de escritorio multiplataforma gratuito para construir con GLM-5.2, con capacidades de control remoto a través de aplicaciones de mensajería y soporte para modelos de terceros.

SOURCES

10. claude-real-video de código abierto prepara contenido de video para el análisis de LLM

La herramienta de código abierto `claude-real-video` ha sido lanzada bajo la licencia MIT para ayudar a los desarrolladores a preparar contenido de video para el análisis de LLM. En lugar de utilizar intervalos de tiempo fijos, la herramienta basada en Python extrae fotogramas basados en cambios de escena y un umbral de densidad, eliminando fotogramas casi duplicados para optimizar el uso de la ventana de contexto. También transcribe audio usando Whisper o subtítulos existentes, generando una carpeta estructurada con fotogramas, transcripciones y un archivo de manifiesto compatible con LLM multimodales.

  • claude-real-video es una herramienta de Python de código abierto lanzada bajo la licencia MIT.
  • La herramienta extrae fotogramas basados en cambios de escena y un umbral de densidad en lugar de intervalos de tiempo fijos, eliminando casi duplicados para ahorrar contexto.
  • Transcribe audio usando subtítulos existentes o la CLI de Whisper para generar un manifiesto estructurado.
  • Admite archivos locales, así como URL de YouTube, Instagram y TikTok.
  • Los requisitos incluyen Python 3.10+, ffmpeg y ffprobe.

Permite a los desarrolladores alimentar fácilmente contenido de video desde archivos locales o URL (YouTube, TikTok) en LLM eliminando fotogramas duplicados y alineando transcripciones.

SOURCES

11. La herramienta CLI 'ctx' basada en Rust proporciona memoria local para agentes de codificación

Se ha lanzado una nueva herramienta CLI basada en Rust llamada `ctx` para proporcionar memoria a largo plazo para agentes de codificación. Al ingerir transcripciones y registros en una base de datos SQLite local, `ctx` utiliza la coincidencia de texto clasificada para permitir que los agentes busquen en sesiones pasadas sin requerir bases de datos de grafos complejas o API de memoria alojadas externamente. Esta configuración local permite a los desarrolladores implementar subagentes de investigación de historial que informan a las herramientas de codificación sobre fallas pasadas y soluciones exitosas antes de comenzar nuevas tareas.

  • ctx es una herramienta CLI de Rust que proporciona memoria a largo plazo para agentes de codificación utilizando una base de datos SQLite local.
  • La herramienta utiliza la coincidencia de texto clasificada para la búsqueda, eliminando la necesidad de bases de datos de grafos o servicios de memoria alojados.
  • Los desarrolladores pueden implementar un Subagente de Investigación de Historial de Agentes para preparar informes sobre sesiones pasadas antes de comenzar nuevas tareas.
  • La herramienta ayuda a los agentes a identificar y resolver problemas recurrentes haciendo referencia a fallas pasadas y soluciones exitosas.
  • Admite la generación de transcripciones de sesión limpias que se pueden compartir o adjuntar a solicitudes de extracción (pull requests).

Permite a los desarrolladores dar a sus agentes de codificación acceso a historiales de sesiones pasadas y soluciones alternativas sin necesidad de bases de datos de grafos complejas o servicios de memoria alojados.

SOURCES

12. La CLI ghealth de código abierto envuelve la API de Google Health para agentes de IA

Se ha lanzado una nueva herramienta CLI de código abierto llamada `ghealth` como sucesora oficial de la API web de Fitbit. Sirviendo como un envoltorio para la API v4 de Google Health, la herramienta se distribuye como un único binario de Go bajo la licencia Apache 2.0. Expone 40 tipos de datos verificados de Fitbit, Pixel Watch y fuentes de terceros como JSON estructurado. Diseñada específicamente para la integración de terminales y agentes de IA, `ghealth` cuenta con códigos de salida deterministas e incluye dos archivos de Habilidades de Agente para simplificar la configuración y la autenticación.

  • ghealth es una herramienta CLI de código abierto que sirve como envoltorio para la API v4 de Google Health bajo la licencia Apache 2.0.
  • La herramienta es la sucesora oficial de la API web de Fitbit y utiliza Google OAuth 2.0 para la autenticación.
  • Distribuida como un único binario de Go, expone 40 tipos de datos verificados como JSON estructurado.
  • La CLI cuenta con códigos de salida deterministas y una salida JSON simplificada diseñada para la integración de terminales y agentes de IA.
  • Incluye dos archivos de Habilidades de Agente para ayudar con la autenticación, la configuración y la documentación de los tipos de datos.

Permite a los desarrolladores alimentar fácilmente datos estructurados de salud y estado físico en agentes de IA utilizando códigos de salida deterministas y archivos de Habilidades de Agente preconstruidos.

SOURCES

13. FriendliAI ofrece una capa de inferencia de alta velocidad para agentes de codificación

FriendliAI ha introducido una capa de inferencia optimizada específicamente para ejecutar agentes de IA. La plataforma admite varios modelos de frontera, incluidos GLM-5.2, MiniMax-M3 y Kimi-K2.7, y afirma tener la velocidad de salida más rápida para GLM-5.1 en OpenRouter. Respaldada por un SLA de tiempo de actividad del 99.99%, la infraestructura de FriendliAI actualmente impulsa servicios centrados en el desarrollador como Claude Code, Cursor, Kilo Code, Hermes Agents y Ollama.

  • FriendliAI proporciona una capa de inferencia dedicada diseñada específicamente para ejecutar agentes de IA.
  • La plataforma afirma tener la velocidad de salida más rápida para el modelo GLM-5.1 en OpenRouter.
  • Los modelos de frontera compatibles incluyen GLM-5.2, MiniMax-M3 y Kimi-K2.7.
  • FriendliAI ofrece un acuerdo de nivel de servicio (SLA) de tiempo de actividad del 99.99%.
  • La plataforma impulsa servicios backend para Claude Code, Cursor, Kilo Code, Hermes Agents y Ollama.

Los desarrolladores que crean agentes de codificación pueden aprovechar un proveedor de inferencia rápido y confiable con un SLA de tiempo de actividad del 99.99% para impulsar herramientas como Claude Code y Cursor.

SOURCES

14. OpenLumara añade un puente API compatible con OpenAI para la integración de modelos locales

Basándose en su lanzamiento inicial como un marco de agentes modular, OpenLumara ahora incluye un puente API compatible con OpenAI. Operando en el puerto 8000, este puente conecta interfaces de usuario front-end como KoboldLite u OpenWebUI con motores back-end locales como llama.cpp o KoboldCPP, reemplazando las convenciones de API centradas en la nube con un rendimiento local optimizado y funciones de ahorro de tokens como el colapso de encabezados de pensamiento.

  • OpenLumara ahora cuenta con un puente API compatible con OpenAI que se ejecuta en el puerto 8000.
  • El puente conecta interfaces de usuario front-end como KoboldLite y OpenWebUI con back-ends locales como llama.cpp y KoboldCPP.
  • Reemplaza las convenciones de API centradas en la nube para mejorar el rendimiento de los modelos locales.
  • Incluye configuraciones específicas para colapsar los encabezados de pensamiento para reducir aún más el uso de tokens.

Esta actualización permite una mayor compatibilidad para el ecosistema OpenLumara, permitiendo a los desarrolladores usar herramientas de interfaz de usuario estándar con modelos locales mientras mantienen el enfoque del marco en la eficiencia de tokens.

SOURCES

15. Thinking Machines Lab y Bridgewater ajustan un modelo de pesos abiertos para superar a los LLM de frontera

El Thinking Machines Lab de Mira Murati y el fondo de cobertura Bridgewater Associates publicaron resultados conjuntos evaluando la IA para filtrar noticias de inversión. Mientras que los modelos de frontera como GPT, Claude y Gemini alcanzaron un máximo de mediados de los 70 incluso con prompts de expertos, Bridgewater ajustó un modelo de pesos abiertos utilizando la API Tinker. El modelo resultante alcanzó una precisión del 84.7%, superando el umbral de confianza operativa del 80%, al tiempo que redujo los costos en 13.8 veces en comparación con el mejor modelo de frontera.

  • Los modelos de frontera (GPT, Claude, Gemini) alcanzaron solo una precisión promedio de ~50% en seis pruebas de filtrado de noticias de inversión.
  • Los prompts escritos por expertos mejoraron la precisión del modelo de frontera a mediados de los 70, aún por debajo del umbral de confianza operativa del 80% de Bridgewater.
  • Bridgewater ajustó un modelo de pesos abiertos utilizando la API Tinker de Thinking Machines Lab basada en juicios de expertos reales.
  • El modelo ajustado alcanzó una precisión del 84.7%, reduciendo los errores en un 29.8% en comparación con el mejor modelo de frontera probado.
  • El modelo ajustado entregó un costo por tarea 13.8 veces menor en comparación con el modelo de frontera de mejor rendimiento probado.

Demuestra un caso concreto donde el ajuste de un modelo de pesos abiertos más pequeño con datos de expertos produce una mayor precisión y costos significativamente más bajos que depender de las API de frontera.

SOURCES

16. Un desarrollador de Hugging Face automatiza su rol usando Claude Agents SDK y Modal

En el evento aiDotEngineer, un desarrollador de Hugging Face demostró un flujo de trabajo diseñado para automatizar aspectos de su rol. La implementación combina el Claude Agents SDK con GLM-5.2 accedido a través de proveedores de inferencia. Para el monitoreo y despliegue de producción, la configuración integra Langfuse para el rastreo y se ejecuta en la plataforma sin servidor de Modal, ofreciendo una referencia de pila concreta para los desarrolladores que construyen agentes autónomos.

  • El flujo de trabajo de automatización fue presentado en el evento aiDotEngineer por un desarrollador de Hugging Face.
  • El sistema utiliza el Claude Agents SDK y GLM-5.2 a través de proveedores de inferencia.
  • Langfuse se utiliza para el rastreo y monitoreo de LLM.
  • Todo el flujo de trabajo de agentes se despliega en la infraestructura sin servidor de Modal.

Proporciona un modelo del mundo real de un flujo de trabajo de agentes de grado de producción que combina SDK, rastreo y despliegue sin servidor.

SOURCES

17. El tutorial de RAG-Anything detalla la recuperación multimodal en Google Colab

Un nuevo tutorial describe cómo construir un flujo de trabajo RAG-Anything para la recuperación multimodal que involucra texto, tablas, ecuaciones e imágenes. Implementado en Google Colab utilizando API de OpenAI para chat, visión y incrustaciones, la guía detalla cómo convertir documentos complejos en una lista de contenido JSON estructurada. El sistema RAG-Anything admite modos de recuperación ingenuos, locales, globales e híbridos, lo que permite a los desarrolladores implementar el razonamiento intermodal sobre conjuntos de datos de medios mixtos.

  • El tutorial demuestra la construcción de un flujo de trabajo RAG-Anything en Google Colab utilizando API de OpenAI para chat, visión y incrustaciones.
  • El flujo de trabajo convierte informes multimodales sintéticos (incluidos tablas, gráficos y PDF) en una lista de contenido JSON estructurada.
  • RAG-Anything admite múltiples modos de recuperación, incluidos ingenuos, locales, globales e híbridos.
  • El sistema se prueba en su capacidad para realizar razonamiento intermodal y responder consultas basadas en valores estructurados y evidencia multimodal.

Proporciona una guía paso a paso para que los desarrolladores implementen razonamiento intermodal y tuberías de recuperación utilizando API de OpenAI estándar.

SOURCES

18. Las actualizaciones de vLLM resuelven problemas de OOM y duplican las ventanas de contexto

Los desarrolladores del motor de código abierto vLLM han lanzado tres actualizaciones importantes destinadas a resolver los problemas de falta de memoria (OOM). Las actualizaciones abordan los cuellos de botella de memoria causados por las preasignaciones y los parámetros de ajuste. En las pruebas del mundo real, las optimizaciones permitieron a un desarrollador duplicar su ventana de contexto utilizable de 120k a 240k tokens al ejecutar Qwen2-7B en una GPU RTX 5090, mejorando significativamente las capacidades de inferencia local.

  • Los desarrolladores de vLLM lanzaron tres actualizaciones importantes que abordan los problemas de falta de memoria (OOM) causados por las preasignaciones y el ajuste.
  • Un usuario informó haber duplicado el tamaño de su ventana de contexto utilizable de 120k a 240k tokens usando Qwen2-7B en una RTX 5090.
  • Las actualizaciones optimizan la preasignación de memoria y los parámetros de ajuste para la inferencia local.

Los desarrolladores que ejecutan modelos locales ahora pueden duplicar sus ventanas de contexto utilizables (por ejemplo, hasta 240k tokens) en GPU de consumo como la RTX 5090.

SOURCES

19. GLM 5.2 obtiene soporte de decodificación especulativa a través de DSpark

Se ha lanzado la vista previa de GLM 5.2 DSpark, marcando la primera aplicación del marco DSpark de código abierto a un modelo que no es de DeepSeek. Al utilizar las capacidades de decodificación especulativa del marco, la vista previa acelera la decodificación FP8 para GLM-5.2 en aproximadamente 1.5 veces en hardware 4x B300 a través de vLLM nightly. Este lanzamiento demuestra la utilidad del marco para optimizar la latencia de inferencia en diversas arquitecturas de pesos abiertos.

  • La vista previa de GLM 5.2 DSpark es el primer especulador desarrollado para un modelo que no es de DeepSeek utilizando el marco DSpark de código abierto.
  • Logra una decodificación 1.5 veces más rápida para GLM-5.2-FP8 en hardware 4x B300.
  • La implementación se ejecuta en vLLM nightly.
  • Se esperan puntos de control más fuertes en futuras actualizaciones.

Los desarrolladores ahora pueden aplicar el marco de decodificación especulativa DSpark a GLM-5.2 para reducir significativamente la latencia de inferencia, validando la compatibilidad más amplia del marco más allá de los modelos DeepSeek-V4 originales.

SOURCES

20. La solicitud de extracción de llama.cpp duplica las velocidades de procesamiento de prompts en Intel ARC

Una nueva solicitud de extracción para el repositorio `llama.cpp` introduce importantes aceleraciones en el procesamiento de prompts para GPU Intel ARC. Desarrollada con la ayuda de Claude, la optimización se probó en una GPU Intel B580 ejecutando un modelo Qwen3.6 35B con un tamaño de contexto de 262k. La actualización redujo el tiempo de procesamiento para una conversación de contexto de 116k de 510 segundos a 262 segundos, duplicando efectivamente el rendimiento de 245 t/s a 462 t/s. La optimización actual se limita a la caché KV F16.

  • Una nueva solicitud de extracción de llama.cpp proporciona optimizaciones de rendimiento para GPU Intel ARC.
  • Las pruebas en una GPU Intel B580 con una conversación de contexto de 116k redujeron el tiempo de procesamiento de 510 segundos a 262 segundos.
  • La velocidad de procesamiento de prompts aumentó de 245 t/s a 462 t/s.
  • Los benchmarks se realizaron utilizando el modelo Qwen3.6 35B A3B Q5_K_XL con un tamaño de contexto de 262,144.
  • La optimización actual se limita a la caché KV F16.

Los desarrolladores que ejecutan modelos locales en hardware Intel ARC pueden reducir significativamente la latencia para conversaciones de contexto largo.

SOURCES

21. Un desarrollador realiza benchmarks de un laboratorio doméstico con 6 NVIDIA P40 para MiniMax-M2.7

Un desarrollador ha documentado una configuración de laboratorio doméstico diseñada para ejecutar modelos grandes localmente utilizando seis GPU NVIDIA P40, proporcionando 144 GB de VRAM total. Construido sobre una placa base Asus X99-E-WS con un BIOS modificado y un procesador Intel Xeon, el sistema fue evaluado utilizando llama.cpp para encontrar la configuración óptima para ejecutar MiniMax-M2.7-GGUF. La configuración verificada del desarrollador utiliza caché KV F16, Flash Attention, un tamaño de lote de 2048 y división de tensores basada en capas.

  • El sistema de laboratorio doméstico cuenta con seis GPU NVIDIA P40 que proporcionan un total de 144 GB de VRAM.
  • El hardware incluye una placa base Asus X99-E-WS con un BIOS modificado, una CPU Intel Xeon E5-2680 v4 y 128 GB de RAM DDR4.
  • La configuración óptima de llama.cpp utiliza caché KV F16, Flash Attention, un tamaño de lote de 2048, un tamaño de ubatch de 256 y división de tensores basada en capas.
  • La configuración fue evaluada ejecutando el modelo MiniMax-M2.7-GGUF a través de llama-server.

Proporciona un modelo de configuración de hardware y software concreto para los desarrolladores que buscan ejecutar modelos grandes localmente en GPU empresariales más antiguas y rentables.

SOURCES

22. Benchmarks locales comparan Qwen3.6, Gemma4 y Ornith1.0 en RTX 3090

Un desarrollador independiente ha publicado resultados de benchmarks locales comparando Qwen3.6 27b, Gemma4 26B y Ornith1.0 35B en una GPU RTX 3090 utilizando el marco inspect-ai. Las pruebas revelaron que Qwen3.6 27b lideró en conocimiento general y razonamiento, mientras que Ornith1.0 35B sobresalió en tareas de fundamentación y recuperación de hasta 100k tokens. Los benchmarks también destacaron desafíos prácticos de integración, como problemas de bucle infinito al ejecutar Gemma4 26B a través de LM Studio.

  • Los benchmarks evaluaron Qwen3.6 27b, Gemma4 26B y Ornith1.0 35B utilizando el marco inspect-ai en una RTX 3090.
  • Qwen3.6 27b obtuvo las puntuaciones más altas o conjuntas más altas en 4 de 6 benchmarks de conocimiento general y razonamiento.
  • Ornith1.0 35B superó a otros modelos en tareas de fundamentación y recuperación, incluida una prueba de 'Aguja en un pajar' de 100k tokens.
  • El evaluador informó problemas técnicos, incluido el bucle infinito con Gemma4 26B y largos tiempos de procesamiento para los benchmarks de codificación.

Proporciona a los desarrolladores datos de rendimiento de hardware local objetivos para ayudar a elegir entre modelos de pesos abiertos populares para tareas de razonamiento y recuperación.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.