Inference Brew

Lanzamiento de Moondream 3.1 con arquitectura de mezcla de expertos de 9B de parámetros

00:00 / --:--

← Volver al inicio

Lanzamiento de Moondream 3.1 con arquitectura de mezcla de expertos de 9B de parámetros

1. Lanzamiento de Moondream 3.1 con arquitectura de mezcla de expertos de 9B de parámetros

Se ha lanzado Moondream 3.1 como un modelo de lenguaje visual con arquitectura de mezcla de expertos. El modelo contiene 9 mil millones de parámetros totales con 2 mil millones de parámetros activos. Está diseñado para tareas de razonamiento visual y detección, soportando habilidades nativas que incluyen consulta, detección, señalamiento y subtitulado. Todas las habilidades en Moondream 3.1 devuelven una salida estructurada.

  • Moondream 3.1 cuenta con una arquitectura de mezcla de expertos (MoE) con 9 mil millones de parámetros totales y 2 mil millones de parámetros activos.
  • El modelo está diseñado para tareas de razonamiento visual y detección.
  • Soporta habilidades nativas que incluyen consulta, detección, señalamiento y subtitulado.
  • Todas las habilidades nativas en Moondream 3.1 devuelven una salida estructurada.

Proporciona un modelo de visión de pesos abiertos, ligero y altamente eficiente para tareas locales de razonamiento visual, detección y salida estructurada.

SOURCES

2. Un informe revela graves vulnerabilidades de seguridad en servidores MCP populares

El informe 'State of MCP Security 2026' de Canopii analizó 11,524 servidores MCP publicados. El informe encontró que 830 servidores, lo que representa uno de cada catorce, recibieron una calificación de seguridad de D o F. Los investigadores identificaron 232 servidores que contenían sumideros de código peligrosos, como eval, inyección de shell o deserialización insegura. El estudio también encontró 184 versiones de servidores que cambiaron sus definiciones de herramientas después de la publicación inicial. Los puntos finales que afirmaban requerir autenticación sirvieron herramientas a llamadores anónimos en 741 instancias. Cabe destacar que los servidores con 1,000 o más estrellas en GitHub tienen cinco veces más probabilidades de ser de alto riesgo que los servidores con menos de 10 estrellas, con seis de los 15 servidores más destacados recibiendo una calificación de D o F.

  • El informe de Canopii analizó 11,524 servidores MCP publicados y calificó a 830 de ellos (uno de cada catorce) con una D o F.
  • Los investigadores identificaron 232 servidores que contenían sumideros de código peligrosos, como eval, inyección de shell o deserialización insegura.
  • El estudio encontró 184 versiones de servidores que cambiaron sus definiciones de herramientas después de la publicación inicial.
  • Los puntos finales que afirmaban requerir autenticación sirvieron herramientas a llamadores anónimos en 741 instancias.
  • Los servidores con 1,000 o más estrellas en GitHub tienen cinco veces más probabilidades de ser de alto riesgo que los servidores con menos de 10 estrellas.
  • Seis de los 15 servidores más destacados en el registro recibieron una calificación de seguridad de D o F.

Los desarrolladores que integran servidores MCP de terceros deben auditarlos cuidadosamente en busca de vulnerabilidades como la inyección de shell y la exposición no autorizada de herramientas para proteger sus aplicaciones.

SOURCES

3. La versión de llama.cpp corrige un error de punto de control de contexto en flujos de trabajo de agentes

La versión b9978 de llama.cpp soluciona un error de punto de control que afectaba específicamente a las cargas de trabajo de agentes. Antes de la corrección, cada turno del agente creaba un nuevo punto de control, lo que evitaba el espaciado mínimo de pasos y colapsaba la ventana de cobertura. El error anterior provocaba que los retrocesos de contexto durante los bucles de llamada a herramientas borraran todos los puntos de control, lo que resultaba en un reprocesamiento completo. La actualización introduce la eliminación de puntos de control muy cercanos de tareas anteriores para mantener una ventana de cobertura más amplia, mejorando la velocidad de las sesiones largas de agentes.

  • La versión b9978 de llama.cpp soluciona un error de punto de control que afectaba específicamente a las cargas de trabajo de agentes.
  • Antes de la corrección, cada turno del agente creaba un nuevo punto de control, evitando el espaciado mínimo de pasos y colapsando la ventana de cobertura.
  • El error provocaba que los retrocesos de contexto durante los bucles de llamada a herramientas borraran todos los puntos de control, resultando en un reprocesamiento completo.
  • La actualización introduce la eliminación de puntos de control muy cercanos de tareas anteriores para mantener una ventana de cobertura más amplia.

Esta corrección mejora significativamente la velocidad y eficiencia de las sesiones largas de agentes locales durante bucles complejos de llamada a herramientas.

SOURCES

4. El servidor MCP Zer0Fit lleva los modelos TabFM y TimesFM de Google a flujos de trabajo locales

Un estudiante de posgrado ha lanzado Zer0Fit, un contenedor MCP que permite que los modelos transformadores TabFM y TimesFM de Google se ejecuten en un único contenedor Docker. La herramienta permite la integración de estos modelos tabulares y de series temporales con LLMs locales como Open WebUI, Claude Code y Codex. Zer0Fit requiere al menos 16 GB de VRAM y está limitado a hardware compatible con CUDA debido a su base en PyTorch. La implementación cuenta con carga y descarga dinámica de modelos con un tiempo de vida (TTL) de 5 minutos para gestionar el uso de VRAM. Las pruebas iniciales en conjuntos de datos clásicos arrojaron una precisión del 94.7% para el clasificador Iris y una puntuación R2 de 0.87 para el modelo de regresión California Housing.

  • Zer0Fit ejecuta los modelos transformadores TabFM y TimesFM de Google localmente en un único contenedor Docker como servidor MCP.
  • La herramienta permite la integración de modelos tabulares y de series temporales con LLMs locales como Open WebUI, Claude Code y Codex.
  • Requiere al menos 16 GB de VRAM y está limitado a hardware compatible con CUDA debido a su base en PyTorch.
  • La implementación cuenta con carga y descarga dinámica de modelos con un tiempo de vida (TTL) de 5 minutos para gestionar el uso de VRAM.
  • Las pruebas iniciales arrojaron una precisión del 94.7% para el clasificador Iris y una puntuación R2 de 0.87 para el modelo de regresión California Housing.
  • El proyecto actualmente admite archivos CSV, con planes para añadir soporte para formatos XLS, XLSX, JSON y JSONL.

Permite a los desarrolladores integrar potentes modelos de pronóstico, clasificación y regresión de series temporales y tabulares directamente en flujos de trabajo de LLM locales y entornos de agentes.

SOURCES

5. Mindwalk visualiza sesiones de agentes de Claude Code y Codex en 3D

Mindwalk es una nueva herramienta de visualización que reproduce sesiones de agentes de codificación en un mapa 3D de una base de código. La herramienta procesa los registros de sesión de Claude Code y Codex localmente sin transmitir datos fuera de la máquina. Representa el repositorio como un mapa 3D donde la actividad de los archivos se visualiza a través de efectos brillantes basados en acciones de búsqueda, lectura y edición. Mindwalk está construido con un backend en Go y un frontend en React/Three.js, utilizando archivos JSON de traza y mapa de ciudad normalizados. Tiene licencia MIT y se atribuye a Ricko Yu.

  • Mindwalk procesa los registros de sesión de Claude Code y Codex localmente para generar un mapa 3D de la actividad de la base de código.
  • La actividad de los archivos se visualiza a través de efectos brillantes basados en acciones de búsqueda, lectura y edición.
  • Las características incluyen vistas de árbol y terreno, seguimiento del estado táctil, una plataforma de reproducción con histograma y marcas de línea de tiempo para turnos de usuario y lanzamientos de subagentes.
  • La herramienta está construida con un backend en Go y un frontend en React/Three.js, utilizando archivos JSON de traza y mapa de ciudad normalizados.
  • Mindwalk tiene licencia MIT y está disponible para su instalación mediante un script de shell o compilación desde el código fuente.

Ayuda a los desarrolladores a depurar y comprender comportamientos complejos de agentes de varios pasos a través de una visualización 3D interactiva de la actividad de la base de código.

SOURCES

6. La aplicación Modelr lleva la generación local de imagen a 3D a Apple Silicon

El desarrollador Zimeng Xiong lanzó Modelr, una aplicación de escritorio independiente de imagen a 3D para Apple Silicon basada en un puerto Swift/MLX de Hunyuan3D-Paint y Hunyuan3D-Shape. La aplicación utiliza el framework MLX para ejecutar modelos en Apple Silicon sin la sobrecarga de PyTorch o el procesamiento de CPU. Los benchmarks en un chip M4 Max en FP16 muestran que hy3d shape (pequeño) se ejecuta en 20.9 segundos con 5.6 GB de memoria máxima, mientras que hy3d paint (pbr) se ejecuta en 344 segundos con 39 GB de memoria máxima. Las características de Modelr incluyen la eliminación de fondo usando SwiftVision y transmisión de difusión en tiempo real para la generación de modelos 3D.

  • El desarrollador Zimeng Xiong lanzó Modelr, una aplicación de escritorio independiente de imagen a 3D para Apple Silicon.
  • La aplicación utiliza el framework MLX para ejecutar Hunyuan3D-Paint y Hunyuan3D-Shape sin la sobrecarga de PyTorch o el procesamiento de CPU.
  • Los benchmarks en un chip M4 Max en FP16 muestran que hy3d shape (pequeño) se ejecuta en 20.9 segundos con 5.6 GB de memoria máxima.
  • El modelo hy3d paint (pbr) se ejecuta en 344 segundos con 39 GB de memoria máxima en el mismo hardware.
  • Las características incluyen la eliminación de fondo usando SwiftVision y transmisión de difusión en tiempo real para la generación de modelos 3D.
  • El código fuente y los pesos están disponibles en GitHub bajo los repositorios Hunyuan3D-Swift y Modelr.

Ofrece a los desarrolladores una forma rápida, ligera y local de generar modelos 3D a partir de imágenes en hardware Mac sin depender de APIs en la nube.

SOURCES

7. Lanzamiento del visualizador y controlador nativo GGUF Jacobian-Lens para llama.cpp

Un desarrollador ha lanzado un visualizador interactivo de lentes Jacobian y un controlador en vivo diseñado para modelos GGUF que se ejecutan en llama.cpp. Inspirado en la investigación de Anthropic, el proyecto cuenta con un servidor GGUF nativo que admite la observación de modelos, el intercambio de espacio J, la abliteración y el control. La herramienta es compatible tanto con modelos GGUF densos como de Mezcla de Expertos (MoE) y puede observar instancias de llama-server en ejecución. Los requisitos de memoria para la lente escalan aproximadamente a 1/8 del tamaño del modelo, requiriendo alrededor de 20 GB de RAM adicional para un modelo de 160 GB.

  • La herramienta jlens-gguf cuenta con un servidor GGUF nativo que admite la observación de modelos, el intercambio de espacio J, la abliteración y el control.
  • La herramienta es compatible tanto con modelos GGUF densos como de Mezcla de Expertos (MoE) y puede observar instancias de llama-server en ejecución.
  • Los requisitos de memoria para la lente escalan aproximadamente a 1/8 del tamaño del modelo, requiriendo alrededor de 20 GB de RAM adicional para un modelo de 160 GB.
  • El código del proyecto está disponible públicamente en GitHub en github.com/igorbarshteyn/jlens-gguf.

Esta herramienta ofrece a los desarrolladores una forma concreta de inspeccionar y controlar las activaciones internas de los modelos GGUF locales durante la inferencia.

SOURCES

8. mlx-lm añade soporte nativo para Nemotron Puzzle 75B en Apple Silicon

Se añadió soporte nativo para nemotron_h_puzzle a la biblioteca mlx-lm a través de la solicitud de extracción #1535. Se realizó una comparación de rendimiento entre la cuantización de expertos de 4 bits y 5 bits en un M2 Max de 64 GB, con ambas configuraciones utilizando capas densas de 6 bits y un cabezal de salida BF16. La configuración de 4 bits superó a la versión de 5 bits, logrando 14.27 tokens por segundo en comparación con 10.53 tokens por segundo. La implementación del modelo requirió añadir soporte de configuración por bloques, reasignación de tensores y hacer coincidir el comportamiento de norma y enrutador FP32 de NVIDIA. Se resolvió una discrepancia en las salidas SSM de la primera capa ajustando el orden de promoción de los cálculos softplus para que coincidiera con la referencia de NVIDIA, mejorando la similitud de coseno a 0.999998.

  • Se añadió soporte nativo para nemotron_h_puzzle a la biblioteca mlx-lm a través de la solicitud de extracción #1535.
  • Una configuración de cuantización de expertos de 4 bits logró 14.27 tokens por segundo en un M2 Max de 64 GB, superando a una configuración de 5 bits (10.53 t/s).
  • La configuración de 5 bits sufrió de presión de memoria, lo que llevó a un menor rendimiento en las comprobaciones de tareas locales y la recuperación de contexto largo.
  • La implementación del modelo requirió añadir soporte de configuración por bloques, reasignación de tensores y hacer coincidir el comportamiento de norma y enrutador FP32 de NVIDIA.
  • Se resolvió una discrepancia en las salidas SSM de la primera capa ajustando el orden de promoción de los cálculos softplus, mejorando la similitud de coseno a 0.999998.
  • El uso de un cabezal de salida BF16 es obligatorio para evitar que el lm_head de vocabulario de 131k genere una salida repetitiva.

Permite a los desarrolladores ejecutar un potente modelo de 75B de parámetros localmente en Apple Silicon con un uso de memoria y rendimiento optimizados.

SOURCES

9. DeepSeek amplía aún más la brecha de costos con un recorte de precios del 75% en V4-Pro

Basándose en la disparidad de costos existente entre DeepSeek y los laboratorios de frontera de EE. UU., DeepSeek ha reducido ahora los precios de su modelo V4-Pro en un 75%. Si bien esto reduce aún más la barrera para los desarrolladores, el rápido crecimiento del consumo de tokens en flujos de trabajo de agentes de varios pasos continúa superando estos costos de inferencia decrecientes. Como se señaló anteriormente, los sistemas de agentes pueden alcanzar relaciones de tokens de entrada a facturados de 1:700, lo que significa que incluso con costos unitarios más bajos, los desarrolladores aún deben adoptar técnicas como el almacenamiento en caché de avisos y el enrutamiento consciente de los costos para mantener márgenes sostenibles.

  • DeepSeek ha reducido los precios de V4-Pro en un 75%, aumentando aún más la ventaja de costos sobre los modelos de frontera de EE. UU.
  • A pesar de los costos unitarios más bajos, los flujos de trabajo de agentes de varios pasos continúan consumiendo tokens a tasas que pueden alcanzar relaciones de 1:700.
  • La amplificación de tokens sigue siendo un impulsor principal de los márgenes brutos negativos para los proveedores que utilizan precios tradicionales basados en asientos.
  • Los desarrolladores se ven obligados cada vez más a implementar estrategias de gestión de costos como el almacenamiento en caché de avisos y la decodificación especulativa para compensar el alto uso de tokens de agentes.

Aunque el recorte de precios de DeepSeek lo convierte en una alternativa aún más atractiva a los costosos modelos de frontera de EE. UU., la amplificación de tokens inherente a los flujos de trabajo de agentes significa que las reducciones de costos unitarios por sí solas pueden no resolver los desafíos de margen subyacentes para los proveedores empresariales.

SOURCES

10. Anthropic extiende el acceso promocional y los límites de tasa de Fable 5 hasta el 19 de julio

Anthropic ha extendido el período promocional para el acceso a Claude Fable 5 y los límites de tasa semanales un 50% más altos para los suscriptores de Claude Code, que anteriormente debían expirar el 12 de julio. Estos beneficios permanecerán vigentes hasta el 19 de julio. El uso de Fable 5 continúa contando hasta la mitad del límite semanal de un suscriptor sin costo adicional.

  • El acceso promocional y los límites de tasa semanales un 50% más altos para Claude Code se extienden hasta el 19 de julio.
  • La extensión sigue a la ventana promocional inicial que estaba programada para finalizar el 12 de julio.
  • El uso de Fable 5 continúa contando hasta la mitad del límite semanal de un suscriptor sin costo adicional.

Los desarrolladores tienen una semana adicional para utilizar los límites de tasa más altos y el acceso promocional a Fable 5 para sus flujos de trabajo de codificación y razonamiento.

SOURCES

11. Un estudio compara la eficiencia de tokens de Claude Code y OpenCode

Se realizó un estudio empírico para comparar la eficiencia de las herramientas de codificación de agentes Claude Code y OpenCode. El estudio se inició después de que la evidencia anecdótica sugiriera que Claude Code hacía que los medidores de uso aumentaran más rápidamente que OpenCode. Los investigadores recopilaron datos empíricos añadiendo registros entre las herramientas de codificación y el punto final de Anthropic para capturar todas las solicitudes y bloques de uso. El estudio concluyó que Claude Code es menos eficiente que OpenCode en términos de su estrategia de caché y uso de tokens de arnés, enviando 33,000 tokens antes de leer el aviso en comparación con los 7,000 tokens de OpenCode.

  • Un estudio comparó la eficiencia de las herramientas de codificación de agentes Claude Code y OpenCode registrando las solicitudes al punto final de Anthropic.
  • El estudio encontró que Claude Code envía 33,000 tokens antes de leer el aviso, mientras que OpenCode envía 7,000 tokens.
  • Los investigadores concluyeron que Claude Code es menos eficiente que OpenCode en su estrategia de caché y uso de tokens de arnés.
  • El estudio se inició después de que la evidencia anecdótica sugiriera que Claude Code hacía que los medidores de uso aumentaran más rápidamente que OpenCode.

Los desarrolladores que utilizan Claude Code deben ser conscientes de su mayor sobrecarga de tokens, lo que puede acelerar los costos de uso de la API en comparación con herramientas alternativas como OpenCode.

SOURCES

12. Benchmarking del rendimiento de agentes paralelos en RTX 5090 con Qwen3.6 35B

Una prueba de rendimiento utilizando una GPU RTX 5090 y el modelo Qwen 3.6 35B cargado a través de LM Studio evaluó el rendimiento de agentes múltiples. Los parámetros de prueba incluyeron 5 solicitudes por agente, 1024 tokens máximos y una temperatura de 0.3. El rendimiento combinado escala de forma sublineal, con 8 agentes proporcionando 2.2 veces el rendimiento de un solo agente. La velocidad individual del agente cae de 256.54 t/s con un agente a 67.22 t/s con ocho agentes. La eficiencia máxima del 70.4% se logra al ejecutar 2 agentes. Los principales cuellos de botella de rendimiento se identifican como los requisitos de caché KV y la división de cómputo.

  • Una prueba de Qwen3.6 35B cargado a través de LM Studio en una RTX 5090 evaluó el rendimiento de agentes múltiples con tareas paralelas establecidas en 8.
  • El rendimiento combinado escala de forma sublineal, con 8 agentes proporcionando 2.2 veces el rendimiento de un solo agente.
  • La velocidad individual del agente cae de 256.54 t/s con un agente a 67.22 t/s con ocho agentes.
  • La eficiencia máxima del 70.4% se logra al ejecutar 2 agentes, mientras que la configuración recomendada para OpenCode es de 4 a 5 agentes.
  • Cada agente utiliza una ventana de contexto completa, lo que resulta en un uso de caché KV 8 veces mayor al ejecutar 8 agentes.
  • Los principales cuellos de botella de rendimiento se identifican como los requisitos de caché KV y la división de cómputo.

Proporciona pautas de configuración concretas para que los desarrolladores equilibren las ganancias de rendimiento frente a los costos de VRAM y sobrecarga al ejecutar sistemas de agentes múltiples locales.

SOURCES

13. Las soluciones alternativas de la comunidad abordan los problemas de llamadas a herramientas y bucles de Qwen3.6-27B

Los usuarios del modelo local Qwen3.6-27B han informado de frecuentes fallos de llamadas a herramientas y comportamientos de bucle que dificultan su uso como una alternativa local fiable a los modelos de frontera. Para abordar esto, un usuario desarrolló una extensión para el agente de codificación Pi que monitorea los flujos JSON en busca de bucles e inyecta automáticamente avisos para mantener el modelo en el camino correcto cuando se detiene prematuramente. Además, los miembros de la comunidad han identificado que el uso de plantillas de chat específicas, como las alojadas en Hugging Face por 'froggeric', puede resolver problemas comunes de bucle y fallos de llamadas a herramientas en modelos locales.

  • Los usuarios de Qwen3.6-27B informaron de frecuentes fallos de llamadas a herramientas y comportamientos de bucle durante las tareas de agentes locales.
  • Un desarrollador creó una extensión para el agente de codificación Pi que monitorea los flujos JSON en busca de bucles e inyecta avisos para mantener el modelo en el camino correcto.
  • Los miembros de la comunidad identificaron que el uso de plantillas de chat específicas, como las alojadas en Hugging Face por 'froggeric', puede resolver problemas comunes de bucle y fallos de llamadas a herramientas.

Estas soluciones alternativas ayudan a los desarrolladores a ejecutar Qwen3.6-27B como una alternativa local más fiable a los modelos de frontera para tareas de agentes.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.