Inference Brew

Thinking Machines Lab lanza Inkling, su primer modelo multimodal público

00:00 / --:--

← Volver al inicio

Thinking Machines Lab lanza Inkling, su primer modelo multimodal público

1. Thinking Machines Lab lanza Inkling, su primer modelo multimodal público

Thinking Machines Lab, que presentó previamente su arquitectura de interacción multimodal en mayo, ha lanzado su primer modelo público, Inkling. Este lanzamiento marca la transición de una vista previa de investigación a un modelo de pesos abiertos listo para producción, con 975 mil millones de parámetros totales y un esfuerzo de razonamiento controlable. Entrenado desde cero con 45 billones de tokens de datos multimodales, el modelo utiliza un transformador de solo decodificador de 66 capas con 256 expertos enrutados y 2 expertos compartidos.

  • Inkling es un modelo de mezcla de expertos (MoE) nativamente multimodal y de pesos abiertos, con 975 mil millones de parámetros totales y 41 mil millones de parámetros activos.
  • El modelo cuenta con un mecanismo de esfuerzo de pensamiento controlable, lo que permite a los desarrolladores ajustar programáticamente el presupuesto de razonamiento entre 0.2 y 0.99.
  • Admite una ventana de contexto de 1 millón de tokens y acepta entradas de texto, imagen y audio.
  • El modelo se lanza bajo una licencia Apache 2.0, con los pesos disponibles en Hugging Face.
  • Inkling es accesible a través de APIs alojadas de socios como TogetherAI, Fireworks, Modal, Databricks y Baseten.

Este lanzamiento pone la tecnología multimodal de la empresa a disposición del público, proporcionando a los desarrolladores un modelo de alta capacidad que se basa en la investigación de interacción anunciada anteriormente.

2. El consorcio Soofi lanza el modelo híbrido MoE Soofi S 30B-A3B

El consorcio Soofi, coordinado por KI Bundesverband, ha publicado los pesos de vista previa de Soofi S 30B-A3B en Hugging Face. Construido como un MoE híbrido Mamba-Transformer, el modelo combina capas de mezcla de secuencias Mamba-2 con capas granulares de MoE y capas de atención de consulta agrupada (Grouped-Query Attention) para optimizar el rendimiento y la eficiencia. El proceso de entrenamiento utilizó un programa de calentamiento-estabilidad-decaimiento (Warmup–Stable–Decay) a lo largo de 26.68 billones de tokens, con la proporción de datos de entrenamiento en alemán aumentando al 15.32% en la segunda fase.

  • Soofi S 30B-A3B es un modelo de mezcla de expertos (MoE) híbrido Mamba-Transformer de pesos abiertos con 31.6 mil millones de parámetros totales y 3.2 mil millones de parámetros activos por token.
  • El modelo admite una ventana de contexto de hasta 1 millón de tokens y está disponible para su implementación a través de vLLM.
  • La arquitectura cuenta con 52 capas, incluyendo 23 capas de mezcla de secuencias Mamba-2, 23 capas granulares de MoE y 6 capas de atención de consulta agrupada.
  • El modelo obtuvo una puntuación agregada de 70.1 en inglés y 79.1 en alemán en evaluaciones frente a otros modelos base abiertos.
  • El entrenamiento fue financiado por el Ministerio Federal de Economía y Acción Climática de Alemania y realizado en la Industrial AI Cloud de Deutsche Telekom utilizando hasta 512 GPUs NVIDIA B200.

Permite a los desarrolladores implementar un modelo híbrido alemán/inglés de pesos abiertos altamente eficiente con una ventana de contexto de 1 millón de tokens utilizando vLLM.

SOURCES

3. Google lanza oficialmente Gemma 4 E2B optimizado para la TPU del Pixel 10

Basándose en el lanzamiento del modelo Gemma 4 12B y los esfuerzos posteriores de la comunidad para ejecutarlo en hardware móvil, Google ha introducido ahora Gemma 4 E2B. Esta versión está específicamente optimizada para la unidad de procesamiento tensorial (TPU) del Pixel 10, permitiendo capacidades multimodales nativas, de baja latencia y sin conexión que van más allá de las implementaciones anteriores lideradas por la comunidad.

  • Gemma 4 E2B es una versión oficial optimizada para TPU de la arquitectura Gemma 4.
  • Permite tareas multimodales nativas y sin conexión, incluyendo transcripción de audio e identificación de imágenes.
  • Admite el control directo de las funciones del sistema del teléfono mediante comandos de voz o texto privados.
  • Realiza la transición de la inferencia local experimental liderada por la comunidad a una función nativa compatible y acelerada por hardware.

Esta optimización oficial proporciona una ruta estable y de alto rendimiento para que los desarrolladores integren IA multimodal privada en el dispositivo en aplicaciones para Pixel 10, pasando de configuraciones experimentales de la comunidad a una función nativa compatible.

SOURCES

4. SpaceXAI libera el código fuente del agente de codificación de terminal Grok Build

SpaceXAI ha publicado el código fuente de Grok Build, haciendo que la herramienta de desarrollo basada en terminal pase de su estado anterior como beta cerrada de pago a un proyecto de código abierto. Operando como una interfaz de usuario de texto (TUI) de pantalla completa, Grok Build puede ejecutarse de forma interactiva o sin interfaz gráfica dentro de tuberías de CI. Se integra con editores externos utilizando el protocolo estandarizado Agent Client Protocol, lo que lo convierte en una adición flexible a los entornos de desarrollo modernos.

  • Grok Build ahora es de código abierto bajo la licencia Apache, versión 2.0.
  • La herramienta funciona como una TUI de pantalla completa para la codificación con IA basada en terminal.
  • Admite uso interactivo, operación sin interfaz gráfica para CI e integración con editores a través del Agent Client Protocol.
  • Los binarios precompilados están disponibles para macOS, Linux y Windows, y las compilaciones desde el código fuente requieren Rust y protoc.
  • No se aceptan contribuciones externas a pesar de la licencia de código abierto.

El cambio a código abierto permite a los desarrolladores acceder y modificar el agente de codificación de IA basado en terminal, que anteriormente requería una suscripción de pago para su uso.

SOURCES

5. deja indexa el historial de agentes de codificación locales para una memoria sincronizada por SSH

A diferencia de las plataformas de memoria que capturan nuevos datos en tiempo real, deja indexa los registros de agentes existentes, incluyendo sesiones históricas creadas antes de su instalación. Proporciona una capa de memoria local segura que se integra con los flujos de trabajo del Protocolo de Contexto de Modelo (MCP). La herramienta se puede instalar a través de Go, npm, Homebrew o un script de shell.

  • deja es un binario de Go sin dependencias que indexa historiales de conversación locales de Claude Code, Codex y opencode.
  • La herramienta realiza una indexación incremental localmente, almacenando datos en un índice invertido en ~/.cache/deja.
  • Redacta automáticamente credenciales sensibles como claves API, tokens y JWT durante la indexación.
  • Las características incluyen recuperación de MCP, recuperación automática al inicio de sesión y sincronización entre máquinas a través de carpetas compartidas o SSH.
  • deja opera completamente de forma local sin código de red, garantizando la privacidad de los datos, y tiene licencia MIT.

Ofrece a los desarrolladores una capa de memoria local, segura y buscable para agentes de codificación como Claude Code que se sincroniza automáticamente entre máquinas y redacta credenciales sensibles.

SOURCES

6. Google lanza LiteRT.js para inferencia en navegador acelerada por WebGPU

El lanzamiento de LiteRT.js por parte de Google trae inferencia en el dispositivo de alto rendimiento y acelerada por hardware a los navegadores web. La biblioteca requiere la delegación completa del modelo a un acelerador, recurriendo a la ejecución en CPU si un modelo no puede delegarse por completo. Google recomienda usar LiteRT.js para la inferencia de modelos mientras se sigue utilizando TensorFlow.js para tareas de pre y post-procesamiento.

  • LiteRT.js compila el tiempo de ejecución nativo de LiteRT (anteriormente TensorFlow Lite) a WebAssembly para ejecutar modelos directamente en el navegador.
  • La biblioteca utiliza tres backends: XNNPACK para CPU, ML Drift a través de WebGPU para GPU y la API experimental WebNN para NPUs.
  • Google informa de un rendimiento hasta 3 veces más rápido que otros tiempos de ejecución web, y una aceleración de 5 a 60 veces en backends de GPU/NPU en comparación con la CPU.
  • Los modelos de PyTorch se pueden convertir al formato .tflite utilizando LiteRT Torch si son exportables mediante TorchDynamo y tienen dimensiones estáticas.
  • Los desarrolladores deben gestionar manualmente la memoria de los tensores llamando a delete para evitar fugas de memoria en LiteRT.js.

Permite a los desarrolladores web ejecutar modelos de IA en el dispositivo acelerados por hardware directamente en el navegador con un rendimiento hasta 3 veces más rápido utilizando WebGPU y WebAssembly.

SOURCES

7. ExLlamaV3 alcanza la versión de producción 1.0.0 con importantes mejoras de rendimiento

Tras más de un año de desarrollo, ExLlamaV3 ha alcanzado su primera versión lista para producción. La actualización se centra en el rendimiento y la facilidad de implementación, eliminando la necesidad de bibliotecas externas flash-attention-2 y xformers. También introduce un programador de tickets de kernel de mezcla de expertos y soporte para modelos GptOssForCausalLM y NemotronHForCausalLM, junto con tiempos de compilación más rápidos.

  • ExLlamaV3 v1.0.0 elimina las dependencias de flash-attention-2 y xformers, simplificando el proceso de compilación e implementación local.
  • El soporte de paralelismo de tensores se ha extendido a la mayoría de los modelos, incluido Gemma 4.
  • Un nuevo kernel de atención admite cuantización de caché en línea y entrada dual para capas SWA y sumideros de atención.
  • El lanzamiento introduce un nuevo kernel conv1d, eliminando la necesidad de causal_conv1d.
  • Las mejoras de rendimiento incluyen un rendimiento mejorado de GEMM/GEMV en la arquitectura Ampere y un nuevo kernel INT8 GEMV.

Acelera la inferencia local de LLM y simplifica la implementación al eliminar dependencias pesadas como flash-attention-2 mientras añade soporte de paralelismo de tensores para modelos como Gemma 4.

SOURCES

8. Anthropic mitiga la vulnerabilidad de exfiltración de memoria de Claude

Un investigador de seguridad demostró un ataque de exfiltración de datos contra el sistema de memoria de Claude, que almacena perfiles de usuario de alta fidelidad mediante un pase de resumen diario y herramientas de recuperación. Al engañar a Claude para que visitara un sitio web malicioso, el atacante podía forzar a la herramienta web_fetch a seguir una estructura de directorios de enlaces, codificando y filtrando datos sensibles del usuario. Anthropic ha mitigado la amenaza restringiendo que web_fetch siga enlaces externos.

  • El investigador Ayush Paul descubrió una vulnerabilidad en el sistema de memoria de Claude que permitía la exfiltración de perfiles de usuario almacenados.
  • El ataque explotó la herramienta web_fetch de Claude, forzando al modelo a codificar y transmitir datos sensibles a través de rutas URL en sitios maliciosos.
  • La vulnerabilidad podía activarse si un usuario pedía a Claude que visitara un sitio malicioso o si el sitio aparecía en los resultados de búsqueda.
  • Anthropic mitigó el problema deshabilitando la capacidad de web_fetch para seguir enlaces en páginas externas, limitando la navegación a los resultados de búsqueda y las URL proporcionadas por el usuario.
  • La vulnerabilidad se reveló a través del programa de recompensas por errores HackerOne de Anthropic, aunque no se otorgó ninguna recompensa ya que el problema había sido identificado internamente.

Informa a los desarrolladores que crean agentes de navegación web sobre vectores críticos de exfiltración de datos y explica la mitigación de Anthropic de deshabilitar el seguimiento de enlaces externos en la herramienta web_fetch de Claude.

SOURCES

9. Ambiance LLM Harness utiliza el sistema de archivos Unix como interfaz de agente

Ambiance reimagina el entorno de ejecución del agente tratando el sistema de archivos local como la interfaz principal para almacenar datos, registros y configuraciones. Al utilizar un kernel basado en eventos para monitorear los cambios en el sistema de archivos, el arnés garantiza que los agentes permanezcan receptivos a los cambios de estado externos, ofreciendo una alternativa estructurada a los bucles de agentes tradicionales.

  • Ambiance aprovecha el conocimiento existente de un agente sobre codificación y administración de sistemas para reducir la carga cognitiva.
  • El sistema cuenta con un 'Kernel' que actúa como un bus de eventos, monitoreando el sistema de archivos en busca de cambios para activar las respuestas del LLM.
  • Define tres instancias de LLM predeterminadas: 'root' para tareas del sistema, 'pai' para interacción humana y 'librarian' para llevar un diario.
  • El proyecto se inició en el Recurse Center y está disponible para pruebas a través de whitematterlabs.ai o un script de instalación.

Proporciona un entorno local experimental inspirado en Unix y un kernel basado en eventos para construir agentes LLM más fiables y receptivos.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.