Inference Brew

Google actualiza la serie Gemini Flash a la versión 3.8

00:00 / --:--

← Volver al inicio

Google actualiza la serie Gemini Flash a la versión 3.8

1. Google actualiza la serie Gemini Flash a la versión 3.8

Tras el lanzamiento de Gemini 3.7 Flash en agosto de 2026, Google ha presentado Gemini 3.8 Flash. Esta actualización mejora las capacidades de razonamiento y codificación, aunque el mayor uso de llamadas a herramientas iterativas por parte del modelo puede aumentar los costos totales de las tareas en aproximadamente un 40%. Además, Google ha lanzado Gemini 3.8 Flash Cyber, una versión especializada para la detección de vulnerabilidades restringida a gobiernos y socios de confianza.

  • • Gemini 3.8 Flash sucede al modelo 3.7 Flash con un mejor rendimiento en razonamiento y codificación.
  • • El modelo cuenta con una ventana de contexto de 1 millón de tokens y tiene un precio de 0,75 dólares por millón de tokens de entrada y 3,75 dólares por millón de tokens de salida hasta finales de 2026.
  • • El aumento de los pasos de razonamiento y las llamadas a herramientas iterativas puede generar un costo total por tarea un 40% mayor en comparación con las versiones anteriores.
  • • Google introdujo Gemini 3.8 Flash Cyber, una variante de modelo restringida ajustada para la corrección automatizada de vulnerabilidades.
  • • El modelo obtuvo una puntuación de 59 en el Artificial Analysis Intelligence Index, una mejora de 3 puntos respecto a Gemini 3.7 Flash.

Los desarrolladores ahora pueden acceder a un modelo de razonamiento más capaz en la serie Flash, aunque deben tener en cuenta los posibles aumentos de costos debido a los procesos de razonamiento más intensivos del modelo.

2. Meta actualiza Muse Spark a la versión 1.3 con mejoras de rendimiento

Meta ha actualizado su línea de modelos Muse Spark a la versión 1.3, tras el lanzamiento de la versión 1.2 en agosto. La nueva versión ofrece mejoras de rendimiento en codificación, flujos de trabajo de agentes y razonamiento científico, manteniendo la misma estructura de precios que su predecesor. La variante Muse Spark 1.3 (xhigh) ya está disponible a través de la API de Meta y Muse Code, con una variante 'max' más potente actualmente en vista previa limitada.

  • • Meta lanzó Muse Spark 1.3, ofreciendo mejoras sustanciales de rendimiento para codificación, tareas de agentes y razonamiento científico.
  • • La variante Muse Spark 1.3 (xhigh) ya está disponible y obtuvo una puntuación de 61 en el Artificial Analysis Intelligence Index.
  • • El precio de la variante xhigh se mantiene sin cambios en 1,25 dólares por millón de tokens de entrada y 4,25 dólares por millón de tokens de salida.
  • • Una variante Muse Spark 1.3 (max) más potente se encuentra actualmente en vista previa limitada para socios.

Los desarrolladores ahora pueden acceder a un modelo de razonamiento y codificación más capaz a través de la API existente de Meta y el ecosistema Muse Code sin ningún aumento en los costos de tokens.

3. Google lanza la comprensión de video agentica para los modelos Gemini

Google ha implementado capacidades de comprensión de video agentica en varios modelos de su familia Gemini. Al combinar herramientas nativas de procesamiento de video con las capacidades de razonamiento central de los modelos, esta actualización mejora el rendimiento en tareas complejas de análisis de video. Los desarrolladores pueden aprovechar estas funciones para crear aplicaciones más robustas para la recuperación automatizada de momentos, la detección de anomalías y el conteo preciso de objetos en flujos de video.

  • • Google lanzó capacidades de comprensión de video agentica para varios modelos Gemini.
  • • La función combina herramientas de video nativas con el razonamiento del modelo.
  • • Mejora el rendimiento en tareas como la recuperación de momentos, la detección de anomalías y el conteo.

Los desarrolladores pueden crear aplicaciones que realicen tareas de video complejas como la recuperación de momentos, la detección de anomalías y el conteo de objetos con mayor precisión.

SOURCES

4. Multiverse Computing lanza el modelo de razonamiento insignia Quasar 438B

Multiverse Computing ha entrado en el espacio de los grandes modelos con Quasar 438B, un modelo de razonamiento insignia que admite inglés y español. Diseñado para agentes a escala empresarial, copilotos técnicos y automatización de flujos de trabajo, el modelo obtuvo una puntuación de 43 en el Artificial Analysis Intelligence Index v4.1.1, marcando un punto alto para los modelos europeos. Demuestra capacidades sólidas en entornos de terminal (obteniendo 69,3 en Terminal-Bench v2.1) y razonamiento de documentos largos (obteniendo 75,0 en AA-LCR), y es accesible a través de la API de CompactifAI.

  • • Multiverse Computing lanzó Quasar 438B, su primer gran modelo de razonamiento que admite inglés y español.
  • • El modelo obtuvo una puntuación de 43 en el Artificial Analysis Intelligence Index v4.1.1, el resultado más alto para un modelo europeo.
  • • Obtuvo 75,0 en el benchmark de razonamiento de documentos largos AA-LCR y 69,3 en Terminal-Bench v2.1 para entornos de terminal.
  • • Quasar 438B está disponible para pruebas y despliegue a través de la API de CompactifAI.
  • • El modelo completa una respuesta de 500 tokens en 15,3 segundos.

Los desarrolladores tienen una nueva opción bilingüe de alto rendimiento para entornos de terminal complejos y razonamiento de documentos largos a través de la API de CompactifAI.

SOURCES

5. Vercel introduce la capa de cómputo Fluid para el escalado dinámico de cargas de trabajo

Vercel ha introducido Fluid, una capa de cómputo unificada diseñada para configurar dinámicamente la infraestructura en función de las demandas de carga de trabajo en tiempo real. Diseñado para absorber la capacidad de ráfaga repentina, Fluid maneja compilaciones, entornos de pruebas (sandboxes) y funciones sin servidor sin problemas. El sistema ya está operando a escala, procesando más de un billón de solicitudes por mes para garantizar una alta disponibilidad y rendimiento para aplicaciones web y de IA modernas.

  • • Vercel introdujo Fluid, una capa de cómputo unificada que configura dinámicamente la infraestructura para diferentes cargas de trabajo.
  • • El sistema está diseñado para absorber la capacidad de ráfaga para compilaciones, entornos de pruebas y funciones.
  • • Fluid actualmente escala para admitir más de un billón de solicitudes por mes.

Los desarrolladores que despliegan aplicaciones de IA en Vercel obtienen una infraestructura más resistente y de escalado dinámico capaz de manejar picos de tráfico masivos sin configuración manual.

SOURCES

6. WebLLM permite la inferencia de LLM en el navegador de alto rendimiento a través de WebGPU

WebLLM, un proyecto complementario a MLC LLM, ofrece un motor de inferencia en el navegador de alto rendimiento impulsado por WebGPU. Al ejecutarse completamente del lado del cliente, elimina los costos y la latencia del servidor mientras mantiene la compatibilidad con el estándar de la API de OpenAI, incluido el soporte para streaming, modo JSON y llamadas a funciones. Los desarrolladores pueden integrar fácilmente el motor en aplicaciones web utilizando NPM o CDN, descargar cálculos pesados a Web Workers para mantener la interfaz de usuario receptiva y desplegar modelos personalizados compilados en el formato MLC.

  • • WebLLM ejecuta modelos de lenguaje completamente dentro del navegador utilizando WebGPU para la aceleración de hardware.
  • • El motor es compatible con la API de OpenAI, admitiendo streaming, modo JSON y llamadas a funciones.
  • • Admite de forma nativa modelos abiertos populares, incluidos Llama 3, Phi 3, Gemma, Mistral y Qwen.
  • • Los desarrolladores pueden integrar WebLLM a través de NPM, Yarn o CDN, y descargar cálculos a Web Workers o Service Workers.
  • • El motor proporciona verificación de integridad opcional para artefactos de modelo utilizando hashes de Subresource Integrity (SRI).

Los desarrolladores pueden crear aplicaciones web totalmente locales y privadas que ejecuten modelos directamente en el navegador del usuario con API compatibles con OpenAI.

SOURCES

7. Perplexity abre el código de Lily para la inferencia optimizada en dispositivos Apple Silicon

Perplexity AI ha abierto el código de Lily, un servidor de inferencia ligero para Mac diseñado para maximizar el rendimiento de LLM en el dispositivo en Apple Silicon. Ajustado específicamente para el modelo Qwen3.6-35B-A3B, que cuenta con enrutamiento MoE disperso y capas Gated DeltaNet, Lily aprovecha la memoria unificada y el hardware especializado de Apple para ofrecer un rendimiento de prellenado y decodificación que supera a MLX-LM. El repositorio está disponible en GitHub, lo que permite a los desarrolladores alojar una inferencia local altamente eficiente en un solo Mac.

  • • Perplexity AI abrió el código del repositorio 'lily' en GitHub, diseñado como un servidor de inferencia para Mac.
  • • El motor está optimizado específicamente para el modelo Qwen3.6-35B-A3B para lograr el máximo rendimiento en Apple Silicon.
  • • Lily aprovecha la memoria unificada y el hardware especializado para ofrecer un mayor rendimiento de prellenado y decodificación que MLX-LM.
  • • El modelo Qwen3.6-35B-A3B utiliza enrutamiento MoE disperso y capas Gated DeltaNet.

Los desarrolladores pueden ejecutar modelos MoE grandes y dispersos localmente en un solo Mac con un rendimiento de prellenado y decodificación que supera a MLX-LM.

SOURCES

8. Worlds via Code genera escenas 3D explorables usando Claude Fable 5.1

El proyecto "Worlds via code" ha demostrado una novedosa tubería que utiliza enjambres de agentes autónomos Claude Fable 5.1 para generar reconstrucciones 3D explorables y nativas del navegador de ubicaciones del mundo real. Construido completamente como aplicaciones Three.js sin motores de juego propietarios, el demo actual reconstruye una plaza detallada de San Francisco con 129 escaparates, semáforos en funcionamiento e interiores interactivos. Toda la tubería, que abarca el reconocimiento, la generación de activos en Blender, el ensamblaje en tiempo de ejecución y el control de calidad basado en Playwright, es de código abierto bajo la licencia MIT.

  • • El proyecto "Worlds via code" crea reconstrucciones explorables y nativas del navegador de ubicaciones reales utilizando enjambres de agentes Claude Fable 5.1.
  • • Las reconstrucciones se construyen como aplicaciones Three.js sin motores de juego ni mosaicos 3D propietarios.
  • • El demo actual reconstruye una plaza de San Francisco con 129 escaparates, semáforos en funcionamiento e interiores explorables.
  • • La tubería utiliza un proceso de cuatro etapas: reconocimiento, generación de activos fuera de línea en Blender, ensamblaje en tiempo de ejecución y control de calidad de coincidencia de cámara a través de Playwright.
  • • El código y los activos del proyecto tienen licencia MIT, utilizando datos de OpenStreetMap y USGS 3DEP.

Los desarrolladores pueden estudiar o adoptar una tubería con licencia MIT que traduce datos espaciales del mundo real en aplicaciones Three.js interactivas sin depender de motores de juego propietarios.

SOURCES

9. Switch ejecuta agentes de IA localmente en Slack, Teams y Discord

Switch se ha lanzado como una herramienta de software local diseñada para conectar modelos de IA y agentes directamente a Slack, Microsoft Teams y Discord. Operando completamente de forma local y sin requerir la creación de cuentas, Switch permite a los desarrolladores probar y ejecutar flujos de trabajo de agentes dentro de sus canales de chat existentes sin bloqueo de plataforma ni la necesidad de migrar su infraestructura subyacente.

  • • Switch permite a los usuarios ejecutar modelos de IA, infraestructura y agentes localmente.
  • • La herramienta integra agentes con Slack, Microsoft Teams y Discord en minutos.
  • • No requiere ninguna cuenta para usar y evita el bloqueo de plataforma o la migración.

Los desarrolladores pueden desplegar y probar rápidamente agentes conversacionales en Slack, Teams o Discord sin configurar una infraestructura en la nube compleja ni crear cuentas externas.

SOURCES

10. Hugging Face lanza kernels WebGPU optimizados para la inferencia en el navegador

Hugging Face ha lanzado @huggingface/kernels, una biblioteca dedicada que contiene 207 kernels WebGPU altamente optimizados. La biblioteca está diseñada para acelerar la inferencia de modelos de IA del lado del cliente, permitiendo a los desarrolladores web ejecutar operaciones complejas de redes neuronales directamente dentro del navegador con una latencia mínima y una utilización máxima del hardware.

  • • Hugging Face introdujo la biblioteca @huggingface/kernels.
  • • La biblioteca contiene 207 kernels WebGPU optimizados.
  • • Está diseñada para acelerar la inferencia de modelos de IA directamente dentro de los navegadores web.

Los desarrolladores web pueden aprovechar estos kernels pre-optimizados para acelerar significativamente la ejecución de modelos del lado del cliente y crear funciones de IA locales más receptivas.

SOURCES

11. Anthropic lanza una herramienta de verificación de archivos C2PA y una vista previa de la API de detección

Basándose en su compromiso de agosto de implementar marcas de agua invisibles, Anthropic ha lanzado ahora una herramienta que lee metadatos C2PA firmados criptográficamente para verificar si los archivos fueron procesados por Claude. La herramienta opera localmente en los dispositivos de los usuarios. Además, la empresa ha abierto una vista previa privada de su API de detección para marcas de agua de texto, lo que permite a las organizaciones verificar la procedencia del contenido en cumplimiento con las regulaciones de IA de la UE.

  • • Anthropic ha lanzado una herramienta local para verificar metadatos C2PA en archivos .png, .jpg y .svg.
  • • Una vista previa privada de la API de detección para marcas de agua de texto ya está disponible para organizaciones elegibles.
  • • Estos lanzamientos cumplen con el compromiso previo de la empresa de proporcionar medios técnicos para detectar contenido generado por Claude.
  • • La herramienta de verificación de archivos garantiza la privacidad al procesar metadatos localmente sin enviar archivos a Anthropic.

Estas herramientas proporcionan la implementación práctica de los estándares de procedencia que Anthropic anunció anteriormente, permitiendo a los desarrolladores y organizaciones verificar el contenido generado por Claude.

SOURCES

12. Unsloth permite la cuantización GGUF para DeepSeek-V4-Flash-Vision-Exp

Basándose en el lanzamiento del 31 de agosto de los pesos de DeepSeek-V4-Flash-Vision-Exp en Hugging Face, Unsloth ha fusionado ahora el soporte de formato GGUF para el modelo. Esta actualización permite a los desarrolladores ejecutar versiones cuantizadas del modelo experimental con capacidad de visión localmente, facilitando la integración en entornos con recursos limitados.

  • • Unsloth añadió soporte GGUF para el modelo DeepSeek-V4-Flash-Vision-Exp.
  • • Esto sigue al lanzamiento del 31 de agosto de los pesos del modelo en Hugging Face.
  • • La actualización permite la inferencia local y cuantizada para el modelo de visión experimental.

Este desarrollo permite a los desarrolladores pasar de simplemente alojar los pesos sin procesar a ejecutar versiones optimizadas y cuantizadas del modelo DeepSeek-V4-Flash-Vision-Exp localmente.

SOURCES

13. llama.cpp añade oficialmente soporte Metal para aceleradores neuronales Apple M5

El proyecto llama.cpp ha actualizado su backend Metal para admitir de forma nativa la multiplicación de matrices M5 y los aceleradores neuronales. Esta integración oficial aborda la brecha de rendimiento que anteriormente requería kernels w8a8 personalizados, impulsando el rendimiento de prellenado para los modelos Q_8 GGUF de Unsloth a 300-350 tokens por segundo en hardware M5. Con velocidades de generación que alcanzan los 19 tokens por segundo para un modelo Qwen3.8 27B en el rango Q8 en un M5 Pro, llama.cpp ahora logra la paridad de rendimiento con los modelos MLX nativos.

  • • llama.cpp ahora incluye soporte Metal nativo para matmul M5 y aceleradores neuronales.
  • • Esta actualización reemplaza la necesidad de kernels w8a8 personalizados reportados anteriormente para desbloquear el rendimiento M5.
  • • El rendimiento de prellenado para los modelos Q_8 GGUF de Unsloth en hardware M5 ahora alcanza los 300-350 tokens por segundo.
  • • Se observaron velocidades de generación de aproximadamente 19 tokens por segundo para el modelo Qwen3.8 27b en el rango Q8 en un M5 Pro.

Los desarrolladores ahora pueden aprovechar la aceleración de hardware M5 directamente dentro del proyecto principal llama.cpp sin depender de kernels personalizados de terceros para evitar los límites de activación predeterminados de 16 bits.

SOURCES

14. VoxGen lanza un motor de inferencia TTS ligero y optimizado para AMD

VoxGen se ha lanzado como un motor de inferencia de texto a voz nativo y ligero diseñado específicamente para modelos VoxCPM2. Escrito en Rust y potenciado por el cómputo Vulkan, VoxGen evita Python, PyTorch y CUDA por completo, ofreciendo un rendimiento optimizado en tarjetas gráficas AMD (incluido un modo dedicado para la XTX 7900). El motor se ejecuta directamente desde el shell, lo que facilita a los desarrolladores la integración de síntesis de voz local y de baja latencia en sus aplicaciones y scripts.

  • • VoxGen es un motor de inferencia nativo ligero para modelos VoxCPM2 escrito en Rust.
  • • El motor utiliza cómputo Vulkan en lugar de Python, PyTorch o CUDA, optimizando el rendimiento para las GPU AMD.
  • • Cuenta con un modo de optimización específico para la AMD Radeon XTX 7900.
  • • La aplicación se ejecuta desde un shell, lo que permite una fácil integración con scripts y programas externos.
  • • La instalación requiere el ejecutable VoxGen y dos archivos de modelo de Hugging Face.

Los desarrolladores pueden ejecutar síntesis de voz local de alto rendimiento en hardware AMD sin depender de dependencias pesadas de Python o PyTorch.

SOURCES

15. Mistral detalla la configuración de exclusión de entrenamiento de datos para usuarios de Vibe y API

Mistral ha descrito los pasos específicos necesarios para que los usuarios y desarrolladores opten por no permitir que sus datos de entrada y salida se utilicen para el entrenamiento de modelos. Si bien las cuentas de Vibe Enterprise están excluidas de forma predeterminada, los usuarios estándar de Vibe, móviles y de API deben ajustar manualmente su configuración. Los desarrolladores que utilizan Mistral Studio o la API pueden proteger sus datos desactivando el interruptor "Datos de mejora anónimos" en el panel de administración, teniendo en cuenta que las configuraciones de exclusión de Vibe y API se gestionan por separado.

  • • Mistral puede utilizar las conversaciones de los usuarios y los documentos cargados para el entrenamiento de modelos a menos que los usuarios opten por no hacerlo.
  • • Los clientes de Vibe Enterprise están excluidos del entrenamiento de forma predeterminada, pero los usuarios estándar de Vibe deben optar por no participar manualmente a través de la configuración.
  • • Los usuarios de API y Mistral Studio pueden optar por no participar desactivando el interruptor "Datos de mejora anónimos" en el panel de administración.
  • • Los usuarios de aplicaciones móviles en iOS y Android pueden optar por no participar deseleccionando "Habilitar intercambio de datos" en la configuración.
  • • La configuración de exclusión para Vibe y la API son independientes y deben configurarse individualmente.

Los desarrolladores y equipos deben configurar manualmente sus ajustes de privacidad en el panel de administración de Mistral para evitar que sus entradas y salidas propietarias se utilicen para el entrenamiento de modelos.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.